OCR - PDF con texto buscable
Un escaneo es una imagen: no hay nada que buscar, seleccionar o copiar. El OCR lee las palabras y coloca una capa de texto invisible sobre la página, palabra por palabra donde se imprimió cada una, para que una búsqueda resalte el lugar correcto y una selección siga la línea. El reconocimiento se ejecuta en tu navegador con Tesseract, en treinta y cuatro idiomas, y la imagen escaneada queda exactamente como estaba.
Suelta aquí los archivos PDF
Arrástralos directamente desde el escritorio
- Solo archivos PDF
- Hasta 15 MB cada uno
- 2 archivos por ejecución - ilimitados con Pro
Preguntas frecuentes
¿El OCR cambia el aspecto del escaneo?
No. La imagen escaneada queda byte a byte como estaba; lo que se añade es una capa de texto invisible encima, la misma construcción que usan Acrobat y cualquier programa de escáner para un PDF con búsqueda. Buscar, seleccionar y copiar funcionan; la impresión no cambia.
¿Qué tal es el reconocimiento?
Es el motor neuronal de Tesseract 5, el mismo que hay detrás de la mayoría del OCR de código abierto, ejecutándose como WebAssembly en tu navegador. Un escaneo limpio a 300 dpi de texto impreso sale casi letra por letra; una página torcida, tenue o fotografiada, menos - endérezala antes con Enderezar PDF. Las palabras de las que el motor no estaba seguro se colocan igualmente, para que una búsqueda las encuentre, y la herramienta dice cuántas había.
¿Qué idiomas hay y puedo elegir varios?
Húngaro, inglés, alemán, francés, italiano, español, polaco, rumano, eslovaco, checo, croata, esloveno, serbio (latino y cirílico), ucraniano, ruso, búlgaro, griego, turco, danés, sueco, noruego, finés, neerlandés, portugués, latín, árabe, persa, hebreo, chino (simplificado y tradicional), japonés, coreano y alemán en Fraktur para la letra gótica de antes de la guerra, en cualquier combinación - un contrato bilingüe se puede leer con dos. Cada idioma es una descarga aparte que el navegador guarda después.
¿Se sube el PDF?
No se sube nada: el archivo se abre y se procesa dentro de tu navegador y nunca sale de tu dispositivo. Cierra la pestaña y desaparece. El motor de OCR y sus archivos de idioma también vienen de este sitio, así que ni siquiera la elección de idioma se envía a ninguna parte.
¿Qué páginas lee?
Por defecto solo las que aún no tienen capa de texto, porque una página nacida digital ya la tiene y una segunda duplicaría cada resultado de búsqueda. Si un OCR anterior hizo un mal trabajo, cambia a todas las páginas - la nueva capa va debajo de la antigua.
¿Cuánto tarda?
Más que cualquier otra cosa de aquí - el reconocimiento es trabajo de verdad, y cada página lleva su momento incluso en un equipo rápido, así que conviene lanzar un escaneo largo y dejarlo trabajar. La primera vez también descarga el motor de reconocimiento y los datos de idioma (unos pocos megabytes, desde este sitio y no desde una CDN); después tu navegador los tiene en caché, y el botón muestra por dónde va, página a página.
¿Echas algo en falta o te sorprendió el resultado?
Herramientas relacionadas
- PDF a textoExtrae el texto de un PDF a un archivo .txt, página a página
- PDF a WordConvierte un PDF en un documento de Word editable (.docx) que conserva el diseño
- Enderezar PDFCorrige escaneos torcidos - detecta la inclinación de cada página y la nivela
- Rotar PDF automáticamentePon derechas las páginas de lado o del revés - detectadas página a página
- Censurar PDFElimina texto e imágenes para siempre