OCR de PDF e imágenes escaneadas
Para PDFs que son en realidad imágenes escaneadas, o para fotos/imágenes sueltas de un documento (sin texto seleccionable). Reconocemos el texto con OCR — todo corre en tu navegador, tus archivos nunca se suben a ningún servidor. Podés combinar PDF e imágenes, en cualquier orden.
Idiomas a reconocer
Elegí solo los idiomas que aparecen en tu documento — cada uno agrega una descarga de varios MB la primera vez que se usa.
Preprocesamiento antes del OCR
"Blanco y negro puro" calcula automáticamente el punto exacto de corte entre tinta y papel (método de Otsu) — puede rendir mejor que el contraste automático en escaneos muy limpios de un solo color, pero puede perder detalle en fotos con sombras irregulares o texto muy fino.
Limitaciones
El resultado se ve igual que el original (salvo si corregís la inclinación), pero el texto queda seleccionable y buscable — también podés descargar solo el texto reconocido como .txt. El OCR es más lento cuanto más páginas/imágenes e idiomas elijas, y funciona mejor con escaneos nítidos y derechos — texto borroso, manuscrito o una foto con sombras fuertes puede reconocerse mal o no reconocerse. El enderezado automático corrige inclinaciones chicas (hasta unos 9°); si tu documento ya viene bien derecho o querés conservarlo exactamente como está, podés destildar esa casilla. Sobre el preprocesamiento: "Contraste automático" funciona bien en la mayoría de los casos; "Blanco y negro puro (Otsu)" puede dar mejores resultados en escaneos muy limpios y parejos, pero en fotos con sombras irregulares o texto con resaltador de color puede perder información — si tu escaneo ya es nítido y a color, probá "Ninguno".
