RRePDFBLOG

PDF escaneado a texto: cómo hacerlo buscable

Primer plano de una hoja de contrato recién salida del escáner sobre la bandeja de cristal, con la pantalla del ordenador al fondo mostrando la misma página y el cursor sobre un párrafo seleccionado en azul.

Has escaneado el documento y lo has guardado en PDF. Se ve perfecto. Pero cuando alguien te pide que busques una cláusula dentro, el buscador no encuentra nada: ahí no hay texto, hay una foto de un papel.

Es el malentendido más común de todo el papeleo digital. El escáner entrega una imagen de la hoja, no las palabras que hay escritas en ella. Y esa diferencia decide qué se puede hacer después con el archivo.

Un escaneo es una fotografía de un papel

Cuando el escáner termina, lo que produce es una imagen por página: una rejilla de puntos con la mancha de la tinta. El ordenador ve zonas claras y oscuras. No ve letras.

Por eso un PDF escaneado se comporta como una foto en todo. Se puede imprimir, girar, recortar y archivar. Lo que no se puede es seleccionar una frase con el ratón, copiar un párrafo a un correo ni encontrar una palabra con el buscador del lector.

Hay una prueba rápida para saber en qué caso estás: intenta marcar una línea de texto con el ratón. Si no se queda nada seleccionado, el documento es una imagen.

Qué es una capa de texto

La capa de texto es una capa invisible que se coloca encima de la imagen. Está hecha de palabras reales, cada una con su posición en la página, pero sin color y sin grosor: no se ve, solo se puede leer.

El programa que la crea —el OCR, reconocimiento óptico de caracteres— hace dos cosas: mira la imagen, adivina qué letra hay en cada mancha, y escribe esa letra en la capa de encima. La imagen se queda debajo, intacta.

Ahí está la parte buena: el documento sigue viéndose igual, con su sello, su firma y su trama. Lo que cambia es que debajo hay texto de verdad. Y la parte mala: lo que hay escrito en esa capa es una suposición del programa, no una copia fiel de lo que dice el papel.

Qué se puede hacer y qué no

Con una capa de texto bien hecha, un PDF escaneado se vuelve manejable:

  • Buscar una palabra o un número de expediente dentro del documento.
  • Seleccionar y copiar un párrafo sin reescribirlo a mano.
  • Que un lector de pantalla pueda leerlo en voz alta.
  • Convertirlo a Word o a Markdown sin teclear el contenido otra vez.

Lo que no cambia es el aspecto: si el escáner salió torcido, el documento sigue torcido. Y lo que no arregla es el contenido: la capa no corrige una errata del papel ni recupera una palabra que una mancha dejó ilegible. Ahí el programa escribirá algo parecido a lo que creyó ver, y casi siempre se equivoca justo en el dato que importa.

Cómo comprobar que la capa es correcta

Nunca conviene fiarse del resultado sin mirarlo. Hay tres comprobaciones que se hacen en un minuto:

  1. Selecciona un párrafo entero y cópialo en un editor de texto. Si el resultado es legible, la capa está bien colocada. Si sale un amasijo de letras, el OCR falló.
  2. Busca tres cosas concretas: el importe, el nombre y la fecha. Son los datos que más duele ver mal transcritos.
  3. Busca una palabra con acento o con eñe, como «año» o «días». Es donde más falla.

Si alguna de las tres falla, el problema casi siempre es la calidad del escaneo, no el programa. Una página torcida, una mancha o un contraste bajo hacen que el reconocimiento invente. En ese caso conviene volver a escanear esa página —recta y a más resolución— antes que dar por bueno el texto.

Los acentos y las búsquedas

El español lleva tildes, eñes y diéresis, y eso significa que una misma palabra puede quedar escrita de dos maneras si el reconocimiento falla: «gestión» o «gestion». El buscador no mezcla las dos. Si la capa escribió la palabra sin tilde, escribirla con tilde no la encuentra.

Con los números pasa lo mismo: un uno leído como una ele, un cero como una o. En un número de expediente o en una cuenta, ese detalle arruina la búsqueda y nadie lo nota hasta que hace falta el documento.

Hay un truco que ahorra tiempo: busca siempre la parte de la palabra que no lleva tilde. Buscar «dias» encuentra «días» y «dias» en casi todos los lectores; buscar «días» solo encuentra una de las dos.

Cómo lo resuelve RePDF

RePDF aplica OCR sobre el documento y añade la capa de texto encima de la imagen, sin tocar la imagen. El archivo se procesa en tu equipo, y el resultado se puede buscar, copiar y convertir desde ahí.

Lo importante es no dar el trabajo por terminado al guardar. Abre el PDF, busca un dato con acento y otro sin él, y selecciona un párrafo entero. Si las tres cosas salen bien, ese escaneo ya es un documento de verdad. Si no, vuelve a la página que falla y repite el escaneo.

Tus documentos nunca salen de tu equipo, así que puedes pasar por OCR un expediente de cliente sin estar pensando dónde queda la copia.

¿Tienes un documento así encima de la mesa? Zero-Cloud Upload — tus documentos nunca salen de tu equipo.
Abrir el estudio