Extraer texto de imágenes y PDF (OCR)

Extrae el texto de imágenes (JPG, PNG, WebP…) y de PDF escaneados directamente en tu navegador, gratis y sin límites de uso. Colibrí usa OCR (reconocimiento óptico de caracteres) con el motor Tesseract para convertir una foto, una captura de pantalla o un documento escaneado en texto que puedes copiar, editar y descargar. Reconoce texto en 9 idiomas —español, inglés, portugués, francés, alemán, italiano, japonés, chino y árabe—, procesa varios archivos a la vez y no impone marcas de agua, registros ni límites. A diferencia de las webs que suben tu documento a un servidor y cobran por el OCR, aquí todo ocurre en tu dispositivo: tus imágenes y PDF nunca salen de tu navegador.

Suelta imágenes o PDF aquí

o haz clic para elegirlos

JPG · PNG · WEBP · PDF escaneado

Cómo extraer texto de una imagen o PDF

  1. Arrastra tus imágenes o PDF, o haz clic para elegirlos (puedes añadir varios).
  2. Elige el idioma del texto que quieres reconocer.
  3. Pulsa «Extraer texto». La primera vez, el idioma se descarga una sola vez.
  4. Espera a que termine el reconocimiento; verás el progreso de cada archivo.
  5. Revisa y corrige el texto si hace falta, y cópialo o descárgalo como .txt.

Preguntas frecuentes

¿Se suben mis imágenes o PDF a algún servidor?

No. Todo el OCR ocurre en tu navegador con WebAssembly (motor Tesseract); tus archivos nunca salen de tu dispositivo y la herramienta sigue funcionando sin conexión una vez descargado el idioma. Es seguro incluso con documentos privados o confidenciales.

¿Qué es el OCR?

El OCR (reconocimiento óptico de caracteres) es la tecnología que «lee» el texto que aparece dentro de una imagen o de un documento escaneado y lo convierte en texto real que puedes seleccionar, copiar y editar. Es justo lo que necesitas cuando tienes una foto o un PDF escaneado del que no puedes copiar el texto.

¿Qué idiomas reconoce?

Nueve: español, inglés, portugués, francés, alemán, italiano, japonés, chino (simplificado) y árabe. Elige el idioma que coincida con el del documento para obtener el mejor resultado. Cada idioma se descarga una sola vez (entre 1 y 3 MB) y se guarda en tu navegador para las próximas veces.

¿Funciona con PDF escaneados?

Sí. Si tu PDF es un escaneo (páginas que en realidad son imágenes y de las que no puedes copiar el texto), la herramienta convierte cada página en imagen y le aplica OCR. Si tu PDF ya tiene texto seleccionable, es más rápido y exacto usar «PDF a texto», que extrae el texto directamente sin OCR.

¿Qué precisión tiene?

Depende mucho de la calidad de la imagen. Con texto impreso, nítido, bien iluminado y recto, el resultado suele ser muy bueno. Con fotos borrosas, torcidas, con poco contraste o con texto manuscrito habrá más errores. Por eso el texto es editable: puedes corregir cualquier fallo antes de copiarlo.

¿Reconoce texto manuscrito?

El motor está optimizado para texto impreso o mecanografiado. La escritura a mano puede funcionar en casos muy claros, pero en general no es fiable; para manuscritos el resultado será limitado.

¿Es gratis? ¿Tiene marcas de agua o límites?

Es totalmente gratis, sin marca de agua, sin registro y sin límite de usos ni de tamaño. Muchas webs de PDF reservan el OCR a sus planes de pago y suben tu documento a su servidor; aquí es libre e ilimitado y nada se sube.

¿Puedo procesar varias imágenes o páginas a la vez?

Sí. Puedes añadir varios archivos y se procesan todos con el idioma elegido. En los PDF se reconoce página por página. Al terminar puedes descargar cada texto por separado o todo junto en un solo archivo .txt.

¿Cómo consigo un mejor reconocimiento?

Usa la mayor resolución posible, con el texto recto y bien contrastado (oscuro sobre fondo claro). Recorta la zona que te interesa y evita sombras o reflejos. Elegir el idioma correcto también mejora bastante la precisión.

Guías relacionadas