Extraer texto de imágenes y PDF (OCR)
Extrae el texto de imágenes (JPG, PNG, WebP…) y de PDF escaneados directamente en tu navegador, gratis y sin límites de uso. Colibrí usa OCR (reconocimiento óptico de caracteres) con el motor Tesseract para convertir una foto, una captura de pantalla o un documento escaneado en texto que puedes copiar, editar y descargar. Reconoce texto en 9 idiomas —español, inglés, portugués, francés, alemán, italiano, japonés, chino y árabe—, procesa varios archivos a la vez y no impone marcas de agua, registros ni límites. A diferencia de las webs que suben tu documento a un servidor y cobran por el OCR, aquí todo ocurre en tu dispositivo: tus imágenes y PDF nunca salen de tu navegador.
Cómo extraer texto de una imagen o PDF
- Arrastra tus imágenes o PDF, o haz clic para elegirlos (puedes añadir varios).
- Elige el idioma del texto que quieres reconocer.
- Pulsa «Extraer texto». La primera vez, el idioma se descarga una sola vez.
- Espera a que termine el reconocimiento; verás el progreso de cada archivo.
- Revisa y corrige el texto si hace falta, y cópialo o descárgalo como .txt.
Preguntas frecuentes
¿Se suben mis imágenes o PDF a algún servidor?
No. Todo el OCR ocurre en tu navegador con WebAssembly (motor Tesseract); tus archivos nunca salen de tu dispositivo y la herramienta sigue funcionando sin conexión una vez descargado el idioma. Es seguro incluso con documentos privados o confidenciales.
¿Qué es el OCR?
El OCR (reconocimiento óptico de caracteres) es la tecnología que «lee» el texto que aparece dentro de una imagen o de un documento escaneado y lo convierte en texto real que puedes seleccionar, copiar y editar. Es justo lo que necesitas cuando tienes una foto o un PDF escaneado del que no puedes copiar el texto.
¿Qué idiomas reconoce?
Nueve: español, inglés, portugués, francés, alemán, italiano, japonés, chino (simplificado) y árabe. Elige el idioma que coincida con el del documento para obtener el mejor resultado. Cada idioma se descarga una sola vez (entre 1 y 3 MB) y se guarda en tu navegador para las próximas veces.
¿Funciona con PDF escaneados?
Sí. Si tu PDF es un escaneo (páginas que en realidad son imágenes y de las que no puedes copiar el texto), la herramienta convierte cada página en imagen y le aplica OCR. Si tu PDF ya tiene texto seleccionable, es más rápido y exacto usar «PDF a texto», que extrae el texto directamente sin OCR.
¿Qué precisión tiene?
Depende mucho de la calidad de la imagen. Con texto impreso, nítido, bien iluminado y recto, el resultado suele ser muy bueno. Con fotos borrosas, torcidas, con poco contraste o con texto manuscrito habrá más errores. Por eso el texto es editable: puedes corregir cualquier fallo antes de copiarlo.
¿Reconoce texto manuscrito?
El motor está optimizado para texto impreso o mecanografiado. La escritura a mano puede funcionar en casos muy claros, pero en general no es fiable; para manuscritos el resultado será limitado.
¿Es gratis? ¿Tiene marcas de agua o límites?
Es totalmente gratis, sin marca de agua, sin registro y sin límite de usos ni de tamaño. Muchas webs de PDF reservan el OCR a sus planes de pago y suben tu documento a su servidor; aquí es libre e ilimitado y nada se sube.
¿Puedo procesar varias imágenes o páginas a la vez?
Sí. Puedes añadir varios archivos y se procesan todos con el idioma elegido. En los PDF se reconoce página por página. Al terminar puedes descargar cada texto por separado o todo junto en un solo archivo .txt.
¿Cómo consigo un mejor reconocimiento?
Usa la mayor resolución posible, con el texto recto y bien contrastado (oscuro sobre fondo claro). Recorta la zona que te interesa y evita sombras o reflejos. Elegir el idioma correcto también mejora bastante la precisión.