Guía de OCR
OCR gratis: extraer texto de imágenes y PDF escaneados sin subirlos
Sacar el texto de una foto, una captura o un PDF escaneado es una de esas tareas que parecen simples hasta que las necesitas: la mayoría de las webs de PDF reservan el OCR a sus planes de pago y, para colmo, suben tu documento a su servidor para procesarlo. Si ese documento es un contrato, una factura o el escaneo de un carnet, subirlo a un tercero para «leerlo» es justo lo que querías evitar.
Esta guía explica, con datos concretos, dónde ponen el muro las herramientas más populares y presenta una alternativa gratis, en 9 idiomas y que no sube nada: reconoce el texto dentro de tu navegador.
Qué cobran o limitan las webs populares
El OCR (reconocimiento óptico de caracteres) es casi siempre una función «premium». A fecha de esta guía:
- SmallPDF: el OCR no está en el plan gratis (que además limita a 2 tareas al día); es una función de pago (plan Pro, desde unos 12 USD al mes).
- iLovePDF: el OCR es Premium; la capa gratuita limita el número de tareas y el tamaño del archivo.
- PDFCandy y similares: OCR con límites por hora o esperas entre usos.
Y el punto común más importante: todas suben el archivo a su servidor para procesarlo. Para un documento escaneado —que por definición suele ser algo que quieres digitalizar, no publicar— esa es precisamente la fricción que sobra.
La alternativa: OCR en tu navegador, gratis y sin subir nada
Extraer texto (OCR) de Colibrí hace el reconocimiento dentro de tu navegador, con el motor de código abierto Tesseract compilado a WebAssembly. Es gratis, sin registro, sin marca de agua y sin límites, y tus imágenes y PDF nunca se suben a ningún sitio.
- Imágenes y PDF escaneados: suelta un JPG, un PNG, una captura o un PDF y obtén el texto. Los PDF se procesan página por página.
- 9 idiomas: español, inglés, portugués, francés, alemán, italiano, japonés, chino y árabe. El idioma se descarga una sola vez (1–3 MB) y se guarda en tu navegador para las próximas.
- Por lotes: añade varios archivos y procésalos de una vez.
- Texto editable: el resultado aparece en un cuadro que puedes corregir antes de copiarlo o descargarlo como .txt.
Honestidad: qué esperar del OCR
Ninguna herramienta de OCR es perfecta, y conviene decirlo. La precisión depende mucho de la calidad de la imagen: con texto impreso, nítido y recto el resultado suele ser muy bueno; con fotos borrosas, torcidas o con poco contraste habrá errores. El texto manuscrito no es fiable. Por eso el resultado es editable: corriges lo que haga falta y listo.
Un caso importante: si tu PDF ya tiene texto seleccionable (no es un escaneo), no necesitas OCR. Usa PDF a texto, que extrae el texto directamente, más rápido y sin errores de reconocimiento. El OCR es para cuando el texto está «dentro» de una imagen o de un escaneo.
Paso a paso
- Abre Extraer texto (OCR) y arrastra tus imágenes o PDF (o pulsa para elegirlos). Se abren en tu navegador; no se suben.
- Elige el idioma del documento. La primera vez se descarga ese idioma (una sola vez).
- Pulsa Extraer texto y espera a que termine el reconocimiento; verás el progreso de cada archivo.
- Revisa y corrige el texto, y cópialo o descárgalo como .txt (individual o todo junto).
Si trabajas mucho con documentos, al lado tienes el resto de la caja de herramientas —comprimir PDF, proteger PDF o el editor de PDF—, y todas funcionan igual: en tu navegador, sin subir nada.
Preguntas frecuentes
¿Es gratis de verdad y sin límites?
Sí. Sin registro, sin marca de agua y sin límite de archivos ni de tamaño. No hay un plan de pago que desbloquee el OCR: está disponible para todo el mundo, en los 9 idiomas.
¿Se sube mi documento a algún servidor?
No. A diferencia de SmallPDF, iLovePDF y la mayoría de webs de OCR, aquí el reconocimiento ocurre en tu navegador y ni el archivo ni el texto extraído salen de tu dispositivo. Es la mejor garantía para documentos escaneados confidenciales.
¿Qué precisión tiene comparado con las de pago?
Usa Tesseract, el motor de OCR de código abierto más extendido. Con texto impreso, nítido y recto los resultados son muy buenos; con imágenes de baja calidad o texto manuscrito habrá errores, igual que en cualquier OCR. Como el texto es editable, corriges lo poco que falle antes de copiarlo.
¿En qué idiomas funciona?
En nueve: español, inglés, portugués, francés, alemán, italiano, japonés, chino (simplificado) y árabe. Cada idioma se descarga una sola vez (1–3 MB) y queda guardado en tu navegador para las próximas veces.
¿Sirve para un PDF que ya tiene texto?
Si el PDF no es un escaneo y ya permite seleccionar el texto, es mejor «PDF a texto», que lo extrae directamente sin OCR (más rápido y exacto). El OCR es para cuando el texto está «dentro» de una imagen o de un documento escaneado.
Herramientas de esta guía
Todo lo de esta guía ocurre dentro de tu navegador: tus archivos no se suben a ningún servidor. Esa es la promesa de Colibrí.
Más guías
- Alternativa gratis para redimensionar una imagen sin subirla
- Alternativa gratis para poner marca de agua a tus fotos
- Alternativa gratis a TinyPNG para comprimir imágenes
- Alternativa gratis para proteger un PDF con contraseña sin subirlo
- Alternativa gratis a iLovePDF y SmallPDF para comprimir PDF
- Cómo editar un PDF gratis y sin subirlo a ningún servidor
- Cómo firmar un PDF online sin subirlo a internet
- Cómo convertir YAML a JSON (y JSON a YAML) sin errores