Plan gratuito: 1 conversión/hora, 1 archivo a la vez
Ir ilimitado →

PDF con reconocimiento óptico de caracteres

Extraer texto de archivos PDF escaneados

Seleccione sus archivos

*Archivos eliminados después de 24 horas

Convierte archivos de hasta 1 GB gratis. Los usuarios Pro pueden convertir archivos de hasta 100 GB. Regístrate ahora.

Subiendo

0%

Cómo OCR PDF

1 Sube el PDF documents escaneado; un escaneo de escala de grises limpio de 300 DPI le da al reconocidor el máximo con el que trabajar.
2 Dile qué idioma esperar — nombrar el idioma late dejando que adivine por un amplio margen.
3 Ejecute el pase de reconocimiento; las palabras se escriben de nuevo como una capa invisible sentada sobre la imagen original de la página.
4 Descargue el archivo PDF que puede buscarse, pero ahora puede buscar y seleccionar el texto que contiene.

PDF con reconocimiento óptico de caracteres Preguntas frecuentes

¿Algo específico para PDF aquí?
+
Sí — un PDF es un gráfico de objetos, no una imagen de página, por lo que el texto permanece seleccionable y los vectores permanecen en forma aguda sin importar lo que pase con el contenido de raster dentro de él. Afecta lo que el reconocidor puede ver.
300 DPI en escala de grises es el punto dulce. Por debajo de 200 DPI de caracteres de formas comienzan a descomponerse; por encima de 400 DPI usted gana casi nada y paga por él en tamaño de archivo y tiempo de procesamiento.
Concretamente, cada página se representa, se ejecuta a través de un pase de reconocimiento de texto Tesseract en más de 100 idiomas, y las palabras reconocidas se escriben de nuevo como una capa de texto invisible colocado sobre la imagen original, por lo que la página se ve sin cambios pero es buscable y seleccionable. La página todavía se ve exactamente como lo hizo — el texto reconocido se encuentra invisiblemente detrás de la imagen así que la búsqueda y selección de trabajo sin cambiar la apariencia.
Más de 100, incluyendo latín, cirílico, griego, árabe, hebreo, chino, japonés, coreano y las escrituras índicas. Diciéndole qué idioma esperar mejora materialmente la precisión sobre dejar que adivine.
No. OCR PDF es gratis sin una cuenta, y nada se estampa en las páginas. Los documentos cargados se eliminan de los trabajadores poco después de que el trabajo completa.
Cualquier PDF estándar, incluyendo los producidos por un escáner, por un procesador de textos o por un controlador de impresión. Los archivos con una contraseña de propietario que sólo restringe la edición se manejan; los archivos que necesitan una contraseña de usuario para abrir no lo son, y no intentamos romper el cifrado.
Sí: cuentas libres procesan documentos hasta 25 MB cada uno, que cubre la mayoría de los informes y contratos, pero no un documento escaneado largo en 600 DPI; Ghostscript y qpdf hacen el trabajo. Los PDF escaneados son lo habitual que lo supera, y comprimir el documento primero es normalmente suficiente para traerlo de vuelta debajo.
Los esquejes, los enlaces internos y las anotaciones se conservan donde la operación lo permita. Las firmas digitales son la excepción: cualquier cambio en el archivo invalida necesariamente una firma, porque para eso es precisamente una firma.
MP3.to está construido alrededor del formato que hizo que el audio portátil fuera ordinario: universalmente jugable, lo suficientemente pequeño como para ignorarlo, y con pérdidas de una manera que solo importa si sigues recodiéndolo. Clúster de trabajos de audio: la misma persona que necesita un formato cambiado generalmente necesita el archivo cortado, nivelado o hecho más pequeño en la misma sesión. Poner OCR PDF detrás de la misma carga, los mismos topes y la misma cuenta es lo que convierte tres pestañas en una.
El convertidor de este sitio mueve audio entre MP3, WAV, FLAC, M4A, OGG y Opus, por lo que el formato de salida es una decisión que puede dejar hasta el final en lugar de comprometerse al principio. Hacer eso después de OCR PDF en lugar de antes significa que el código ocurre una vez, en el archivo en el que realmente se estableció, en lugar de dos veces.
Los motores son compartidos — la misma construcción ffmpeg, los mismos trabajadores, los mismos límites. Lo que un sitio MP3 añade es un punto de vista sobre las tasas de bits, sobre lo que sobrevive a un código y sobre cuando un intermediario sin pérdidas vale la pena el tiempo de carga. También comienza de un hecho sobre el formato de este sitio se llama después de: Los marcos MP3 son bloques de tamaño fijo, por lo que un terreno cortado en un límite de marco y marcadores de reproducción sin huecos no sobreviven a un re-encode.
No se hace ninguna cuenta, y no se guarda nada: las cargas se eliminan de los trabajadores poco después de que el trabajo termina, nada se escucha y nada se indexa. Existen cuentas gratuitas para el historial y el tamaño de lote, no para el acceso.

Califica esta herramienta
5.0/5 - 0 votos
ns6.com — Su dominio, hecho bien. Privacidad gratuita y DNS incluido.
O suelta tus archivos aquí