1Sube el PDF documents escaneado; un escaneo de escala de grises limpio de 300 DPI le da al reconocidor el máximo con el que trabajar.
2Dile qué idioma esperar — nombrar el idioma late dejando que adivine por un amplio margen.
3Ejecute el pase de reconocimiento; las palabras se escriben de nuevo como una capa invisible sentada sobre la imagen original de la página.
4Descargue el archivo PDF que puede buscarse, pero ahora puede buscar y seleccionar el texto que contiene.
PDF con reconocimiento óptico de caracteres Preguntas frecuentes
¿Algo específico para PDF aquí?
+
Sí — un PDF es un gráfico de objetos, no una imagen de página, por lo que el texto permanece seleccionable y los vectores permanecen en forma aguda sin importar lo que pase con el contenido de raster dentro de él. Afecta lo que el reconocidor puede ver.
¿En qué debería buscar el mejor resultado?
+
300 DPI en escala de grises es el punto dulce. Por debajo de 200 DPI de caracteres de formas comienzan a descomponerse; por encima de 400 DPI usted gana casi nada y paga por él en tamaño de archivo y tiempo de procesamiento.
¿Cómo OCR PDF convierte un escaneo en texto?
+
Concretamente, cada página se representa, se ejecuta a través de un pase de reconocimiento de texto Tesseract en más de 100 idiomas, y las palabras reconocidas se escriben de nuevo como una capa de texto invisible colocado sobre la imagen original, por lo que la página se ve sin cambios pero es buscable y seleccionable. La página todavía se ve exactamente como lo hizo — el texto reconocido se encuentra invisiblemente detrás de la imagen así que la búsqueda y selección de trabajo sin cambiar la apariencia.
¿Qué idiomas puede reconocer?
+
Más de 100, incluyendo latín, cirílico, griego, árabe, hebreo, chino, japonés, coreano y las escrituras índicas. Diciéndole qué idioma esperar mejora materialmente la precisión sobre dejar que adivine.
Does OCR PDF cost anything?
+
No. OCR PDF es gratis sin una cuenta, y nada se estampa en las páginas. Los documentos cargados se eliminan de los trabajadores poco después de que el trabajo completa.
¿Qué puedo subir a OCR PDF?
+
Cualquier PDF estándar, incluyendo los producidos por un escáner, por un procesador de textos o por un controlador de impresión. Los archivos con una contraseña de propietario que sólo restringe la edición se manejan; los archivos que necesitan una contraseña de usuario para abrir no lo son, y no intentamos romper el cifrado.
¿Hay un límite de tamaño de archivo en OCR PDF?
+
Sí: cuentas libres procesan documentos hasta 25 MB cada uno, que cubre la mayoría de los informes y contratos, pero no un documento escaneado largo en 600 DPI; Ghostscript y qpdf hacen el trabajo. Los PDF escaneados son lo habitual que lo supera, y comprimir el documento primero es normalmente suficiente para traerlo de vuelta debajo.
¿Sobreviven marcadores, enlaces y campos de forma?
+
Los esquejes, los enlaces internos y las anotaciones se conservan donde la operación lo permita. Las firmas digitales son la excepción: cualquier cambio en el archivo invalida necesariamente una firma, porque para eso es precisamente una firma.
¿Por qué un MP3 sitio host OCR PDF?
+
MP3.to está construido alrededor del formato que hizo que el audio portátil fuera ordinario: universalmente jugable, lo suficientemente pequeño como para ignorarlo, y con pérdidas de una manera que solo importa si sigues recodiéndolo. Clúster de trabajos de audio: la misma persona que necesita un formato cambiado generalmente necesita el archivo cortado, nivelado o hecho más pequeño en la misma sesión. Poner OCR PDF detrás de la misma carga, los mismos topes y la misma cuenta es lo que convierte tres pestañas en una.
¿Qué debo hacer con el resultado una vez que OCR PDF esté terminado?
+
El convertidor de este sitio mueve audio entre MP3, WAV, FLAC, M4A, OGG y Opus, por lo que el formato de salida es una decisión que puede dejar hasta el final en lugar de comprometerse al principio. Hacer eso después de OCR PDF en lugar de antes significa que el código ocurre una vez, en el archivo en el que realmente se estableció, en lugar de dos veces.
Is OCR PDF here the same tool the sibling sites run?
+
Los motores son compartidos — la misma construcción ffmpeg, los mismos trabajadores, los mismos límites. Lo que un sitio MP3 añade es un punto de vista sobre las tasas de bits, sobre lo que sobrevive a un código y sobre cuando un intermediario sin pérdidas vale la pena el tiempo de carga. También comienza de un hecho sobre el formato de este sitio se llama después de: Los marcos MP3 son bloques de tamaño fijo, por lo que un terreno cortado en un límite de marco y marcadores de reproducción sin huecos no sobreviven a un re-encode.
¿Necesito una cuenta, y se guarda algo?
+
No se hace ninguna cuenta, y no se guarda nada: las cargas se eliminan de los trabajadores poco después de que el trabajo termina, nada se escucha y nada se indexa. Existen cuentas gratuitas para el historial y el tamaño de lote, no para el acceso.