1Last opp skannet PDF documents. En ren 300 DPI gråtoneskanning gir gjenkjenneren mest virkemed.
2Fortell det hvilket språk som skal forventes – å gi språket navn slår å gi det et gjetting med stor margin.
3Kjør gjenkjenningspasset, ordene blir skrevet tilbake som et usynlig lag som sitter over det opprinnelige sidebildet.
4Last ned den søkbare fila PDF – den ser identisk ut, men du kan nå søke og velge teksten i den.
OCR PDF Vanlige spørsmål
Hvordan gjør OCR PDF en skanning til tekst?
+
Konkret, hver side blir tegnet, kjørt gjennom en tekstgjenkjenning i Tesseract på over 100 språk, og de gjenkjente ordene skrives tilbake som et usynlig tekstlag plassert over originalbildet – så siden ser uendret ut, men kan søkes og velges.. Siden ser fremdeles akkurat slik ut, den gjenkjente teksten sitter usynlig bak bildet, så søk og utvalg virker uten å endre utseende.
Hvilke språk kan det gjenkjenne?
+
Over 100, inkludert latinske, kyrilliske, greske, arabiske, hebraiske, kinesiske, japanske, koreanske og indiske skript. Fortelling om hvilket språk som kan forventes, forbedrer nøyaktigheten betydelig når det gisttes.
Har kildeformatet innvirkning på gjenkjenningen?
+
Det gjør det. PDF fikser siden: skrifttyper, vektorer, rasterbilder og tekstkoordinater er fryste slik at alle lesere ser samme utforming Hvordan siden lagres bestemmer hvilken oppløsning og fargeinformasjon som gjenkjenneren må arbeide med.
Noe spesielt for PDF her?
+
Ja, en PDF er en objektgraf, ikke et sidebilde, så teksten forblir valgbar og vektorer er skarp uansett hva som skjer med raster- innholdet inne i den Det påvirker det som gjenkjenneren kan se.
Hvor nøyaktig er det?
+
På en ren 300 DPI tekstskanning, høy nok til at feil er sjeldne og for det meste i uvanlig riktige substantiv. Nøyaktighet faller kraftig av med lav oppløsning, skjevhet, skygger fra et telefonkamera, uvanlige skrifter og håndskrift – håndskrift spesielt ikke hva dette er til.
Hva skal jeg skanne på for det beste resultatet?
+
300 DPI i gråskala er søtpunktet. Under 200 DPI tegn begynner å bryte ned, over 400 DPI får du nesten ingenting og betaler for det i filstørrelse og behandlingstid.
Hva kan jeg laste opp til OCR PDF?
+
Alle vanlige PDF- er, også de som en skanner, en tekstbehandler eller en skriverdriver lager. Filer med et eierpassord som bare begrenser redigeringen, håndteres, filer som trenger et brukerpassord for å åpne er ikke det, og vi forsøker ikke å bryte krypteringen.
Er det en filstørrelsesgrense på OCR PDF?
+
Ja: « free accounts » behandler dokumenter opptil 5 MB hver, som dekker de fleste rapporter og kontrakter, men ikke et lenge skannet dokument ved 600 DPI, Ghostscript og qpdf utfører arbeidet. Skannede PDF- er er det vanlige som overstiger det, og å komprimere dokumentet først er normalt nok til å bringe det tilbake under.
Vil OCR PDF senke kvaliteten til min PDF documents?
+
Tekst - og vektorgrafikk er objekter i stedet for piksler, så de holder seg helt skarpe uansett forstørrelse. Bare de innebygde rasterbildene kan bryte sammen, og bare hvis operasjonen du valgte tar om samplinger.
Kan jeg kjøre OCR PDF på flere PDF documents samtidig?
+
Ja, last opp settet og de behandler det parallelt under ett sett med innstillinger, noe som er poenget med å gjøre en arbeidsflyt for dokumentet her i stedet for å klikke gjennom en skrivebordsleser.
Overleve bokmerker, lenker og skjemafelt?
+
Omrisser, interne lenker og merknader blir beholdt uansett hvor operasjonen tillater det. Digitale signaturer er unntaket: enhver endring i fila gjør en signatur ugyldig, fordi det er akkurat det en signatur er for.
Koster OCR PDF noe?
+
Nr. OCR PDF er ledig uten konto, og ingenting er stemplet på sidene. Opplastede dokumenter slettes fra arbeiderne kort tid etter at jobben er ferdig.