Slobodan plan: 1 pretvorba/sat, 1 datoteka u isto vrijeme
Idi neograničeno →

PDF OCR

Izdvajanje teksta iz skeniranih PDF-ova

Odaberite svoje datoteke

*Datoteke izbrisane nakon 24 sata

Besplatno konvertujte datoteke do 1 GB, Pro korisnici mogu konvertovati datoteke do 100 GB; Registrujte se odmah

Otpremanje

0%

Kako da OCR PDF

1 Upload the scanned PDF documents; a clean 300 DPI grayscale scan gives the recognizer the most to work with.
2 Recite mu koji jezik da očekuje - imenovanje jezika pobjeđuje, dopuštajući mu da pogodi sa velikom razlikom.
3 U tom slučaju, riječi se vraćaju kao nevidljivi sloj koji se nalazi iznad originalne slike stranice.
4 Preuzmi PDF datoteku koja se može pretraživati — izgleda identično, ali sada možete pretraživati i birati tekst u njoj.

PDF OCR Često postavljana pitanja

Kako OCR PDF pretvara skeniranje u tekst?
+
Konkretno, svaka stranica se renderuje, prolazi kroz Tesseract-ov prolaz za prepoznavanje teksta na preko 100 jezika, a prepoznate riječi se zapisuju nazad kao nevidljivi sloj teksta postavljen preko originalne slike — tako da stranica izgleda nepromijenjeno, ali je moguće pretraživati i birati. stranica i dalje izgleda tačno kao što je bila - prepoznati tekst sjedi nevidljivo iza slike tako da pretraživanje i odabir rade bez mijenjanja izgleda.
Preko 100, uključujući latinski, ćirilica, grčki, arapski, hebrejski, kineski, japanski, korejskindijski pisma.
To je tako. PDF popravlja stranicu: fontovi, vektori, rasterske slike i tekstne koordinate su zamrznuti tako da svaki čitalac vidi identičan izgled. Kako je stranica pohranjena odlučuje sa kojom rezolucijom i informacijama o boji prepoznavač mora raditi.
Da, PDF je objektni graf, a ne slika stranice, tako da tekst ostaje odabirljiv i vektori ostaju oštri bez obzira šta se desilo sa rastrskim sadržajem unutar njega. Utiče na ono što prepoznavač može vidjeti.
Na čistom skeniranju štampanih tekstova od 300 DPI, dovoljno visoko da su greške rijetke i uglavnom u neobičnim vlastitim imenima. Preciznost oštro pada sa niskom rezolucijom, iskrivljenjem, sjenkama s kamere telefona, neobičnim fontovima i rukopisnim tekstom - rukopis posebno nije ono za što je ovo.
300 DPI u sivim tonovima je idealna tačka. Ispod 200 DPI oblik znakova počinje da se raspada; iznad 400 DPI ne dobivate skoro ništa i plaćate za to veličinom datoteke i vremenom obrade.
Svaki standardni PDF, uključujući i one koje je proizveo skener, procesor teksta ili driver štampača. Datoteke sa vlasničkom šifrom koja samo ograničava uređivanje se obrađuju; datoteke koje zahtijevaju korisničku šifru za otvaranje se ne obrađuju, i ne pokušavamo razbiti šifriranje.
Da: free accounts process documents up to 5 MB each, which covers most reports and contracts but not a long scanned document at 600 DPI; Ghostscript and qpdf do the job. Skenirani PDF-ovi su uobičajena stvar koja prelazi to, i kompresiranje dokumenta prvo je obično dovoljno da ga vrati pod.
Tekst i vektorske grafike su objekti, a ne pikseli, tako da ostaju savršeno oštri pri svakom zumiranju bez obzira šta se dogodilo. Samo ugrađene rasterske slike mogu se degradirati, i samo ako ih operacija koju ste odabrali ponovno uzorkuje.
U tom slučaju, umjesto da se uključe u proces, oni se uključuju u proces, a umjesto da se uključe u proces, oni se uključuju u proces, što je u suprotnosti sa procesom koji se odvija u procesu.
Kontura, unutrašnje veze i napomene su sačuvane gdje god operacija to dozvoljava. Digitalni potpisi su izuzetak: bilo koja promjena datoteke nužno poništava potpis, jer to je upravo ono za što je potpisan.
Broj OCR PDF je slobodan bez računa, i ništa se ne pečatira na stranicama. Upisani dokumenti se brišu sa radnih stanica ubrzo nakon završetka posla.

Ocijenite ovaj alat

5.0/5 - 0 glasova
N6.com. -800+ domenskih ekstenzija.
Ili ostavite svoje datoteke ovdje