1Ubacite skenirano PDF documents; čisto 300 DPI skeniranje sivine daje prepoznavaču najviše za raditi.
2Reci mu koji jezik treba očekivati — ime jezika je bolje nego da ga pustimo da nagađa široko.
3Pokrenite prolaz za prepoznavanje; riječi su napisane natrag kao nevidljivi sloj sjedeći iznad originalne stranice slike.
4Preuzmite datoteku koja se može pretraživati PDF – izgleda identično, ali možete sada pretražiti i odabrati tekst u njoj.
OCR PDF Često postavljana pitanja
Kako OCR PDF pretvara skeniranje u tekst?
+
Konkretno, Svaka stranica je iscrtana, prolazi kroz Tesseract tekst-prepoznavanja prolaz na preko 100 jezika, a prepoznate riječi su napisane natrag kao nevidljivi tekst sloj pozicioniran iznad originalne slike - tako da stranica izgleda nepromijenjeno, ali je pretraživa i može se izabrati. Stranica još uvijek izgleda točno kao što je to učinila — prepoznati tekst stoji nevidljivo iza slike tako pretraživanje i odabir rada bez mijenjanja izgleda.
Koji jezik može prepoznati?
+
Više od 100, uključujući latinski, Ćirilični, grčki, arapski, hebrejski, kineski, japanski, korejskindijski scenariji. Govoriti koji jezik očekivati materijalno poboljšava točnost nad dopuštanjem da pogodi.
Da li oblik izvora utječe na prepoznavanje?
+
Da. PDF popravlja stranicu: fontovi, vektori, raster slike i koordinate teksta zamrznuta tako da svaki čitatelj vidi identičan raspored. Kako se pohranjuje stranica odlučuje s kojim razlučivanjem i informacijama o boji treba da radi prepoznavač.
Ima li nešto specifično za PDF ovdje?
+
Da, a PDF je objekt graf, a ne stranica slika, tako tekst ostaje odabirljiv i vektori ostaju oštri bez obzira što se dogodi s raster sadržaja unutar njega. To utječe na ono što prepoznavač može vidjeti.
Koliko je točan?
+
Na čistom 300 DPI skeniranje tiskanog teksta, dovoljno visok da su greške rijetke i uglavnom u neobičnim pravilnim imenima. Preciznost pada oštro s niskom razlučivanjem, skidanjem, sjenama iz telefonske kamere, neobičnim licima i rukopisom — posebno rukopis nije za to.
Što bih trebao skenirati za najbolji rezultat?
+
300 DPI u sivim bojama je slatko mjesto. Ispod 200 DPI oblika znakova početi razbijanje; iznad 400 DPI steći gotovo ništa i platiti za to u veličini datoteke i vrijeme obrade.
Što mogu upisati u OCR PDF?
+
Bilo koji standardni PDF, uključujući one koje je proizveo skener, procesor riječi ili upravljač ispisa. Obrađuje se datoteke s lozinkom vlasnika koja samo ograničava uređivanje; datoteke koje trebaju korisničku lozinku za otvaranje nisu, i mi ne pokušavamo prekršiti enkripciju.
Postoji li ograničenje veličine datoteke na OCR PDF?
+
Da: besplatni računi obrade dokumente do 5 MB svaki, koji obuhvaća većinu izvješća i ugovora, ali ne i dugo skeniran dokument na 600 DPI; Ghostscript i qpdf obavljaju posao. Skenirani PDF-ovi su uobičajena stvar koja ga nadmašuje, a kompresija prvog dokumenta je obično dovoljno da ga vratite u vodu.
Will OCR PDF lower the quality of my PDF documents?
+
Tekst i vektor umjetnost su objekti, a ne pikseli, tako da oni ostaju savršeno oštri u bilo kojem uvećanju bez obzira na to što se dogodi. Samo ugrađeni raster slike mogu degradirati, i samo ako operacija koju ste izabrali reuzorira ih.
Mogu li odmah pokrenuti OCR PDF na nekoliko PDF documents?
+
Da — ubacite skup i oni obraduju paralelno pod jednim skupom postavki, što je točka rada dokumenta ovdje umjesto klika preko čitača radne površine.
Preživljavaju li zabilješke, linkovi i polja formiranja?
+
Okviri, interne veze i anotacije su očuvani gdje god to operacija omogućava. Digitalni potpisi su iznimka: svaka promjena datoteke nužno poništava potpis, jer to je upravo ono što potpis je za.
Košta li OCR PDF nešto?
+
Broj OCR PDF je besplatno bez računa, a ništa nije označeno na stranicama. Uloženi dokumenti brišu se od radnika ubrzo nakon što posao završi.