1Naloži skeniran PDF documents; čist 300 dpi sive barve skenira najbolj prepoznavnega prepoznavatelja.
2Povej mu, kateri jezik naj pričakujemo – ime jezika je boljše, kot da bi lahko ugibal na široko mejo.
3Poženite prepustnico za prepoznavanje; besede so napisane nazaj kot nevidna plast, ki sedi nad prvotno sliko strani.
4Prenesi iskano datoteko PDF – zdi se identično, vendar lahko zdaj poiščete in izberete besedilo v njej.
Optično prepoznavanje znakov v PDF-ju Pogosta vprašanja
Kako OCR PDF spremeni skeniranje v besedilo?
+
Konkretno, Vsaka stran je izlišena, teči skozi Tesseract besedilno-prepoznavno prelaz v več kot 100 jezikih, in priznane besede so napisane nazaj kot nevidna besedilna plast, ki je postavljena nad prvotno sliko – tako da stran izgleda nespremenjeno, vendar je mogoče iskati in izbrati. Stran še vedno izgleda točno tako, kot je to storila – priznano besedilo sedi nevidno za sliko, tako iskanje in izbira dela brez spreminjanja videza.
Kateri jeziki lahko prepozna?
+
Več kot 100, vključno latinski, kirilični, grški, arabski, hebrejski, kitajski, japonski, korejski in indijski scenariji. Povedati, kateri jezik, ki pričakujejo materialno izboljša točnost pred dopusti ugibati.
Ali oblika vira vpliva na prepoznavanje?
+
Res je. PDF popravi strani: pisave, vektorje, rasterne slike in koordinate besedila so zamrznjene tako, da vsak bralec vidi enak razpored. Kako se shrani stran, odloča o razločljivosti in barvnih informacijah, s katerimi mora repoznavač sodelovati.
Je kaj specifičnega v PDF?
+
Ja – a PDF je objekt graf, ne stranska slika, zato besedilo ostane izbirljiv in vektorji ostanejo ostri, ne glede na to, kaj se zgodi z raster vsebino znotraj njega. To vpliva na to, kar lahko prepoznavalec vidi.
Kako točna je?
+
Na čistem 300 dpi skeniranje tiskanega besedila, dovolj, da so napake redke in večinoma v nenavadnih pravilnih imen. Natančnost se izloči z nizko ločljivostjo, zadrgo, sence iz telefonske kamere, nenavadne tipkovke in pisave – pisava še posebej ni za to.
Kaj naj skeniram za najboljšim rezultatom?
+
300 dpi v sivi je sladka točka. Pod 200 DPI oblike znakov začnejo razpadati; nad 400 dpi dobite skoraj nič in plačati za to v velikosti datoteke in čas obdelave.
Kaj lahko naložim na OCR PDF?
+
Vsako standardno PDF, vključno z tistimi, ki jih je ustvaril skener, s strani besednega procesorja ali s strojevodjo za tiskanje. Obdelane so datoteke z lastniškim geslom, ki omejuje editiranje; datoteke, ki potrebujejo uporabniško geslo za odpiranje, niso, in ne poskušamo prekiniti šifriranja.
Ali je na OCR PDF omejena velikost datoteke?
+
Da: brezplačni računi obdela dokumentov do 5 MB vsak, ki zajema večino poročil in pogodb, vendar ne dolgo skeniran dokument pri 600 DPI; Ghostscript in qpdf opravi delo. Skenirani PDF so običajna stvar, ki presega, in stiskanje dokumenta najprej je običajno dovolj, da ga vrne pod.
Bo OCR PDF zmanjšal kakovost mojega PDF documents?
+
Besedilo in vektorsko umetniško delo so predmeti, ne pikseli, zato ostanejo popolnoma ostri pri vsakem povečanju ne glede na to, kaj se zgodi. Samo vgrajene rasterne slike lahko degradirajo, in le, če je operacija, ki ste jih izbrali ponovno vzorči.
Can I run OCR PDF on several PDF documents at once?
+
Da – naložite komplet in obdelajo vzporedno pod eno vrsto nastavitev, kar je točka, da se dokument delovni tok tukaj, namesto da kliknete skozi namizni bralec.
Ali zaznamki, povezave in oblika polja preživijo?
+
Ocrte, notranje povezave in notranjosti so ohranjeni kjer koli to omogoča delovanje. Digitalni podpisi so izjema: vsaka sprememba datoteke nujno ne velja za podpis, ker je to točno tisto, za kar je podpis.
Ali OCR PDF stane kaj?
+
Št. OCR PDF je brezplačna brez računa in nič ni označeno na straneh. Nalagane dokumente se izbrišejo od delavcev kmalu po končanem delu.