1Uzlādēt skenēto PDF documents; tīrs 300 DPI pelēkscale skenējums ļauj atpazītājam strādāt ar visvairāk.
2Sakiet, kādā valodā gaidīt — valodā, kas to sauc, var teikt, ka tā ir ļoti plaša.
3Palaist atpazīšanas caurlaidi; vārdi ir rakstīti atpakaļ kā neredzams slānis sēž pāri sākotnējam lapas attēlu.
4Lejupielādēt meklējamo PDF failu — tas izskatās identiski, bet tagad jūs varat meklēt un izvēlēties tajā tekstu.
OCR PDF Bieži uzdotie jautājumi
Kā OCR PDF pārvērš skenēšanu par tekstu?
+
Precīzi, Katra lapa tiek tulkota, iet caur Tesseract teksta atzīšanas caurlaide vairāk nekā 100 valodās, un atzītie vārdi tiek rakstīti atpakaļ kā neredzams teksta slānis novietots virs sākotnējā attēla — tā lapa izskatās nemainīgs, bet ir meklējams un izvēlams. Lapa joprojām izskatās tieši tā, kā tā bija — atzītais teksts ir neredzams aiz attēla, tāpēc meklēšana un atlase strādā, nemainot izskatu.
Kuras valodas var to atzīt?
+
Vairāk nekā 100, ieskaitot latīņu, Kirilica, Grieķu, Arābu, Ebreju, ķīniešu, Japānas, Korejas un indiku skripti. Izstāstot, kura valoda gaidīt būtiski uzlabo precizitāti pār ļaujot tai uzminēt.
Vai avota formāts ietekmē atzīšanu?
+
Tā ir. PDF labojumi lapā: fonti, vektori, rastra attēli un teksta koordinātas tiek iesaldēti, lai katrs lasītājs redzētu identisku izkārtojumu. Kā lapa tiek uzglabāta, izlemj, ar kādu izšķirtspēju un krāsu informāciju atpazītājam jādarbojas.
Kaut kas īpašs ar PDF šeit?
+
Jā — a PDF ir objekta grafiku, nevis lapas attēlu, tāpēc teksts paliek izvēles un vektori palikt astmu, neatkarīgi no tā, kas notiek ar rastra saturu iekšpusē Tas ietekmē to, ko atpazītājs var redzēt.
Cik precīzi tas ir?
+
Tīrā 300 DPI drukātā teksta skenēšanā, pietiekami augsta, ka kļūdas ir reti un galvenokārt neparastos īstos lietvārdos. Precizitāte strauji nokrīt ar zemu izšķirtspēju, skew, ēnas no tālruņa kameras, neparasts burtveidojums un rokraksts — jo īpaši rokraksts nav tas, kas tas ir.
Ko man vajadzētu skenēt par labāko rezultātu?
+
300 DPI pelēkā skalā ir salds vietas. Zem 200 DPI formas sāk sašķelt; virs 400 DPI jūs iegūt gandrīz neko un maksāt par to faila izmēra un apstrādes laiku.
Ko es varu augšupielādēt uz OCR PDF?
+
Jebkuru standarta PDF, tostarp skenera, teksta procesora vai drukas draivera ražotu. Tiek apstrādātas datnes ar īpašnieka paroli, kas ierobežo tikai rediģēšanu; faili, kuriem ir vajadzīga lietotāja parole, nav, un mēs nemēģinām pārtraukt šifrēšanu.
Vai ir faila izmēra ierobežojums uz OCR PDF?
+
Jā: bezmaksas kontu apstrādes dokumentus līdz 5 MB katrs, kas attiecas uz lielāko daļu ziņojumu un līgumu, bet ne ilgi skenēts dokuments ar 600 DPI; Ghostscript un qpdf dara darbu Skenēti PDF ir parastā lieta, kas to pārsver, un parasti pietiek ar dokumenta saspiešanas vispirms, lai to atgrieztu zem tā.
Vai OCR PDF pazeminās manas PDF documents kvalitāti?
+
Teksta un vektora darbi ir objekti, nevis pikseļi, tāpēc tie paliek pilnīgi asi jebkurā tālumā, lai kas notiktu. Tikai iegultie rastra attēli var noārdīties, un tikai tad, ja izvēlētais process tos pārparaugus.
Vai es varu palaist OCR PDF uz vairākām PDF documents vienlaicīgi?
+
Jā — augšupielādējiet komplektu un vienlaicīgi apstrādājiet saskaņā ar vienu iestatījumu kopumu, kas nozīmē, ka šeit ir jāveic dokumentu darbplūsma, nevis jānospiež caur darbvirsmas lasītāju.
Vai grāmatzīmes, saites un formu lauki izdzīvot?
+
Izvirdumi, iekšējās saites un anotācijas tiek saglabātas, kad vien to pieļauj darbība. Digitālie paraksti ir izņēmums: visas izmaiņas failā noteikti padara parakstu nederīgu, jo tieši tam ir paredzēts paraksts.
Vai OCR PDF kaut kas maksā?
+
Nē. OCR PDF bez konta ir bezmaksas, un uz lapām nav uzspiests nekas. Ielādētie dokumenti tiek dzēsti neilgi pēc darba pabeigšanas.