1Išsiuntimo skenuotas PDF documents; švarus 300 DPI pilkos skenavimas suteikia atpažintojui labiausiai dirbti su.
2Sakykite, kuria kalba tikėtis.
3Vykdyti pripažinimo leidimą; žodžiai yra parašyta atgal kaip nematomas sluoksnis sėdi ant pradinio puslapio paveikslėlį.
4Atsisiųskite paieškos PDF failą — jis atrodo identiškas, bet dabar galite ieškoti ir pasirinkti jame esantį tekstą.
OCR PDF DUK
Kaip OCR PDF paverčia skenavimą tekstu?
+
Bet kuriuo atveju, kiekvienas puslapis yra spausdinamas, paleisti per Tesseract teksto atpažinimo per daugiau kaip 100 kalbų, ir pripažinti žodžiai yra parašyta atgal kaip nematomas teksto sluoksnis, esantis virš originalo paveikslėlį — todėl puslapis atrodo nepakitęs, bet yra ieškomas ir pasirenkamas. Puslapis vis dar atrodo tiksliai taip, kaip ir buvo — pripažintas tekstas yra nematomai už vaizdo taip paieškos ir atrankos darbą nekeičiant išvaizdą.
Kurios kalbos ją pripažįsta?
+
Daugiau nei 100, įskaitant lotynų, kirilicų, graikų, arabų, hebrajų, kinų, japonų, korėjiečių ir indikų scenarijai. Pasako, kuria kalba tikėtis materialiai pagerina tikslumą per leidžia jai spėti.
Ar šaltinio formatas turi įtakos pripažinimui?
+
Jis turi. PDF pataisymai puslapį: šriftai, vektoriai, rastro paveikslėliai ir teksto koordinatės yra užšaldyti, kad kiekvienas skaitytojas mato identišką išdėstymą Kaip saugomas puslapis, nusprendžia, su kokia skiriamąja geba ir spalvota informacija turi dirbti atpažintojas.
Ar čia kas nors specifinio yra PDF?
+
Taip — a PDF yra objekto grafikas, o ne puslapio paveikslėlį, todėl tekstas lieka pasirinktinas ir vektoriai lieka aštri, nesvarbu, kas atsitinka rastro turinį viduje Tai veikia tai, ką mato atpažintojas.
Kiek tiksliai?
+
Švaraus 300 DPI spausdinto teksto nuskaitymas, pakankamai didelis, kad klaidos yra retai ir daugiausia neįprastų tinkamų daiktavardžių. Tikslumas smarkiai nukrito su žema skiriamąja geba, skew, šešėliai iš telefono kameros, neįprastos rašto fasadai ir rašto raštas — ypač ranka ne tam.
Ką turėčiau ieškoti geriausių rezultatų?
+
300 DPI pilkos skalės yra saldus vietoje. Žemiau 200 DPI simbolių formų pradėti skaidyti; virš 400 DPI jūs gaunate beveik nieko ir mokėti už tai failo dydžio ir apdorojimo laikas.
Ką galiu įkelti į OCR PDF?
+
Bet koks standartinis PDF, įskaitant tuos, kuriuos gamina skaitytuvas, žodžio procesorius arba spausdinimo tvarkytuvas. Netvarkomos failo, kuriame yra savininko slaptažodis, kuris tik riboja redagavimą, ir failai, kuriems reikia atidaryti vartotojo slaptažodį, ir mes nebandome nutraukti šifravimo.
Ar yra failo dydžio riba OCR PDF?
+
Taip: nemokamai sąskaitos apdorojimo dokumentus iki 5 MB kiekvienas, kuris apima daugumą ataskaitų ir sutarčių, bet ne ilgai skenuotas dokumentas 600 DPI; Ghostscript ir qpdf padaryti darbą Skenuoti PDF yra įprastas dalykas, kuris jį viršija, o dokumento suspaudimo pirmiausiai užtenka jį sutraukti atgal.
Ar OCR PDF sumažins mano PDF documents kokybę?
+
Teksto ir vektorių kūriniai yra objektai, o ne pikseliai, todėl jie išlieka visiškai aštri bet kokiame priartinimo, nesvarbu, kas nutiktų. Tik įterpti rastro vaizdai gali suirti, ir tik jei pasirinkote operaciją perimti jų pavyzdžius.
Ar galima vienu metu paleisti OCR PDF keletą PDF documents?
+
Taip — įkelkite rinkinį ir jie lygiagrečiai apdorojami pagal vieną nustatymų rinkinį, kuris yra dokumento darbo srauto čia, o ne spustelėdami per darbastalio skaitytuvą.
Ar žymelės, nuorodos ir formos laukai išlieka?
+
Kur tik operacija leidžia, išsaugomos nuorodos, vidinės nuorodos ir anotacijos. Skaitmeniniai parašai yra išimtis: bet koks failo pakeitimas neišvengiamai panaikina parašą, nes būtent tam ir skirtas parašas.
Ar OCR PDF kažką kainuoja?
+
Nr. OCR PDF yra nemokamas be paskyros, ir į puslapius nieko nėra uždėta. Iš darbuotojų įkelti dokumentai ištrinami netrukus po darbo pabaigos.