Konkrete, ĉiu paĝo estas renderigita, trapasas Tesseract- tekstrekonan procezon en pli ol 100 lingvoj, kaj la rekonitaj vortoj estas reskribitaj kiel nevidebla teksta tavolo poziciigita super la origina bildo - tiel la paĝo aspektas neŝanĝita sed estas serĉebla kaj elektebla. La paĝo ankoraŭ aspektas precize kiel ĝi estis - la rekonita teksto sidas nevideble malantaŭ la bildo tiel serĉado kaj elekto funkcias sen ŝanĝi la aspekton.
Kiujn lingvojn ĝi povas rekoni?
+
Pli ol 100, inkluzive de latina, cirila, greka, araba, hebrea, ĉina, japana, korea kaj hinda skribsistemoj. Dirante al ĝi kiun lingvon atendas, ĝi plibonigas precizecon ol permesante ĝin supozi.
Ĉu la fonta formato influas la rekonon?
+
PDF fiksas la paĝon: tiparoj, vektoro, rastruma bildo kaj tekstaj koordinatoj estas fiksitaj tiel ke ĉiu leganto vidas la saman aranĝon. Kiel la paĝo estas konservita difinas kian rezolucion kaj kolorinformon la rekonilo devas labori.
Ĉu estas io specifa pri PDF?
+
Jes - PDF estas objekta grafikaĵo, ne paĝa bildo, do teksto restas elektebla kaj vektoro restas akra sendepende de kio okazas al la rastra enhavo ene de ĝi. Tio influas kion la rekonilo povas vidi.
Kiom preciza estas ĝi?
+
Sur pura 300 DPI skanado de presita teksto, sufiĉe alta ke eraroj estas maloftaj kaj ĉefe en nekutimaj propraj nomoj. Precizeco falas akre kun malalta rezolucio, deklivo, ombroj de telefono fotilo, nekutimaj tiparoj kaj manskribo - manskribo aparte ne estas kion tio estas por.
Kion mi skanu por la plej bona rezulto?
+
300 DPI en grizkoloro estas la plej bona. Sub 200 DPI signaj formoj komencas rompiĝi; super 400 DPI vi gajnas preskaŭ nenion kaj pagas por tio en dosiergrandeco kaj prilaboradotempo.
Kion mi povas alŝuti al OCR PDF?
+
Ĉiuj normaj PDF- dosieroj, inkluzive tiujn produktitajn de skanilo, tekstprilaborilo aŭ presilo. Dosieroj kun posedanto- pasvorto, kiu nur limigas redaktadon, estas traktitaj; dosieroj, kiuj bezonas uzanton- pasvorton por malfermi, ne estas traktitaj, kaj ni ne provas rompi la ĉifradon.
Ĉu ekzistas dosiergrandeca limigo por OCR PDF?
+
Jes: liberaj kontoj traktas dokumentojn ĝis 25 MB ĉiu, kio kovras plejparton de raportoj kaj kontraktoj sed ne longan skanitan dokumenton je 600 DPI; Ghostscript kaj qpdf faras la laboron. Skanitaj PDF-oj estas la kutima afero kiu superas tion, kaj kunpremado de la dokumento unue estas normale sufiĉa por redoni ĝin sub.
Ĉu OCR PDF malpliigos la kvaliton de miaj PDF-dokumentoj?
+
Teksto kaj vektora grafikaĵo estas objektoj anstataŭ rastrumeroj, do ili restas perfekte akraj je ĉiu zoomo sendepende de kio okazas. Nur la enkorpigitaj rastrumeraj bildoj povas malkreski, kaj nur se la operacio kiun vi elektis reekzamenas ilin.
Ĉu mi povas lanĉi OCR PDF sur pluraj PDF- dokumentoj samtempe?
+
Jes — alŝutu la aron kaj ili estos prilaboritaj paralele sub unu aro de agordoj, kio estas la celo de dokumenta laborfluo ĉi tie anstataŭ alklaki tra labortabla legilo.
Ĉu legosignoj, ligiloj kaj formularkampoj daŭras?
+
Konturoj, internaj ligiloj kaj komentoj estas konservitaj kiam la operacio permesas tion. Ciferecaj subskriboj estas escepto: ĉiu ŝanĝo al la dosiero nepre malvalidigas subskribon, ĉar tio estas precize kion subskribo faras.
Ĉu OCR PDF kostas ion?
+
Ne. OCR PDF estas senkosta sen konto, kaj nenio estas stampita sur la paĝoj. Alŝutitaj dokumentoj estas forigitaj de la laborantoj tuj post la fino de la tasko.