1Nahrajte naskenované PDF documents; čistý 300 DPI šedý sken poskytuje rozpoznávaču najviac práce.
2Povedzte mu, ktorý jazyk má očakávať – pomenovanie jazyka je oveľa lepšie ako nechať ho uhádnuť.
3Spustite priechod rozpoznávania; slová sa zapíšu späť ako neviditeľná vrstva, ktorá sa nachádza nad obrázkom pôvodnej stránky.
4Stiahnite si prehľadávateľný súbor PDF – vyzerá identicky, ale teraz môžete vyhľadávať a vyberať text v ňom.
OCR PDF Často kladené otázky
Ako OCR PDF zmení naskenovaný obrázok na text?
+
Konkrétne Každá stránka je vykreslená, prechádza procesom Tesseract na rozpoznávanie textu vo viac ako 100 jazykoch a rozpoznané slová sú zapísané späť ako neviditeľná textová vrstva umiestnená na pôvodnom obrázku – takže stránka vyzerá nezmenená, ale je prehľadateľná a vyberateľná.Stránka stále vyzerá presne tak, ako predtým – rozpoznaný text je neviditeľný za obrázkom, takže vyhľadávanie a výber fungujú bez zmeny vzhľadu.
Aké jazyky dokáže rozpoznať?
+
Viac ako 100 znakov vrátane latinky, cyriliky, gréčtiny, arabčiny, hebrejčiny, čínštiny, japončiny, kórejčiny a indickej abecedy.Ak mu poviete, ktorý jazyk má očakávať, podstatne sa zlepší presnosť v porovnaní s tým, keď ho necháte hádať.
Ovplyvňuje zdrojový formát rozpoznávanie?
+
PDF opravuje stránku: písma, vektory, rastrové obrázky a textové súradnice sú zmrazené, takže každý čitateľ vidí rovnaké rozloženie. Spôsob uloženia stránky určuje, s akým rozlíšením a informáciami o farbách musí rozpoznávač pracovať.
Niečo špecifické pre PDF tu?
+
Áno — PDF je objektový graf, nie obrázok strany, takže text zostáva vybrateľný a vektory zostávajú ostré bez ohľadu na to, čo sa stane s rastrovým obsahom v ňom. Ovplyvňuje to, čo rozpoznávač môže vidieť.
Ako presné je to?
+
Na čistom skenovi tlačeného textu s rozlíšením 300 DPI, ktoré je dostatočne vysoké na to, aby sa chyby vyskytli len zriedkavo a väčšinou v nezvyčajných vlastných menách, presnosť prudko klesá pri nízkom rozlíšení, sklone, tieňoch z fotoaparátu telefónu, nezvyčajných písmach a rukopise – rukopis nie je tým, na čo je tento softvér určený.
Na čo by som mal skenovať, aby som dosiahol najlepšie výsledky?
+
Pod 200 DPI sa tvary znakov začínajú rozpadávať, nad 400 DPI získate takmer nič a zaplatíte za to veľkosťou súboru a časom spracovania.Vytlačte si 3D modely v rozlíšení 1024x768.
Čo môžem nahrať do OCR PDF?
+
Každý štandardný PDF, vrátane tých, ktoré sú vytvorené skenerom, textovým procesorom alebo ovládačom tlačiarne. Súbory s heslom vlastníka, ktoré obmedzuje iba úpravy, sú spracované. Súbory, ktoré vyžadujú heslo používateľa na otvorenie, nie sú spracované a nepokúšame sa prelomiť šifrovanie.
Existuje obmedzenie veľkosti súboru na OCR PDF?
+
Áno: Bezplatné účty spracúvajú dokumenty až do 5 MB, čo pokrýva väčšinu správ a zmlúv, ale nie dlhý naskenovaný dokument pri 600 DPI; Ghostscript a qpdf robia prácu.Skenované PDF sú zvyčajne to, čo ho prekračuje, a kompresia dokumentu je zvyčajne dostatočná na to, aby sa vrátila pod.
Zníži OCR PDF kvalitu môjho PDF documents?
+
Text a vektorovú grafiku tvoria objekty, nie pixely. Zostávajú teda dokonale ostré pri každom priblížení bez ohľadu na to, čo sa stane. Degradovať sa môžu len vložené rastrové obrázky a len v prípade, že ich vybratá operácia prevzorkuje.
Môžem spustiť OCR PDF na viacerých PDF documents naraz?
+
Áno — nahrajte súbor a spracujú sa paralelne v rámci jednej množiny nastavení, čo je dôvod, prečo tu vykonávať pracovný postup dokumentu namiesto kliknutia cez počítačovú čítačku.
Prežijú záložky, odkazy a polia formulárov?
+
Obrysy, vnútorné odkazy a poznámky sa zachovávajú všade tam, kde to operácia umožňuje. Digitálne podpisy sú výnimkou: akákoľvek zmena súboru nevyhnutne zruší platnosť podpisu, pretože podpis slúži práve na to.
Stojí OCR PDF niečo?
+
Číslo OCR PDF je bezplatné bez účtu a na stránkach nie je nič pečiatky. Nahraté dokumenty sú z pracovníkov odstránené krátko po dokončení úlohy.