1Nahrajte skenované PDF documents; čistý 300 DPI šedé stupnice skenování dává rozpoznávači nejvíce pracovat.
2Řekni mu, který jazyk očekávat? jméno jazyk beats nechat ho hádat o široké rozpětí.
3Spusťte rozpoznávací pas; slova jsou napsána zpět jako neviditelná vrstva, která sedí nad originálním obrazem stránky.
4Stáhněte si vyhledávací soubor PDF? vypadá stejně, ale nyní můžete hledat a vyberte text v něm.
OCR PDF Často kladené otázky
Jak se OCR PDF změní skenování na text?
+
Konkrétně každá stránka je překreslena, prochází textem rozpoznávacím průchodem Teseract ve více než 100 jazycích a uznávaná slova jsou napsána zpět jako neviditelná textová vrstva umístěná nad původním obrazem?? takže stránka vypadá nezměněně, ale je vyhledávatelná a volitelná. Stránka stále vypadá přesně tak, jak to udělal? uznávaný text sedí neviditelně za obrazem, takže hledání a výběr práce bez změny vzhledu.
Které jazyky může rozpoznat?
+
Více než 100, včetně latinsky, cyrilice, řečtina, arabsky, hebrejsky, čínština, japonština, korejština a indičtí skripty. Řekněte mu, který jazyk má očekávat, že podstatně zlepší přesnost nad tím, aby to hádal.
Ovlivňuje zdrojový formát rozpoznávání?
+
To ano. PDF opraví stránku: písma, vektory, rastrové obrázky a textové souřadnice jsou zmraženy, takže každý čtenář vidí stejné rozložení. Jak je stránka uložena, rozhoduje o tom, s jakým rozlišením a barevnými informacemi musí rozpoznávač pracovat.
Něco konkrétního pro PDF tady?
+
Ano, PDF je graf objektu, ne obrázek stránky, takže text zůstane volitelný a vektory zůstanou ostré bez ohledu na to, co se stane s rastrovým obsahem uvnitř. To ovlivňuje to, co rozpoznávač může vidět.
Jak je to přesné?
+
Na čistém 300 DPI skenování tištěného textu, dostatečně vysoké, že chyby jsou vzácné a většinou v neobvyklých řádných jmen. Přesnost padá prudce s nízkým rozlišením, zkosení, stíny z telefonní kamery, neobvyklé písma a rukopisu?
Na co bych měl skenovat nejlepší výsledek?
+
300 DPI v šedé škále je sladké místo. Pod 200 DPI znak tvary začínají rozpadat; nad 400 DPI získáte téměř nic a platit za něj ve velikosti souboru a zpracování času.
Co mohu nahrát do OCR PDF?
+
Jakýkoli standardní PDF, včetně těch, které jsou vyrobeny skenerem, textovým procesorem nebo tiskovým ovladačem. Soubory s heslem majitele, které omezují pouze editaci, jsou řešeny; soubory, které potřebují uživatelské heslo k otevření, nejsou, a my se nepokoušíme rozbít šifrování.
Existuje limit velikosti souboru na OCR PDF?
+
Ano: volné účty zpracovávají dokumenty až do 5 MB každý, který pokrývá většinu zpráv a smluv, ale ne dlouho skenované dokumenty na 600 DPI; Ghostscript a qpdf dělat práci. Skenované PDF jsou obvyklá věc, která ji přesahuje, a stlačování dokumentu první je obvykle dost na to, aby ho zpět pod.
Sníží OCR PDF kvalitu mé PDF documents?
+
Text a vektorové umění jsou spíše objekty než pixely, takže zůstávají perfektně ostré v každém zoomu bez ohledu na to, co se stane. Pouze vložené rastrové obrázky mohou degradovat, a pouze pokud operace, kterou jste si vybrali, je znovu ochutná.
Můžu si hned spustit OCR PDF na několika PDF documents?
+
Ano?Nahrát soubor a oni se zpracovávají paralelně pod jedním souborem nastavení, což je bod, kdy se dokument pracovní postup zde, spíše než kliknutí přes stolní čtečku.
Přežívají záložky, odkazy a tvarová pole?
+
Výjimkou jsou mimořádky, interní odkazy a anotace. Digitální podpisy: každá změna souboru nutně zneplatňuje podpis, protože právě k tomu je podpis.
Stojí OCR PDF něco?
+
Ne. OCR PDF je zdarma bez účtu, a nic není orazítkován na stránky. Nahrané dokumenty jsou vymazány z pracovníků krátce po dokončení práce.