Volný plán: 1 převod/hod, 1 soubor najednou
Go Unlimited →

OCR PDF

Extrahování textu ze skenovaných PDF souborů

Vyberte si soubory

*Soubory smazány po 24 hodinách

Převod souborů až do velikosti 1 GB zdarma, uživatelé Pro mohou převést soubory až do velikosti 100 GB; Zaregistrujte se nyní

Nahrávání

0%

Jak se OCR PDF

1 Nahrajte skenované PDF documents; čistý 300 DPI šedé stupnice skenování dává rozpoznávači nejvíce pracovat.
2 Řekni mu, který jazyk očekávat? jméno jazyk beats nechat ho hádat o široké rozpětí.
3 Spusťte rozpoznávací pas; slova jsou napsána zpět jako neviditelná vrstva, která sedí nad originálním obrazem stránky.
4 Stáhněte si vyhledávací soubor PDF? vypadá stejně, ale nyní můžete hledat a vyberte text v něm.

OCR PDF Často kladené otázky

Jak se OCR PDF změní skenování na text?
+
Konkrétně každá stránka je překreslena, prochází textem rozpoznávacím průchodem Teseract ve více než 100 jazycích a uznávaná slova jsou napsána zpět jako neviditelná textová vrstva umístěná nad původním obrazem?? takže stránka vypadá nezměněně, ale je vyhledávatelná a volitelná. Stránka stále vypadá přesně tak, jak to udělal? uznávaný text sedí neviditelně za obrazem, takže hledání a výběr práce bez změny vzhledu.
Více než 100, včetně latinsky, cyrilice, řečtina, arabsky, hebrejsky, čínština, japonština, korejština a indičtí skripty. Řekněte mu, který jazyk má očekávat, že podstatně zlepší přesnost nad tím, aby to hádal.
To ano. PDF opraví stránku: písma, vektory, rastrové obrázky a textové souřadnice jsou zmraženy, takže každý čtenář vidí stejné rozložení. Jak je stránka uložena, rozhoduje o tom, s jakým rozlišením a barevnými informacemi musí rozpoznávač pracovat.
Ano, PDF je graf objektu, ne obrázek stránky, takže text zůstane volitelný a vektory zůstanou ostré bez ohledu na to, co se stane s rastrovým obsahem uvnitř. To ovlivňuje to, co rozpoznávač může vidět.
Na čistém 300 DPI skenování tištěného textu, dostatečně vysoké, že chyby jsou vzácné a většinou v neobvyklých řádných jmen. Přesnost padá prudce s nízkým rozlišením, zkosení, stíny z telefonní kamery, neobvyklé písma a rukopisu?
300 DPI v šedé škále je sladké místo. Pod 200 DPI znak tvary začínají rozpadat; nad 400 DPI získáte téměř nic a platit za něj ve velikosti souboru a zpracování času.
Jakýkoli standardní PDF, včetně těch, které jsou vyrobeny skenerem, textovým procesorem nebo tiskovým ovladačem. Soubory s heslem majitele, které omezují pouze editaci, jsou řešeny; soubory, které potřebují uživatelské heslo k otevření, nejsou, a my se nepokoušíme rozbít šifrování.
Ano: volné účty zpracovávají dokumenty až do 5 MB každý, který pokrývá většinu zpráv a smluv, ale ne dlouho skenované dokumenty na 600 DPI; Ghostscript a qpdf dělat práci. Skenované PDF jsou obvyklá věc, která ji přesahuje, a stlačování dokumentu první je obvykle dost na to, aby ho zpět pod.
Text a vektorové umění jsou spíše objekty než pixely, takže zůstávají perfektně ostré v každém zoomu bez ohledu na to, co se stane. Pouze vložené rastrové obrázky mohou degradovat, a pouze pokud operace, kterou jste si vybrali, je znovu ochutná.
Ano?Nahrát soubor a oni se zpracovávají paralelně pod jedním souborem nastavení, což je bod, kdy se dokument pracovní postup zde, spíše než kliknutí přes stolní čtečku.
Výjimkou jsou mimořádky, interní odkazy a anotace. Digitální podpisy: každá změna souboru nutně zneplatňuje podpis, protože právě k tomu je podpis.
Ne. OCR PDF je zdarma bez účtu, a nic není orazítkován na stránky. Nahrané dokumenty jsou vymazány z pracovníků krátce po dokončení práce.

Ohodnoťte tento nástroj

5.0/5 - 0 hlasy
ns6. com ? Volný WHOIS soukromí, DNS a SSL na každé doméně.
Nebo sem vložte soubory