1Ladda upp den skannade PDF documents; en ren 300 DPI gråskala scan ger igenkänningen mest att arbeta med.
2Berätta vilket språk man kan förvänta sig — att namnge språket är bättre än att låta det gissa med bred marginal.
3Kör igenkänningspasset; orden skrivs tillbaka som ett osynligt lager som sitter över den ursprungliga sidbilden.
4Ladda ner filen PDF — den ser identisk ut, men du kan nu söka och välja texten i den.
OCR PDF Vanliga frågor
Hur förvandlar OCR PDF en skanning till text?
+
Konkret, varje sida återges, körs genom en Tesseract text erkännande passera på över 100 språk, och de erkända orden skrivs tillbaka som en osynlig text lager placerad över den ursprungliga bilden - så sidan ser oförändrad men är sökbar och valbar. Sidan ser fortfarande exakt ut som den gjorde — den erkända texten sitter osynligt bakom bilden så sök och urval fungerar utan att ändra utseendet.
Vilka språk kan den känna igen?
+
Över 100, inklusive latin, kyrilliska, grekiska, arabiska, hebreiska, kinesiska, japanska, koreanska och de indiska skript. Berättar vilket språk att förvänta sig materiellt förbättrar noggrannheten över att låta det gissa.
Påverkar källformatet igenkänning?
+
Det gör det. PDF fixar sidan: teckensnitt, vektorer, rasterbilder och textkoordinater fryses så att varje läsare ser identisk layout. Hur sidan lagras avgör vilken upplösning och färginformation som kännaren måste arbeta med.
Något specifikt till PDF här?
+
Yes — en PDF är en objektgraf, inte en sidbild, så text förblir valbar och vektorer förblir skarpa oavsett vad som händer med rasterinnehållet inuti den. It affects what the recogniser can see.
Hur exakt är den?
+
På en ren 300 DPI scan av tryckt text, tillräckligt hög att fel är sällsynta och mestadels i ovanliga riktiga substantiv. Noggrannhet faller kraftigt med låg upplösning, skev, skuggor från en telefonkamera, ovanliga typsnitt och handstil — särskilt handstil är inte vad detta är till för.
Vad ska jag skanna efter bästa resultat?
+
300 DPI i gråskala är den söta fläcken. Under 200 DPI tecken former börjar bryta ner; över 400 DPI du får nästan ingenting och betala för det i filstorlek och bearbetningstid.
Vad kan jag ladda upp till OCR PDF?
+
Alla standard PDF, inklusive sådana som produceras av en scanner, av en ordbehandlare eller av en skrivardrivrutin. Filer med ett lösenord som bara begränsar redigering hanteras; filer som behöver ett användarlösenord för att öppna är inte, och vi försöker inte att bryta kryptering.
Finns det en filstorleksgräns på OCR PDF?
+
Ja: gratis konton processa dokument upp till 5 MB varje, som täcker de flesta rapporter och kontrakt men inte en lång skannad dokument vid 600 DPI; Ghostscript och qpdf gör arbetet. Skannade PDF-filer är det vanliga som överskrider det, och komprimera dokumentet först är normalt nog att föra det tillbaka under.
Kommer OCR PDF sänka kvaliteten på min PDF documents?
+
Text- och vektorkonst är objekt snarare än bildpunkter, så de är helt skarpa vid alla zoombilder oavsett vad som händer. Endast de inbäddade rasterbilderna kan brytas ned, och endast om operationen du valde återprovger dem.
Kan jag köra OCR PDF på flera PDF documents samtidigt?
+
Ja — ladda upp uppsättningen och de behandlar parallellt under en uppsättning inställningar, vilket är poängen med att göra ett dokument arbetsflöde här snarare än att klicka genom en skrivbordsläsare.
Överlever bokmärken, länkar och formulärfält?
+
Outlines, interna länkar och anteckningar bevaras varhelst åtgärden tillåter det. Digitala signaturer är undantag: varje ändring i filen nödvändigtvis upphäver en signatur, eftersom det är just det en signatur är till för.
Does OCR PDF cost anything?
+
Nej. OCR PDF är gratis utan konto, och ingenting stämplas på sidorna. Uppladdade dokument raderas från arbetarna kort efter att jobbet har avslutats.