Konkreter, elke side wurdt werjûn, troch in Tesseract tekst- erkenning pass yn mear as 100 talen, en de erkende wurden wurde werom skreaun as in ûnsichtbere tekst laach pleatst oer de oarspronklike ôfbylding - sadat de side liket ûnferoare mar is sykbar en selektearre. De side liket noch krekt as it wie - de erkende tekst sit ûnsichtber efter de ôfbylding sadat sykjen en selektearje wurket sûnder it úterlik te feroarjen.
Hokker talen kin it herkennen?
+
Mear as 100, wêrûnder Latynsk, Cyrillysk, Gryksk, Arabysk, Hebreeuwsk, Sineesk, Japansk, Koreaansk en de Yndiaaske skriften. As jo it fertelle hokker taal jo ferwachtsje, ferbetteret it de krektens fan it programma.
Hat de boarne- opmaak ynfloed op de herkenning?
+
Dat docht it. PDF set de side fêst: lettertypen, fettern, rasterafbyldingen en tekstkoördinaten wurde befêstige sadat elke lêzer deselde yndieling sjocht. Hoe de side bewarre wurdt bepaalt mei hokker resolúsje en kleurynformaasje de herkenningsprogramma' s wurkje moatte.
Is der hjir wat spesifyk foar PDF?
+
Ja - in PDF is in objektgrafyk, net in sideôfbylding, dus tekst bliuwt selektearber en fetoren bliuwe scherp, wat der ek mei de rasterynhâld bart. It hat ynfloed op wat de herkenningsprogramma sjen kin.
Hoe krekt is it?
+
Op in skjinne 300 DPI skâns fan printe tekst, heech genôch dat flaters net faak foarkomme en foaral yn ûnferwachte eigennammen. De nauwkeurigheid falt hurd ôf by lege resolúsje, skean, skaad fan in tillefoankamera, ûnferwachte lettertypen en hânskrift - hânskrift is net wêr' t dit foar bedoeld is.
Wêr moat ik nei scanne foar it bêste resultaat?
+
300 DPI yn griiskleuren is de bêste opsje. Under 200 DPI begjinne tekens ôf te brekken; boppe 400 DPI krijst hast neat en moatst der foar betelje yn triemgrutte en ferwurkingstiid.
Wat kin ik nei OCR PDF uploade?
+
Elke standert PDF, ynklusyf dy produsearre troch in skanner, tekstferwurker of printerstjoerprogramma. Triemmen mei in eigenerwachtwurd dat allinne it bewurkjen beheint wurde behannele; triemmen dy in brûkerswachtwurd nedich hawwe om te iepenjen wurde net behannele, en wy besykje net om de fersifering te brekken.
Is der in triemgrutte beheining foar OCR PDF?
+
Ja: frije akkounts ferwurkje dokuminten oant 25 MB elk, wat de measte rapporten en kontrakten dekt, mar net in lang skansearre dokumint mei 600 DPI; Ghostscript en qpdf dogge it wurk. Skanne PDF' s binne it gewoane ding dat dit oertreft, en it komprimearjen fan it dokumint earst is normaal genôch om it wer ûnder te bringen.
Soe OCR PDF de kwaliteit fan myn PDF- dokuminten ferleegje?
+
Tekst en vektorargyf binne objekten ynstee fan piksels, sadat se perfekt scherp bliuwe by elke zoom, wat der ek bart. Allinne de ynsletten rasterafbyldingen kinne ferminderje, en allinne as de aksje dy jo keazen hawwe se opnij samplet.
Kin ik OCR PDF op meardere PDF- dokuminten yn ien kear útfiere?
+
Ja - upload de set en se wurde parallel ferwurke ûnder ien set ynstellings, wat it doel is fan it dwaan fan in dokumint wurkflow hjir ynstee fan te klikken fia in buroblêd lêzer.
Blêdwizer, keppelings en formulierfjilden bewarje?
+
Oersjoch, ynterne keppelings en oantekeningen wurde behâlden as de hanneling dat tastiet. Digitale hântekenings binne de útsûndering: elke feroaring yn de triem makket de hântekening ûnjildich, om' t dat krekt is wêr' t in hântekening foar brûkt wurdt.
Is OCR PDF wat kost?
+
Nee, OCR PDF is frij sûnder akkount, en der wurdt neat op de siden stempele. Opladen dokuminten wurde koart nei de taak wiske fan de wurkers.