Ali mi pretvorba JPG v DOCX daje besedilo, ki se lahko uredi?
+
Da, ko je OCR omogočen – slika se analizira, so znaki prepoznani in zapisani v DOCX kot pravo besedilo, ki ga lahko izberete, iskate in urejate. Z OCR izključeno, JPG je preprosto dano v dokument kot sliko. JPG je standard JPEG od leta 1992, po treh desetletjih pa še vedno format, ki ga večina kamer uporablja za fotografije. DOCX je Office Open XML, oblika Word je privzeto od leta 2007 in ISO standard od leta 2008.
Kako natančno je prepoznavanje besedila?
+
Na čistem, ravnim, visoko ločljivost skeniranje tiskanega besedila je točnost običajno precej nad 98%. Odpada z nizko ločljivostjo, skečanjem, sencami, barvami ali teksturiran ozadje, nenavadnimi pisavi in pisavo – pisavo je treba obravnavati kot nezanesljivo.
Kako naj dobim najboljši rezultat OCR od mojega JPG?
+
Skenirajte ali fotografirajte pri 300 dpi ali bolje, imejte stran ravno in kvadratno na kamero, enakomerno ga osvetlite in se izogibajte težkemu stiskanju. Ker JPG shranjuje 8-bitni RGB skozi izgublja DCT z 4:2:0 kroma subsemping privzeto, tako da je fino rdeče besedilo in trdi robovi so prve stvari, ki so mehčali, vir, ki je prihranjen na nizko kakovost ima kompresijske artefakte okoli vsake črke, in prepoznavalec jih bere kot del glifa.
Kateri jeziki se lahko prepoznajo?
+
Vsi glavni latinsko-pisni jeziki plus kirilični, grški, arabski, hebrejski, kitajski, japonski in Korejski. Povej pretvorniku, ki naj pričakujejo – prepoznavalec uporablja jezikovni model, in pravi measurely izboljša točnost na nejasnih znakov.
Ali je razpored strani ohranjen?
+
Preoblikovanje je reda za branje, prelomov odstavkov in preprostih stolpcev. Kompleksni razporedi revije, bonitetne pasove, opombe in besedilo, ki se obmotajo okoli slik, bodo linearizirani – vse besede so tam, vendar je vizualni dogovor poenostavljen.
Ali so tabele v sliki priznane kot tabele?
+
Pravilne tabele z vidnimi mrežnimi linijami so običajno rekonstruirane kot realne DOCX tabele. Tabele, poravnane le z praznimi črkami, se pogosto berejo kot stolpci navadnega besedila, ker ni vizualne meje za analizator razporeditve za odkrivanje.
Can I convert several JPG pages into one document?
+
Yes — upload the pages in order and they become sequential pages or sections of a single DOCX. Name the files so they sort correctly, since filename order is what determines page order.
Kaj, če hočem samo sliko v dokumentu, ne besedilo?
+
Turn OCR off. The JPG is then embedded as an image, sized to the page, and the DOCX contains a picture rather than characters. That is the right choice for photographs, diagrams and artwork.
Will the image quality drop inside the DOCX?
+
Vgrajena slika se vstavi v prvotno ločljivost in le zmerja za prikaz. Ker DOCX je zapečatena OOXML svežnja – besedilo je XML, zato ostane editable, iskalna in različna, dokument lahko ponovno stisne shrani, odvisno od nastavitev aplikacije, zato lahko zelo velika slika po okroglem potovanju izgleda nekoliko mehkejše.
Lahko po tem spremenim rezultat?
+
Da – izhod je običajen DOCX, ki se odpre v katerem koli združljivem urejevalniku. To je na splošno razlog za pretvorbo: pretvorba ravni sliki strani v nekaj, kar lahko popravite, preoblikovate in ponovno uporabite.
Naj preverim izhod OCR?
+
Vedno, za vse, kar je pomembno. Priznavanje napak našteti na številke, interpunkcija in pravilne imennice – natančno vsebino, kjer napaka naredi največ škode. Obravnavajte OCR kot zelo hiter prvi osnutek, ne kot končano transkripcijo.
Je moj JPG zasebno med preobratovanjem?
+
Da – nalaganja se obdelujejo v izoliranih delavcih in se črtajo v nekaj minutah. Skenirani dokumenti, ki pogosto vsebujejo osebne podatke, se nikoli ne shranjujejo, pregledujejo ali uporabljajo za usposabljanje. Glejte /privatnost/.
Datoteke JPG uporabljajo stiskanje z izgubo, optimizirano za fotografije, kar zagotavlja majhne velikosti datotek, hkrati pa ohranja vizualno kakovost.