Кожная старонка рэндеруецца, праходзіць праз Tesseract для выяўлення тэксту на больш чым 100 мовах, і выяўленыя словы запісваюцца назад як небачныя тэкставыя пласты, размешчаныя над арыгінальным малюнкам - так што старонка выглядае не змененай, але дазваляе пошук і вылучэнне. Старонка выглядае так жа, як і раней - выяўлены тэкст знаходзіцца небачным за малюнкам, таму пошук і вылучэнне працуюць без змены выгляду.
Якія мовы ён можа распазнаваць?
+
Больш за 100, уключаючы лацінскую, кірылічную, грэчаскую, арабскую, габрэйскую, кітайскую, японскую, карэйскую і індыйскую мовы. Калі вы паведаміце праграме, якую мову чакаць, яна будзе больш дакладнай, чым калі вы дазволіце ёй самай вызначыць.
Ці ўплывае фармат зыходнага коду на распазнаванне?
+
PDF фіксуе старонку: шрыфты, вектары, растравыя малюнкі і тэкставыя каардынаты замярзаюць, каб кожны чытач бачыў аднолькавы макет. Як захоўваецца старонка, вызначае, з якой раздзяляльнасцю і колерамі павінна працаваць праграма распазнавання.
Штосьці асаблівае для PDF тут?
+
Так - PDF - гэта аб' ектная графіка, а не малюнак старонкі, таму тэкст застаецца вылучаным, а вектары застаюцца рэзкімі, незалежна ад таго, што адбываецца з растарным зместам. Гэта ўплывае на тое, што можа бачыць праграма распазнавання.
Наколькі гэта дакладна?
+
На чыстай 300 DPI сканаванне друкаванага тэксту, дастаткова высокай, каб памылкі былі рэдкімі і большасць з іх у незвычайных уласных імёнах. Дакладнасць рэзка знізіцца з нізкай раздзяляльнасцю, скажэннем, ценямі з камеры тэлефона, незвычайнымі шрыфтамі і рукапісам - рукапіс у прыватнасці не тое, што гэтая праграма для.
У якім становішчы мне трэба сканаваць, каб атрымаць найлепшы вынік?
+
300 DPI у шэрых адценняў - гэта ідэальная тэмпература. Пры менш чым 200 DPI сімвалы пачынаюць разбурацца; пры больш чым 400 DPI вы не атрымаеце нічога, а толькі павялічваеце памер файла і час апрацоўкі.
Што я магу загрузіць у OCR PDF?
+
Любы стандартны PDF, уключаючы тыя, што створаны сканерам, тэкставым працэсарам або драйверам друку. Файл з паролем уласніка, які абмяжоўвае толькі рэдагаванне, будзе апрацоўвацца; файлы, якія патрабуюць пароля карыстальніка для адкрыцця, не будуць апрацоўвацца, і мы не будзем спрабаваць разблакаваць шыфраванне.
Ці ёсць абмежаванне памеру файла для OCR PDF?
+
Так: бясплатныя рахункі апрацоўваюць дакументы памерам да 25 Мб, што ахоплівае большасць справаздач і кантрактаў, але не доўгі сканаваны дакумент у 600 DPI; Ghostscript і qpdf робяць працу. Сканаваныя PDF - гэта звычайная рэч, якая перавышае гэта, і спачатку сціскае дакумент звычайна дастаткова, каб вярнуць яго пад.
Ці можа OCR PDF паменшыць якасць маіх PDF дакументаў?
+
Тэкст і векторныя малюнкі - гэта аб' екты, а не пікселя, таму яны застаюцца рэзкімі пры любым павелічэнні. Толькі ўбудаваныя растравыя малюнкі могуць пагоршыцца, і толькі калі выбраная аперацыя перавыбірае іх.
Ці магу я выканаць OCR PDF на некалькіх дакументах PDF адначасова?
+
Так - загрузіць набор і яны будуць апрацоўвацца паралельна пад адным набор налад, што з' яўляецца мэтай працы з дакументам тут, а не націскання праз працоўны стол чытача.
Ці захоўваюцца закладкі, спасылкі і палі формы?
+
Кантуры, унутраныя спасылкі і анатацыі захоўваюцца, калі гэта дазваляе аперацыя. Лічбавыя подпісы - гэта выключэнне: любыя змены ў файле абавязкова робяць подпіс несапраўдным, бо падпіска выкарыстоўваецца менавіта для гэтага.
Ці каштуе OCR PDF?
+
Не. PDF з OCR бясплатны без уліковага запісу, і на старонках не ставіцца ніякіх надпісаў. Выцягнутыя дакументы выдаляюцца з сервера пасля завяршэння працы.