1Скандалған PDF documents файлды жүктеп беру; таза 300 н/ д сұр реңкті сканның танып- білуішке ең көп жұмыс істеуге мүмкіндік береді.
2Бұл сөздің мағынасы: «қазақ тілінде сөйлеу» дегенді білдіреді, яғни қазақ тілінде сөйлеудің мағынасы қазақ тілінде сөйлеу.
3Тану жолын орындау; сөздер беттің бастапқы кескініне қарағанда көрінбейтін қабат ретінде жазылады.
4Іздеу үшін PDF файлды жүктеп алу - ол бірдей көрінеді, бірақ енді сіз іздеу және мәтінін таңдау үшін қолдана аласыз.
OCR PDF форматында Жиі қойылатын сұрақтар
OCR PDF сканерлеуді мәтінге қалай аударады?
+
Мысалы, әрбір бет 100- ден астам тілде Tesseract мәтін таныу арқылы рендерингтен өтіп, танып білген сөздер бастапқы суреттің үстіне көрінбейтін мәтін қабаты ретінде жазылады - сондықтан бет өзгермегендей көрінеді, бірақ іздеуге және таңдауға болады. Парақтың көрінісі бұрынғыдай - танылған мәтін суреттің артында көрінбейді, сондықтан іздеу мен таңдау көрінісін өзгертпей жұмыс істейді.
Қандай тілдерді біледі?
+
100- ден астам жазу, оның ішінде латын, кирилл, грек, араб, иврит, қытай, жапон, корей және үнді жазулары. Қай тіл керек екенін айтуы, болжауға қарағанда, дәлдігін арттырады.
Бастапқы пішімі танылуына әсер етеді ме?
+
Бұл солай. PDF бетті түзейді: қаріп, вектор, растрлық суреттер мен мәтін координаттары біркелкі, сондықтан барлық оқырмандар біркелкі орналасуды көреді. Парақтың сақталуы оны танитын бағдарламаның қандай ажыратымдылық пен түстер мәліметімен жұмыс істеуін анықтайды.
PDF үшін ерекше бірдеңе бар ма?
+
Иә — PDF - беттің суреті емес, нысан графикі, сондықтан мәтін таңдалып, векторлар оның ішіндегі растр мазмұнына не болғанына қарамастан, дәл болып қалады. Бұл танығыштың не көретініне әсер етеді.
Бұл қаншалықты дәл?
+
300 н/ д сканерлеу кезінде, қателерді азайту үшін жеткілікті жоғары, көбінесе, ұқсас емес зат есімдерді сканерлеу кезінде. Төмен ажыратымдылық, бұрмалау, телефон камерасының көлеңкесі, ұқсас емес қаріптер мен қолтаңбаларда дәлдігі төмендейді, әсіресе қолтаңбаларда бұл арнаулы емес.
Ең жақсы нәтиже алу үшін қай жерден сканерлеу керек?
+
Сұр реңкті 300 н/ д - ең жақсысы. 200 н/ д- ден төмен болса, таңбалардың пішіні бұзылады; 400 н/ д- ден жоғары болса, ештеңе шықпайды, файл өлшемі мен өңдеу уақыты азайады.
OCR PDF дегенге не жүктеп бере аламын?
+
Барлық стандартты PDF файлдары, соның ішінде сканер, мәтін өңдегіш немесе принтер драйвері шығарған файлдар. Тек өңдеуді шектейтін иесіне пароль қойылған файлдар өңделеді, пайдаланушының паролін талап ететін файлдар өңделмейді, шифрлауды бұзуға тырыспаймыз.
OCR PDF файлының өлшемі шектеулі ме?
+
Иә: free тіркелгісі бір құжатта 5 MB дейін өңдей алады, бұл есеп берулер мен контракттардың көпшілігіне, бірақ 600 н/ д- дегі ұзын сканерлеу құжаттарына келмейді; Ghostscript пен qpdf бұл жұмысты орындайды. Скандалынған PDF файлдары бұл шектен асып кететіні әдетте, құжатты алдымен қысу оны әдетте төмендетуге жеткілікті.
OCR PDF менің PDF documents сапасын төмендетеді ме?
+
Мәтін мен векторлық кескіндер пиксел емес, нысандар, сондықтан олар қандай масштабта да түзу болып қалады. Тек ендірілген растрлық кескіндер ғана бұзылады, және тек таңдаған әрекет оларды қайта сканерлегенде ғана.
OCR PDF бір мезгілде бірнеше PDF documents-де орындала ала ма?
+
Иә - топты жүктеп беріңіз, олар бір қатар параметрлер бойынша параллельді түрде өңделеді, бұл үстелдегі оқығыш арқылы түртудің орнына құжат жұмыс үрдісін жасаудың мәні.
Бетбелгілер, сілтемелер және пішін өрістері сақталсын ба?
+
Сұлба, ішкі сілтемелер мен түсініктемелер операция рұқсат бергенде сақталады. Цифрлық қолтаңбалар бұдан өзгеше: файлдағы кез келген өзгеріс қолтаңбаны жарамсыз етеді, өйткені қолтаңбаның мақсаты осы.
OCR PDF ақы төлей ме?
+
OCR PDF нөмірі тіркелгісіз бос, беттерге ештеңе басылып шығарылмайды. Жүктелген құжаттар тапсырма біткен соң бірден жұмысшылардан өшіріледі.