1Muatkan naik PDF documents yang diimbas; imbasan skala kelabu 300 DPI bersih memberikan pengiktirafan yang paling banyak untuk bekerja.
2Beritahu bahasa mana yang hendak diharapkan — nama bahasa melebihi biarkan ia meneka dengan margin yang luas.
3Jalankan laluan pengenalan; perkataan ditulis semula sebagai lapisan tak kelihatan duduk di atas imej halaman asal.
4Muat turun fail bolehcari PDF — ia kelihatan sama, tetapi anda boleh cari dan pilih teks didalamnya.
PDF OCR Soalan Lazim
Bagaimana OCR PDF menukar imbasan ke teks?
+
Secara khusus, setiap halaman dihasilkan, berjalan melalui laluan pengenalan teks Tesseract dalam lebih 100 bahasa, dan perkataan yang dikenali ditulis semula sebagai lapisan teks tak kelihatan diletakkan di atas imej asal — jadi halaman kelihatan tidak berubah tetapi boleh dicari dan dipilih. Halaman masih kelihatan seperti yang ia lakukan - teks yang dikenali duduk tidak kelihatan di belakang imej jadi carian dan pemilihan bekerja tanpa mengubah penampilan.
Bahasa apa yang ia boleh mengenali?
+
Lebih 100, termasuk Latin, Cyrillic, Greek, Arab, Hebrew, Cina, Jepun, Korea dan skrip India. Memaklumkan bahasa mana yang dijangkakan secara material meningkatkan ketepatan berbanding membiarkan ia meneka.
Adakah format sumber mempengaruhi pengecaman?
+
Ianya boleh. PDF memperbaiki halaman: fon, vektor, imej raster dan koordinat teks dibekukan supaya setiap pembaca melihat susunatur yang sama. Cara halaman disimpan menentukan resolusi dan maklumat warna yang perlu diguna oleh pengiktirafan.
Sesuatu yang spesifik untuk PDF di sini?
+
Ya — PDF adalah graf objek, bukan imej halaman, jadi teks tetap boleh dipilih dan vektor tetap tajam tidak kira apa yang berlaku kepada kandungan raster di dalamnya. Ia mempengaruhi apa yang pengiktirafan boleh lihat.
Berapa tepatnya?
+
Pada imbasan 300 DPI bersih teks cetak, cukup tinggi untuk ralat jarang berlaku dan kebanyakannya dalam nama benda yang tidak biasa. Ketepatan jatuh dengan jelas dengan resolusi rendah, lengkung, bayang dari kamera telefon, font yang tidak biasa dan tulisan tangan — tulisan tangan khususnya bukanlah apa yang ini untuk.
Apa yang patut saya imbas untuk hasil yang terbaik?
+
300 DPI dalam skala kelabu adalah titik manis. Di bawah 200 DPI bentuk aksara mula rosak; di atas 400 DPI anda tidak mendapat apa- apa dan membayar untuknya dalam saiz fail dan masa pemprosesan.
Apa yang boleh saya muat naik ke OCR PDF?
+
Sebarang PDF piawai, termasuk yang dihasilkan oleh pengimbas, pemproses kata atau pemacu cetakan. Fail dengan kata laluan pemilik yang hanya membatasi penyuntingan ditangani; fail yang memerlukan kata laluan pengguna untuk dibuka tidak, dan kami tidak cuba memecah penyulitan.
Adakah terdapat had saiz fail pada OCR PDF?
+
Ya: akaun bebas proses dokumen sehingga 5 MB setiap satu, yang meliputi kebanyakan laporan dan kontrak tetapi bukan dokumen mengimbas panjang pada 600 DPI; Ghostscript dan qpdf melakukan kerja. PDF yang diimbas adalah perkara biasa yang melebihinya, dan memampatkan dokumen pertama biasanya cukup untuk membawanya kembali ke bawah.
Adakah OCR PDF akan menurunkan kualiti PDF documents saya?
+
Teks dan karya seni vektor adalah objek bukan piksel, jadi mereka tetap tajam pada sebarang zum tanpa mengira apa yang berlaku. Hanya imej raster terbenam boleh merosot, dan hanya jika operasi yang anda pilih sampel semula mereka.
Bolehkah saya jalankan OCR PDF pada beberapa PDF documents sekaligus?
+
Ya — muat naik set dan mereka diproses secara serentak di bawah satu set tetapan, yang merupakan titik untuk melakukan aliran kerja dokumen di sini daripada mengklik melalui pembaca desktop.
Adakah tandabuku, pautan dan medan borang akan kekal?
+
Garis luar, pautan dalaman dan anotasi disimpan di mana-mana operasi membenarkannya. Tandatangan digital adalah pengecualian: sebarang perubahan kepada fail mesti melumpuhkan tandatangan, kerana itulah yang tandatangan adalah untuk.
Adakah OCR PDF memerlukan bayaran?
+
No. OCR PDF adalah bebas tanpa akaun, dan tiada apa yang ditempel pada halaman. Dokumen yang dimuat naik dipadam dari pekerja tidak lama selepas tugas selesai.