Özellikle, her sayfa 100'den fazla dilde Tesseract metin tanıma geçişi ile 100'den fazla dilde Tesseract metin tanıma geçişi ile her sayfa renklendirilir ve tanımlanmış kelimeler orijinal görüntünün üzerine konumlandırılan görünmez bir metin katmanı olarak geri yazılırlar - böylece sayfa değişmemiş gibi görünür ama arama ve seçme yapılabilir. Sayfa hala tam olarak göründüğü gibi görünür - tanımlanmış metin görüntünün arkasında görünmez olarak oturur böylece arama ve seçme görünümü değiştirmeden çalışmaktadır.
Hangi dilleri tanıyabilir?
+
Latin, Kiril, Yunanca, Arapça, İbranice, Çince, Japonca, Korece ve Hint alfabesi dahil 100'den fazla yazı tipi. hangi dilini beklediğini söylemek tahmin etmesine izin vermekten çok doğruluğu artırır.
Kaynak biçimi tanımayı etkiler mi?
+
PDF sayfayı düzeltir: yazı tipleri, vektörler, raster resimler ve metin koordinatları dondurulur böylece her okuyucu aynı düzenlemeyi görür. Sayfanın nasıl depolandığı tanımlayıcının ne tür çözünürlük ve renk bilgisiyle çalışması gerektiğine karar verir.
PDF'ye özel bir şey var mı?
+
Evet — PDF sayfa görüntüsü değil, nesne grafiğidir, bu yüzden metin seçilerek ve vektörler içindeki raster içeriğine ne olursa olsun keskin olarak kalır. Bu tanımlayıcının ne görebileceğini etkiler.
Ne kadar doğru?
+
Yazılmış metinlerin temiz bir 300 DPI taramasında, hataların nadiren ve çoğunlukla alışılmadık doğru isimlerde meydana geldiği kadar yüksek. Düşük çözünürlük, eğrilik, telefon kamerasından gelen gölgeler, alışılmadık yazı tipleri ve el yazısı ile doğruluk keskin bir şekilde düşer - özellikle el yazısı için bu bu değil.
En iyi sonuç için nerede taramalıyım?
+
Gri tonlarında 300 DPI en iyi noktadır. 200 DPI' nin altında karakter şekilleri bozulma göstermeye başlar; 400 DPI' nin üzerinde neredeyse hiçbir şey kazanmıyorsunuz ve bunun bedelini dosya boyutu ve işlem süresi olarak ödeyorsunuz.
OCR PDF'ye ne yükleyebilirim?
+
Bir tarayıcı, bir söz işlemci veya bir yazıcı sürücüsü tarafından üretilenler dahil olmak üzere herhangi bir standart PDF. Sadece düzenlemeyi kısıtlayan sahip şifreli dosyalar işlenir; açılmak için kullanıcı şifresine ihtiyaç duyan dosyalar işlenmez ve şifreyi kırmaya çalışmıyoruz.
OCR PDF için dosya boyutu sınırı var mı?
+
Evet: ücretsiz hesaplar, çoğu rapor ve sözleşmeyi kapsayan, ancak 600 DPI'de uzun bir tarama belgesi içermeyen, her biri 25 MB'a kadar olan belgeleri işleme alabilir; Ghostscript ve qpdf bu işi yapabilir. Taranan PDF'ler, bunu aşan olağan şeylerdir ve belgeyi önce sıkıştırmak, onu geri getirmek için normalde yeterlidir.
OCR PDF PDF belgelerimin kalitesini düşürecek mi?
+
Metin ve vektörel resimler pikseller yerine nesnelerdir, bu yüzden ne olursa olsun herhangi bir zoom ile mükemmel keskin kalırlar. Sadece entegre raster resimleri bozulabilir ve sadece seçtiğiniz işlem onları yeniden örneklerse.
Birden fazla PDF belgesinde OCR PDF'yi aynı anda çalıştırabilir miyim?
+
Evet — set yükleyin ve onlar paralel olarak bir set ayar altında işleme, bu noktada bir belge çalışma akışını yapmak yerine masaüstü okuyucusu üzerinden tıklayın.
İzlenimler, bağlantılar ve form alanları hayatta kalıyor mu?
+
Özellikler, iç bağlantılar ve notlar işlemin izin verdiği her yerde korunur. Dijital imzalar istisnadır: dosyadaki herhangi bir değişiklik imzayı geçersiz kılacaktır, çünkü imzanın tam olarak amacı budur.
OCR PDF ücretli mi?
+
Hayır. OCR PDF hesap olmadan ücretsizdir ve sayfalara damga vurmuyor. Yüklenen belgeler iş tamamlandıktan kısa bir süre sonra çalışanlardan silinir.