1Upload the scanned PDF documents; a clean 300 DPI grayscale scan gives the recogniser the most to work with.
2به آن بگویید که چه زبانی را انتظار داشته باشد - نامگذاری زبان از اجازه دادن به حدس زدن با یک فاصلهٔ وسیع بهتر است.
3این تابع به صورت زیر عمل میکند: تابع تابعی است که در آن یک تابع به صورت یک تابع تصادفی در یک صفحهٔ متنی نوشته میشود.
4پروندۀ PDF قابل جستجو را بارگیری کنید — به نظر مشابه میآید، اما حالا میتوانید متن در آن را جستجو و انتخاب کنید.
او سی آر پی دی اف سوالات متداول
چطور OCR PDF اسکن را به متن تبدیل میکند؟
+
Concretely, هر صفحه نمایش داده میشود، از طریق یک گذرگاه تشخیص متن Tesseract در بیش از ۱۰۰ زبان اجرا میشود، و کلمات شناسایی شده به عنوان لایه متن نامرئی بر روی تصویر اصلی نوشته میشوند — بنابراین صفحه تغییری نمیکند اما قابل جستجو و انتخاب است. The page still looks exactly as it did — the recognised text sits invisibly behind the image so search and selection work without changing the appearance.
چه زباني رو مي تونه بشناسه؟
+
بیش از ۱۰۰، از جمله لاتین، سیریلیک، یونانی، عربی، عبری، چینی، ژاپنی، کرهای و هندی. گفتن به آن که چه زبانی را انتظار داشته باشد به طور قابل توجهی دقت را نسبت به حدس زدن بهبود میبخشد.
آیا شکل منبع بر تشخیص تأثیر میگذارد؟
+
این کار را میکند. پیدیاف صفحات را ثابت میکند: قلمها، برداریها، تصاویر راستر و مختصات متن یخ زده میشوند تا هر خواننده طرح مشابهی را ببیند. چگونگی ذخیره صفحه تصمیم میگیرد که تشخیص دهنده با چه وضوح و اطلاعات رنگی باید کار کند.
چيزي خاص براي PDF اينجا هست؟
+
بله — یک PDF یک نمودار شیء است ، نه یک تصویر صفحه ، بنابراین متن قابل انتخاب باقی میماند و برداریها بدون توجه به آنچه که برای محتوای راستر درون آن اتفاق میافتد ، تیز باقی میمانند. این بر آنچه که شناساگر میتواند ببیند تأثیر میگذارد.
چقدر دقیقه؟
+
در یک اسکن ۳۰۰ DPI تمیز از متن چاپ شده، به اندازه کافی بالا که خطاها نادر و بیشتر در نامهای خاص غیرمعمول هستند. دقت با وضوح پایین، انحراف، سایههای دوربین تلفن، فونتهای غیرمعمول و دستنوشتهها به شدت کاهش مییابد — دستنوشتهها به ویژه چیزی نیست که این برای آن است.
براي بهترين نتيجه بايد چي رو اسکن کنم؟
+
۳۰۰ DPI در مقیاس خاکستری نقطهٔ دلخواه است. زیر ۲۰۰ DPI ، شکلهای کاراکتر شروع به خراب شدن میکنند؛ بالای ۴۰۰ DPI ، تقریباً هیچ چیز بدست نمیآورید و برای آن در اندازه پرونده و زمان پردازش هزینه میپردازید.
چه چیزی را میتوانم در OCR PDF بارگذاری کنم؟
+
هر پیدیاف استاندارد ، از جمله آنهایی که توسط یک اسکنر ، یک پردازشگر متن یا یک راننده چاپ تولید شدهاند. پروندههای با گذرواژه مالک که فقط ویرایش را محدود میکند ، مدیریت میشوند. پروندههایی که برای باز کردن نیاز به گذرواژه کاربر دارند ، مدیریت نمیشوند ، و ما تلاش نمیکنیم رمزگشایی را بشکنیم.
آیا محدودیت اندازه پرونده در OCR PDF وجود دارد؟
+
بله: حسابهای آزاد سندها را تا 5 MB تک پردازش میکنند ، که بیشتر گزارشها و قراردادها را پوشش میدهد ، اما نه یک سند اسکنشده طولانی با ۶۰۰ DPI؛ Ghostscript و qpdf کار را انجام میدهند. اسکن شده PDFها چیز معمول است که از آن تجاوز میکند، و فشرده سازی سند اول معمولاً کافی است تا آن را به زیر بیاورند.
آیا OCR PDF کیفیت PDF documents من را کاهش خواهد داد؟
+
متن و گرافیک برداری شیء هستند نه پیکسل ، بنابراین در هر بزرگنمایی بدون توجه به اتفاقی که میافتد کاملاً تیز باقی میمانند. فقط تصاویر راستر توکار میتوانند تخریب شوند ، و فقط اگر عملیاتی که انتخاب کردید آنها را دوباره نمونهگیری کند.
آیا میتوانم OCR PDF را در چند PDF documents همزمان اجرا کنم؟
+
در این روش، یک تابع به صورت یک تابع تصادفی و یک تابع به صورت یک تابع تصادفی در نظر گرفته میشود و در نتیجه، یک تابع تصادفی به جای یک تابع تصادفی در نظر گرفته میشود.
آیا چوبالفها، پیوندها و دامنههای فرم زنده میمانند؟
+
خطوط ، پیوندهای داخلی و یادداشتها ، هر جا که عملیات اجازه میدهد ، حفظ میشوند. امضای دیجیتال استثنا هستند: هر تغییری در پروندۀ لازماً امضا را بیاثر میکند ، زیرا دقیقاً برای این کار است.
Does OCR PDF cost anything?
+
شماره OCR PDF بدون حساب آزاد است و هیچ چیز روی صفحات مهر نمیشود. سندهای بارگذاری شده پس از پایان کار از کارمندان حذف میشوند.