Kế hoạch miễn phí: 1 chuyển đổi/ giờ, 1 tập tin mỗi lần
Không giới hạn →

PDF OCR

Trích xuất văn bản từ các tệp PDF đã quét

Chọn tập tin của bạn

*Các tệp bị xóa sau 24 giờ

Chuyển đổi miễn phí các tập tin có dung lượng lên đến 1 GB, người dùng Pro có thể chuyển đổi các tập tin lên đến 100 GB; Đăng ký ngay!

Đang tải lên

0%

Cách sử dụng

1 Upload your scanned PDF
2 Select OCR language
3 Click Process to extract text
4 Download your searchable PDF

PDF OCR Câu hỏi thường gặp

Làm thế nào OCR PDF chuyển một bản scan thành văn bản?
+
Đặc biệt, mỗi trang được hiển thị, chạy qua một đoạn nhận dạng văn bản Tesseract trong hơn 100 ngôn ngữ, và các từ được nhận dạng được viết lại như một lớp văn bản vô hình được đặt trên hình ảnh gốc — vì vậy trang trông không thay đổi nhưng có thể tìm kiếm và chọn. Trang vẫn trông giống như trước — văn bản được nhận dạng nằm vô hình sau hình ảnh vì vậy tìm kiếm và chọn tác động mà không thay đổi hình ảnh.
Hơn 100, bao gồm Latin, Cyrillic, Greek, Arabic, Hebrew, Chinese, Japanese, Korean và Indian scripts. Nói cho nó biết ngôn ngữ nào để mong đợi sẽ cải thiện chính xác hơn là để nó đoán.
Nó có thể. PDF cố định trang: phông chữ, vectơ, hình ảnh raster và tọa độ văn bản được đóng băng để mọi người đọc thấy thiết kế giống nhau. Cách trang được lưu quyết định độ phân giải và thông tin màu mà trình nhận dạng phải làm việc với.
Có — PDF là đồ thị đối tượng, không phải hình ảnh trang, vì vậy văn bản vẫn có thể chọn và vector vẫn sắc nét dù có gì xảy ra với nội dung raster bên trong nó. Nó ảnh hưởng đến những gì mà trình nhận dạng có thể thấy.
Trong một bản scan văn bản in sạch 300 DPI, độ cao đủ cao để các lỗi hiếm gặp và hầu hết là trong các danh từ chính bất thường. Độ chính xác giảm mạnh với độ phân giải thấp, lệch, bóng tối từ máy ảnh điện thoại, phông chữ bất thường và chữ viết tay — đặc biệt là chữ viết tay không phải là mục đích của công cụ này.
300 DPI trong độ xám là điểm tốt nhất. Dưới 200 DPI, hình dạng ký tự bắt đầu bị phá vỡ; trên 400 DPI, bạn hầu như không có gì cả và phải trả giá bằng kích thước tập tin và thời gian xử lý.
Mọi PDF tiêu chuẩn, bao gồm những tập tin được tạo bởi máy quét, trình xử lý văn bản hay trình điều khiển in. Tập tin có mật khẩu chủ chỉ hạn chế sửa đổi sẽ được xử lý; tập tin cần mật khẩu người dùng để mở không được xử lý, và chúng tôi không cố gắng phá mã hóa.
Có: tài khoản miễn phí xử lý tài liệu lên đến 25 MB mỗi tài liệu, bao gồm hầu hết các báo cáo và hợp đồng nhưng không phải là một tài liệu scan dài ở 600 DPI; Ghostscript và qpdf làm việc. PDF scan là thứ thường xuyên vượt quá nó, và nén tài liệu trước thường là đủ để mang nó trở lại dưới.
Văn bản và tranh vectơ là các đối tượng chứ không phải điểm ảnh, vì vậy chúng vẫn giữ được độ sắc nét hoàn hảo ở bất kỳ độ phóng to nào dù có chuyện gì xảy ra. Chỉ có hình ảnh raster nhúng có thể bị giảm chất lượng, và chỉ khi thao tác bạn chọn lấy mẫu lại chúng.
Có — tải lên tập tin và chúng sẽ xử lý song song dưới một tập hợp các cài đặt, đó là điểm của việc làm một luồng tài liệu ở đây thay vì click qua một trình đọc desktop.
Các đường nét, liên kết nội bộ và ghi chú được giữ lại bất cứ khi nào thao tác cho phép. Chữ ký số là ngoại lệ: bất kỳ thay đổi nào vào tập tin đều làm hỏng chữ ký, vì đó chính xác là mục đích của chữ ký.
Không. PDF OCR miễn phí mà không cần tài khoản, và không có gì được dán dấu lên trang. Tài liệu tải lên sẽ bị xóa khỏi người làm việc ngay sau khi công việc hoàn thành.

Đánh giá công cụ này

5.0/5 - 0 phiếu bầu
Nhà xuất bản NXB.com. - 800+ tên miền. Tìm tên hoàn hảo của bạn.
Hoặc tải tệp của bạn lên đây