Nhận Dạng Văn Bản
Trích xuất văn bản từ PDF scan và làm cho chúng có thể tìm kiếm. Tự động nhận diện ngôn ngữ tài liệu. 100% cục bộ — không tải lên.
Trích xuất văn bản từ PDF scan và làm cho chúng có thể tìm kiếm. Tự động nhận diện ngôn ngữ tài liệu. 100% cục bộ — không tải lên.
Trích xuất văn bản từ PDF scan, làm cho chúng có thể tìm kiếm, và sao chép nội dung — ngay trong trình duyệt của bạn bằng OCR (Nhận Dạng Ký Tự Quang Học). Không cần cài phần mềm, không cần tài khoản, và file của bạn không bao giờ rời khỏi thiết bị.
PDFree tự động nhận diện ngôn ngữ tài liệu của bạn trước khi chạy OCR, nên bạn không cần đoán. Hoạt động tốt với hợp đồng scan, sách giáo khoa, hóa đơn và tài liệu lưu trữ bằng hàng chục ngôn ngữ và bảng chữ cái khác nhau.
Kéo thả hoặc bấm "Chọn PDF". PDFree tự động phát hiện xem PDF của bạn đã có lớp văn bản hay chỉ là ảnh scan thuần túy.
Với PDF scan: bấm Cài đặt Bộ máy OCR để tải Tesseract.js (~17 MB, chỉ tải một lần). PDFree phân tích trang và tự động đề xuất ngôn ngữ tài liệu; bạn có thể đổi từ menu thả xuống nếu cần. PDF có lớp văn bản sẽ bỏ qua bước này.
Bộ máy nhận dạng xử lý từng trang cục bộ — không có gì được tải lên. Thanh tiến trình hiển thị thời gian ước tính còn lại.
PDF của bạn tự động tải về khi nhận dạng văn bản hoàn tất. Giao diện gốc không thay đổi; chỉ có lớp văn bản vô hình được thêm vào để bạn có thể tìm kiếm, chọn và sao chép văn bản trong bất kỳ trình đọc PDF nào.
OCR hữu ích bất cứ khi nào bạn có tài liệu dạng ảnh và cần làm việc với văn bản bên trong:
PDFree tự động phát hiện loại PDF bạn có. PDF có lớp văn bản (hầu hết PDF được tạo kỹ thuật số từ Word, Google Docs hoặc ứng dụng hiện đại khác) đã chứa văn bản máy đọc được — trích xuất tức thì, không cần bộ máy OCR. PDF scan (ảnh chụp trang giấy, fax, bản scan lưu trữ cũ) chỉ chứa hình ảnh và cần OCR để chuyển pixel thành văn bản có thể chọn và tìm kiếm.
Hầu hết công cụ OCR bắt bạn chọn trước ngôn ngữ tài liệu, và chọn sai sẽ âm thầm làm giảm độ chính xác. Thay vào đó, PDFree phân tích nội dung trang và tự động đề xuất đúng ngôn ngữ — một tính năng thực sự khác biệt, vì bộ máy nhận dạng hoạt động độc lập với việc bạn đang dùng ngôn ngữ giao diện nào trong 6 ngôn ngữ của PDFree. Đang đọc bản scan tiếng Nga, Nhật hay Thổ Nhĩ Kỳ trong khi giao diện đang để tiếng Việt? Việc nhận diện vẫn tìm ra đúng ngôn ngữ thật của tài liệu. Bạn luôn có thể ghi đè đề xuất theo cách thủ công.
PDFree sử dụng Tesseract.js, một bộ máy nhận dạng văn bản mã nguồn mở hàng đầu, hỗ trợ 18 ngôn ngữ: Anh, Pháp, Đức, Tây Ban Nha, Ý, Bồ Đào Nha, Nga, Uzbek, Hà Lan, Ba Lan, Thổ Nhĩ Kỳ (bảng chữ cái châu Âu) và Ả Rập, Nhật, Trung Giản thể, Trung Phồn thể, Hàn, Hindi, Thái (chữ viết phức tạp).
PDF có thể tìm kiếm giữ nguyên hình ảnh scan gốc và thêm lớp văn bản vô hình lên trên — hữu ích để lưu trữ, tìm kiếm trong trình đọc PDF, hoặc chia sẻ. File .txt chỉ chứa văn bản thuần với dấu phân cách trang — hữu ích để chỉnh sửa trong Word hoặc đưa vào công cụ khác. Bật "Cũng tải bản sao .txt" để nhận cả hai file cùng lúc.
Tài liệu scan thường chứa nội dung nhạy cảm — hợp đồng, hồ sơ y tế, thư từ cá nhân, giấy tờ thuế. Với PDFree, không có gì từng được tải lên. Bộ máy OCR (Tesseract.js) được tải về một lần rồi chạy hoàn toàn trong tab trình duyệt của bạn. Không có máy chủ nào nhận file của bạn, không lưu trữ đám mây, và không thu thập dữ liệu dưới bất kỳ hình thức nào. Mở DevTools → tab Network trong khi xử lý để tự kiểm chứng: không có lượt tải lên nào.
Sau khi bộ máy Tesseract.js được tải về ở lần chạy OCR đầu tiên (~17 MB, được trình duyệt lưu cache), OCR PDFree hoạt động hoàn toàn không cần mạng. Không cần kết nối internet để xử lý các tài liệu tiếp theo — phù hợp cho môi trường hạn chế truy cập mạng như văn phòng luật, cơ sở y tế, hoặc rà soát tài liệu mật.
Để chuyển PDF scan thành văn bản có thể chỉnh sửa, hãy dùng PDFree qua hai bước: đầu tiên chạy OCR để tạo PDF có thể tìm kiếm (như trên), sau đó mở kết quả trong PDF sang Word — công cụ này chuyển lớp văn bản nhúng thành tài liệu .docx hoàn toàn có thể chỉnh sửa. Toàn bộ quá trình chạy cục bộ; tài liệu của bạn không bao giờ được tải lên bất cứ đâu.
Có, hoàn toàn miễn phí. Không có gói đăng ký, không có cấp cao cấp, không tính phí theo file. Bộ máy OCR (Tesseract.js) là mã nguồn mở và chạy hoàn toàn trong trình duyệt của bạn.
Không. PDFree không có máy chủ backend nào nhận file của bạn, nên không có gì có thể được lưu trữ, ghi lại hay giữ lại. PDF và văn bản nhận dạng của bạn chỉ tồn tại trong bộ nhớ trình duyệt trong phiên làm việc và bị xóa khi bạn đóng tab.
Không bao giờ. Toàn bộ quá trình xử lý diễn ra trong tab trình duyệt của bạn. File PDF của bạn không bao giờ rời khỏi thiết bị — không máy chủ nào nhận được nó. Bộ máy Tesseract.js được tải từ CDN một lần và lưu cache; sau đó chạy hoàn toàn ngoại tuyến.
PDFree phân tích văn bản từ các trang scan của bạn và đề xuất ngôn ngữ tài liệu có khả năng cao nhất trước khi chạy OCR — bạn không cần biết trước. Việc này hoạt động độc lập với ngôn ngữ giao diện của trang web. Bạn luôn có thể ghi đè đề xuất từ menu thả xuống.
18 ngôn ngữ: Anh, Pháp, Đức, Tây Ban Nha, Ý, Bồ Đào Nha, Nga, Uzbek, Hà Lan, Ba Lan, Thổ Nhĩ Kỳ, Ả Rập, Nhật, Trung (Giản thể và Phồn thể), Hàn, Hindi và Thái.
Không. PDFree thêm một lớp văn bản vô hình lên trên các trang scan gốc của bạn. Giao diện không thay đổi — hình ảnh, bố cục và định dạng vẫn giữ nguyên chính xác.
Độ chính xác OCR phụ thuộc vào chất lượng bản scan gốc. Độ phân giải thấp (dưới 150 DPI), trang mờ hoặc nghiêng, nền màu và chữ viết tay đều làm giảm điểm tin cậy. Để có kết quả tốt nhất: scan ở 300 DPI trở lên với ánh sáng tốt.
OCR PDFree hỗ trợ file lên đến 200 MB. Trên di động (iOS/iPadOS), xử lý giới hạn ở 30 trang đầu tiên — hãy tách PDF trước để xử lý phần còn lại. Không có giới hạn trên trình duyệt máy tính.
Có. Sau khi bộ máy Tesseract.js được tải về ở lần chạy OCR đầu tiên, PDFree hoạt động hoàn toàn ngoại tuyến như một Progressive Web App.