OCR PDF
Ekstrak teks dari PDF hasil scan dan jadikan bisa dicari. Mendeteksi bahasa dokumen secara otomatis. 100% lokal — tanpa unggah.
Ekstrak teks dari PDF hasil scan dan jadikan bisa dicari. Mendeteksi bahasa dokumen secara otomatis. 100% lokal — tanpa unggah.
Ekstrak teks dari PDF hasil scan, buat jadi bisa dicari, dan salin isinya — langsung di browser Anda menggunakan OCR (Optical Character Recognition). Tanpa instal software, tanpa akun, dan file Anda tidak pernah meninggalkan perangkat Anda.
PDFree mendeteksi bahasa dokumen Anda secara otomatis sebelum menjalankan OCR, jadi Anda tidak perlu menebak-nebak. Cocok untuk kontrak hasil scan, buku pelajaran, faktur, dan dokumen arsip dalam puluhan bahasa dan aksara.
Seret dan lepas, atau klik "Pilih PDF". PDFree otomatis mendeteksi apakah PDF Anda sudah punya lapisan teks atau murni gambar hasil scan.
Untuk PDF hasil scan: klik Instal Mesin OCR untuk memuat Tesseract.js (~17 MB, sekali unduh). PDFree menganalisis halaman dan menyarankan bahasa dokumen secara otomatis; Anda bisa mengubahnya dari menu dropdown jika perlu. PDF dengan lapisan teks melewati langkah ini.
Mesin pengenalan teks memproses tiap halaman secara lokal — tidak ada yang diunggah. Progress bar menampilkan estimasi waktu tersisa.
PDF Anda otomatis terunduh setelah pengenalan teks selesai. Tampilan asli tidak berubah; hanya lapisan teks tak terlihat yang ditambahkan agar Anda bisa mencari, memilih, dan menyalin teks di pembaca PDF mana pun.
OCR berguna kapan pun Anda punya dokumen berupa gambar dan perlu bekerja dengan teks di dalamnya:
PDFree otomatis mendeteksi jenis PDF Anda. PDF berlapisan teks (sebagian besar PDF yang dibuat secara digital — dari Word, Google Docs, atau aplikasi modern lainnya) sudah berisi teks yang bisa dibaca mesin — ekstraksi langsung instan tanpa perlu mesin OCR. PDF hasil scan (foto halaman, dokumen faks, arsip lama) hanya berisi gambar dan butuh OCR untuk mengubah piksel menjadi teks yang bisa dipilih dan dicari.
Kebanyakan alat OCR mengharuskan Anda memilih bahasa dokumen terlebih dahulu, dan salah pilih diam-diam merusak akurasi. PDFree malah menganalisis isi halaman dan menyarankan bahasa yang tepat secara otomatis — fitur yang benar-benar khas, karena mesin pengenalan bekerja lepas dari bahasa antarmuka mana pun dari 6 bahasa PDFree yang sedang Anda pakai. Sedang membaca hasil scan berbahasa Rusia, Jepang, atau Turki sambil memakai antarmuka Bahasa Indonesia? Deteksi tetap menemukan bahasa asli dokumen. Anda selalu bisa mengganti saran itu secara manual.
PDFree menggunakan Tesseract.js, mesin pengenalan teks open-source terkemuka, dan mendukung 18 bahasa: Inggris, Prancis, Jerman, Spanyol, Italia, Portugis, Rusia, Uzbek, Belanda, Polandia, Turki (aksara Eropa) serta Arab, Jepang, Mandarin Sederhana, Mandarin Tradisional, Korea, Hindi, Thai (aksara kompleks).
PDF bisa dicari mempertahankan gambar hasil scan asli Anda persis dan menambahkan lapisan teks tak terlihat di atasnya — cocok untuk arsip, pencarian dalam pembaca PDF, atau berbagi file. File .txt hanya berisi teks murni dengan pemisah halaman — cocok untuk mengedit di Word atau memasukkan ke alat lain. Aktifkan "Unduh juga salinan .txt" untuk mendapatkan keduanya sekaligus.
Dokumen hasil scan sering berisi konten sensitif — kontrak, rekam medis, surat pribadi, formulir pajak. Dengan PDFree, tidak ada yang pernah diunggah. Mesin OCR (Tesseract.js) diunduh sekali lalu berjalan sepenuhnya di dalam tab browser Anda. Tidak ada server yang menerima file Anda, tidak ada penyimpanan cloud, dan tidak ada pengumpulan data apa pun. Buka DevTools → tab Network saat memproses untuk memverifikasi sendiri: nol unggahan.
Setelah mesin Tesseract.js diunduh saat OCR pertama Anda (~17 MB, disimpan cache oleh browser), OCR PDFree bekerja sepenuhnya offline. Tidak perlu koneksi internet untuk memproses dokumen berikutnya — cocok untuk lingkungan dengan akses jaringan terbatas seperti kantor hukum, fasilitas medis, atau tinjauan dokumen rahasia.
| Fitur | PDFree | OCR online pada umumnya |
|---|---|---|
| Pemrosesan file | Di browser Anda — hanya lokal | File diunggah ke server |
| Pemilihan bahasa | Terdeteksi otomatis dari dokumen | Manual, mudah salah pilih |
| Perlu akun | Tidak | Sering diperlukan |
| Output | PDF yang bisa dicari + .txt opsional | Hanya .txt di banyak alat |
| Tata letak asli | Dipertahankan persis | Sering diformat ulang |
| Bisa offline | Ya, setelah pemuatan pertama | Tidak |
Untuk mengubah PDF hasil scan menjadi teks yang bisa diedit, gunakan PDFree dalam dua langkah: jalankan dulu OCR untuk membuat PDF bisa dicari (di atas), lalu buka hasilnya di PDF ke Word — alat ini mengubah lapisan teks tertanam menjadi dokumen .docx yang sepenuhnya bisa diedit. Semua proses berjalan lokal; dokumen Anda tidak pernah diunggah ke mana pun.
Ya, sepenuhnya gratis. Tanpa langganan, tanpa tingkat premium, tanpa biaya per file. Mesin OCR (Tesseract.js) bersifat open-source dan berjalan sepenuhnya di browser Anda.
Tidak. PDFree tidak memiliki server backend yang menerima file Anda, jadi tidak ada yang bisa disimpan, dicatat, atau dipertahankan. PDF dan teks hasil pengenalan Anda hanya ada di memori browser selama sesi berlangsung dan terhapus saat Anda menutup tab.
Tidak pernah. Semua pemrosesan terjadi di dalam tab browser Anda. File PDF Anda tidak pernah meninggalkan perangkat — tidak ada server yang menerimanya. Mesin Tesseract.js diunduh sekali dari CDN dan disimpan cache; setelah itu berjalan sepenuhnya offline.
PDFree menganalisis teks dari halaman hasil scan Anda dan menyarankan bahasa dokumen yang paling mungkin sebelum OCR dijalankan — Anda tidak perlu tahu sebelumnya. Ini bekerja lepas dari bahasa antarmuka situs. Anda selalu bisa mengganti saran itu dari menu dropdown.
18 bahasa: Inggris, Prancis, Jerman, Spanyol, Italia, Portugis, Rusia, Uzbek, Belanda, Polandia, Turki, Arab, Jepang, Mandarin (Sederhana dan Tradisional), Korea, Hindi, dan Thai.
Tidak. PDFree menambahkan lapisan teks tak terlihat di atas halaman hasil scan asli Anda. Tampilan tidak berubah — gambar, tata letak, dan format tetap persis sama.
Akurasi OCR bergantung pada kualitas scan asli. Resolusi rendah (di bawah 150 DPI), halaman buram atau miring, latar belakang berwarna, dan tulisan tangan semuanya menurunkan skor kepercayaan. Untuk hasil terbaik: scan di 300 DPI atau lebih dengan pencahayaan baik.
OCR PDFree mendukung file hingga 200 MB. Di ponsel (iOS/iPadOS), pemrosesan dibatasi hanya 30 halaman pertama — pisahkan PDF dulu untuk memproses sisanya. Tidak ada batasan di browser desktop.
Ya. Setelah mesin Tesseract.js diunduh saat OCR pertama Anda, PDFree bekerja sepenuhnya offline sebagai Progressive Web App.