PDF文字認識
スキャンしたPDFからテキストを抽出し、検索可能にします。文書の言語を自動検出。100%ローカル処理 — アップロードなし。
スキャンしたPDFからテキストを抽出し、検索可能にします。文書の言語を自動検出。100%ローカル処理 — アップロードなし。
スキャンしたPDFからテキストを抽出し、検索可能にして内容をコピーできます — ブラウザ内でOCR(光学文字認識)を使って直接処理。ソフトのインストールやアカウント登録は不要で、ファイルはデバイスから一切出ません。
PDFreeはOCRを実行する前に文書の言語を自動検出するので、推測する必要はありません。スキャンした契約書、教科書、請求書、アーカイブ文書など、数十の言語と文字体系に対応しています。
ドラッグ&ドロップするか「PDFを選択」をクリック。PDFreeはPDFにすでにテキスト層があるか、単なるスキャン画像かを自動的に判定します。
スキャンPDFの場合:「OCRエンジンをインストール」をクリックしてTesseract.js(約17MB、初回のみ)を読み込みます。PDFreeはページを解析して文書の言語を自動的に提案します。必要ならドロップダウンから変更できます。テキスト層のあるPDFはこの手順を省略します。
文字認識エンジンが各ページをローカルで処理します — アップロードは一切ありません。進捗バーで推定残り時間が表示されます。
文字認識が完了すると、PDFは自動的にダウンロードされます。元の見た目は変わらず、見えないテキスト層が追加されるだけなので、どのPDFリーダーでも検索・選択・コピーができるようになります。
文書が画像として存在し、その中のテキストを扱う必要があるときにOCRは役立ちます:
PDFreeはPDFの種類を自動で判定します。テキスト層があるPDF(Word、Google Docsなど現代的なアプリで作成された大半のPDF)はすでに機械可読なテキストを含んでいるため、OCRエンジンなしで瞬時に抽出できます。スキャンPDF(ページの写真、FAX、古いアーカイブスキャンなど)は画像のみを含み、ピクセルを選択・検索可能なテキストに変換するにはOCRが必要です。
多くのOCRツールでは事前に文書の言語を選ぶ必要があり、選択を誤ると気づかないうちに精度が落ちます。PDFreeはページの内容を解析して正しい言語を自動的に提案します — これは本当に独自の機能です。認識エンジンは、PDFreeの6つのインターフェース言語のうちどれを使っていても独立して動作するからです。日本語インターフェースを使いながらロシア語やトルコ語のスキャンを読んでいる場合でも、検出は文書の実際の言語を正しく見つけます。提案はいつでも手動で上書きできます。
PDFreeはオープンソースの主要な文字認識エンジンTesseract.jsを使用し、18言語をサポートしています:英語、フランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、ロシア語、ウズベク語、オランダ語、ポーランド語、トルコ語(ヨーロッパ系文字)、およびアラビア語、日本語、簡体字中国語、繁体字中国語、韓国語、ヒンディー語、タイ語(複雑な文字体系)。
検索可能なPDFは元のスキャン画像をそのまま保持し、その上に見えないテキスト層を追加します — アーカイブ、PDFリーダー内での検索、共有に便利です。.txtファイルはページ区切り付きの抽出テキストのみを含みます — Wordでの編集や他ツールへの取り込みに便利です。「.txtコピーも一緒にダウンロード」を有効にすると両方一度に入手できます。
スキャン文書には契約書、医療記録、私信、税務書類など機密性の高い内容が含まれることがよくあります。PDFreeでは何もアップロードされません。OCRエンジン(Tesseract.js)は一度だけダウンロードされ、その後はブラウザのタブ内で完全に動作します。ファイルを受け取るサーバーもクラウドストレージもデータ収集も一切ありません。処理中にDevTools → Networkタブを開けば、アップロードがゼロであることを自分で確認できます。
初回のOCR実行時にTesseract.jsエンジン(約17MB、ブラウザにキャッシュ)がダウンロードされた後は、PDFreeのOCRは完全にオフラインで動作します。以降の文書処理にインターネット接続は不要です。法律事務所や医療機関、機密文書のレビューなど、ネットワークアクセスが制限された環境にも適しています。
スキャンPDFを編集可能なテキストに変換するには、PDFreeで2つのステップを踏みます:まずOCRを実行して検索可能なPDFを作成し(上記)、次にその結果をPDFをWordに変換で開きます — このツールは埋め込まれたテキスト層を完全に編集可能な.docxファイルに変換します。すべての処理はローカルで行われ、文書はどこにもアップロードされません。
はい、完全に無料です。サブスクリプションもプレミアムプランもファイルごとの課金もありません。OCRエンジン(Tesseract.js)はオープンソースで、完全にブラウザ内で動作します。
いいえ。PDFreeにはファイルを受け取るバックエンドサーバーが存在しないため、何も保存・記録・保持されません。PDFと認識されたテキストはセッション中ブラウザのメモリ内にのみ存在し、タブを閉じると消去されます。
一切ありません。すべての処理はブラウザのタブ内で行われます。PDFファイルは端末から出ることはなく、どのサーバーも受け取りません。Tesseract.jsエンジンはCDNから一度だけダウンロードされキャッシュされ、以降は完全にオフラインで動作します。
PDFreeはスキャンしたページからテキストを解析し、OCR実行前に最も可能性の高い文書の言語を提案します — 事前に知っておく必要はありません。これはサイトのインターフェース言語とは無関係に機能します。提案はいつでもドロップダウンから上書きできます。
18言語:英語、フランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、ロシア語、ウズベク語、オランダ語、ポーランド語、トルコ語、アラビア語、日本語、中国語(簡体字・繁体字)、韓国語、ヒンディー語、タイ語。
いいえ。PDFreeは元のスキャンページの上に見えないテキスト層を追加するだけです。見た目は変わりません — 画像、レイアウト、書式はそのまま維持されます。
OCRの精度は元のスキャン品質に依存します。低解像度(150dpi未満)、ぼやけたり傾いたページ、色付きの背景、手書き文字はすべて信頼度スコアを下げます。最良の結果を得るには、300dpi以上で良好な照明の下でスキャンしてください。
PDFreeのOCRは最大200MBまでのファイルに対応しています。モバイル(iOS/iPadOS)では、メモリ問題を避けるため最初の30ページのみ処理されます — 残りを処理するには先にPDFを分割してください。デスクトップブラウザには上限がありません。
はい。初回のOCR実行時にTesseract.jsエンジンがダウンロードされた後は、PDFreeはプログレッシブウェブアプリとして完全にオフラインで動作します。