PDF文字認識

スキャンしたPDFからテキストを抽出し、検索可能にします。文書の言語を自動検出。100%ローカル処理 — アップロードなし。

✓ ファイルサイズ制限なし ✓ アカウント不要 ✓ 透かしなし ✓ 永久無料
ここにファイルをドロップ
またはクリックして参照 — ファイル数に制限なし
ファイルはブラウザから出ません — ローカルで処理、アップロードなし

PDF OCR 無料 — スキャンPDFを検索可能なテキストに変換

スキャンしたPDFからテキストを抽出し、検索可能にして内容をコピーできます — ブラウザ内でOCR(光学文字認識)を使って直接処理。ソフトのインストールやアカウント登録は不要で、ファイルはデバイスから一切出ません

PDFreeはOCRを実行する前に文書の言語を自動検出するので、推測する必要はありません。スキャンした契約書、教科書、請求書、アーカイブ文書など、数十の言語と文字体系に対応しています。

OCRとは? OCR(光学文字認識)は、各ページが写真であるスキャンPDF(画像PDF)を、元の画像の上に見えないテキスト層を追加することで検索可能なPDFに変換する技術です。PDFreeはTesseract.jsを使ってブラウザ内で完全にOCRを実行します。ファイルはサーバーにアップロードされることはありません。文書の元の見た目は正確に維持されます。

スキャンPDFを検索可能にする方法

1
スキャンしたPDFを開く

ドラッグ&ドロップするか「PDFを選択」をクリック。PDFreeはPDFにすでにテキスト層があるか、単なるスキャン画像かを自動的に判定します。

2
言語を自動検出させるか、自分で選ぶ

スキャンPDFの場合:「OCRエンジンをインストール」をクリックしてTesseract.js(約17MB、初回のみ)を読み込みます。PDFreeはページを解析して文書の言語を自動的に提案します。必要ならドロップダウンから変更できます。テキスト層のあるPDFはこの手順を省略します。

3
「PDFを検索可能にする」をクリック

文字認識エンジンが各ページをローカルで処理します — アップロードは一切ありません。進捗バーで推定残り時間が表示されます。

4
検索可能なPDFをダウンロード

文字認識が完了すると、PDFは自動的にダウンロードされます。元の見た目は変わらず、見えないテキスト層が追加されるだけなので、どのPDFリーダーでも検索・選択・コピーができるようになります。

OCRが役立つ場面

文書が画像として存在し、その中のテキストを扱う必要があるときにOCRは役立ちます:

  • 法務 — 紙からスキャンした古い契約書や裁判資料を検索できるようにする
  • 学生 — スキャンした教科書からテキストをコピーし、箇所をハイライトしてノートに取り込む
  • 経理 — 監査用にスキャンした請求書や領収書を検索可能にする
  • 医療 — 紙のカルテをデジタル化しつつ、ファイルを端末外に出さない
  • 研究者 — スキャンした論文やアーカイブ資料を検索可能にする
  • 行政・人事 — 紙の書類を検索可能なデジタル記録として保管する

テキストPDFとスキャンPDF — 何が違う?

PDFreeはPDFの種類を自動で判定します。テキスト層があるPDF(Word、Google Docsなど現代的なアプリで作成された大半のPDF)はすでに機械可読なテキストを含んでいるため、OCRエンジンなしで瞬時に抽出できます。スキャンPDF(ページの写真、FAX、古いアーカイブスキャンなど)は画像のみを含み、ピクセルを選択・検索可能なテキストに変換するにはOCRが必要です。

自動言語検出 — 推測不要

多くのOCRツールでは事前に文書の言語を選ぶ必要があり、選択を誤ると気づかないうちに精度が落ちます。PDFreeはページの内容を解析して正しい言語を自動的に提案します — これは本当に独自の機能です。認識エンジンは、PDFreeの6つのインターフェース言語のうちどれを使っていても独立して動作するからです。日本語インターフェースを使いながらロシア語やトルコ語のスキャンを読んでいる場合でも、検出は文書の実際の言語を正しく見つけます。提案はいつでも手動で上書きできます。

18言語をサポート

PDFreeはオープンソースの主要な文字認識エンジンTesseract.jsを使用し、18言語をサポートしています:英語、フランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、ロシア語、ウズベク語、オランダ語、ポーランド語、トルコ語(ヨーロッパ系文字)、およびアラビア語、日本語、簡体字中国語、繁体字中国語、韓国語、ヒンディー語、タイ語(複雑な文字体系)。

OCRの品質に影響する要因

  • スキャン解像度 — 300dpi以上が最良の結果を生みます。150dpi未満では細い線や小さな文字の認識が難しくなります。
  • ページの傾き — 傾いたり回転したページは精度を下げます。PDFreeはPDFの回転(90°/180°/270°)を自動補正しますが、スキャン自体の物理的な傾きは補正できません。
  • 印刷 vs 手書き — 印刷文字はよく認識されますが、Tesseractは筆記体の手書き文字には対応していません。
  • 言語の一致 — 自動検出はほとんどの場合正しいモデルを選びますが、多言語文書では優勢な言語を手動選択すると最良の結果が得られます。

検索可能なPDF vs プレーンテキスト — どちらをダウンロードすべきか

検索可能なPDFは元のスキャン画像をそのまま保持し、その上に見えないテキスト層を追加します — アーカイブ、PDFリーダー内での検索、共有に便利です。.txtファイルはページ区切り付きの抽出テキストのみを含みます — Wordでの編集や他ツールへの取り込みに便利です。「.txtコピーも一緒にダウンロード」を有効にすると両方一度に入手できます。

プライバシー — スキャン文書は非公開のまま

スキャン文書には契約書、医療記録、私信、税務書類など機密性の高い内容が含まれることがよくあります。PDFreeでは何もアップロードされません。OCRエンジン(Tesseract.js)は一度だけダウンロードされ、その後はブラウザのタブ内で完全に動作します。ファイルを受け取るサーバーもクラウドストレージもデータ収集も一切ありません。処理中にDevTools → Networkタブを開けば、アップロードがゼロであることを自分で確認できます。

PDFreeのOCRをオフラインで使う

初回のOCR実行時にTesseract.jsエンジン(約17MB、ブラウザにキャッシュ)がダウンロードされた後は、PDFreeのOCRは完全にオフラインで動作します。以降の文書処理にインターネット接続は不要です。法律事務所や医療機関、機密文書のレビューなど、ネットワークアクセスが制限された環境にも適しています。

スキャンPDFを編集可能なテキストに変換する方法

スキャンPDFを編集可能なテキストに変換するには、PDFreeで2つのステップを踏みます:まずOCRを実行して検索可能なPDFを作成し(上記)、次にその結果をPDFをWordに変換で開きます — このツールは埋め込まれたテキスト層を完全に編集可能な.docxファイルに変換します。すべての処理はローカルで行われ、文書はどこにもアップロードされません。

よくある質問

このOCRツールは本当に無料ですか?

はい、完全に無料です。サブスクリプションもプレミアムプランもファイルごとの課金もありません。OCRエンジン(Tesseract.js)はオープンソースで、完全にブラウザ内で動作します。

PDFreeは処理後にファイルを保存・記録しますか?

いいえ。PDFreeにはファイルを受け取るバックエンドサーバーが存在しないため、何も保存・記録・保持されません。PDFと認識されたテキストはセッション中ブラウザのメモリ内にのみ存在し、タブを閉じると消去されます。

ファイルはサーバーにアップロードされますか?

一切ありません。すべての処理はブラウザのタブ内で行われます。PDFファイルは端末から出ることはなく、どのサーバーも受け取りません。Tesseract.jsエンジンはCDNから一度だけダウンロードされキャッシュされ、以降は完全にオフラインで動作します。

自動言語検出はどのように機能しますか?

PDFreeはスキャンしたページからテキストを解析し、OCR実行前に最も可能性の高い文書の言語を提案します — 事前に知っておく必要はありません。これはサイトのインターフェース言語とは無関係に機能します。提案はいつでもドロップダウンから上書きできます。

どの言語がサポートされていますか?

18言語:英語、フランス語、ドイツ語、スペイン語、イタリア語、ポルトガル語、ロシア語、ウズベク語、オランダ語、ポーランド語、トルコ語、アラビア語、日本語、中国語(簡体字・繁体字)、韓国語、ヒンディー語、タイ語。

OCR後にPDFの見た目は変わりますか?

いいえ。PDFreeは元のスキャンページの上に見えないテキスト層を追加するだけです。見た目は変わりません — 画像、レイアウト、書式はそのまま維持されます。

なぜOCR品質が「普通」や「低い」と評価されるのですか?

OCRの精度は元のスキャン品質に依存します。低解像度(150dpi未満)、ぼやけたり傾いたページ、色付きの背景、手書き文字はすべて信頼度スコアを下げます。最良の結果を得るには、300dpi以上で良好な照明の下でスキャンしてください。

ファイルサイズの上限はどれくらいですか?

PDFreeのOCRは最大200MBまでのファイルに対応しています。モバイル(iOS/iPadOS)では、メモリ問題を避けるため最初の30ページのみ処理されます — 残りを処理するには先にPDFを分割してください。デスクトップブラウザには上限がありません。

オフラインでも動作しますか?

はい。初回のOCR実行時にTesseract.jsエンジンがダウンロードされた後は、PDFreeはプログレッシブウェブアプリとして完全にオフラインで動作します。

関連ツール

  • PDFをWordに変換 — 検索可能なPDFを編集可能なWord文書に変換
  • PDF分割 — OCR前に大きなスキャン文書を分割してメモリ制限内に収める
  • PDF圧縮 — 共有やアーカイブの前にスキャンPDFのサイズを削減
  • PDF結合 — 複数のスキャンページを1つのPDFにまとめる
  • PDF黒塗り — 共有前に機密部分を隠す

他のPDFツールではなくPDFreeを使う理由

📁
ファイルサイズ制限なし 500MB、1GBなど、あらゆるサイズのPDFを結合・圧縮・変換できます。
🔒
ファイルがデバイスを離れることはありません すべてブラウザ内で処理されます。アップロードなし、サーバーなし、オフラインでも動作。
👤
アカウント不要 登録なし、メールなし、ログインなし。ページを開くだけで使えます。
🚫
透かしなし 出力ファイルはクリーンです。ブランドロゴも透かしも隠しテキストも一切なし。
♾️
1日の利用回数制限なし 何度でも使えます。日次・月次クォータなし、プレミアムプランへの誘導なし。
🆓
永久無料 無料トライアルもフリーミアムも不要。PDFreeは完全無料 — AGPLv3のオープンソース。