OCR PDF
Text aus gescannten PDFs erkennen und durchsuchbar machen. Erkennt automatisch die Dokumentsprache. 100% lokal — kein Upload.
Text aus gescannten PDFs erkennen und durchsuchbar machen. Erkennt automatisch die Dokumentsprache. 100% lokal — kein Upload.
Extrahiere Text aus gescannten PDFs, mache sie durchsuchbar und kopiere Inhalte — direkt im Browser mit OCR (optische Zeichenerkennung). Keine Software-Installation, kein Konto nötig, und deine Dateien verlassen niemals dein Gerät.
PDFree erkennt die Sprache deines Dokuments automatisch, bevor die Texterkennung startet — du musst nicht raten. Funktioniert bei gescannten Verträgen, Lehrbüchern, Rechnungen und Archivdokumenten in Dutzenden Sprachen und Schriftsystemen.
Per Drag & Drop oder Klick auf „PDF auswählen". PDFree erkennt automatisch, ob dein PDF bereits eine Textebene hat oder ein reines Scan-Bild ist.
Bei gescannten PDFs: Klicke auf OCR-Engine installieren, um Tesseract.js zu laden (~17 MB, einmaliger Download). PDFree analysiert die Seite und schlägt die Dokumentsprache automatisch vor; du kannst sie über das Dropdown jederzeit ändern. Bei Text-PDFs entfällt dieser Schritt.
Die Texterkennung verarbeitet jede Seite lokal — nichts wird hochgeladen. Ein Fortschrittsbalken zeigt die geschätzte Restzeit.
Dein PDF wird automatisch heruntergeladen, sobald die Texterkennung fertig ist. Das Erscheinungsbild bleibt unverändert — nur eine unsichtbare Textebene wird hinzugefügt, damit du in jedem PDF-Reader suchen, markieren und Text kopieren kannst.
OCR ist immer dann nützlich, wenn ein Dokument nur als Bild vorliegt und du mit dem enthaltenen Text arbeiten musst:
| Wer | Typischer Einsatz |
|---|---|
| Rechtsabteilung | Alte Verträge und Gerichtsdokumente aus Papierscans durchsuchen |
| Studierende | Text aus gescannten Lehrbüchern kopieren, Passagen markieren, in Notizen übernehmen |
| Buchhaltung | Gescannte Rechnungen und Belege für Prüfungen durchsuchbar machen |
| Gesundheitswesen | Papierakten digitalisieren, ohne dass Daten das Gerät verlassen |
| Forschung | Gescannte Fachartikel und Archivdokumente durchsuchbar machen |
| Verwaltung / HR | Papierformulare archivieren und in durchsuchbare digitale Unterlagen umwandeln |
PDFree erkennt automatisch, welchen PDF-Typ du hast. Text-PDFs (die meisten digital erstellten PDFs — aus Word, Google Docs oder anderen Programmen) enthalten bereits maschinenlesbaren Text — die Extraktion ist sofort möglich, keine OCR-Engine nötig. Gescannte PDFs (Fotos von Seiten, Faxe, alte Archivscans) enthalten nur Bilder und benötigen OCR, um Pixel in auswählbaren, durchsuchbaren Text umzuwandeln.
Die meisten OCR-Tools verlangen, dass du die Dokumentsprache vorher auswählst — eine falsche Wahl verschlechtert die Genauigkeit still und heimlich. PDFree analysiert stattdessen den Seiteninhalt und schlägt die richtige Sprache automatisch vor — ein wirklich eigenständiges Feature, denn die Erkennung funktioniert unabhängig davon, in welcher der 6 PDFree-Oberflächensprachen du gerade surfst. Liest du einen russischen, japanischen oder türkischen Scan, während die Oberfläche auf Deutsch eingestellt ist? Die Erkennung findet trotzdem die tatsächliche Dokumentsprache. Du kannst den Vorschlag jederzeit manuell überschreiben.
PDFree nutzt Tesseract.js, eine führende Open-Source-Texterkennung, und unterstützt 18 Sprachen: Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Russisch, Usbekisch, Niederländisch, Polnisch, Türkisch (europäische Schriften) sowie Arabisch, Japanisch, Chinesisch (vereinfacht), Chinesisch (traditionell), Koreanisch, Hindi, Thailändisch (komplexe Schriften).
Nach der Texterkennung zeigt PDFree einen Qualitätswert (Exzellent / Gut / Ausreichend / Schlecht) basierend auf der Wort-Konfidenz von Tesseract. Die wichtigsten Faktoren:
Das durchsuchbare PDF behält deine ursprünglichen Scan-Bilder exakt bei und legt eine unsichtbare Textebene darüber. Öffne es in jedem PDF-Reader, markiere Text, nutze Strg+F zur Suche und kopiere Inhalte — das Erscheinungsbild bleibt unverändert. Ideal für Archivierung, Weitergabe oder Langzeitspeicherung.
Die .txt-Datei enthält nur den extrahierten Klartext mit Seitentrennern. Nutze sie, wenn du den Inhalt in Word oder Google Docs bearbeiten, in ein anderes Tool einspeisen oder programmatisch verarbeiten möchtest. Aktiviere „Auch .txt-Kopie herunterladen", um beide Dateien gleichzeitig zu erhalten.
Gescannte Dokumente enthalten oft sensible Inhalte — Verträge, medizinische Unterlagen, private Briefe, Steuerformulare. Bei PDFree wird nie etwas hochgeladen. Die OCR-Engine (Tesseract.js) wird einmalig heruntergeladen und läuft danach vollständig im Browser-Tab. Es gibt keine Server, die deine Dateien empfangen, keinen Cloud-Speicher und keine Datenerfassung jeglicher Art. Öffne die DevTools → Network-Tab während der Verarbeitung, um es selbst zu prüfen: null Uploads.
Sobald die Tesseract.js-Engine beim ersten OCR-Lauf heruntergeladen wurde (~17 MB, vom Browser zwischengespeichert), funktioniert PDFree OCR vollständig offline. Für weitere Dokumente ist keine Internetverbindung nötig — ideal für Umgebungen mit eingeschränktem Netzwerkzugang wie Anwaltskanzleien, medizinische Einrichtungen oder die Prüfung vertraulicher Dokumente. Der Service Worker speichert die App-Oberfläche zwischen, sodass sogar die UI nach dem ersten Besuch offline lädt.
| Merkmal | PDFree | Typisches Online-OCR |
|---|---|---|
| Dateiverarbeitung | Im Browser — nur lokal | Datei wird auf einen Server hochgeladen |
| Sprachauswahl | Automatisch erkannt | Manuell, leicht falsch gewählt |
| Konto erforderlich | Nein | Oft erforderlich |
| Ausgabe | Durchsuchbares PDF + optional .txt | Oft nur .txt |
| Ursprüngliches Layout | Bleibt exakt erhalten | Oft neu formatiert |
| Funktioniert offline | Ja, nach dem ersten Laden | Nein |
Um ein gescanntes PDF in bearbeitbaren Text umzuwandeln, nutze PDFree in zwei Schritten: Führe zuerst OCR aus, um ein durchsuchbares PDF zu erstellen (siehe oben), und öffne das Ergebnis dann in PDF zu Word — das Tool wandelt die eingebettete Textebene in ein vollständig bearbeitbares .docx-Dokument um. Der gesamte Vorgang läuft lokal ab; dein Dokument wird nirgendwo hochgeladen. Für reinen Text aktiviere während der OCR die Checkbox „Auch .txt-Kopie herunterladen" und überspringe die Word-Konvertierung.
Ja, komplett kostenlos. Kein Abo, keine Premium-Stufe, keine Kosten pro Datei. Die OCR-Engine (Tesseract.js) ist Open Source und läuft vollständig im Browser.
Nein. PDFree hat keinen Backend-Server, der deine Dateien empfängt — daher kann nichts gespeichert, protokolliert oder aufbewahrt werden. Dein PDF und der erkannte Text existieren nur im Arbeitsspeicher deines Browsers und werden beim Schließen des Tabs gelöscht.
Nie. Die gesamte Verarbeitung findet im Browser-Tab statt. Deine PDF-Datei verlässt dein Gerät nie — kein Server erhält sie jemals. Die Tesseract.js-Engine wird einmalig von einem CDN geladen und zwischengespeichert; danach läuft sie vollständig offline.
PDFree analysiert Text aus deinen gescannten Seiten und schlägt vor dem OCR-Lauf die wahrscheinlichste Dokumentsprache vor — du musst sie nicht vorher kennen. Das funktioniert unabhängig von der Oberflächensprache der Seite. Du kannst den Vorschlag jederzeit über das Dropdown überschreiben.
18 Sprachen: Englisch, Französisch, Deutsch, Spanisch, Italienisch, Portugiesisch, Russisch, Usbekisch, Niederländisch, Polnisch, Türkisch, Arabisch, Japanisch, Chinesisch (vereinfacht/traditionell), Koreanisch, Hindi und Thailändisch.
Nein. PDFree fügt eine unsichtbare Textebene über deine gescannten Seiten ein. Das Erscheinungsbild ändert sich nicht — Bilder, Layout und Formatierung bleiben exakt erhalten. Du kannst zusätzlich in jedem PDF-Reader suchen, markieren und Text kopieren.
Die OCR-Genauigkeit hängt von der Scan-Qualität ab. Niedrige Auflösung (unter 150 DPI), unscharfe oder schiefe Seiten, farbige Hintergründe und Handschrift senken den Konfidenzwert. Beste Ergebnisse: mindestens 300 DPI, gute Beleuchtung, gerade Ausrichtung und die korrekte Sprache bestätigen.
Das durchsuchbare PDF behält deine gescannten Bilder bei und legt eine unsichtbare Textebene darüber — nützlich zum Archivieren, Durchsuchen im PDF-Reader oder Teilen. Die .txt-Datei enthält nur den reinen Text mit Seitentrennern — nützlich zum Bearbeiten in Word oder zum Import in andere Tools. Beide gleichzeitig herunterladen mit „Auch .txt-Kopie herunterladen".
PDFree OCR unterstützt Dateien bis 200 MB. Auf Mobilgeräten (iOS/iPadOS) werden nur die ersten 30 Seiten verarbeitet, um Speicherprobleme zu vermeiden — teile das PDF vorher, um den Rest zu verarbeiten. Auf Desktop-Browsern gibt es keine Grenzen.
Ja. Sobald die Tesseract.js-Engine beim ersten OCR-Lauf heruntergeladen wurde, funktioniert PDFree als Progressive Web App vollständig offline — für weitere Dokumente ist keine Internetverbindung nötig.