OCR PDF
Extrayez le texte des PDF scannés et rendez-les consultables. Détecte automatiquement la langue du document. 100% local — rien à envoyer.
Extrayez le texte des PDF scannés et rendez-les consultables. Détecte automatiquement la langue du document. 100% local — rien à envoyer.
Extrayez le texte de PDF scannés, rendez-les consultables et copiez leur contenu — directement dans votre navigateur grâce à l'OCR (reconnaissance optique de caractères). Aucun logiciel à installer, aucun compte requis, et vos fichiers ne quittent jamais votre appareil.
PDFree détecte automatiquement la langue de votre document avant de lancer l'OCR — inutile de deviner. Fonctionne avec des contrats scannés, des manuels, des factures et des documents d'archives dans des dizaines de langues et d'écritures.
Glissez-déposez ou cliquez sur « Choisir un PDF ». PDFree détecte automatiquement si votre PDF possède déjà une couche de texte ou s'il s'agit d'une simple image scannée.
Pour les PDF scannés : cliquez sur Installer le moteur OCR pour charger Tesseract.js (~17 Mo, téléchargement unique). PDFree analyse la page et suggère automatiquement la langue du document ; vous pouvez la modifier depuis le menu déroulant si besoin. Les PDF avec couche de texte sautent cette étape.
Le moteur de reconnaissance traite chaque page localement — rien n'est envoyé. Une barre de progression indique le temps restant estimé.
Votre PDF se télécharge automatiquement une fois la reconnaissance terminée. L'apparence d'origine ne change pas ; seule une couche de texte invisible est ajoutée pour rechercher, sélectionner et copier du texte dans n'importe quel lecteur PDF.
L'OCR est utile chaque fois que vous avez un document sous forme d'image et que vous devez exploiter le texte qu'il contient :
| Qui | Usage typique |
|---|---|
| Juridique | Rechercher dans d'anciens contrats et documents judiciaires scannés |
| Étudiants | Copier du texte depuis des manuels scannés, surligner des passages, importer dans ses notes |
| Comptabilité | Rendre consultables des factures et reçus scannés pour les audits |
| Santé | Numériser des dossiers patients papier sans que les fichiers ne quittent l'appareil |
| Chercheurs | Rendre consultables des articles académiques et documents d'archives scannés |
| Administration / RH | Archiver des formulaires papier et les transformer en registres numériques consultables |
PDFree détecte automatiquement le type de PDF que vous avez. Les PDF avec couche de texte (la plupart des PDF créés numériquement depuis Word, Google Docs ou toute application moderne) contiennent déjà du texte exploitable par machine — l'extraction est instantanée, sans moteur OCR. Les PDF scannés (photos de pages, fax, anciennes archives numérisées) ne contiennent que des images et nécessitent l'OCR pour convertir les pixels en texte sélectionnable et consultable.
La plupart des outils OCR vous obligent à choisir la langue du document à l'avance, et une erreur de choix nuit silencieusement à la précision. PDFree analyse plutôt le contenu de la page et suggère automatiquement la bonne langue — une fonctionnalité vraiment distinctive, car le moteur de reconnaissance fonctionne indépendamment de la langue d'interface parmi les 6 proposées par PDFree. Vous lisez un scan en russe, en japonais ou en turc tout en utilisant l'interface en français ? La détection trouve quand même la vraie langue du document. Vous pouvez toujours corriger la suggestion manuellement.
PDFree utilise Tesseract.js, un moteur de reconnaissance de texte open source de référence, et prend en charge 18 langues : anglais, français, allemand, espagnol, italien, portugais, russe, ouzbek, néerlandais, polonais, turc (écritures européennes) et arabe, japonais, chinois simplifié, chinois traditionnel, coréen, hindi, thaï (écritures complexes).
Après l'OCR, PDFree affiche un score de qualité (Excellent / Bon / Correct / Faible) basé sur le niveau de confiance de Tesseract. Les principaux facteurs :
Le PDF consultable conserve exactement vos images scannées d'origine et ajoute une couche de texte invisible par-dessus. Ouvrez-le dans n'importe quel lecteur PDF pour sélectionner du texte, utiliser Ctrl+F pour rechercher et copier du contenu — l'apparence visuelle ne change pas. Idéal pour l'archivage, le partage ou le stockage à long terme.
Le fichier .txt contient uniquement le texte extrait avec des séparateurs de page. Utilisez-le pour modifier le contenu dans Word ou Google Docs, l'injecter dans un autre outil, ou le traiter par programme. Activez « Télécharger aussi une copie .txt » pour obtenir les deux fichiers à la fois.
Les documents scannés contiennent souvent des informations sensibles — contrats, dossiers médicaux, courriers personnels, formulaires fiscaux. Avec PDFree, rien n'est jamais envoyé. Le moteur OCR (Tesseract.js) est téléchargé une seule fois puis s'exécute entièrement dans votre onglet de navigateur. Aucun serveur ne reçoit vos fichiers, aucun stockage cloud, aucune collecte de données. Ouvrez les DevTools → onglet Réseau pendant le traitement pour vérifier vous-même : zéro envoi.
Une fois le moteur Tesseract.js téléchargé lors de votre premier OCR (~17 Mo, mis en cache par votre navigateur), l'OCR PDFree fonctionne entièrement hors ligne. Aucune connexion internet n'est nécessaire pour traiter les documents suivants — idéal pour les environnements à accès réseau restreint : cabinets juridiques, établissements médicaux, examen de documents confidentiels. Le service worker met en cache l'interface de l'application, si bien que même l'UI se charge hors ligne après la première visite.
| Fonctionnalité | PDFree | OCR en ligne classique |
|---|---|---|
| Traitement du fichier | Dans votre navigateur — local uniquement | Fichier envoyé sur un serveur |
| Choix de la langue | Détectée automatiquement | Manuel, erreur facile |
| Compte requis | Non | Souvent requis |
| Sortie | PDF consultable + .txt optionnel | Souvent .txt uniquement |
| Mise en page d'origine | Préservée exactement | Souvent reformatée |
| Fonctionne hors ligne | Oui, après le premier chargement | Non |
Pour convertir un PDF scanné en texte modifiable, utilisez PDFree en deux étapes : lancez d'abord l'OCR pour créer un PDF consultable (ci-dessus), puis ouvrez le résultat dans PDF en Word — l'outil convertit la couche de texte intégrée en document .docx entièrement modifiable. Tout le processus se déroule localement ; votre document n'est jamais envoyé nulle part. Pour un texte brut, activez la case « Télécharger aussi une copie .txt » pendant l'OCR et sautez la conversion Word.
Oui, entièrement gratuit. Pas d'abonnement, pas de palier premium, pas de frais par fichier. Le moteur OCR (Tesseract.js) est open source et fonctionne entièrement dans votre navigateur.
Non. PDFree n'a aucun serveur backend qui reçoit vos fichiers, donc rien ne peut être stocké, enregistré ou conservé. Votre PDF et le texte reconnu n'existent que dans la mémoire de votre navigateur pendant la session, et sont effacés à la fermeture de l'onglet.
Jamais. Tout le traitement se fait dans votre onglet de navigateur. Votre fichier PDF ne quitte jamais votre appareil — aucun serveur ne le reçoit. Le moteur Tesseract.js est téléchargé une fois depuis un CDN et mis en cache ; il fonctionne ensuite entièrement hors ligne.
PDFree analyse le texte de vos pages scannées et suggère la langue la plus probable du document avant de lancer l'OCR — inutile de la connaître à l'avance. Cela fonctionne indépendamment de la langue de l'interface du site. Vous pouvez toujours corriger la suggestion depuis le menu déroulant.
18 langues : anglais, français, allemand, espagnol, italien, portugais, russe, ouzbek, néerlandais, polonais, turc, arabe, japonais, chinois (simplifié et traditionnel), coréen, hindi et thaï.
Non. PDFree ajoute une couche de texte invisible par-dessus vos pages scannées d'origine. L'apparence ne change pas — images, mise en page et formatage restent exactement identiques.
La précision de l'OCR dépend de la qualité du scan d'origine. Une faible résolution (moins de 150 DPI), des pages floues ou inclinées, des fonds colorés et du texte manuscrit réduisent le score de confiance. Pour de meilleurs résultats : scannez à 300 DPI ou plus, avec un bon éclairage.
Le PDF consultable conserve vos images scannées et ajoute une couche de texte invisible par-dessus. Le fichier .txt contient uniquement le texte brut avec des séparateurs de page. Téléchargez les deux à la fois avec la case « Télécharger aussi une copie .txt ».
L'OCR PDFree prend en charge les fichiers jusqu'à 200 Mo. Sur mobile (iOS/iPadOS), le traitement est limité aux 30 premières pages — divisez d'abord le PDF pour traiter le reste. Aucune limite sur les navigateurs de bureau.
Oui. Une fois le moteur Tesseract.js téléchargé lors de votre premier OCR, PDFree fonctionne entièrement hors ligne en tant que Progressive Web App.