Распознать Текст
Распознавайте текст в отсканированных PDF и делайте их доступными для поиска. Автоматически определяет язык документа. 100% локально — без загрузки.
Распознавайте текст в отсканированных PDF и делайте их доступными для поиска. Автоматически определяет язык документа. 100% локально — без загрузки.
Извлекайте текст из отсканированных PDF, делайте их доступными для поиска и копируйте содержимое — прямо в браузере с помощью OCR (оптического распознавания символов). Не нужно устанавливать программы, не нужен аккаунт, а ваши файлы никогда не покидают устройство.
PDFree автоматически определяет язык документа перед запуском распознавания — вам не нужно гадать. Подходит для отсканированных договоров, учебников, счетов и архивных документов на десятках языков и алфавитов.
Перетащите файл или нажмите «Выбрать PDF». PDFree автоматически определяет, есть ли в вашем PDF текстовый слой или это чистое отсканированное изображение.
Для отсканированных PDF: нажмите «Установить движок OCR», чтобы загрузить Tesseract.js (~17 МБ, разовая загрузка). PDFree анализирует страницу и автоматически предлагает язык документа; при необходимости вы можете изменить его в выпадающем списке. PDF с текстовым слоем пропускают этот шаг.
Движок распознавания обрабатывает каждую страницу локально — ничего не загружается. Индикатор прогресса показывает оставшееся время.
Ваш PDF скачивается автоматически по завершении распознавания текста. Исходный вид не меняется; добавляется только невидимый текстовый слой, чтобы вы могли искать, выделять и копировать текст в любой программе для чтения PDF.
Распознавание текста полезно всякий раз, когда у вас есть документ в виде изображения и нужно работать с текстом внутри него:
PDFree автоматически определяет, какой у вас тип PDF. PDF с текстовым слоем (большинство PDF, созданных цифровым способом — из Word, Google Docs или другого современного приложения) уже содержат машиночитаемый текст — извлечение происходит мгновенно, без движка OCR. Отсканированные PDF (фотографии страниц, факсы, старые архивные сканы) содержат только изображения и требуют OCR, чтобы превратить пиксели в выделяемый и доступный для поиска текст.
Большинство OCR-инструментов заставляют вас заранее выбирать язык документа, а ошибка в выборе незаметно портит точность. PDFree вместо этого анализирует содержимое страницы и автоматически предлагает правильный язык — по-настоящему отличительная особенность, ведь движок распознавания работает независимо от того, какой из 6 языков интерфейса PDFree вы используете. Читаете скан на японском, турецком или испанском, пока интерфейс на русском? Определение всё равно найдёт настоящий язык документа. Вы всегда можете вручную изменить предложенный вариант.
PDFree использует Tesseract.js — ведущий движок распознавания текста с открытым исходным кодом, поддерживающий 18 языков: английский, французский, немецкий, испанский, итальянский, португальский, русский, узбекский, нидерландский, польский, турецкий (европейские алфавиты) и арабский, японский, китайский упрощённый, китайский традиционный, корейский, хинди, тайский (сложные системы письма).
PDF с возможностью поиска сохраняет исходные отсканированные изображения в точности и добавляет невидимый текстовый слой поверх — полезно для архивирования, поиска внутри PDF-программы или отправки другим. Файл .txt содержит только извлечённый обычный текст с разделителями страниц — полезно для редактирования в Word или переноса в другой инструмент. Включите «Также скачать копию .txt», чтобы получить оба файла сразу.
Отсканированные документы часто содержат конфиденциальную информацию — договоры, медицинские записи, личную переписку, налоговые формы. С PDFree ничего никогда не загружается. Движок OCR (Tesseract.js) скачивается один раз, а затем полностью работает внутри вкладки браузера. Нет серверов, получающих ваши файлы, нет облачного хранения и никакого сбора данных. Откройте DevTools → вкладку Network во время обработки, чтобы убедиться самостоятельно: ноль загрузок.
После того как движок Tesseract.js будет загружен при первом запуске распознавания (~17 МБ, кешируется браузером), OCR PDFree полностью работает офлайн. Для обработки следующих документов интернет не нужен — это подходит для сред с ограниченным доступом к сети: юридических офисов, медицинских учреждений или проверки конфиденциальных документов.
Чтобы превратить отсканированный PDF в редактируемый текст, используйте PDFree в два шага: сначала запустите распознавание, чтобы создать PDF с возможностью поиска (см. выше), затем откройте результат в разделе PDF в Word — инструмент преобразует встроенный текстовый слой в полностью редактируемый документ .docx. Весь процесс происходит локально; ваш документ никуда не загружается.
Да, полностью бесплатный. Никаких подписок, премиум-уровней или платы за файл. Движок OCR (Tesseract.js) с открытым исходным кодом и работает полностью в вашем браузере.
Нет. У PDFree нет серверного бэкенда, получающего ваши файлы, поэтому ничего нельзя сохранить, залогировать или удержать. Ваш PDF и распознанный текст существуют только в памяти браузера на время сеанса и удаляются при закрытии вкладки.
Никогда. Вся обработка происходит внутри вкладки браузера. Ваш PDF-файл никогда не покидает устройство — ни один сервер его не получает. Движок Tesseract.js загружается один раз с CDN и кешируется; после этого он работает полностью офлайн.
PDFree анализирует текст с отсканированных страниц и предлагает наиболее вероятный язык документа перед запуском OCR — вам не нужно знать его заранее. Это работает независимо от языка интерфейса сайта. Вы всегда можете переопределить предложение в выпадающем списке.
18 языков: английский, французский, немецкий, испанский, итальянский, португальский, русский, узбекский, нидерландский, польский, турецкий, арабский, японский, китайский (упрощённый и традиционный), корейский, хинди и тайский.
Нет. PDFree добавляет невидимый текстовый слой поверх исходных отсканированных страниц. Внешний вид не меняется — изображения, макет и форматирование остаются точно такими же.
Точность OCR зависит от качества исходного скана. Низкое разрешение (ниже 150 dpi), размытые или перекошенные страницы, цветной фон и рукописный текст снижают показатель уверенности. Для лучшего результата: сканируйте с разрешением от 300 dpi при хорошем освещении.
OCR PDFree поддерживает файлы до 200 МБ. На мобильных устройствах (iOS/iPadOS) обработка ограничена первыми 30 страницами — сначала разделите PDF, чтобы обработать остальное. На настольных браузерах ограничений нет.
Да. После загрузки движка Tesseract.js при первом запуске OCR, PDFree полностью работает офлайн как прогрессивное веб-приложение.