К содержанию
Выпуск №11 · 19 июня 2026 / Новости

EasyOCR извлекает текст из сканов, но теряет структуру документов по сравнению с Docling

В серии Enterprise Document Intelligence Vol. 1 5quinquies сравнили, как два инструмента обрабатывают один и тот же сканированный PDF‑документ 1974 года.

Редакция 19 июня 2026 г., 18:32 MSK

В Telegram

В серии Enterprise Document Intelligence [Vol.1 #5quinquies] сравнили, как два инструмента обрабатывают один и тот же сканированный PDF‑документ 1974 года. Эксперимент показал, что на этапе подготовки таких файлов к дальнейшей работе, например для задач RAG, системы дают заметно разный результат.

EasyOCR умеет извлекать текст из скана, но на выходе получается просто последовательность слов без какой-либо структуры. Фактически это плоская строка: в ней нет информации о разделах документа и других элементах оформления.

Docling работает иначе. Он восстанавливает не только сам текст, но и структуру исходного документа, включая разделы и фигуры. В результате сохраняется организация материала, поэтому такой вывод проще использовать в последующих системах обработки данных. По сравнению с этим результат EasyOCR оказывается менее удобным для дальнейших этапов работы.

Ключевые факты

  • В материале Enterprise Document Intelligence [Vol.1 #5quinquies] сравниваются результаты обработки одного и того же сканированного PDF 1974 года двумя движками.

  • EasyOCR извлекает из сканированного PDF только текст.

  • Docling извлекает из того же файла текст вместе со структурой документа, включая разделы и иллюстрации.

  • Из-за разницы в структуре один результат описывается как пригодный для дальнейшего использования, тогда как другой представляет собой плоскую строку текста.

Как процитировать

«EasyOCR извлекает текст из сканов, но теряет структуру документов по сравнению с Docling». hegai.media, 19 июня 2026 г.. https://hegai.media/novosti/easyocr-izvlekaet-tekst-iz-skanov-no-teryaet-strukturu-dokumentov-po-s--de5a5f1b-7341-444d-96a9-36e0e55fcca4

так материал выглядит в мессенджере