К содержанию
Новости

Сравнение OCR для рукописного русского: девять моделей протестировали на трех движках инференса

Сравнение OCR для рукописного русского: девять моделей протестировали на трех движках инференса

Авторы исследования проверили девять OCR-моделей на рукописном русском языке и сравнили их работу на трех движках инференса. В материале разбираются разные сочетания моделей и инфраструктуры, в том числе vLLM, SGLang, TGI и Native HF Transformers.

Как сообщает Habr, тест провели из-за сложности выбора OCR-решения среди множества вариантов, которые позиционируются как SOTA. В обзоре рассматриваются Tesseract, PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL. Результаты тестирования авторы собрали в таблицу и дополнили рекомендациями по выбору модели для разных задач.

Ключевые факты

  • В тестировании участвовали девять OCR-моделей.

  • Сравнение проводилось на трех движках инференса.

  • В материале упомянуты vLLM, SGLang, TGI и Native HF Transformers.

  • Среди рассматриваемых моделей названы PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL.

Вопросы и ответы

Какие OCR-модели сравнивали именно для рукописного русского, а не только печатного текста?

В обзоре тестировали девять OCR-моделей, включая PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL. Сравнение проводили именно на задачах распознавания рукописного русского языка.

Какие движки инференса проверяли и зачем это важно при выборе OCR?

Авторы сравнили работу моделей на трех движках инференса, включая vLLM, SGLang, TGI и Native HF Transformers. Это позволяет оценить не только качество распознавания, но и совместимость модели с конкретной инфраструктурой запуска.

Есть ли в исследовании рекомендации под разные сценарии использования?

Да. Результаты тестирования сведены в таблицу с рекомендациями по выбору OCR-модели под разные задачи, чтобы упростить выбор среди решений, которые позиционируются как SOTA.

Контекст по теме