Сравнение OCR для рукописного русского: девять моделей протестировали на трех движках инференса
Авторы исследования проверили девять OCR-моделей на рукописном русском языке и сравнили их работу на трех движках инференса. В материале разбираются разные сочетания моделей и инфраструктуры, в том числе vLLM, SGLang, TGI и Native HF Transformers.
Как сообщает Habr, тест провели из-за сложности выбора OCR-решения среди множества вариантов, которые позиционируются как SOTA. В обзоре рассматриваются Tesseract, PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL. Результаты тестирования авторы собрали в таблицу и дополнили рекомендациями по выбору модели для разных задач.
Ключевые факты
В тестировании участвовали девять OCR-моделей.
Сравнение проводилось на трех движках инференса.
В материале упомянуты vLLM, SGLang, TGI и Native HF Transformers.
Среди рассматриваемых моделей названы PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL.
Вопросы и ответы
- Какие OCR-модели сравнивали именно для рукописного русского, а не только печатного текста?
В обзоре тестировали девять OCR-моделей, включая PaddleOCR-VL, DeepSeek-OCR, Dots.OCR и Qwen2.5-VL. Сравнение проводили именно на задачах распознавания рукописного русского языка.
- Какие движки инференса проверяли и зачем это важно при выборе OCR?
Авторы сравнили работу моделей на трех движках инференса, включая vLLM, SGLang, TGI и Native HF Transformers. Это позволяет оценить не только качество распознавания, но и совместимость модели с конкретной инфраструктурой запуска.
- Есть ли в исследовании рекомендации под разные сценарии использования?
Да. Результаты тестирования сведены в таблицу с рекомендациями по выбору OCR-модели под разные задачи, чтобы упростить выбор среди решений, которые позиционируются как SOTA.
Контекст по теме
- Anthropic, OpenAI, Google и ByteDance обновили ИИ-модели для кода, дизайна и повседневных задач22 июля 2026 г.
- IT World сравнил сервисы ИИ-транскрибации для встреч и рабочих задач5 июля 2026 г.
- TurboOCR v3 ускорил обработку документов до ~520 изображений в секунду на RTX 509030 июня 2026 г.
- Модель Unlimited-OCR на 3.3B параметров появилась на платформе ModelScope24 июня 2026 г.