Рост агентных workflows усилил давление на модели среднего сегмента по экономике задач

DeepSeek V4 Flash за сутки обработала 8 трлн токенов в инструменте для AI-кодинга OpenCode. По данным сервиса, 5 трлн токенов пришлись на бесплатные квоты, еще 3 трлн на платные тарифы. Это выше среднего суточного объема всей платформы OpenRouter, который оценивается примерно в 6,6 трлн токенов.
Как пишет Pandaily, рост потребления связан с распространением агентных сценариев. Если раньше работа с моделью часто сводилась к одному запросу, теперь AI читает файлы, меняет код, запускает программы и повторяет попытки после ошибок. В качестве примера издание приводит пользователя, который создал одностраничную 3D-игру с Claude Opus 5. Для итогового HTML-файла понадобилось 690 млн токенов, а стоимость составила почти ≈ 35,5 тыс ₽ (3000 юаней).
На этом фоне модели все чаще сравнивают не по качеству одного ответа, а по стоимости выполнения длинной задачи. Один миллион выходных токенов у DeepSeek стоит ≈ 23,7 ₽ (2 юаня). Для Claude Opus 4.8 тот же объем обходится в 25 долларов, или около ≈ 2 тыс ₽ (170 юаней). В Artificial Analysis Intelligence Index v4.1 модель V4 Flash Max получила 50 баллов против 56 у Opus Max, при этом стоимость прохождения оценки составила 72,02 доллара против 3752,55 доллара соответственно.
По версии Pandaily, сильнее всего этот сдвиг влияет на модели среднего сегмента. Они заметно дороже DeepSeek, но в ряде агентных задач не дают сопоставимого прироста качества. Для компаний это означает, что приходится пересматривать подход к выбору моделей для длинных workflows, где ключевой метрикой становится уже не качество отдельного ответа, а стоимость завершения всей цепочки действий. Среди причин низкой стоимости инференса DeepSeek авторы материала называют архитектурные оптимизации модели и работу с KV cache.
Ключевые факты
OpenCode сообщил о потреблении 8 трлн токенов за сутки: 5 трлн по бесплатным квотам и 3 трлн по платным тарифам
Средний суточный объем OpenRouter в материале оценивается примерно в 6,6 трлн токенов
В Artificial Analysis Intelligence Index v4.1 модель V4 Flash Max получила 50 баллов против 56 у Opus Max
У DeepSeek V4 Flash заявлено 284 млрд параметров, при этом на один токен активируется около 13 млрд