DeepSeek V4 Flash быстро стала фаворитом разработчиков и вышла в лидеры по использованию, но реальная агентная нагрузка вернула разговор с лидербордов на землю. В тестах модель успешно завершила 53,8% прогонов, а одновременно DeepSeek объявила повышение цен. Поэтому прежний аргумент «достаточно умная и очень дешёвая» для агентных систем больше не работает без собственного теста.
Лидерборд не выполняет задачи
Как пишет VentureBeat, Composio проверила V4 Flash в восьми агентных средах, включая Claude Code, Codex и OpenCode. Модель получила 30 намеренно сложных многошаговых задач с живыми инструментами Gmail, GitHub, Slack и Google Sheets.
Из 240 прогонов успешными оказались 129. Это 53,8%. Только шесть из 30 сценариев смогли выполнить все восемь протестированных сред.
Именно второй результат важнее общего процента. Одна и та же модель заметно меняла качество в зависимости от агентной среды, настройки инструментов, кеширования, повторных попыток и провайдера. Иными словами, рейтинг модели показывает возможности двигателя, но бизнес покупает поездку целиком. С трансмиссией, водителем и шансом не доехать.
Если грубо разделить число прогонов на число успехов, получается 1,86 запуска на одно успешное завершение. Это не прогноз количества ретраев: некоторые ошибки могут повторяться системно, а задачи в тесте различаются. Но такой расчёт уже полезнее цены одного вызова. Внутренняя экономика агента должна делить полную стоимость всех прогонов на число принятых результатов, а не умножать тариф на красивое число токенов из демо.
Цена растёт именно там, где агенту трудно экономить
DeepSeek планирует поднять тарифы V4 Flash на 57% до 371% в зависимости от типа токенов и времени использования. Во внепиковые часы миллион входных токенов будет стоить $0,22, выходных $0,66. В пиковые часы ставки составят $0,44 и $1,32 соответственно.
Ещё заметнее меняется стоимость попаданий в кеш: рост составит от 52% до 1100%. DeepSeek оставляет 17 часов из каждых 24 по тарифу вдвое ниже пикового и объясняет это желанием стимулировать более гибкое планирование нагрузки.
Для пакетной обработки это разумная конструкция. Оценки, генерацию синтетических данных и ночные прогоны можно перенести на дешёвые часы. Интерактивный агент, который отвечает клиенту, работает с почтой или выполняет операцию в момент запроса, такой роскоши не имеет. У него время инференса превращается в экономическую переменную, которую нельзя просто оптимизировать расписанием.
При этом V4 Flash не стала дорогой относительно рынка. Опрошенный VentureBeat аналитик Карми Леви говорит, что DeepSeek по-прежнему заметно дешевле моделей OpenAI, Anthropic, Google, Cohere и xAI. Ценовое преимущество сократилось, но не исчезло. Вот только теперь его недостаточно показать строкой в тарифной таблице.
DeepSeek сама признала роль обвязки
Контекст здесь почти ироничен. 13 августа DeepSeek выпустила V4 Pro и открытый DeepSeek Harness v0.1, то есть начала двигаться от поставки модели к софту, который заставляет агентов работать. Новые тесты объясняют зачем: оркестрация способна решить исход задачи не меньше, чем способности самой модели.
Для команды, строящей бизнес с ИИ в России, вывод практический. V4 Flash можно рассматривать для изолированных и несекретных процессов с чёткими критериями успеха, контролем разрешений и резервной моделью. Именно такой сценарий рекомендуют собеседники VentureBeat. Но мигрировать на неё агентный контур только потому, что модель лидирует по недельному объёму токенов в OpenRouter, преждевременно.
Перед выбором нужен прогон собственных цепочек инструментов в той же среде, с тем же провайдером, кешем и политикой повторов, которые будут использоваться в продакшене. Считать стоит три показателя: долю принятых результатов, среднее число прогонов до успеха и полную стоимость этих прогонов в реальные часы нагрузки.
Главный маркер дальше не новое место V4 Flash в рейтинге. Смотреть нужно, сближается ли её успешность между разными агентными средами и сохраняет ли она ценовое преимущество после учёта ошибок и повторов. Если стоимость принятого результата остаётся ниже альтернатив на ваших сценариях, DeepSeek действительно дешёвая. Если нет, дешёвым был только токен.