Как сообщает VentureBeat, Composio протестировала V4 Flash на 30 намеренно сложных многошаговых задачах, в которых использовались Gmail, GitHub, Slack и Google Sheets. Модель запускали через восемь агентных оболочек, включая Claude Code, Codex и OpenCode.
Успешными оказались 129 из 240 прогонов. Общая доля выполнения составила 53,8%. При этом все протестированные оболочки справились лишь с шестью из 30 сценариев. Результаты одной и той же модели заметно различались в зависимости от оболочки, конфигурации инструментов, кэширования, повторных попыток и провайдера.
DeepSeek также сообщила о предстоящем повышении цен на V4 Flash и Pro. Разработчики используют эти модели для создания ассистентов для программирования и агентов.
Ключевые факты
Composio провела 240 прогонов на 30 сложных многошаговых задачах.
Успешными оказались 129 прогонов, общая доля выполнения составила 53,8%.
Только шесть из 30 сценариев выполнили все протестированные агентные оболочки.
DeepSeek сообщила о предстоящем повышении цен на V4 Flash и Pro.
Вопросы и ответы
- На каких рабочих сценариях проверяли модель?
Тест охватил 30 сложных многошаговых задач в Gmail, GitHub, Slack и Google Sheets: всего 240 прогонов через восемь агентных оболочек.
- На какую базовую надежность можно ориентироваться при внедрении?
Успешными были 129 из 240 прогонов, то есть 53,8%. Все восемь оболочек справились лишь с шестью из 30 сценариев.
- Что команде нужно сравнивать помимо самой модели?
Результат зависел от агентной оболочки, конфигурации инструментов, кэширования, повторных попыток и провайдера. В тесте сравнивали восемь оболочек, включая Claude Code, Codex и OpenCode.
Контекст по теме
- Muse Glimmer рассчитана на локальные агентные процессы на PC и Mac11 августа 2026 г.
- Почему Mistral AI остаётся в тени громких игроков рынка ИИ22 июня 2026 г.
- Z.ai представила открытую модель GLM-5.2 для длительных задач программной инженерии19 июня 2026 г.
- Anthropic отключила модели Claude Fable 5 и Claude Mythos 5 после требований администрации Trump18 июня 2026 г.
