Anthropic выпустила Claude Sonnet 5.5. Модель генерирует ответы более чем на 30% быстрее Sonnet 5, а в тестах по программированию и управлению компьютером показывает результаты около уровня флагманской Opus 5.5.
Самый заметный прирост пришёлся на многоэтапную работу через командную строку. В Terminal-Bench 4.0 Sonnet 5.5 набрала 70,6% против 10,3% у Sonnet 5 и 66,4% у Opus 5.5. Впрочем, составители теста отмечали, что предыдущая Sonnet упиралась в ограничения по времени и объёму текста, поэтому разрыв выглядит особенно драматично.
В CursorBench, основанном на реальных сессиях программирования, новая модель набрала 55,5% против 57,8% у Opus 5.5, пишет iXBT. В тесте управления компьютером результаты составили 80,1% и 81,8% соответственно. Anthropic по-прежнему считает Opus лучшим выбором для сложных открытых задач, где модели нужно долго рассуждать и самостоятельно принимать решения.
Цена API, то есть интерфейса для подключения модели к приложениям, осталась прежней: $2 за миллион входных токенов и $10 за миллион выходных. Токены здесь означают небольшие фрагменты текста, которые модель читает или создаёт. По данным The New Stack, Sonnet 5.5 обычно расходует их экономнее, поэтому стоимость выполнения отдельной задачи может снизиться до 30%.
Модель уже появилась в Claude, на платформе Anthropic и в облаках Amazon Web Services, Google Cloud и Microsoft Azure. Релиз вышел через несколько дней после Opus 5.5, для которой Anthropic снизила API-тарифы. Конкуренция всё заметнее смещается от цены миллиона токенов к стоимости результата, который не приходится переделывать вручную.
Что это значит
- Для вас. Разработчики и компании могут получить производительность около уровня Opus в хорошо поставленных задачах по цене Sonnet, которая вдвое ниже по входным и выходным токенам. Для сложной работы с неопределённым результатом Anthropic всё ещё рекомендует Opus 5.5.
- В России. Claude и API Anthropic напрямую недоступны, российские карты не принимаются. Подключение возможно через посредников или зарубежное юрлицо; альтернативы: DeepSeek, Qwen и Llama на своих серверах или в российском облаке, а также GigaChat и YandexGPT.
- Что сделать. Перед переносом рабочих задач сравните Sonnet 5.5 с текущей моделью на собственных примерах: важны число успешных результатов, расход токенов и объём ручных исправлений. Разработчикам, отключавшим режим рассуждения, нужно обновить настройки по документации Anthropic.
