К содержанию
Выпуск №1 · 9 июня 2026 / Новости

Модель Opus 4.7 получила 156 баллов в ECI и приблизилась к лидерам рейтинга

Opus 4.7 получила 156 баллов в ECI, инструменте, который сводит результаты нескольких бенчмарков к единой шкале.

Редакция 9 июня 2026 г., 15:56 MSK

В Telegram

Opus 4.7 получила 156 баллов в ECI, инструменте, который сводит результаты нескольких бенчмарков к единой шкале. По этому показателю модель немного опережает Opus 4.6 и уступает лишь GPT-5.4, Gemini 3.1 Pro и GPT-5.4 Pro.

В отдельных тестах результаты выглядят так: 44% на FrontierMath для Tiers 1–3 и 23% на Tier 4. Здесь модель обошла всех конкурентов, кроме GPT-5.4 и GPT-5.4 Pro. На SWE-bench Verified она набрала 83%, это рекорд среди оценок авторов на этом бенчмарке. При этом исследователи отмечают проблему: SWE-bench Verified может постепенно «загрязняться». Поэтому Opus 4.7 планируют дополнительно проверить на других coding benchmarks.

На бенчмарке Chess Puzzles модель получила 30%. Это заметно выше результатов предыдущих моделей Anthropic, хотя до frontier‑уровня показатель всё ещё далёк. В 31% задач модель упиралась в максимальный лимит вывода раньше, чем успевала дать ответ. Также Opus 4.7 смогла решить последнюю задачу старого математического бенчмарка Mock AIME. Ранее ни одна модель с ней не справлялась; задача требует интерпретации диаграммы, представленной в виде Asymptote vector graphics code.

На GPQA Diamond результат составил 90%, тогда как лучшие показатели достигают 95%. По наблюдениям авторов, разница может объясняться тем, что модель иногда отказывается отвечать на вопросы по соображениям безопасности. В расчёт ECI также входят сторонние бенчмарки: ARC-AGI-1, ARC-AGI-2, WeirdML v2 и SimpleBench. Ожидается, что итоговый показатель ECI для Opus 4.7 будет меняться по мере появления новых результатов.

Ключевые факты

  • Opus 4.7 получил 156 баллов в ECI, немного опередив Opus 4.6 и уступив только GPT-5.4, Gemini 3.1 Pro и GPT-5.4 Pro.

  • На FrontierMath модель показала 44% на Tiers 1-3 и 23% на Tier 4, уступив только GPT-5.4 и GPT-5.4 Pro.

  • На SWE-bench Verified Opus 4.7 набрал 83%, что стало новым рекордом для оценок авторов на этом бенчмарке.

  • В 31% задач модель достигала максимального лимита вывода до ответа; на бенчмарке Chess Puzzles её результат составил 30%.

Как процитировать

«Модель Opus 4.7 получила 156 баллов в ECI и приблизилась к лидерам рейтинга». hegai.media, 9 июня 2026 г.. https://hegai.media/novosti/model-opus-4-7-poluchila-156-ballov-v-eci-i-priblizilas-k-lideram-reyt--d4b09fc6-bf9b-4b56-8c9c-4bf6c5e7544a

так материал выглядит в мессенджере