К содержанию
Выпуск №75 · 22 августа 2026 / Новости

AVO подняла результат Claude Opus 5 с 30% до 100%: харнесс пора сравнивать наравне с апгрейдом модели

NVIDIA заявила о полном прохождении публичного набора ARC-AGI-3 системой AVO. Для билдеров это повод тестировать память, надзор и циклы проверки как отдельный продуктовый слой, но не повод считать бенчмарк решённым по одному посту разработчика.

Редакция 21 августа 2026 г., 01:19 MSK

В Telegram
Вывеска NVIDIA у штаб-квартиры компании в Санта-Кларе
Иллюстрация: hegai.media

Claude Opus 5 сама по себе набрала на ARC-AGI-3 30%, а в составе NVIDIA AVO получила 100.00 RHAE и прошла все 183 уровня в 25 средах публичного набора. Разрыв слишком велик, чтобы продолжать выбирать агента по названию модели: на длинных задачах архитектура вокруг LLM может дать больше, чем очередной дорогой апгрейд.

Но покупать вывод NVIDIA целиком пока рано. Результат опубликован самой NVIDIA, относится к публичному набору, а в представленном описании нет численных абляций, которые отделили бы вклад памяти, супервизора и отдельных циклов проверки друг от друга.

Что именно сделала AVO

В техническом блоге NVIDIA называет AVO универсальной архитектурой для агентов, рассчитанных на длительную автономную работу. Модель внутри такой системы лишь один компонент. Харнесс определяет, какой контекст она получает, как использует инструменты, сохраняет состояние, реагирует на обратную связь и восстанавливается после ошибок.

У AVO два особенно важных механизма. Первый, постоянная память. В ней остаются прошлые реализации, результаты оценок, выводы компилятора и профайлера, а также накопленные рассуждения. Агенту не приходится при каждом новом цикле заново собирать историю задачи.

Второй, супервизор. Он следит за общей траекторией, замечает застой и повторение бесполезных действий, после чего может направить основного агента к другой стратегии. При этом именно основной агент решает, что изучать, менять, запускать и оценивать.

ARC-AGI-3 проверяет работу в незнакомых интерактивных средах без инструкций, заранее сформулированных правил и целей. NVIDIA подключила к ним тот же базовый агент AVO, заменив только инструменты конкретной среды и оценивание. По данным компании, система прошла весь публичный набор и использовала на 12% меньше действий в среде, чем VISTA.

Почему дело не только в одном бенчмарке

До ARC-AGI-3 NVIDIA испытывала эту архитектуру на оптимизации GPU-ядер. Там AVO должна была изучать существующий код, строить гипотезы, вносить изменения, запускать тесты на оборудовании, разбирать обратную связь и повторять цикл.

За семь дней система исследовала более 500 направлений оптимизации и зафиксировала 40 версий ядра. На NVIDIA DGX B200 получившиеся ядра multihead attention показали преимущество до 3,5% над cuDNN и до 10,5% над FlashAttention-4 в протестированных конфигурациях. Затем агент примерно за 30 минут автономной работы адаптировал результат для grouped-query attention.

Именно эта часть делает заявление полезным для бизнеса, даже если результат ARC-AGI-3 позже окажется менее универсальным, чем звучит заголовок NVIDIA. AVO описывает не магический промпт, а производственный цикл: сохранить следы предыдущих попыток, проверить следующую гипотезу исполнением, записать результат и вмешаться на уровне управления, если поиск застрял.

Для длинных процессов это меняет единицу сравнения. Сопоставлять только модели недостаточно. Нужно отдельно сравнивать харнессы на одной и той же модели: сколько полезных итераций они выдерживают, теряют ли найденное после переполнения контекста, повторяют ли ошибки, умеют ли сменить стратегию и подтверждают ли результат внешним исполнением.

Что проверить у себя

Практический вывод не в том, чтобы срочно копировать AVO. По публикации NVIDIA нельзя понять, какой отдельный механизм обеспечил основную часть скачка с 30% до 100%. Возможно, критична память. Возможно, супервизор. Возможно, сочетание инструментов, оценки и бюджета действий. Без абляций слово «архитектура» рискует стать удобным контейнером для всего хорошего сразу.

Поэтому полезный тест для билдера выглядит проще: взять одну модель и один длинный рабочий процесс, затем последовательно добавить сохранение состояния, журнал результатов исполнения, контроль повторяющихся циклов и отдельный механизм смены стратегии. Если такой харнесс даст больший прирост, чем замена модели, тезис AVO воспроизводится уже в вашей экономике, а не только на слайде NVIDIA.

Следующий маркер стоит искать не в новом рекорде. Нужны независимое повторение результата на ARC-AGI-3 и численные абляции компонентов AVO. Пока их нет, 100% следует читать как сильную демонстрацию системного подхода, а не как доказательство того, что ARC-AGI-3 решён.

Как процитировать

«AVO подняла результат Claude Opus 5 с 30% до 100%: харнесс пора сравнивать наравне с апгрейдом модели». hegai.media, 21 августа 2026 г.. https://hegai.media/novosti/avo-podnyala-rezultat-claude-opus-5-s-30-do-100-harness-pora-sravnivat--8198f3a4-2e62-44bc-8855-1f58ff9633e5

так материал выглядит в мессенджере