Как сообщает VentureBeat, исследователи Meta* обучили модель с 8 млрд параметров. В испытаниях длительных агентных процессов она показала результаты на уровне Claude Opus 4.5. При этом издание не указывает конкретный бенчмарк и метрику сравнения, поэтому говорить об общем равенстве возможностей моделей нельзя.
В основе подхода лежит runtime-слой, или harness. Через него агент получает обратную связь о выполнении задач, включая серверные журналы. Во время длительных процессов harness помогает отслеживать выполненные и ожидающие подзадачи, чтобы агент не пропускал и не дублировал пакеты данных.
При сбое слой предоставляет инструкции и инструменты для восстановления работы. Например, это может понадобиться, если база данных отклоняет пакет из-за строгих ограничений API. Поэтому заявленный результат относится именно к длительным процессам, где нужно удерживать состояние, контролировать подзадачи и восстанавливаться после ошибок.
Обычно разработчик вручную прописывает пошаговые правила использования инструментов. Он может, например, потребовать, чтобы перед написанием письма агент всегда искал информацию в корпоративной базе знаний. Тогда агент следует жёсткому сценарию и не может самостоятельно оценивать издержки и преимущества своих действий.
Ключевые факты
Harness передаёт агенту обратную связь о выполнении задач, включая серверные журналы.
Механизмы отслеживания состояния разделяют выполненные и ожидающие подзадачи.
При отклонении пакета из-за ограничений API harness предоставляет инструменты и инструкции для восстановления.
Пошаговые правила использования инструментов обычно задаёт разработчик.
Вопросы и ответы
- За счёт чего небольшая модель приблизилась к более мощной?
Ключевую роль играет runtime-слой harness: он передаёт агенту обратную связь о выполнении задач, включая серверные журналы.
- Что это меняет в длительных рабочих процессах?
Harness разделяет выполненные и ожидающие подзадачи, чтобы агент не пропускал и не дублировал пакеты данных. Если база отклоняет пакет из-за ограничений API, слой предоставляет инструменты и инструкции для восстановления.
- Кому придётся настраивать поведение агента?
Разработчик вручную задаёт пошаговые правила использования инструментов, например обязательный поиск в корпоративной базе знаний перед написанием письма. Агент следует этому сценарию и сам не оценивает издержки и преимущества действий.
Контекст по теме
- Perplexity и Nvidia запускают локального ИИ-агента Portable Computer25 августа 2026 г.
- Результаты V4 Flash заметно различались в зависимости от агентной обвязки16 августа 2026 г.
- Исследование рассматривает архитектуру LLM-агентов через связку модели и execution harness23 июня 2026 г.
- Автономная система провела пост‑обучение модели 30B Nemotron и заняла 8‑е место на NVIDIA Nemotron‑Reasoning Challenge23 июня 2026 г.