К содержанию
Выпуск №77 · 24 августа 2026 / Новости

Модель агента можно заменить. Плохой harness придется перестраивать

Рабочего агента определяет уже не только выбранная LLM, а система вокруг нее: контекст, инструменты, состояние, права и проверка результата. Для бизнеса это значит, что покупать нужно не красивое демо, а управляемую архитектуру, из которой модель можно вынуть без капитального ремонта.

* Деятельность Meta признана экстремистской и запрещена в РФ

Редакция 23 августа 2026 г., 01:23 MSK

В Telegram

Агенты стали заметно полезнее не потому, что одна модель внезапно научилась работать за отдел. Latent Space связывает скачок с совпадением двух процессов: выросли возможности моделей и одновременно созрел agent harness, то есть вся система вокруг весов. Поэтому главный архитектурный риск сегодня не в выборе «не той» LLM, а в том, что команда намертво пришьет к ней контекст, инструменты, память и права доступа.

Модель через квартал можно заменить вызовом другого API. Плохо устроенный harness придется разбирать вместе с бизнес-процессом.

Что именно изменилось

Latent Space определяет harness как все, что заставляет модель действовать в цифровой среде: окружение, инструменты, контекст и ограничения. Модель принимает решение, но именно harness дает ей возможность получить данные, выполнить действие, сохранить информацию и не выйти за разрешенные границы.

В ноябре 2022 года ChatGPT был, по формулировке автора обзора, «мозгом в колбе»: обучение и пользовательский промпт, но без поиска, инструментов и отдельного механизма рассуждения. ReAct в октябре 2022 года уже описывал цикл «рассуждение, действие, наблюдение, повтор», однако существовал как техника промптинга. Toolformer от Meta* в феврале 2023 года показал другую идею: использование инструментов можно не только подсказывать, но и обучать.

Затем разработчики попытались выдать автономию раньше, чем модели научились ею пользоваться. AutoGPT и BabyAGI весной 2023 года помещали модель в цикл и предлагали ей действовать как автономный сотрудник. Но цикл не создает новые способности, а усиливает уже имеющиеся. При надежности 95% на каждом шаге задача из 20 шагов завершается успешно примерно в 36% случаев. Ошибки тоже умеют масштабироваться, причем без презентации для инвесткомитета.

Cursor и Copilot в 2023–2024 годах вернули цикл человеку: модель ускоряет отдельные действия, а оператор управляет процессом. Такая осторожность была рациональной. В тесте Answer.AI первая версия Devin показала около 15% успешных выполнений.

К концу 2024 года, после появления o1, Latent Space увидел обратную ситуацию: возможности модели начали опережать слишком осторожные оболочки. В феврале 2025 года Claude Code попытался использовать этот запас, отказавшись от IDE в пользу терминала и дав модели больше пространства для действий. По версии автора обзора, именно пересечение кривых модели и harness объясняет, почему примерно к Рождеству 2025 года инженеры почувствовали: агенты наконец начали работать.

Покупать LLM отдельно от системы управления

Практический вывод для команды в России простой: оценивать модель и harness нужно раздельно.

Модель отвечает на вопрос, насколько хорошо она понимает задачу, рассуждает и выбирает следующее действие. Harness отвечает на более приземленные вопросы: какие данные модель увидит, какие команды сможет выполнить, где сохранится состояние, кто выдаст разрешение и как система поймет, что результат действительно получен.

Если все это смешано в одном фреймворке или продукте, хорошее демо мало что доказывает. Оно показывает одну модель, один набор инструментов и заранее подготовленный маршрут. Бизнесу же придется пережить смену модели, сбой на двенадцатом шаге, отзыв доступа и повторный запуск задачи. Это уже не конкурс ответов в чате, а эксплуатация системы.

Я бы собирал agent harness как минимум из пяти независимых контуров:

  1. Контекст. Какие данные получает модель на каждом шаге и кто контролирует их объем.
  2. Инструменты. Какие действия доступны агенту и в каком формате возвращается результат.
  3. Состояние. Что сохраняется между шагами и запусками. Это состояние стоит держать вне модели, иначе перенос превращается в археологию промптов.
  4. Права. Какие инструменты разрешены для конкретной задачи, пользователя и этапа процесса. Модель может предложить действие, но разрешение должна определять система.
  5. Проверка. Как фиксируются шаги, ошибки и итог, и по каким критериям задача считается выполненной.

Отсюда меняется и порядок тестирования. Сначала стоит прогнать одну модель в разных harness, затем несколько моделей в одном harness. Если результаты сильно зависят от оболочки, покупка «самой умной модели» не лечит архитектуру. Если новая LLM подключается только после переписывания памяти, прав и инструментов, команда приобрела не агента, а зависимость от поставщика.

На что смотреть дальше

Главный маркер зрелости рынка не очередной рекорд модели, а простота ее замены внутри рабочего агента. Просите поставщика показать не сценарий из демо, а трассу выполнения: полученный контекст, вызовы инструментов, изменение состояния, проверки прав и критерий завершения.

Если модель можно заменить без переноса памяти и пересборки политик доступа, harness действительно стал отдельным инженерным слоем. Если нельзя, качество агента по-прежнему держится на удачном сочетании деталей, которое красиво работает до первого обновления API.

Как процитировать

«Модель агента можно заменить. Плохой harness придется перестраивать». hegai.media, 23 августа 2026 г.. https://hegai.media/novosti/model-agenta-mozhno-zamenit-plohoy-harness-pridetsya-perestraivat--182f3879-4a4c-4a2f-a5a3-4d103f77c9fc

так материал выглядит в мессенджере