Агенты стали заметно полезнее не потому, что одна модель внезапно научилась работать за отдел. Latent Space связывает скачок с совпадением двух процессов: выросли возможности моделей и одновременно созрел agent harness, то есть вся система вокруг весов. Поэтому главный архитектурный риск сегодня не в выборе «не той» LLM, а в том, что команда намертво пришьет к ней контекст, инструменты, память и права доступа.
Модель через квартал можно заменить вызовом другого API. Плохо устроенный harness придется разбирать вместе с бизнес-процессом.
Что именно изменилось
Latent Space определяет harness как все, что заставляет модель действовать в цифровой среде: окружение, инструменты, контекст и ограничения. Модель принимает решение, но именно harness дает ей возможность получить данные, выполнить действие, сохранить информацию и не выйти за разрешенные границы.
В ноябре 2022 года ChatGPT был, по формулировке автора обзора, «мозгом в колбе»: обучение и пользовательский промпт, но без поиска, инструментов и отдельного механизма рассуждения. ReAct в октябре 2022 года уже описывал цикл «рассуждение, действие, наблюдение, повтор», однако существовал как техника промптинга. Toolformer от Meta* в феврале 2023 года показал другую идею: использование инструментов можно не только подсказывать, но и обучать.
Затем разработчики попытались выдать автономию раньше, чем модели научились ею пользоваться. AutoGPT и BabyAGI весной 2023 года помещали модель в цикл и предлагали ей действовать как автономный сотрудник. Но цикл не создает новые способности, а усиливает уже имеющиеся. При надежности 95% на каждом шаге задача из 20 шагов завершается успешно примерно в 36% случаев. Ошибки тоже умеют масштабироваться, причем без презентации для инвесткомитета.
Cursor и Copilot в 2023–2024 годах вернули цикл человеку: модель ускоряет отдельные действия, а оператор управляет процессом. Такая осторожность была рациональной. В тесте Answer.AI первая версия Devin показала около 15% успешных выполнений.
К концу 2024 года, после появления o1, Latent Space увидел обратную ситуацию: возможности модели начали опережать слишком осторожные оболочки. В феврале 2025 года Claude Code попытался использовать этот запас, отказавшись от IDE в пользу терминала и дав модели больше пространства для действий. По версии автора обзора, именно пересечение кривых модели и harness объясняет, почему примерно к Рождеству 2025 года инженеры почувствовали: агенты наконец начали работать.
Покупать LLM отдельно от системы управления
Практический вывод для команды в России простой: оценивать модель и harness нужно раздельно.
Модель отвечает на вопрос, насколько хорошо она понимает задачу, рассуждает и выбирает следующее действие. Harness отвечает на более приземленные вопросы: какие данные модель увидит, какие команды сможет выполнить, где сохранится состояние, кто выдаст разрешение и как система поймет, что результат действительно получен.
Если все это смешано в одном фреймворке или продукте, хорошее демо мало что доказывает. Оно показывает одну модель, один набор инструментов и заранее подготовленный маршрут. Бизнесу же придется пережить смену модели, сбой на двенадцатом шаге, отзыв доступа и повторный запуск задачи. Это уже не конкурс ответов в чате, а эксплуатация системы.
Я бы собирал agent harness как минимум из пяти независимых контуров:
- Контекст. Какие данные получает модель на каждом шаге и кто контролирует их объем.
- Инструменты. Какие действия доступны агенту и в каком формате возвращается результат.
- Состояние. Что сохраняется между шагами и запусками. Это состояние стоит держать вне модели, иначе перенос превращается в археологию промптов.
- Права. Какие инструменты разрешены для конкретной задачи, пользователя и этапа процесса. Модель может предложить действие, но разрешение должна определять система.
- Проверка. Как фиксируются шаги, ошибки и итог, и по каким критериям задача считается выполненной.
Отсюда меняется и порядок тестирования. Сначала стоит прогнать одну модель в разных harness, затем несколько моделей в одном harness. Если результаты сильно зависят от оболочки, покупка «самой умной модели» не лечит архитектуру. Если новая LLM подключается только после переписывания памяти, прав и инструментов, команда приобрела не агента, а зависимость от поставщика.
На что смотреть дальше
Главный маркер зрелости рынка не очередной рекорд модели, а простота ее замены внутри рабочего агента. Просите поставщика показать не сценарий из демо, а трассу выполнения: полученный контекст, вызовы инструментов, изменение состояния, проверки прав и критерий завершения.
Если модель можно заменить без переноса памяти и пересборки политик доступа, harness действительно стал отдельным инженерным слоем. Если нельзя, качество агента по-прежнему держится на удачном сочетании деталей, которое красиво работает до первого обновления API.