К содержанию
Новости

Ouroboros: архитектура автономного агента, который переписывает свой рантайм

Абстрактная графика hegai.media: плотное поле мелких квадратов разной яркости с приводочной меткой
Графика: hegai.media

Разработчик Ouroboros называет проект автономным «лупом» на чистом Python. Агент получил доступ к git, научился переписывать собственный рантайм и перезапускаться уже на новой версии. Если после изменений что-то ломается, он может вернуться к предыдущему состоянию. Первую версию запустили в Google Colab, затем агенту предоставили автономность и ограниченный бюджет.

Как пишет Habr, за несколько месяцев проект вырос из desktop-агента, который «рисовал котиков, зависал на YouTube и менял обои», в систему с заявленными SOTA-результатами на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro автор говорит о паритете с Claude Code и Codex. Однако эти оценки основаны на его заявлениях, которые приводит вторичный источник, поэтому доказательная база остается ограниченной.

По словам автора, архитектура сформировалась в процессе автономной эволюции агента. Для этого потребовалось множество итераций и расходы на токены. Автор утверждает, что не смог бы заранее спроектировать такой харнесс вручную.

Для практического применения подобного подхода потребуется полноценный эксплуатационный контур. Изменения нужно проверять в песочнице по понятным критериям допуска. При этом сбой после обновления не должен мешать безопасно перезапустить систему или откатить ее к рабочему состоянию.

Ключевые факты

  • Ouroboros работает как агентный луп на чистом Python с доступом к git

  • Система умеет переписывать собственный рантайм и откатываться к прошлой версии при сбое

  • Первую версию агента разместили в Google Colab

  • На GAIA и SWE-Pro автор проекта заявляет паритет с Claude Code и Codex

Вопросы и ответы

Что в архитектуре Ouroboros отличает его от обычного AI-кодинга агента?

Агент работает как автономный луп на чистом Python с доступом к git: он может переписывать собственный рантайм, перезапускаться на новой версии и автоматически откатываться к предыдущей, если обновление ломает систему.

Насколько зрелой выглядит система по сравнению с Claude Code и Codex?

Автор проекта заявляет паритет с Claude Code и Codex на бенчмарках GAIA и SWE-Pro, а также SOTA-результаты на Terminal-Bench 2.1, CL-Bench и OSWorld.

Как быстро проект вырос из прототипа в рабочую систему?

По описанию автора, за несколько месяцев Ouroboros прошёл путь от desktop-агента, который «рисовал котиков, зависал на ютюбе и менял обои», до системы с лучшими результатами на нескольких агентных бенчмарках. Первую версию при этом запускали в Google Colab с ограниченным бюджетом.

Контекст по теме