Ouroboros: архитектура автономного агента, который переписывает свой рантайм

Разработчик Ouroboros называет проект автономным «лупом» на чистом Python. Агент получил доступ к git, научился переписывать собственный рантайм и перезапускаться уже на новой версии. Если после изменений что-то ломается, он может вернуться к предыдущему состоянию. Первую версию запустили в Google Colab, затем агенту предоставили автономность и ограниченный бюджет.
Как пишет Habr, за несколько месяцев проект вырос из desktop-агента, который «рисовал котиков, зависал на YouTube и менял обои», в систему с заявленными SOTA-результатами на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro автор говорит о паритете с Claude Code и Codex. Однако эти оценки основаны на его заявлениях, которые приводит вторичный источник, поэтому доказательная база остается ограниченной.
По словам автора, архитектура сформировалась в процессе автономной эволюции агента. Для этого потребовалось множество итераций и расходы на токены. Автор утверждает, что не смог бы заранее спроектировать такой харнесс вручную.
Для практического применения подобного подхода потребуется полноценный эксплуатационный контур. Изменения нужно проверять в песочнице по понятным критериям допуска. При этом сбой после обновления не должен мешать безопасно перезапустить систему или откатить ее к рабочему состоянию.
Ключевые факты
Ouroboros работает как агентный луп на чистом Python с доступом к git
Система умеет переписывать собственный рантайм и откатываться к прошлой версии при сбое
Первую версию агента разместили в Google Colab
На GAIA и SWE-Pro автор проекта заявляет паритет с Claude Code и Codex
Вопросы и ответы
- Что в архитектуре Ouroboros отличает его от обычного AI-кодинга агента?
Агент работает как автономный луп на чистом Python с доступом к git: он может переписывать собственный рантайм, перезапускаться на новой версии и автоматически откатываться к предыдущей, если обновление ломает систему.
- Насколько зрелой выглядит система по сравнению с Claude Code и Codex?
Автор проекта заявляет паритет с Claude Code и Codex на бенчмарках GAIA и SWE-Pro, а также SOTA-результаты на Terminal-Bench 2.1, CL-Bench и OSWorld.
- Как быстро проект вырос из прототипа в рабочую систему?
По описанию автора, за несколько месяцев Ouroboros прошёл путь от desktop-агента, который «рисовал котиков, зависал на ютюбе и менял обои», до системы с лучшими результатами на нескольких агентных бенчмарках. Первую версию при этом запускали в Google Colab с ограниченным бюджетом.
Контекст по теме
- Claude Code, Codex и Cursor: как отличаются AI-агенты для задач разработки29 июня 2026 г.
- Саймон Уиллисон описал поведение Claude Fable 5 на примере отладки Datasette Agent12 июня 2026 г.
- Anthropic, OpenAI и Nous Research представили обновления инструментов для агентной разработки9 июня 2026 г.
- Anthropic представила модель Claude Opus 4.7 с улучшениями для кодирования и агентных задач9 июня 2026 г.