Новость
Агент Ouroboros показал высокие результаты на Terminal-Bench, OSWorld и CL-Bench
Разработчик рассказал о создании самоэволюционирующего ИИ-агента Ouroboros, который может переписывать свой код и добился SOTA-результатов на нескольких бенчмарках. На GAIA и SWE-Pro он, по словам автора, вышел на паритет с Codex и Claude Code.
Разработчик поделился историей создания универсального ИИ-агента Ouroboros, который способен самостоятельно эволюционировать. Проект начинался как аналог Jarvis из «Железного человека», а затем превратился в автономный цикл на чистом Python с доступом к git, возможностью переписывать собственный рантайм и безопасным рестартом. Первая версия была запущена в Google Colab для изоляции. За несколько месяцев агент прошёл путь от простого desktop-агента, рисовавшего котиков, до системы, показывающей SOTA-результаты на Terminal-Bench 2.1, CL-Bench и OSWorld. На GAIA и SWE-Pro он, по словам разработчика, достигает паритета с Claude Code и Codex. Автор отмечает, что автономная эволюция и значительные затраты на токены помогли добиться результатов, которые он не смог бы спроектировать вручную. В посте также обещаны цифры, воспроизводимость, истории из аудита трейсов и описание архитектуры.
-
Агент Ouroboros показал высокие результаты на Terminal-Bench, OSWorld и CL-Bench
Habr AI
Мой агент Ouroboros побил Codex с Claude Code на Terminal-Bench, OSWorld и CL-Bench. Он написал себя сам Я долго думал, как мог бы выглядеть идеальный универсальный агент. Такой Jarvis из «Железного человека». И довольно быстро понял: фиг я смогу такого сделать. Зато можно попробовать дать агенту возможность придумать и построить себя самого в автономном цикле эволюции. Так появился Уроборос: кривой косой агентный луп на чистом Python с доступом к git, правом переписывать свой рантайм, безопасным рестартом на новой версии и откатом к прошлой, если всё сломалось. Я поселил первую версию в Google Colab, чтобы он не убил мне комп самоэволюцией (сервера Google не жалко, у них хорошая изоляция), дал бюджет и автономность, и понеслось. С тех пор прошло несколько месяцев. Когда я последний раз рассказывал про него публично, это был ещё милый desktop‑агент, который рисовал котиков, зависал на ютюбе и менял обои. Сейчас на Terminal‑Bench 2.1, CL‑Bench и OSWorld у него SOTA результаты, а на GAIA и SWE‑Pro получается паритет с Claude Code и Codex. Сам бы я такой харнесс не придумал, а вот автономная эволюция и куча сожжённых денег на токены — да. В этом посте: цифры и воспроизводимость, несколько неловких историй из аудита трейсов, коротко про архитектуру, и почему я теперь почти всё делаю через него. Читать далее #ai_agents #ml #codex #claude_code #coding_agent #llm_benchmarking | @habr_ai