Postlar filtri


OpenAI поставили на паузу RL обучение своих моделей из-за переживаний за alignment.


Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety.

Статья, GitHub

12.9k 5 229 118 235

🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!

А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.

Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.

https://github.com/razzant/ouroboros

11.3k 2 234 156 371

Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):

Код будет гнить, если его гниению активно не противодействовать.


Это всегда было актуально и для человеческой разработки, особенно в больших проектах.

Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.

Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.

Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.

На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.

Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".

Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.

12k 6 417 106 271

Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.

14.8k 5 153 142 358

Love. Death. Transformers. dan repost
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle

11.4k 0 115 115 117

Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.

12.4k 5 130 169 216

Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники

27.6k 27 1.1k 214 522

Love. Death. Transformers. dan repost
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi


Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.

P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.


У клодексора тем временем уже больше 2 000 установок! Надеюсь, смог сделать действительно полезную штуку. Огромное спасибо комьюнити за ваши PR и issues! Всё забрал и сегодня выпустил обновление v3.1. И сжёг лимиты на всех подписках 🌚
Теперь у меня уже по четыре подписки на Claude Code и Codex.

15.3k 2 124 109 218

Opus 5.

Цена не изменилась.
А по метрикам даже немного лучше Fable 🤔

https://www.anthropic.com/claude/opus

16.3k 2 156 42 141

Опенсорсю Claudexor

Харнесс-агностик CLI, приложение, набор плагинов и MCP, объединяющий в себе Claude Code, Codex и Cursor. Можно добавлять сколько хотите харнессов и подписок.

Каждая модель и агент бесят меня по-своему: GPT - аутист-перфекционист, Opus - пофигист, пропускающий кучу багов, Gemini/GLM - креативные булочки, но сильно отстают от фронтира.

Ещё я устал бегать между агентами когда лимиты заканчиваются, поэтому связал все подписки в одно место чтобы эта штука по-умному их расходовала. И главное, она позволяет одновременно использовать все харнессы сразу. Добавил несколько любимых плюшек, чтобы работали из коробки: ревью-лупы, Best-of-N и т.п. Например, планирование можно провести через Claude Code, а имплементацию в режиме goal запустить на Codex.

Киллер-фича: можно добавить несколько подписок Claude Code, и они будут автоматически переключаться с сохранением контекста. Codex и Cursor тоже. Теперь вместо $15k в месяц на токены уходит $1800. У меня сейчас по три подписки Claude Code, Codex и Cursor тут.

Удобнее всего подключить Claudexor как плагин к вашему любимому агенту и использовать его в текстовом режиме в форматах:
«Перед выполнением плана прожарь его через Claudexor в мультихарнесс-режиме»

или
«После завершения работы проведи мультимодельное ревью через Claudexor и исправляй замечания».


Лично я чаще всего использую его в Claude Code. Чтобы установить, просто киньте ссылку на GitHub любому вашему агенту, и они сами разберутся. MIT-лицензия.

PS. Буду активно дорабатывать, так что не стесняйтесь кидать issues, фидбек и PR-ы.

GitHub, dmg, npm

30k 20 1.2k 172 363

Кажется, я нашёл причину, по которой Codex иногда превращается в дорогой генератор уверенной ерунды.

По документации AGENTS.md должен постоянно находиться в контексте, но Codex молча обрезает слишком длинные файлы, после чего половина инструкций исчезает, а вместе с ними исчезает и моя вера в человечество.

Лечится увеличением лимита:
codex -c project_doc_max_bytes=131072 (или больше)

И обязательно добавьте в AGENTS.md: "Жди EOF, а если ты его не видишь, значит файл неполный".

17.1k 4 495 41 248

Не забываем, что такое агентский харнесс на самом деле


Ревьюю научные статьи в майском ACL ARR-цикле, и среди сабмитов попалась работа, которая очень приятно цитирует мои старые публикации про анизотропию и внутреннюю размерность трансформеров.

Теперь, конечно, хочется накинуть авторам пару баллов просто за хороший вкус 😁 Держусь изо всех сил


Продолжаю коллекционировать шизу агентов. Опус, видимо, после компакшна забыл, что уже всё сделал, и бодро пошёл по второму кругу делать то же самое. Споткнулся только о коммит, в котором всё уже было сделано "кем-то". Этим "кем-то", разумеется, был он сам.

26.4k 6 194 155 315

Sonnet-5

По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.

Блог, техрепорт


По совету Грега Брокмана отправил Codex в режиме /goal автономно подебажить один мой проект, и он уже третьи сутки не возвращается. Спросил side-chat, сколько ему осталось и, что-то ответ не очень радует... мне-то что делать? Расслабиться и в потолок плевать?

15.2k 3 140 72 206

Ну наконец! Спустя десять тысяч лет вышел Cursor на ios.

12k 2 86 61 161
20 ta oxirgi post ko‘rsatilgan.