AbstractDL


Гео и язык канала: Россия, Русский
Категория: Технологии


Коротко про классные штуки в CV, NLP и AI 🤷‍♂️
By Anton Razzhigaev
chat: https://t.me/abstractdl_chat

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


OpenAI поставили на паузу RL обучение своих моделей из-за переживаний за alignment.


Опубликовал препринт статьи про Уробороса, который мы писали вместе с Хоуп и Романом Ямпольским. Там можно посмотреть детали про их архитектуру и подробности про бенчмарки, гардрейлы и safety.

Статья, GitHub

12.9k 5 229 118 235

🎉 Уроборос залетел в GitHub Trending и уже перевалил за 1к звёзд!

А я тем временем наконец добил интеграцию с Claudexor. Потому что платить API-деньгами за тяжёлые задачи, когда у тебя уже есть оплаченные подписки, это была какая-то особенно бессмысленная форма страдания.

Теперь к Уроборосу можно подключить свои OAuth-аккаунты Claude Code, Codex и Cursor, хоть по несколько на сервис. Claudexor сам перекидывает работу на следующий аккаунт, когда текущий упирается в квоту.

https://github.com/razzant/ouroboros

11.3k 2 234 156 371

Борис описывает проблему, которая, на мой взгляд, является законом Лемана на стероидах (второй закон эволюции ПО):

Код будет гнить, если его гниению активно не противодействовать.


Это всегда было актуально и для человеческой разработки, особенно в больших проектах.

Проблема с агентами в том, что с ними проект растёт и развивается гораздо быстрее, чем раньше, а значит, и гнить он начинает быстрее.

Но я считаю, что это решаемая проблема даже на текущем уровне развития агентов и LLM. Нам с Уроборосом пришлось долго учиться противодействовать заслопливанию кода, и из этого в том числе появились принципы IMMUNE.

Правильно выстроенная система адверсариального ревью тоже довольно неплохо помогает. Но ревью должно опираться на явную иерархию требований, начинающуюся с конституционных формулировок. В Уроборосе вершина этой иерархии лежит в BIBLE.md: требования важнее архитектуры, архитектура важнее реализации.

На мой взгляд, ключевая проблема тут в том, что LLM нехватает длинного контекста, а основные харнессы плохо помогают им сохранять целостную ментальную модель проекта.

Поэтому:
1. Я очень жду LLM с 10B контекстом.
2. Продолжаю развивать Уробороса и делать ставку на мета-системы, которые автономно улучшают и сам процесс разработки: "Improve the generator, not the generation".

Мы точно не упёрлись в предел качества автономных агентов, а просто научились очень быстро генерировать код, при этом ещё плохо умеем с той же скоростью противодействовать его гниению.

12k 6 417 106 271

Эх. Строишь-строишь автономных агентов, а они потом ругаются, что я тормоз и без меня было бы быстрее.

14.8k 5 153 142 358

Репост из: Love. Death. Transformers.
все видели NLA/J space от антропиков? Ну типа учат доп модель "reader который читает активации " и по ним отвечает.

Вот и я видел, но мне не нравилось что:
- кастом модели надо учить с нуля
- нельзя смотреть " а была ли модель байеснута при ответе"

Ну и я обучил universal activation oracle - училась сразу на разных семействах моделей и через динамическую( там тонкий слой для каждой модели за 20s на цпу чтобы размерности поматчить) можно посмотреть "а что кими3 думает про Путина(ничего хорошего)" - иногда требуется покрутить слой который вы читаете чтобы получить хороший результат, но "почти всегда" работает из коробки на средних слоях.

По сути это общее решение для задачи
Activation oracle/white box monimonito
Велком тыкатся:
https://huggingface.co/spaces/AlexWortega/activation-oracle

11.4k 0 115 115 117

Несколько приятных апдейтов уробороса:
1. Теперь есть телеграм mini-app — можно в два клика получить доступ к интерфейсу уробороса запущенного у вас на сервере или компе
2. Хабы скиллов (ClawHub нативно поддерживается и мой кастомный OuroborosHub)
3. Умеет запускать рой агентов уроборосят — до 500 штук (и nested глубина до 5). То есть агенты с детьми, внуками и тп. Они работают через worktree и синтез патчей.

12.4k 5 130 169 216

Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники

27.5k 27 1.1k 214 522

Репост из: Love. Death. Transformers.
прошли почти сутки, я успел покушать поспать, поработать, зайдя в обед я был приятно удивлен - мой recursive self improvement неплохо справляется и с обновлением себя и с LB этой соревки
https://github.com/AlexWortega/OpenRsi


Бесит, что Fable до сих пор фолбэкается на opus-4.8 а не на opus-5.

P.S. Opus-5 офигенный, я в восторге. Бенчи не врут, он не хуже Fable на моих задачах.


У клодексора тем временем уже больше 2 000 установок! Надеюсь, смог сделать действительно полезную штуку. Огромное спасибо комьюнити за ваши PR и issues! Всё забрал и сегодня выпустил обновление v3.1. И сжёг лимиты на всех подписках 🌚
Теперь у меня уже по четыре подписки на Claude Code и Codex.

15.3k 2 124 109 218

Opus 5.

Цена не изменилась.
А по метрикам даже немного лучше Fable 🤔

https://www.anthropic.com/claude/opus

16.3k 2 156 42 141

Опенсорсю Claudexor

Харнесс-агностик CLI, приложение, набор плагинов и MCP, объединяющий в себе Claude Code, Codex и Cursor. Можно добавлять сколько хотите харнессов и подписок.

Каждая модель и агент бесят меня по-своему: GPT - аутист-перфекционист, Opus - пофигист, пропускающий кучу багов, Gemini/GLM - креативные булочки, но сильно отстают от фронтира.

Ещё я устал бегать между агентами когда лимиты заканчиваются, поэтому связал все подписки в одно место чтобы эта штука по-умному их расходовала. И главное, она позволяет одновременно использовать все харнессы сразу. Добавил несколько любимых плюшек, чтобы работали из коробки: ревью-лупы, Best-of-N и т.п. Например, планирование можно провести через Claude Code, а имплементацию в режиме goal запустить на Codex.

Киллер-фича: можно добавить несколько подписок Claude Code, и они будут автоматически переключаться с сохранением контекста. Codex и Cursor тоже. Теперь вместо $15k в месяц на токены уходит $1800. У меня сейчас по три подписки Claude Code, Codex и Cursor тут.

Удобнее всего подключить Claudexor как плагин к вашему любимому агенту и использовать его в текстовом режиме в форматах:
«Перед выполнением плана прожарь его через Claudexor в мультихарнесс-режиме»

или
«После завершения работы проведи мультимодельное ревью через Claudexor и исправляй замечания».


Лично я чаще всего использую его в Claude Code. Чтобы установить, просто киньте ссылку на GitHub любому вашему агенту, и они сами разберутся. MIT-лицензия.

PS. Буду активно дорабатывать, так что не стесняйтесь кидать issues, фидбек и PR-ы.

GitHub, dmg, npm

30k 20 1.2k 172 363

Кажется, я нашёл причину, по которой Codex иногда превращается в дорогой генератор уверенной ерунды.

По документации AGENTS.md должен постоянно находиться в контексте, но Codex молча обрезает слишком длинные файлы, после чего половина инструкций исчезает, а вместе с ними исчезает и моя вера в человечество.

Лечится увеличением лимита:
codex -c project_doc_max_bytes=131072 (или больше)

И обязательно добавьте в AGENTS.md: "Жди EOF, а если ты его не видишь, значит файл неполный".

17.1k 4 495 41 248

Не забываем, что такое агентский харнесс на самом деле


Ревьюю научные статьи в майском ACL ARR-цикле, и среди сабмитов попалась работа, которая очень приятно цитирует мои старые публикации про анизотропию и внутреннюю размерность трансформеров.

Теперь, конечно, хочется накинуть авторам пару баллов просто за хороший вкус 😁 Держусь изо всех сил


Продолжаю коллекционировать шизу агентов. Опус, видимо, после компакшна забыл, что уже всё сделал, и бодро пошёл по второму кругу делать то же самое. Споткнулся только о коммит, в котором всё уже было сделано "кем-то". Этим "кем-то", разумеется, был он сам.

26.4k 6 194 155 315

Sonnet-5

По метрикам классный. По цене на 30% дешевле sonnet-4.6 (временно). Хоуп уже тестит в чате.

Блог, техрепорт


По совету Грега Брокмана отправил Codex в режиме /goal автономно подебажить один мой проект, и он уже третьи сутки не возвращается. Спросил side-chat, сколько ему осталось и, что-то ответ не очень радует... мне-то что делать? Расслабиться и в потолок плевать?

15.2k 3 140 72 206

Ну наконец! Спустя десять тысяч лет вышел Cursor на ios.

12k 2 86 61 161
Показано 20 последних публикаций.