Big Ledovsky | AI изнутри


Гео и язык канала: Россия, Русский
Категория: Блоги


Александр Ледовский
Head of AI @ Listee, ex: Avito, Сбер, ШАД
@aledovsky

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Блоги
Статистика
Фильтр публикаций


Апдейты по моему прохождению cs336

Про который писал

Потратил на него примерно 40 часов. Сделал только одно задание. Ну.. это было жестко. Нужно было написать все с нуля: токенизатор, небольшую LLM с современными слоями, оптимизатор adam w (!) и код для обучения. И на всем этом провести десяток экспериментов

Учитывая что задание дают на 2 недели, я думаю люди отключают запрет на агентов

Признавать что я просто медленный я конечно не собираюсь 🗿

Да, и знаете что? Даже понимая внутренности современных LLM-ок и обучив все своими руками, я все равно поражаюсь что они все-таки работают 👁


Мнение про свежий гайд Claude Code

Как клодовод со стажем, могу вставить несколько копеек 😎

Выбор модели и уровня усилий

Абсолютно нереально этим управлять. Модели так часто меняются, даже в стеке антропика. Невозможно успевать вырабатывать интуицию, поставить фейбл или опус или соннет. Я тупо пользуюсь fable.

Уменьшение контекста и сабагенты

Ральф луп и контекст задачи в маркдаун файле - все еще лучшее решение на мой взгляд.

Управлять сабагентами сложно, потому что они включаются непредсказуемо. Теоретически можно аккуратно прописать правила когда и как их запускать в Claude.md, но я до этого не дошел. Сабагенты - это автоматический способ экономии контекста. Ральф луп - это ручной, но достаточно хорошо управляемый.

Совет запускать компактизацию когда уходишь от компьютера странный. Это требует огромной ментальной энергии, а в агентах наоборот хочешь ее экономить. Да и не доверяю я компактизации. Не понятно насколько она ухудшает качество контекста.

Совет тегать файлы через @ в моем случае работает плохо, потому что я читаю файлы из разных мест и работаю с несколькими репозиториям сразу.

Про часовое кеширование

А вот на этом хочу акцентировать внимание. Часовое кеширование - это самый важный геймченджер антропика. Это причина, почему если просто включить API на Гермесе через OpenRouter агенты становятся золотыми. Я плохо понимаю, как работает подписка кодекса. Но в обычных API у других провайдеров нет нормального предсказуемого способа кеширования. Обычно они говорят, что кешируют, но как и на сколько - не гарантируют. Обычно кешируют на несколько минут и часто мы отвечаем агенту с большим лагом. В подписке Claude часовое кеширование включено по умолчанию и именно это позволяет укладываться в лимиты на больших задачах.

https://claude.com/blog/maximizing-the-value-of-your-claude-code-sessions


Что я думаю про Conductor

Conductor - это приложение для оркестрации агентов, которое я периодически видел в разных ютубах. Это что-то среднее между UI Claude Code и Codex и полноценной IDE типа курсора. IDE вайбкодера короче 🤪

Основа рабочего процесса состоит из двух элементов. Традиционные сессии с агентами. И код ревью того, что наделал агент. Conductor сам не ходит в модели, как курсор, а подключается к уже установленным Claude, Codex итд.

Я посидел на нем над одним личным проектом. Тул прикольный, подойдет для неинженеров. Для инженеров скорее нерабочий.

Что понравилось

Conductor форсит свой подход к работе. Проект обязательно должен быть git репозиторием, подключенным к гитхабу или другой платформе с механизмом PR. Каждая новая задача агенту создается в виде workspace - 1 или более сессия с агентом + git worktree, который мерджится исключительно через PR.

Что не понравилось

В рабочих проектах вы не хотите плодить PR-ы на каждое изменение агента. Почему не поддерживаются локальные ветки и мерджи - я не понимаю. Вторая проблема - там нет полноценной поддержки синтаксиса - go to definition итд. Без этого раскапывать километры вайбкода очень больно. Третья проблема - нельзя делать фичу сразу в нескольких репозиториях. А в ds это постоянно (сервис + рисерч репозиторий)

Итого

Интересный инструмент, но моя перемотанная скотчем фабрика задачи решает лучше 😎




Правда жизни про поиск

После того, как на конференции вы вдохновились очередным докладом про супер-пупер нейронку для поиска, может сложиться впечатление, что поиск - уже решенная задача

Вот вам простой пример, что это не так 😄

Запрос: "гермомешок 50л". Можете посмотреть как с ним справляются крупные ecom площадки. Ozon, Avito, Amazon, Ebay. Все выдают гермомешки неправильных размеров (Авито кстати меньше всех!)

С числовыми параметрами справляется Lamoda, потому что у них относительно узкая область и есть разбор запроса и преобразование его в фильтры. Но на большом ассортименте это очень тяжело поддерживать.

Короче есть еще чем позаниматься в поиске 😎


Какое-то время сидел на Opus 5 как на основной модели в Claude Code. Понял, что страдаю 🦶

Агент тратит много времени на простые задачи, выдает полотна ненужной информации и прочее. В итоге, на сложных проектах переключился на Fable, на простых вернулся на Opus 4.8 (если не знаете как - /model claude-opus-4-8)

Пошел смотреть что пишут другие, у других людей 🫁 тоже много негатива раз два

Тем временем Boris Cherny в свежем выступлении на YC рассказал, что под каждую новую модель они на самом деле почти полностью переделывают систем промпт Claude Code.

Не факт, что Opus 5 правда настолько плох, думаю его допилят за счет систем промпта и он будет лучше ощущаться. У меня такое уже было, кажется, на Opus 4.6. Сперва страдал, а потом стало ничего 👌


Marimo побеждает Streamlit в нашей команде

К моему удивлению. Потому что сам я два раза пробовал пересесть на Marimo, и оба раза не выдерживал из-за неудобного UI

Вообще, marimo - это современная альтернатива jupyter ноутбукам. Еще у него есть режим публикации, который позволяет делать хорошие интерфейсы, по функционалу примерно как стримлит. Т.е. на нем можно сделать смотрелку предсказаний, или тестовый интерфейс для модели, или интерактивный дашборд.

Причем ребята говорят, что де-факто не работают в UI marimo и все делают через агента. Мне лично работая с агентами больше нравится комбинация python-скрипты + streamlit. Но мб нужно еще раз попробовать.


2-го августа будет конфа UrbanML. Собираюсь сам и могу порекомендовать вам.



18 докладов по RecSys, NLP, антифроду и агентным системам, выступления специалистов из MTS Web Services, ВТБ, «Звук», Wildberries, Альфа-Банка и других компаний. После основной части — спортивные активности (мастер-класс по баскетболу, настольный теннис и ИИ-шахматы) нетворкинг и афтепати.

Вход бесплатный, но нужна регистрация (на площадку необходимо взять с собой паспорт или права): ссылка

📅 2 августа, 11:00–21:00 (первый доклад в 12:00)
📍 Москва, офлайн


Про Wispr Flow

Вот уже какое-то время пользуюсь Wispr Flow. Это приложение, которое ставится на Mac и на iPhone и распознаёт голос. Идея этого приложения в том, что оно добавляет ваш контекст 🧠

Не очень понимаю, как это работает, но по идее оно должно видеть, где вы пишете, что вы пишете, какие используете слова и использовать их при распознавании. Спойлер, все не совсем так

Я слышал про Wispr Flow и про его аналог Aqua в нескольких каналах и лично от нескольких людей, и все очень хвалили. В итоге мои впечатления смешаны 🙄

Сперва был восторг, что теперь можно всё вводить голосом. Потом я немного попользовался и столкнулся с реальностью, что все не так гладко. По итогу Wispr Flow - это офигенный инструмент для общения с агентами, потому что все грехи распознавания агент принимает легко.

Но если мы говорим про написание сообщений или написание документов, то тут всё сильно сложнее. Несмотря на то, что говорят, что Wispr Flow смотрит контекст, специфичные слова он не распознает. Получается довольно много ошибок и без редактирования такой текст отправлять нельзя 🩸

Вообще я сомневаюсь, что Wispr Flow проходится ллм-кой по выходу движка распознавания речи, как я думал вначале. Потому что мы делаем похожую историю у себя в приложении и таких ошибок не происходит.

Но по итогу все равно прикольно. Главная киллер 🔫 фича Wispr Flow: как удобно он интегрировал интерфейс, особенно в маке, где распознавание работает в любом приложении по нажатию кнопки.

Последняя мысль: что навык голосового ввода нужно развивать, как и навык использования LLM 😎

PS. Если будете пробовать, можете взять мою рефералку


Бенчмарки - это как собеседования
Есть люди, которые их замечательно проходят, а потом нифига не работают 🙂
Посмотрим что будет с Kimi K3

PS. Если что, заявка очень серьезная. На данный момент открытые модели идут во втором эшелоне и заметно отстают


Традиционно пишу в этом блоге про походы. В этом году пошел на сплав с Силой Территории. Очень хорошая компания. И главное у нее классное комьюнити тех, кто с ними ходит. Нетворк хороший короче 🙂

На самом деле для меня день дейоффа и три дня в байдарке - все что нужно для счастья. Прошли в районе Ржева по Волге, немного, километров 50. Ну, много и не нужно.

Читайте также

Прошлогодний байдарочный поход в Киргизии


Репост из: Старший Авгур
Вот такую писюльку получил 5 минут назад.

Нахуй Хабр. Не пишите туда, не читайте его.

Датасет я не закрою, пока они не соизволят написать нормальное письмо.

После этого сделаю приватным, если кому-то будет нужен - пишите в личку. А лучше скачайте сейчас.


Сомнительные действия со стороны Хабра 🤔

Непонятно зачем. От каких рисков они хотят защитится, удаляя неофициальный датасет на котором люди учат модели. Только негативно настроят против себя сообщество, которое их хлеб.

Кто-нибудь кстати Хабр читает еще?

Его репутация как места, где с позором выгоняли за плохие статьи, уже очень давно потеряна 🏄‍♂


Люблю Дорофеева за философский подход к продуктивности. Для меня он как-то пропал из инфоповестки последнее время. Рекомендую свежий подкаст, если вам тоже такое заходит.

Джун: не использует техники продуктивности, вокруг пожары

Мидл: обмазан миллионом техник продуктивности, пожаров нет, но очень тревожный и результаты не выдающиеся

Мастер: не использует никаких техник, достигает выдающихся результатов естественно и спонтанно (на первый взгляд)


https://youtu.be/7Ipt0a43U4Q?si=lVkky-fdeqqz0X2q


Прохожу новый курс

Начал проходить Стэнфордский курс Language Modeling from Scratch

Моя цель - проходить по два курса в год. Зимой я проходил курс по программированию на CUDA, теперь вот учусь обучать LLM с нуля.

➡️ Мысль за этим следующая. Во-первых, чтобы хорошо делать свою работу, нужно иметь знания на 1-2 уровня глубже чем используешь в повседневной деятельности. Во-вторых, в части задач я все-таки рассчитываю, что мы начнем использовать легкие зафайнтюненные LLM-ки. Чтобы сэкономить, снизить лейтенси и главное - быть менее зависимыми от внешних API. Но тут хз, непонятно, что будет с областью через пару лет 🤷‍♂️

Прикольный курс. Я пока не смотрю лекции, только делаю домашки. Лекции буду смотреть по факту, когда сделаю. То, что ты не трогаешь руками - не откладывается. На этом курсе абсолютно шикарные домашки с хорошими тестами. Курс рассчитан в том числе и на самостоятельное прохождение.

Уже написал и обучил токенизатор с нуля, сейчас пишу компоненты LLM на торче.

➡️ Из интересного, с домашками идут настройки Клода и Кодекса, которые не дают агенту напрямую писать код за студента, но дают отвечать на вопросы и помогать искать ошибки. Супер полезно.

Буду делиться впечатлениями!

1.8k 4 80 17 48

Видео недоступно для предпросмотра
Смотреть в Telegram
Коллеги прислали. Говорят про меня 🤷‍♂️🙈


«Это Гулаг» - что происходит в Мете*

Эту историю на прошлой неделе мне рассказал один знакомый. Я честно говоря поделил на 10, но тут новости просто взорвались.

Мета принудительно отправила 6.5 тысяч инженеров размечать данные для AI на фул-тайм. Люди бунтуют.

Выглядит ооочень плохо. Принудиловка требует либо большой кредит доверия у компании, либо хорошую компенсацию взамен. Учитывая ситуацию с волнами сокращений, ни того ни другого нет.

Мета очевидно отстанет в AI гонке и хочет это изменить. Но вместо камбека пока получается саморазрушение 🏌️

* запрещенная организация в РФ

https://techcrunch.com/2026/06/12/metas-months-old-ai-unit-is-a-soul-crushing-gulag-say-the-engineers-stuck-inside-it/

2.1k 0 20 21 25

Я заметил, что мало у кого в итоге прижились OpenClaw, Hermes и похожие агенты 🦀

Проблема OpenClaw как класса агентов, что люди им играются и бросают. Почему, можно описать одним примером.

Допустим, человек просит вести за него задачи и планировать время. Но до этого он что-нибудь делал? Есть ли у него привычка записывать задачи? Умеет ли вообще придерживаться расписания?

Поставит ему агент с 6 до 8 утра слот учить data science, он все равно не проснется. Дело не в инструментах, дело в человеке 🤷‍♂️


Какой алгоритм рекомендаций победил в Avito ML Cup

Пока на разных днях датафеста рассказывали про трансформерные рекомендации, интересно было посмотреть, что нарешали победители соревнования, про которое я писал. Напомню, что датасет был серьезный - 5kkk взаимодействий.

🔜 Как вы наверное догадались, это не трансформер. И самое интересное, что не ALS

Победил графовый кандидатогенератор. Базовая идея этого алгоритма очень простая. Это когда вы ходите по графу взаимодействий: юзер - айтем на который он кликал - другой юзер - новый айтем. И так при желании какое-то количество раз. Дальше у алгоритма есть усложнения, как ходить лучше, чем случайно. Примеры вариаций: Pixie от Pinterest аж 2017 года и RP3beta аж 2016 года.

🔜 Все топ решения использовали подобные кандидатогенераторы и ранжирование бустингом поверх

Интересно, почему получилось так? Может быть виной хитрая метрика, которая усредняет перформанс по разным вертикалям (товары, услуги итд). Может быть то, что оставили только прогретых пользователей, у которых был контакт. Может быть гэп в 12 часов между трейном и валидацией. А может быть было мало данных на такой объем пользователей и айтемов. Говорят, трансформер не выучивал item_id (хотя они уже были semantic id).

По итогу, соревнование показало пример, что хорошие рекомендации можно построить достаточно простым подходом.

YouTube - Запись разбора решений
Б/У ML - Канал Толи, автора сорева


Удивился решению Майкрософта срезать косты на Claude 😏. Не смогли найти 100 долларов в месяц на разработчика? В ту же сторону отреагировал убер

💬 Мысли по теме

- Факт, что при неаккуратном использовании на агентах можно сжигать нереальное количество денег. Я недавно пробовал запускать Hermes на Opus 4.7. Расхотелось 😅

- Просто подписка на курсор или клод код многократно себя окупает. Это видно невооруженным взглядом без всяких аб тестов

💬 Чтобы AI не стал только лишь дополнительным финансовым бременем 🔫, нужно делать две вещи.

1. Вводить политики на траты сверх обычных подписок. Например, включать бюджет на AI в бюджет проектов. У меня вот есть такой бюджет на DS функцию и я трижды думаю на что его тратить.

2. Закладывать сокращение количества сотрудников на тот же объем работы. Иначе это правда все бессмысленно.

Майкрософту сложно быстро отреагировать на такую смену парадигмы. Я думаю, что кран прикрыт временно. Либо они будут просто использовать не Антропик.

Показано 20 последних публикаций.