Mashkka про Data Science


Гео и язык канала: Россия, Русский
Категория: Технологии


Погружение в Data Science и технологии GenAI

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Dealer.AI
Как тестировать AI агентов: от роутинга до траекторий и ответов. 🤖

Помню, как читал лекции по RAG и говорил, что агентные эвалы схожи, но более сложные из-за недетрменированности флоу.
Теперь вышел достойный обзор, как можно это делать удобно. Ниже представлен разбор статьи инженера Postgres AI Hybrid Manager.

🔥 Проблема.
В RAG у вас ~четыре измерения: данные, кандидатогенератор, реранкер и ответ LLM. Но с агентами интереснее.
Тестировать AI-агента как обычный REST API (статус-коды и JSON-схемы) - бесполезно. LLM недетерминированы: они могут правильно решить задачу, но пойти другим путём, или наоборот – красиво ответить (увернуться, сглюкать), но пропустить главное.

Автор статьи прошёл путь от простых проверок к сложной системе и щедро поделился граблями. Вот этапы этого пути 👇

Этап 1: Роутинг - самая дешёвая и быстрая проверка. Убеждаемся, что запрос пользователя попал в нужный скилл или инструмент. По сути это аналог классификации интентов.

Метод оценки: Детерминированное сравнение строк (ожидаемый инструмент = фактический).
+ Ловит критичные баги на старте.
- Правильный роутинг НЕ гарантирует правильный ответ.

Этап 2: Полнота задачи (TCR - Task Completion Rate)
Здесь вводится как инструмент – LLM as J.
Вы пишете рубрику - метрики на на естественном языке, а другой LLM ставит оценку (например, от 0 до 1) за финальный ответ. Порог прохождения теста обычно ставят 0.7–0.85.

Этап 3: Многошаговые диалоги
Жизнь - это диалог, а не один запрос. Тесты учатся поддерживать сессию, склеивать историю и оценивать не только итог, но и корректность уточняющих вопросов.

Этап 4: Траектории - здесь проверяется не только «что сказал агент», но и «как он шёл».
Порядок вызовов инструментов, переданные параметры, изменения состояния системы. Это позволяет поймать ситуацию, когда финальный ответ хорош, но внутри агент «сходил» за данными в обход логики или нарушил политики безопасности.

Оба пункта 3 и 4 проводятся также, как ранее для оценки ассистентов - диалог идёт с накоплением по фразно, трейсы тоже, таким образом каждый квант действия проходит оценку на релевантность и полноту. См SSA. Берете эту логику и кладёте в рубрики для судьи. Далее оцениваете именно не число траекторий, шагов, фраз, а контекстуальную релевантность и итоговые ответы.

⚙️ Стек автора:
- deepeval для написания метрик и запуска LLM-судей.
- Langfuse для наблюдаемости.

Каждый тест - это трейс. Если тест упал, вы сразу видите в Langfuse, что пошло не так: промпт, выбор инструмента или ответ судьи.

📊 БОЛЬ - ЭТО ДАННЫЕ
Автор подчёркивает, что тестировать без корзин оценки или как я говорю "на глазок"- преступление против человечества качества. Агент покажет 90% прохождения, но в бою провалится. Это будет точечная оценка, а не стат значимая выборка.

Решение:
Использовать тестовое окружение в БД (тк тут ребята из Postgres и задача SQL агент) и проводить мутационное тестирование – намеренно удалять индексы, дублировать поля и ломать данные, чтобы проверить, как агент справляется с «грязным» окружением.

Особое внимание уделено тестированию под разный масштаб моделей.
Система поддерживает модели разного размера (S, M, L, XL) для офлайн/и onprem AI.
Умный вывод об оценке:
Маленькая модель не должна видеть все инструменты (ей не хватит контекста). Поэтому фреймворк должен быть «Tier-Aware», когда один запрос для модели S должен тестироваться по одним ожиданиям (отказ или простой ответ), а для модели XL по другим (сложная аналитика).

Эта статья мастрид для всех, кто строит Production AI. Сохраните, чтобы не потерять.

И делитесь в комментариях тем, как вы измеряет е2е пайпы с агентами 👇👇👇


#justaboutme Иногда так хочется...

...чего-то простого. Просто плюнуть на все и с ветерком промчаться по ночной Москве.

#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK).

@mashkka_ds


#ride #bike #moto


Репост из: Градиент обреченный
🔺 Конференции и митапы в сентябре

В сентябре ожидаем не только мемы про третье, но ещё и пару интересных событий.

🗓 5 сентябряdeep tech night

Мероприятие от Яндекса. Вижу доклады про инференс, агентов и продуктивность с использованием AI, послушаем.

https://deeptechnight.ru

🗓 17 сентябряAI R&D Day

Коллеги по Сберу расскажут, что у них нового в R&D. Тоже вижу прикольные доклады: про рассуждения, обработку видео моделями, про память.

https://airndday.ontico.ru

😊 19 сентябряPractical ML Conf

Большая конфа от Яндекса, тут просто много всего интересного. Вижу, что Саша Мурзина расскажет про AI Marvel. Не знаю что это, но нейминг на уровне.

Ещё организаторы поддерживают безработных блогеров и подарили крутую термокружку. Какие же молодцы (ни на что не намекаю остальным).

https://pmlconf.yandex.ru

👉 Везде дойду ногами, куда пустят. Вы тоже регистрируйтесь. Если увидите меня, то подходите, поболтаем, познакомимся. Расскажу про Библиоточку.


🧠 Можно ли маленькой моделью обойти большую LLM?

Если кратко: да. Коллеги проверили это и разработали STARM — фреймворк для обучения рекурсивных reasoning-моделей

Какие результаты оказались самыми интересными?
✔️ Небольшая рекурсивная модель действительно может конкурировать с гораздо более крупными моделями на алгоритмических задачах, при этом рекурсивные reasoning-модели плохо масштабируются на многозадачное обучение.

✔️ Для качества оказался важнее не размер модели, а то, как именно она обучается: большой реальный батч дал заметный прирост, а длинный путь градиента улучшил обобщение.

✔️ Многие интуитивно привлекательные идеи не сработали. Например, второй рекурсивный модуль оказался не нужен, а увеличение глубины модели не дало выигрыша.

Почему так происходит и какие именно эксперименты привели к результатам — читайте в статье коллег на Хабр.

#ai #reasoning #research #machinelearning


#пятнтчныемемасы


🐦AIST принес Accept🎉

Поздравьте нас, а точнее мою выпускницу бакалавриата ФКН - @any_fadeeva, с принятием нашей статьи на конференцию AIST'26. Эта статья по мотивам Аниного бакалаврского диплома и для первой пробы пера это не просто сильный, а наиотличнейший результат.

#трудовыебудни #aist


🧐#paperwatch DeepSeek Sparse Attention в GigaChat
В новом выпуске разбираем путь к внедрению архитектурного новшества — DeepSeek Sparse Attention — в модели GigaChat.

Что обсуждаем:
✔️ преимущества архитектуры и технические ограничения, которые накладывает разреженное внимание;
✔️ почему так сложно конкурировать с Flash Attention;
✔️ реализацию CUDA-ядер.

Статьи:
✔️DeepSeek V3.2
✔️DeepSeek V4

👀Запись

@mashkka_ds

#paperwatch


📆Бронируйте слот на R&D day 📆

17 сентября приглашаем всех, кто формирует ландшафт искусственного интеллекта, на конференцию AI R&D DAY, где мы с командой расскажем про последние достижения и разработки в области ML и AI.

Что по программе?
➡️ 2 трека: Продуктизация R&D и ML&Research
➡️ 22 доклада на двух сценах. От «Трендов в ML» до «Омнимодальной долгосрочной памяти» и «Страха и ненависти в LangGraph». И это только верхушка айсберга.

А на постер-сессии я расскажу, как писать научные статьи!

👉Регистрация: тут
🏘 Место: Москва+онлайн
🕐 Время: 17 сентября


До встречи на AI R&D DAY 🧩🚀

@mashkka_ds

#sberai #research #наука #ds #llm


#justaboutme ОТЗЫВ: Мадагаскар и Маврикий - от лемуров до китов и зебр с Travel4You🇲🇬🇲🇺

Вы уже знаете эту историю: я летела на Маврикий обниматься с зебрами, забронировала тур, не читая программу, и только потом узнала, что по пути мы заедем на Мадагаскар дней так на 10. Спойлер: страна, о которой я не знала практически ничего, открылась для меня самой яркой и красочной стороной. Это мой 4-й тур с @travel4_you, и, пожалуй, одна из самых сильных и мощных поездок за весь мой немаленький опыт путешествий.

🇲🇬Чем запомнился тур:
✔️Мадагаскар, который стал открытием. Невероятная природа, баобабы, каменный лес Цинги, колорит местной жизни. А лемуры это просто любовь!
✔️Полная перезагрузка. В таких условиях рабочая суета отпускает сама собой: ты просто физически не можешь думать о дедлайнах, когда вокруг такая жизнь. Погружение в страну на все сто.
✔️Впечатления, которые требуют сил. К Мадагаскару нужно быть готовым: длинные переезды, местами перебои с водой и электричеством. Но @travel4_you выбирали лучшие места из возможных, и программа была составлена потрясающе. Питание организовали отлично даже там, где это совсем непросто, отели достойные для Мадагаскара, а на Маврикии так вообще топ.
✔️Замечательная группа. У нас собрался невероятный коллектив: мы все были очень разные, но за время тура стали родными.
✔️Лучшие тур-лидеры в мире. Якуб и Антса! @runoutofthetown один из лучших тур-лидеров, с которыми я путешествовала: всегда поддержит, особенно когда тебе непросто. А в нашего местного гида Антсу мы все просто влюбились.
✔️Маврикий как финальный аккорд. После Мадагаскара приехать в этот рай на земле отдельное вау. Каждый день новое приключение: то киты, то вертолет, то львы и зебры. Впечатления не успеваешь переваривать.

Итог: Мадагаскар это направление для искушенных путешественников, но оно определенно того стоит. А с @travel4_you даже самая непростая страна раскрывается на максимум.

👀Другие отзывы о @travel4_you:
🇺🇸США
🇳🇦Намибия
🇿🇦ЮАР
❔С кем еще поехать?

#justaboutme воскресная рубрика, в которой я делюсь яркими событиями из своей жизни, не связанными с DS и ИТ, подобно тому, как я это делаю в соцсетях (например, в инсте или VK).

@mashkka_ds

#mashkka_africa #туротзыв #мадагаскар #маврикий #travel4you #justaboutme


ML Global Recap'H1: это 10 из 10✨

Вчера сходила на ML Global Recap'H1 2026 в Яндексе, большой митап с обзором ICML. Тот самый, который я две недели пиарила здесь в канале, а потом благополучно забыла зарегистрироваться сама. Вспомнила в последний момент, когда регистрацию уже закрыли. Выручили друзья по ШАДу и нашли для меня место, так что на самый разгар я все-таки успела.

Что было полезного:
✔️Общий обзор конференции и трендов: куда движется область по итогам первого полугодия и что реально взлетело.
✔️Доклады про ризонинг, тема, вокруг которой сейчас крутится половина всего интересного.
✔️Доклад ровно по моей теме, про оценку моделей и тренды бенчмаркинга. Все никак не доходили руки разобраться, что там по статьям с ICML на эту тему, а тут готовая выжимка.

Но главное на таких митапах, конечно, люди. От нашей команды собрался золотой состав AGI NLP, ребят из Sber AI было столько, что нас обогнали только местные яндексоиды.
И отдельная история это встретить здесь вас. Каждый раз, когда на таком мероприятии ко мне подходят, просят сфоткаться и говорят, что читают канал, я не знаю, куда себя деть от смущения и радости одновременно. Спасибо вам, это правда очень вдохновляет и мотивирует писать дальше!

Итог: 10 из 10.
Полезно, интересно, вкусный кофе-брейк и отличная компания.

@mashkka_ds

#трудовыебудни #ml #icml #митап


#прямоевключение с ML Global Recap'H1. Так приятно видеть столько знакомых лиц в зале! И всем подписчикам огромный привет!

#трудовыебудни



Показано 12 последних публикаций.