AI.Insaf


Channel's geo and language: Russia, Russian
Category: Technologies


Личный канал Инсафа Ашрапова
Исполнительный директор по исследованию данных в банке (aka Lead DS) — @insafq
Здесь про AI, менеджмент, личные истории и многое другое

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Хорошие курсы от самого LangChain, дошли руки пройти Deep Agents (лекции + лабы). Это их собственное решение по harness. Плюсы - гибкость и возможность самому управлять всеми частями. Интересные опции: injection в state нужной информации, от памяти до tool usage или todo plan. Или вместо того, чтобы промптить с user_id, сразу самому подставлять его в вызов tool как параметр. Внутри разные guardrails по количеству вызовов tools, циклов работы субагентов и тд

И в целом там остальные курсы тоже хорошие


Хотел почеленджить ребят на работе, что развернуть модельки просто. А именно попробовав серверные истории SGLang, vLLM или Triton. А вот от llama.cpp отказался, тк больше про локальный инференс, хотя через lm studio было бы легко

Но везде оказались свои подводные камни. И как итог, Qwen3.8-9B-GGUF (Q4/Q5) вообще плохо поддерживается vLLM. Патч под Qwen 3.5 от некого чувака, который 24 часа делал его на Fable, тоже не помог. Плюс были проблемы с CUDA DLL и ZMQ.

При этом исходные оригинальные веса зачастую требуют слишком много памяти, а квантованные, которые собирают сторонние люди, уже поддерживаются заметно хуже.

Потом попробовал Gemma 4 E4B (safetensors и QAT самые разные версии), но vLLM и SGLang тоже не завелись из-за проблем с совместимостью compressed-tensors и мультимодальными особенностям, спасибо еще heterogeneous attention head dimensions

PS qwen 3.8 27b локально это прогрев






Новая библиотека SIRIN для оценки и мониторинга contextual hallucinations в RAG и memory-based LLM системах (статья arxiv + github )

Идейно внутри три инструмента:
- probing по hidden states - легкий классификатор по hidden states генератора но нужно немного разметки
- LLM-as-a-judge. Есть response-level и span-level варианты, где модель пытается локализовать конкретные галлюцинированные фрагменты.
- uncertainty (entropy, perplexity, semantic uncertainty) - разные технические метрики как baseline, но обычно хуже чем LLM-as-a-judge

И два гейта:
1) до ответа: хватает ли контекста (Answerability gate)
2) после ответа: не наврал ли относительно контекста (Faithfulness gate)


- С учетом всего этого можно считать разные метрики качества. Еще у ребят неплохо получилось улучшить метрики на на memory-агенте повесив два гейта, и при непрохождения заставляя еще раз идти думать (метрики точности с 62.4% до 79.3%)
- Кастомный judge под задачу часто нужен все равно, но решение хороший baseline

770 2 11 1 16

Forward from: AbstractDL
Ouroboros теперь SOTA на Terminal Bench, OSWorld и CL-bench

Мой любимый агентный луп на чистом питоне доэволюционорал до состояния лучшего харнесса для кодинга! На главных бенчмарках он теперь обходит Codex, Claude code, Cursor и Hermes.

Выходит, что в рисёрче, в computer use, в работе через терминал и в задачах на кодинг — уроборос сейчас является лучшим агентом. Так что с этого момента всю разработку и исследования я веду только через уробороса.

Для полной воспроизводимости результатов. Весь код, скрипты, трейсы я выложил в открытый доступ.

Напоминаю: лицензия MIT. Так что спокойно ломайте, форкайте, проверяйте трейсы, пишите что я где наврал. И кидайте issues и PR-ы! Все постараемся с уроборосом принять😋

P.S. Кошмар какие дорогие агентные бенчи. Прогнать весь набор стоит как квартиру купить (это не шутка!!)

GitHub, Хабр, установочники


Все еще сидите на codex и claude code. А как насчет уробороса 🤌🏻

ps человек отдал 50к $ чтобы прогнать все бенчи


Придумали еще скилл, который создает скилл по книгам (Book-to-Skill - 10k ⭐️). По сути, зумеры заново изобрели оглавление.

Собрал такой скилл по книге "Братья Карамазовы" и спросил: что будет с AI? Ответ со смыслом:
Не к сознанию, как у Ивана, и не к святости, как у Алёши, а к институту опеки с лицом чуда. Пока свобода не станет дороже комфорта и явным выбором

- если главный KPI — снятие тревоги и принятие решений за человека → Великий инквизитор;
- если KPI — усиление свободы и ответственности конкретного человека → старец в миру.

Но если книгу не читал, то ответ вызывает еще больше вопросов. А если читал - то зачем вообще нужен этот скилл? Заставляет задуматься


Harness evaluation - deepeval

Кто-то, возможно, начинает разработку harness решений и скиллов для них. Стало интересно, какие инструменты можно использовать для тестирования качества.

Если для RAG многие использовали Ragas, то для LLM и агентов активно применяются решения для трейсинга, например Langfuse и Phoenix. Однако они больше про observability, хотя на их основе также можно прогонять выборки и анализировать качество. Но нужно что-то для harness и такое есть, DeepEval, спойлер с ним можно и все выше.

Но так или иначе все сводится к одному: прогнать набор тестовых сценариев, сравнить результат с эталоном или заданными критериями, проверить качество контекста и оценить корректность вызовов тулов

PS в итоге наверняка что-то кастомное 😅


Прикольно, что Cloudflare позволяет без регистрации за пару секунд поднять статический сайт - просто перекинув ZIP-архив.

А если зарегистрироваться, то уже можно бесплатно хостить небольшие проекты. Да, собственного домена не будет, но возможность управлять всем через API - мое уважение. Вот сделал инглишь реплику канала (но надо покупать доменное имя иначе сложности с dns)


Upd еще подсказывают что можно использовать для хостинга телеграмм ботов




TabFM - придумали foundation-модель для табличных данных (что? 😅), и она SOTA на TabArena

В отличие от привычных LightGBM, CatBoost или TabM, она работает в zero-shot режиме: для нового датасета не требуется обучение или подбор гиперпараметров, достаточно передать обучающие строки в качестве контекста. TabFM рассматривает задачу табличного ML как in-context learning. Вместо обучения под конкретный датасет обучающие строки передаются модели как контекст. Веса модели не обновляются - достаточно одного forward pass. Архитектура сочетает идеи TabPFN и TabICL: row/column attention, компрессию строк и transformer для in-context learning. Модель обучали на сотнях миллионов синтетических таблиц, ибо открытых данных мало. Из минусов - лицензия только для некоммерческого использования

Удивительно, но это действительно работает. Во всех моих экспериментах TabFM показал качество выше, чем бустинги, даже без какого-либо обучения под датасет. Причем на самом большом датасете контекст пришлось сократить из-за нехватки памяти, но TabFM все равно показала лучший результат.

Ниже - сравнение качества и времени работы. Время указано для GPU, без которого TabFM работал бы еще на пару порядков медленнее


Потестировал новый PageAgent от Alibaba

Это open-source браузерный AI-агент, который умеет самостоятельно работать с сайтами: понимать интерфейс, двигать курсор, кликать по элементам, вводить текст и выполнять многошаговые сценарии. Для быстрого старта разработчики уже предоставляют доступ к Qwen, так что ключик к api не нужен

Запускается очень просто, но если использовать версию по ссылке, то PageAgent.js рассчитан только на текущую страницу (SPA - Single Page Application). Для переходов между страницами нужен Chrome Extension, и лучше сразу использовать его, иначе при навигации теряется JS-контекст и агент забывает состояние.

Работает неплохо: мышкой двигает, тексты пишет. Ради эксперимента попросил выбрать кондиционер на Яндекс.Маркете. Самое забавное - он выбрал ровно ту же модель, что рекомендует AI Алиса в Маркете (хотя на это ушло заметно больше времени, и сам я в итоге выбрал другую модель).

В целом интересная история для автоматизации через браузер, особенно если нет нативных интеграций с нужным сервисом или готовых инструментов (tools). Но это долго и дорого и нужна API к LLM

553 0 12 1 15

AI-кофе с робо рукой: Чита - Москва 1:0 по внедрению ИИ 😎


Corporate Bullshit Receptivity Scale (2026г)

Статья исследует, почему часть людей воспринимает бессодержательные корпоративные формулировки (где много разных buzzwords) как значимые и умные, и предлагает инструмент для измерения этой склонности. Как итог более высокая восприимчивость к корпоративному bullshit связана с более низкими показателями аналитического мышления и когнитивной рефлексии. Все выводы конечно получены на основе корреляций, а впрочем 😁

745 0 11 1 17

*это только документацию прочитал


*Уроки промтинга от топ участников


Я проиграл Волендеморту 🤩

В мае проходило соревнование от Avito "ML CUP 2026" по предсказанию наиболее релевантных объявлений, с которыми пользователь проконтактирует. Казалось бы, обычный рексис: за несколько вечеров выделил, построить несколько бейзлайнов. Честно, не погружался сильно в задачу и метрику, которая оказалась хитрее, чем я думал. Там щедро залили данных на 40 гб, я попробовал базовые ALS (а надо было covisit + bm25, даже тут, aka item-to-item), эвристики, двухбашенные подходы и ранжирующие модельки (спойлер: работало все примерно одинаково и сильно отставало от топов).

Как рассказали победители, нужно было строить графовые (pixie и RP3Beta и упомянутые covisit) лидогенераторы, но да, ранжировать потом бустингом. Интересно, что полезно было для реранкера сделать поменьше кандидатов (с 10к до 5к). Про решения можно посмотреть тут

PS Причем тут Волендеморт, а он был в топе и я его не смог обойти 🫡


NVIDIA DGX Spark vs Macbook

NVIDIA DGX Spark не прошло и года можно купить на wildberries, обойдётся в 500к+, например, тут (и его действительно привозят). Звучит неплохо, с учетом того, что там 128 ГБ объединенной памяти (unified memory), архитектура Blackwell и возможность запускать модели до 200B параметров локально.

Но за аналогичную стоимость можно взять MacBook Pro M4 Max (например, здесь), и памяти там будет столько же. Забавно только, что у Макбука скорость памяти в 2 раза выше (546 ГБ/с против 273 ГБ/с у NVIDIA) и по бенчам скорость тоже будет больше. Более того даже TDP у мака в два раза лучше (120W против 240W) 😁


Интересный проект для вайбкодинга https://freebuff.com/ с бесплатными лимитами и без ограничений по токенам, действительно работает. На деле - 5 сессий по часу каждый день. Доступны DeepSeek и MiniMax. Сам сервис говорит, что внутри ваш код не читает, но, как видно на скрине, живет за счет рекламы. Звучит интересно, но часовые сессии обрываются, и для чего-то долгого (например, обучения) им не воспользуешься.

Установка: npm install -g freebuff
Запуск: freebuff

Доступные модели (неплохие, но вы будете помогать их обучать):
- DeepSeek V4 Pro: smartest. Its API collects data for training.
- Kimi K2.6: balanced.
- DeepSeek V4 Flash: most efficient. Its API also collects data for training.
- MiniMax M2.7: fastest.


PS Написал письмо разработку с вопросом: Is it spyware or a trojan?

20 last posts shown.