Math and AI


Гео и язык канала: Россия, Русский
Категория: Технологии


Канал про искусственный интеллекти и математику

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Подкаст make sense (Есть смысл)
417-й выпуск make sense: об устройстве контекстного окна моделей, неоднородности интеллекта и правилах контекст-инжиниринга

«То, что вчера требовало от эксперта знаний — сделать сайт, написать описание, разметить данные — сегодня модель делает почти что из коробки.»

«Модель на самом деле не ошибается — просто у неё нет понимания, как решать именно эти задачи.»

«Когда вы ловите себя на том, что повторяете модели одно и то же снова и снова, — это сигнал, что в контексте появилась дыра.»

Ведущий:
Юра Агеев, основатель ProductSense

Конференция ProductSense пройдёт 10—11 сентября 2026 года в Москве. Сайт конференции: https://productsense.io

Подписывайтесь на канал анонсов подкаста: https://t.me/mspodcast

О чем говорим:
00:00 — Введение
02:50 — Устройство контекстного окна на примере аналогий
04:14 — Статистический разрыв при обучении модели
05:09 — Семантический разрыв при обучении модели
06:56 — Ошибки мышления модели, подхалимство и уход от ответственности
09:00 — Захламление контекста и сжатие
11:11 — Две картины мира: человек и модель
18:22 — Неоднородность интелекта моделей и рваные границы
21:40 — Почему дообучить модель самому это тупик?
22:16 — Контекст-инжиниринг: то, на что мы реально влияем
24:52 — Правило 1: разбивать задачи на чаты и контролировать сжатие
26:16 — Правило 2: не сваливать 30 файлов сразу, ловушка якорения
27:50 — Правило 3: hand-off, выжимка задачи для следующей сессии
28:51 — Правило 4: разметка источников по важности и актуальности
31:04 — Правило 5: повтор инструкций — сигнал о дыре в контексте
32:31 — Луп-инжиниринг: что приходит на смену

Словарик:
Луп-инжиниринг — (Loop Engineering) практика проектирования систем, которые автономно управляют работой ИИ-агентов

Слушать: 
Telegram 
Mave 
Apple 
Яндекс
YouTube




Репост из: База знаний AI
СПбГУ совместно со «Сбером» и AIRI создаст лабораторию исследований в сфере ИИ и математики

В новом подразделении будут изучать фундаментальные принципы искусственного интеллекта, создавать архитектуры ИИ-моделей и искать решения для вычислительно сложных задач.

Структура будет создана на базе факультета математики и компьютерных наук СПбГУ. Директором назначен ведущий научный сотрудник Института искусственного интеллекта AIRI Константин Яковлев. По его словам, главная цель лаборатории — создание новых методов и моделей ИИ, «объединяющих математическую строгость, алгоритмическую обоснованность, вычислительную эффективность и практическую применимость».

🔗 Источник: https://spbu.ru/news-events/novosti/spbgu-i-sber-sozdadut-laboratoriyu-fundamentalnykh-i-prikladnykh-issledovaniy-v

***
📎 В июне стало известно, что AIRI и ИТМО открыли лаборатории для создания новых лекарств и мультиагентных ИИ-систем.


Репост из: Время Валеры
Прочитал интересную (и применимую) статью Rethinking Early Stopping: Refine, Then Calibrate.

Часто в курсах по машинному обучению говорят, что ошибку системы можно разложить на bias, variance, noise. На некоторых редких курсах даже учат, как это считать и что с этим делать дальше.

Попробуем посмотреть на эту проблему с другой стороны. В задачах вероятностной классификации loss для proper scoring rules можно разложить на: calibration и refinement.

Калибровка — мы сказали, что вероятность 80%. Сколько из взятых образцов будут принадлежать к классу 1? (Считать это можно через ECE — Expected Calibration Error).

Refinement — насколько хорошо модель разделяет классы. Допустим, модель выдала скор 0.9, все образцы оказались класса 1, а все, что ниже — класса 0. Модель откалибрована так себе, но разделяет классно. Собственно, если бы модель была откалибрована, мы могли бы выбирать отсечку вероятностно через саму вероятность.

Легко представить и обратную ситуацию: модель прекрасно откалибрована, но разделяет плохо. Например, модель, которая всегда предсказывает вероятность 50% для честной монетки, идеально откалибрована, но её разделяющая способность минимальна.

Из чего делаем вывод, что в какой-то момент улучшение функции потерь, из тех что относятся к семейству proper scoring functions, может происходить лишь за счет улучшения калибровки или даже ухудшать разделение, но за счет большого по величине улучшения калибровки выдавать лучший скор.

Это плохо. Калибровку часто можно существенно поправить потом post-hoc методами, поэтому остановка обучения по лоссу на валидации может привести к ситуации, что мы взяли далеко не лучший чекпойнт.

Что делать?

Сохранить несколько чекпойнтов модели.
Откалибровать каждый из них одинаковым методом.
Только после этого сравнивать их по loss.

В таком случае для каждого чекпойнта мы отдельно минимизируем доступную calibration error выбранным post-hoc методом (ссылка на запись вебинара), а разница в loss начинает лучше отражать именно качество разделения классов. Соответственно, мы выбираем модель с лучшей разделяющей способностью, а не ту, которая случайно оказалась лучше откалибрована на данном этапе обучения.

Проверили на датасетах для computer vision и 196 табличных датасетах — так и оказалось, победа.

Может ли это хотя бы частично объяснять эффекты вроде grokking или double descent?

Там мы тоже наблюдаем нетривиальную динамику loss во времени. Возможно, на ранних этапах обучения модель в основном улучшает калибровку, затем временно жертвует ей ради построения более качественной разделяющей поверхности, а потом начинает улучшать уже обе составляющие одновременно.
#ArticleReview


Репост из: Всеволод Устинов (канал: ai, стартапы, пост-ирония)
Посмотрел выступление Anthropic про то, как они собирают агентов, которые могут работать часами.

Схема такая:

planner → agent → evaluator

Это маленькая продуктовая команда из агентов. У каждого своя роль, свой контекст и своя зона ответственности. Но есть важные нюансы.

1. Planner: верхний план и спринты

Planner получает короткий запрос и превращает его в структуру работы:

— что собираем
— какие большие части нужны
— в какой последовательности идти
— какие спринты должны получиться

Важная деталь: planner не расписывает всю техническую реализацию заранее.

Если в начале придумать подробный план на 200 шагов и ошибиться, ошибка потом поедет каскадом через несколько часов работы.

Поэтому planner держит уровень продукта и спринтов, а технические решения остаются ближе к моменту реализации.

2. Agent: сборка следующего спринта

Agent берёт следующий спринт и собирает фичу.

Но перед началом работы он сначала договаривается с evaluator, что именно будет считаться готовым результатом.

Это главный механизм всей системы.

В обычной агентской работе часто бывает так: дал задачу, агент что-то сделал, сам себя проверил, сказал “готово”, а потом выясняется, что половина сценариев не работает.

Anthropic решает это через contract.

3. Contract: договорённость о готовом результате

Agent пишет: я соберу такую фичу, проверять её надо вот так.

Evaluator отвечает: добавь такой сценарий, такой edge case, такое состояние интерфейса, такую проверку.

Они обмениваются markdown-файлами и уточняют критерии, пока не сходятся на contract.

Contract — это список конкретных проверяемых утверждений.

Дальше evaluator проверяет уже не исходный расплывчатый запрос пользователя, а этот contract.

Например, исходный запрос:

“сделай retro game maker”

А contract превращает его в конкретику:

— можно создать новый проект
— есть sprite editor
— есть play mode
— сохраняется состояние
— canvas работает корректно
— основные сценарии кликаются в браузере

В примере Anthropic для одного приложения получилось 27 contract criteria.

Если критерии расплывчатые, critique тоже будет расплывчатой. Agent получает “ну как-то не очень” и не понимает, что именно чинить.

Если критерии конкретные, он видит точную проблему.

4. Evaluator: жёсткая проверка через браузер

Evaluator — это отдельный агент-критик.

Он открывает приложение через Playwright, кликает по интерфейсу, делает скриншоты, проверяет сценарии, пишет критику и отдаёт её обратно agent.

Отдельного критика проще настроить быть жёстким. У него отдельный контекст, отдельная роль и отдельная инструкция.

Agent собирает.
Evaluator атакует результат.

За счёт этого появляется нормальное давление на качество.

5. Финальный цикл

Итоговый процесс выглядит так:

1. planner разбивает задачу на спринты
2. agent берёт следующий спринт
3. agent и evaluator согласуют contract
4. agent строит
5. evaluator проверяет через браузер
6. agent чинит
7. цикл повторяется

С новыми моделями эту схему можно делать проще. Иногда agent может два часа спокойно собирать продукт, а потом evaluator прогоняет проверку.

Но суть остаётся: качество держится не на “модель умная”, а на архитектуре процесса.

6. Как собрать похожее самому

Нужны понятные примитивы:

— subagents для отдельных ролей
— Playwright / Chrome MCP для проверки интерфейса
— skills / rubrics для критериев качества
— auto mode / permissions для долгой автономной работы
— contract files для договорённости о “готово” до начала реализации



Я сам дошёл до части этих принципов: независимое тестирование, контракт (у меня назвался definition of done, dod). Теперь хочу попробовать воспроизвести целиком.

Видео:
https://youtu.be/mR-WAvEPRwE


Репост из: сладко стянул
Да, этой весной Кевин Баззард прочитал серию из 11 лекций (по математике!) о том, как устроено доказательство Великой теоремы Ферма "по модулю результатов из 80-ых", и в чём эти результаты заключаются. Слайды доступны:
https://github.com/ImperialCollegeLondon/FLT/tree/main/2026_EPSRC_TCC_course


Репост из: Повышение квалификации по математике
#видео

❗️Сергей Дориченко: "Один учитель может в корне переменить ситуацию". Часть 1

Сергей Александрович Дориченко
– учитель 179 школы, главный редактор журнала Квантик, председатель жюри Турнира городов. Поговорили о жизни и работе Сергея Александровича, о том, как он заинтересовался математикой и попал в образование. Обсудили, как можно увидеть математические способности в ребенке, как можно показывать школьникам красоту математики. Вспомнили Николая Николаевича Константинова.


Репост из: Embodied AI Reading Club
🔥Всем привет!

📆Завтра (05.06) в 17:00 Егор Черепанов, Алексей Староверов и Татьяна Земскова разберут архитектуру и методы обучения и инференса модели

RLDX-1

от корейского стартапа RLWRLD и обсудят, почему эту работу уже можно считать заметным вызовым современным VLA-моделям.

⚫️Авторы предлагают VLA-архитектуру для мобильной манипуляции, которая объединяет память на разных уровнях, тактильные сигналы, синтетические данные для редких сценариев и оптимизации инференса для работы в реальном времени.

⚫️Отдельно будет уделено внимание архитектуре MSAT, где разные модальности обрабатываются отдельными потоками и затем связываются через совместное self-attention.

⚫️Также будет разобрано, как эти инженерные и модельные решения переводятся в практический результат: RLDX-1 работает на частоте до 22 Гц на RTX 5090, а в экспериментах на реальном роботе и в симуляции заметно превосходит сильные базовые модели, включая π0.5 и NVIDIA GR00T N1.6. В частности, в задачах для гуманоидного робота ALLEX модель достигает 86.8% успеха против примерно 40% у конкурентов.

⚫️На семинаре обсудим, насколько эти результаты делают RLDX-1 серьёзным конкурентом для Pi0.7 и других SOTA VLA, а также посмотрим, что особенно важно для сообщества: у работы уже доступны код и веса.

Ссылки:
1. Технический репорт
2. Код и веса моделиr

🍿Ссылка на подключение

Подписаться⤵️
Embodied AI Reading Club


Привет!

Завтра в 16:30 на РГ:

@Sp1r1donSunR0tAtor расскажет про современный KV offloading и на каких задачах он отказывается работать https://arxiv.org/abs/2604.08426

@puhsuuu расскажет про OBLIQ-Bench https://arxiv.org/abs/2605.06235 и наконец доскажет про то что Muon -- хороший оптимизатор в мире табличных нейронок https://arxiv.org/abs/2604.15297
(это же предложение, но голосом и с картинками)

@nordllichterrr расскажет про LLM-based рекомендации, почему LLM-реранкеры в условиях холодного старта существенно уступает Popularity
https://arxiv.org/abs/2604.16318v1

zoom: https://yandex.zoom.us/j/97483365363


Уже сегодня


Репост из: Душный NLP
Технический отчёт Step 3.5 Flash — часть 1/2

Step 3.5 Flash [hf] — опенсорсная MoE-модель на 196 миллиардов параметров, из которых 11 миллиардов активные.При таком размере модель демонстрирует конкурентные результаты в сравнении с более крупными опенсорсными и проприетарными моделями. Разберём, как устроена Step 3.5 Flash.

Архитектура

Одна из главных целей, которую ставили перед архитектурой разработчики — создать модель с низкой задержкой (latency) для использования в агентских сценариях. Добиваются этого с помощью гибридного механизма внимания, sparse MoE и Multi Token Prediction (MTP). В каждом MoE-слое — 288 routed-экспертов и один shared-эксперт, при этом для каждого токена активируются восемь routed-экспертов. Модель содержит 45 слоёв. По сравнению с современными открытыми MoE-моделями (DeepSeek-V3.2, Qwen-3.5, GLM-5), здесь больше мелких экспертов, более высокая sparsity и меньшее число слоёв, что снижает вычислительные затраты на один шаг инференса.

Авторы используют схему 3:1 — последовательных слоя внимания используют механизм скользящего окна (sliding-window attention, SWA), а каждый четвёртый — классический (full attention, FA). Есть Grouped Query Attention с восемью KV-головами (GQA-8), что даёт эффективное распределение KV-кэша на стандартных нодах с восемью GPU и тензорный параллелизм на восемь частей. Это ведёт к увеличению утилизации памяти. Attention становится memory-bound, освободившиеся вычислительные ресурсы идут на MTP — speculative drafting и verification.

Изначально метод чередования слоёв (3 SWA на 1 FA) уступал классической FA-архитектуре по качеству на бенчмарках. Авторы смогли исправить эту проблему, увеличив число query-голов с 64 до 96. Вторая модификация — Head-Wise Gated Attention, который в SWA снижает влияние шумовых активаций в случаях, когда релевантный контекст отсутствует внутри локального окна.

В модели используется стандартный Sparse MoE с fine-grained-сегментацией, при которой отдельные подпространства скрытого представления маршрутизируются независимо. Для лучшего распределения токенов по экспертам применяется механизм EP-Group Balanced MoE Routing, который оптимизирует равномерное распределение токенов по экспертам и по GPU.

Используют три MTP-головы. В течение обучения учится только одна, а остальные две — лишь на последней стадии посттрейнинга. Добавляют также position-dependent loss reweighting, чтобы снизить влияние далёких токенов на лосс и не переучиваться на их предсказание.

Нестабильности в обучении

Авторы описывают три фактора нестабильности, с которыми боролись во время претрейна: спайки в лоссе, «мёртвые» эксперты и «взрывы» экспертов. Первые выявили в процессе обучения — обнаружили накопление ошибки сложения при вычислении полярной декомпозиции в оптимизаторе Muon. Смена типа данных с bfloat16 на float16 исправила проблему.

Даже при хорошем роутинге эксперты могут либо перестать учиться, либо генерировать «вредные» активации. Shared-эксперт может «давить» отдельных экспертов, не позволяя им учиться; плохо обученный эксперт способен «игнорироваться» впоследствии; при идеальном роутинге эксперты «соревнуются» даже за неподходящие им токены — всё это приводит к коллапсу отдельных экспертов. Таким образом, статистика роутинга — не показатель здоровья обучения: необходимо отслеживать нормы выходных активаций, весов, динамику изменений, распределение по экспертам. И использовать эти метрики для диагностики и стабилизации обучения.

Существует обратная проблема — «взрывы» активаций. Они происходят, когда эксперт, который обрёл узкую специализацию, даёт высокие активации важным для себя биграммам, особенно частотным. При использовании pre-norm ничто не ограничивает абсолютные значения при добавлении к residual. Если через гейт SwiGLU проходят активации, рост становится ещё сильнее. Muon при обучении может усиливать подобные паттерны, приводя к положительной обратной связи между активациями и обновлениями весов. Для борьбы с этим авторы использовали клиппинг на выходные активации и на веса экспертов.

Разбор подготовил Антон Селиванов

Душный NLP


Репост из: Wild Mathing
Семья, работа, ученики — вот лишь малый список жалких оправданий не заниматься математикой.


Репост из: iMak AI Lab
🔬 К слову, речь идет о нашем ИИ-рисерчере, про который мы рассказывали ранее.

SciForge - это рабочий инструмент, который уже превосходит своих конкурентов и помогает исследователям прийти от размытой идеи к вполне конкретной научной статье за часы, а не недели, как это было раньше.

🔬 Наш сайт
😌 Наш ТГ


Репост из: ИСП РАН
✏️На «Иванниковских чтениях»представили систему, способную автоматизировать полный цикл исследования до написания научной статьи

О разработке рассказал Илья Макаров (AIRI, ИСП РАН, Университет Иннополис) в рамках секции «Управление данными и искусственный интеллект». Сегодня система также обсуждалась на конференции в рамках пленарной дискуссии и проектной сессии «Доменные ИИ-пилоты для развития научных исследований».

Разработка уже продемонстрировала практический результат: с её помощью были подготовлены две научные статьи, опубликованные на ведущих международных конференциях уровня A*.

Создание данной системы демонстрирует фундаментальный сдвиг в исследовательской деятельности под влиянием ИИ: приоритет смещается с формального выполнения публикационных требований на достижение измеримой практической пользы. Роль исследователя трансформируется в определение социально и технологически значимых задач, тогда как инструментальная часть научного цикла будет автоматизирована современными ИИ-решениями,

— отметил Илья Макаров.

💬ИСП РАН в Telegram
💬ИСП РАН в МАКС




Репост из: Истории (не)успеха
Свежая работа по ИИ в математических доказательствах от Google DeepMind (AlphaProof)

Успехи ИИ в решении серьёзных математических задач уже мало кого удивляют, но новая работа Google DeepMind интересна не только результатами, а тем, как именно они были получены.

Исследователи представили AlphaProof Nexus — систему, где LLM перестаёт быть просто генератором текста и начинает работать как полноценный агент внутри среды с обратной связью.

Это важный сдвиг.

Главная проблема обычных LLM — галлюцинации. Для математики это критично: одна ошибка ломает всё доказательство. Но вместо попыток «сделать модель аккуратнее» исследователи изменили сам процесс работы ИИ.

Ключевая идея в том, что модель больше не работает в вакууме. Теперь у неё есть внешняя система проверки, которая может мгновенно подтвердить или опровергнуть каждый шаг рассуждений.

Для этого используется Lean — язык формальных математических доказательств, где каждое утверждение проходит строгую автоматическую верификацию компилятором.

Получается такой цикл:
— модель предлагает следующий шаг доказательства;
— система проверки валидирует его;
— при ошибке агент получает точную обратную связь;
— корректирует стратегию;
— и продолжает поиск решения.

То есть система работает уже не как чат-бот, выдающий ответ за один проход, а как агент, взаимодействующий со средой и постоянно адаптирующий свои действия.

Именно это сейчас становится одним из главных направлений развития ИИ:
не просто “больше нейронных связей”, а появление циклов
генерация → проверка → обратная связь → исправление → новая попытка
.

По сути, модель получает нечто похожее на настоящий исследовательский процесс.

Результаты при этом очень серьёзные:
— решены 9 открытых задач Эрдёша;
— доказаны 44 гипотезы из OEIS;
— найден контрпример к одной из гипотез Бена Грина;
— продвинут 15-летний спор в алгебраической геометрии.

Но, возможно, главный вывод работы даже не в математике.

Похоже, что следующий этап развития ИИ — это не «ещё более умные чат-боты», а системы, которые умеют:
— долго работать над задачей;
— проверять себя;
— использовать внешние инструменты;
— хранить промежуточное состояние;
— и постепенно улучшать собственное решение.

Именно это и называют переходом к агентному ИИ.

📄 Статья:
https://arxiv.org/abs/2605.22763v1?ref=airadar.one

🔗 GitHub с полученными доказательствами:
https://github.com/google-deepmind/alphaproof-nexus-results

#AIAndMath #GoogleDeepMind #AlphaProof


Репост из: Арсе
Во вторник, 2 июня 2026 г. в 18:00 Дмитрий Еремеев, исследователь Yandex Research, выступит с докладом «Prior-Data Fitted Networks для задач машинного обучения на графах», посвящённым проблемам графовых фундаментальных моделей, фреймворку Prior-Data Fitted Networks и своим наработкам в этой области.

Фундаментальные модели произвели революцию в таких областях, как компьютерное зрение и обработка естественного языка. Тем не менее, их применение для других типов данных, в частности графов, остаётся менее изученным. За последний год область Graph Foundation Models (GFMs) получила заметное развитие, во многом благодаря успеху фреймворка Prior-Data Fitted Networks (PFN). В рамках доклада обсудим, с какими проблемами сталкиваются GFMs, что представляет собой фреймворк PFN и как он помогает в создании GFMs. Рассмотрим как общее состояние области, так и наши работы в этом направлении.

Выступление пройдёт в аудитории 503 корпуса D НИУ ВШЭ (Покровский бульвар, д. 11),  с возможностью онлайн-участия в Zoom. Начало состоится в 18:00 по Московскому времени.

📑 Статья «GraphPFN: A Prior-Data Fitted Graph Foundation Model»

💻 Zoom

📌 Анонс на сайте НИУ ВШЭ


Репост из: Machinelearning
🔥 AlphaProof Nexus: формальные доказательства начинают превращаться в инженерный пайплайн

Google DeepMind показали AlphaProof Nexus - систему, которая автономно закрыла 9 открытых задач Эрдёша, часть из которых висела десятилетиями. По оценке авторов, стоимость решения одной задачи составила всего несколько сотен долларов.

Кроме этого, система доказала 44 открытые гипотезы из OEIS, закрыла 15-летний вопрос в алгебраической геометрии и нашла новый алгоритмический параметр в оптимизационной теории, который раньше не был описан людьми.

Модель генерирует идеи и фрагменты доказательств, а Lean проверяет каждый логический шаг через компилятор. Если доказательство некорректно, оно просто не проходит проверку. Не нужен рецензент, который вручную ищет дыру в рассуждении.

Базовый агент, который просто чередует генерацию LLM и обратную связь от компилятора, смог повторить все 9 успешных решений задач Эрдёша. Более сложная версия с эволюционным поиском и reinforcement learning дала заметный выигрыш только на самых тяжёлых случаях.

Чем сильнее становятся foundation models, тем чаще простые циклы «сгенерировал - проверил - исправил» начинают догонять специализированные архитектуры.

Отличие от неформального подхода к математическим доказательствам принципиальное. Модель часто придумывала несуществующие леммы, ссылалась на «известные результаты» и пыталась спрятать сложность задачи в вспомогательное утверждение. В обычном текстовом доказательстве такие ошибки легко пропустить. Lean отсекает их сразу.

Ещё один неожиданный эффект: агент находил неточности в формализациях уже существующих математических утверждений. То есть он работал не только как решатель, но и как диагностический инструмент для самой постановки задачи.

Успехи пока сосредоточены там, где библиотека Lean уже достаточно зрелая: комбинаторика, теория чисел, оптимизация. Задачи, где нужно строить большой пласт новой теории, всё ещё далеко не закрыты. И большинство задач Эрдёша система не решила.


Та же схема подходит для кодигша, спецификаций, верификации протоколов, компиляторов, криптографии.

Формальная проверка отсекает галлюцинации.
Модель может придумать лемму или сослаться на несуществующий результат, но Lean это не пропустит.

https://arxiv.org/html/2605.22763v1

@ai_machinelearning_big_data


Репост из: AI[ex]Time
На неделе у нас был очень классный reading club по статье Coupling without Communication and Drafter-Invariant Speculative Decoding, из которой хочется поделиться одной интересной концепцией.

Но для начала стоит сказать про Gumbel-Max trick – способ семплировать из категориального распределения. Стандартный путь такой – считаем softmax над всем словарём и семплируем сам токен. Обе процедуры могут быть достаточно дорогими. Gumbel-Max делает следующее: к логитам прибавляем шум из распределения Gumbel(0, 1) и просто берём argmax. Математически это эквивалентно семплированию из softmax распределения, но при этом:

- softmax можно не считать вообще
- шум не зависит от логитов, его можно подготовить заранее, пока модель делает forward pass
- из коробки получается top-k семплирование (Stochastic Beams and Where to Find Them)

Теперь про идею Gumbel Coupling и ее применение для спекулятивного декодинга. Идея в том, чтобы использовать один и тот же gumbel шум при семплировании из драфтового и таргетного распределений. В таком случае можно записать корректный алгоритм с оценкой на acceptance rate, который будет просто сравнивать два токена между собой: токен от draft и target моделей. И вот тут получаются две интересные истории:

1. Не нужно материализовывать драфтовые логиты. В классической схеме верификации rejection sampling работает с обоими распределениями p и q одновременно, то есть драфтовые вероятности надо тащить через всю фазу верификации. С Gumbel coupling решение можно принимать, имея на руках только argmax от драфтера.
2. Воспроизводимость генерации. Вот это прям супер прикольно! В стандартной схеме итоговый сэмпл зависит от обоих распределений: меняется драфтер – меняется и то, что итоговая модель насемплит, даже при фиксированном seed. Получается, что чисто техническая оптимизация инференса влияет на то, что выходит из модели. С Gumbel coupling это свойство восстанавливается: при фиксированном seed выход не зависит от того, какой драфтер используется (и используется ли он вообще). Естественно, при условии, что все остальные источники недетерминизма мы победили (Defeating Nondeterminism in LLM Inference).

В презентации есть ещё иллюстрации к самому coupling-у, разбор алгоритма в vLLM и отсылки в сторону Speculative Speculative Decoding.


Репост из: AI[ex]Time

Показано 20 последних публикаций.