Samally ML / AI / LLM Notes


Гео и язык канала: Россия, Русский
Категория: Технологии


Just saved notes on ML/AI, a garbage can 🗑

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: эйай ньюз
MAI-Image-2.5-Pro

Майкрософт ворвался в лидеры на t2i арене со своей Pro версией модели.

Чаржат за генерацию по токенам:
• $5 per 1M text input tokens,
• $8 per 1M image input tokens
• $106 per 1M image output tokens

Выходит ~$108.5 за тысячу 1024x1024 картинок. Что дает нам понять, что одна 1024x1024 картинка это примерно 1024 токенов (32x32), то есть у них используется автоэнкодер с 16x сжатием по кадой стороне.

Для сравнения MAI-Image-2.5 чтоит $48 за 1к картинок, а Image-2.5-Flash $20.

Черипики от арены меня не очень впечатлили - кмк разница с GPT-Image-2 минимальная. Что по сути говорит о том, что арена все менее имеет какой-то вес, т.к. там тестируют модель обычные рандомы из интернета на абсолютно любых промптах вроде "нарисуй собаку, сделай красиво". Среди топ-10 моделей различия можно найти только с специфичных кейсах, а в среднем модели очень близки друг к другу по качеству.

У Microsoft кстати еще неделю назад вышла MAI-Image-2.6-Preview - трудно понять, в чем различие с 2.5-Pro, но к 2.6, и тестили ее только на другой арене (arena.ai), где она уступает GPT-Image-2.

Но в любом случае респект парням из команды MAI (ex Meta GenAI team 💪), что так внезапно ворвались в топ по генерации картинок, ведь Microsoft особо SOTA моделей не выдавал до этого момента вообще.

>> Потыкать модели можно в их плейграунде (абсолютно убогом)

@ai_newz


#image


Репост из: эйай ньюз
Открытая MoE-видеомодель MAGI-2 Preview от Sand.ai

Разработчики из Sand.ai выложили в открытый доступ веса и код инференса MAGI-2 Preview. Модель построена на single-stream архитектуре и генерирует 10-секундные ролики сразу вместе с синхронной аудиодорожкой.

Внутри применили редкий для таких моделей fine-grained MoE. При суммарном объеме в 114B параметров на каждый токен активируется всего 6B. По объему вычислений на шаг это в разы легче плотного MiniMax H3 (33B), благодаря чему стоимость инференса упала в ~10 раз, а модель заскочила на 6 место в лидерборде Artificial Analysis.

Сам пайплайн генерации двухстадийный. Сначала базовая модель генерирует видео в низком разрешении, а затем refiner апскейлит результат до 1080p.

Пока это не конкурент MiniMax H3 в плане локальной доступности. Квантованный H3 влезает в одну карту на 24GB (RTX 3090/4090), тогда как для MAGI-2 нужно заметно больше ресурсов. Зато у облачных провайдеров за счет всего 6B активных параметров инференс по API будет значительно дешевле dense моделей, да и у такой архитектуры хороший потенциал для скейлинга.

Техрепорт
Код
Веса

@ai_newz


#video


Репост из: Борис опять
Музыка
MiniMax: открытые веса Music 3

Открытый генератор музыки длительностью до пяти минут. На выходе 32 кГц, 16-битное стерео.
Модель принимает отдельно текст песни и подробное описание музыки, включая жанр, BPM, вокал, инструменты и развитие аранжировки. Полная версия помещается примерно в 24 ГБ VRAM, с выгрузкой слоев ее можно запустить даже на 8 ГБ. В общем, локальный Suno.
Веса, Демо

Suno: Studio 2.0 и монетизация кнопки Download
Тем временем сам у самого Suno Suno Studio идет к тому чтобы стать AI First FL Studio. Появились импорт, запись и редактирование MIDI, встроенный wavetable-синтезатор, эффекты, автоматизация, улучшенное разделение на стемы и чат. Через чат можно генерировать инструменты, звуки и даже собственные плагины.
Доступно только подписчикам Premier.
Одновременно Suno объявила, что с 3 сентября вводит лимиты на скачивания: 7 файлов за все время на Free, 20 в месяц на Pro и 60 на Premier. Дополнительные скачивания будут продаваться отдельно. При этом экспорт из Studio для Premier остается безлимитным. Очевидно, массовый слоп вреден, пока не экспортируется через более дорогой интерфейс.
Studio 2.0, Новые лимиты

Pika: Pika Audio
Pika внезапно стала еще и аудиокомпанией. Pika Music генерирует песни по описанию и тексту, умеет использовать референсный трек и образец голоса, а также делать cover исходного аудио. Длительность от 10 секунд до 6 минут, цена $0.015 за минуту.
Вместе с ней выпустили Pika SFX для звуковых эффектов за $0.0002/сек, Pika Speech для TTS и клонирования голоса за $0.01/мин и Pika Soundtrack, который озвучивает готовое видео синхронно с происходящим за $0.005/сек. Все доступно через API. Видимо после видео Pika решила заодно стать Suno, ElevenLabs и саунд-дизайнером.
Pika Audio, Pika Music

Видео
Sand AI: MAGI-2 Preview
Новый видеогенератор! Большая MoE-модель для совместной генерации видео и звука: 114B параметров, из которых активируется 6B. Принимает текст или текст с первым кадром, генерирует десятисекундный ролик со звуком
Дистиллированную версию с меньшим числом шагов обещают позже.
GitHub, Веса

Lightricks: LTX-2.5
LTX-2.5 заменил 2.3 в качестве рекомендуемой открытой аудиовидеомодели Lightricks. Это по-прежнему 22B, но теперь с дообученным Gemma 4 12B в роли текстового энкодера,и автоматическим выбором длительности ролика.
Есть полная Dev-версия и дистиллированная, которая работает за 8 шагов на первом этапе и 4 на втором. Поддерживаются синхронная генерация видео и звука, keyframes, перегенерация отдельных фрагментов. Занимает 66 ГБ.
GitHub, Веса


#audio #music #video


Репост из: Борис опять
Исследователи рексиса из Т-Технологий выступили на ACM KDD 2026 (A*, Южная Корея, 9–13 августа) с техрепортом о T-ECD — одном из крупнейших в мире обезличенных датасетов пользовательских взаимодействий. В открытый доступ его выложили ещё прошлой осенью. Скачать можно с Huggingface: https://huggingface.co/datasets/t-tech/T-ECD 

С полей конференции команда разослала датасет руководителям академпрограмм и профессорам крупнейших ИТ-вузов России. Так же сделали гайд по работе с ним с идеями исследовательских задач: https://github.com/kliakhnovich/tecd-quickstart 

Рексис в целом очень закрытая сфера в которую непросто вкатиться. В этом году я прослушал 5+ одинаковых дипломов про рекомендательные системы как член приемной комиссии. Поэтому я радуюсь, что у студентов появится возможность взять этот датасет в курсовые, дипломы и лабы и сделать что-то поинтереснее: модельки теперь можно учить не на синтетике и не на MovieLens десятилетней давности, а на данных, приближенных к реальному бизнесу. 

Датасет огромный — 135 млрд взаимодействий, поэтому есть и small-версия. В гайде расписаны сценарии от "GPU вообще не нужны" до 8×H100, так что студенты без карточек тоже в деле.


#recommendation #recsys


Репост из: Пресидский залив
умеют ли ллм слушать аудиодорожки? 🎧

я, конечно, не просто распознавание речи в текст, но и про то как разбирать интонации и разные акустические события

С видео все давно понятно - почти любая модель режет его на кадры с требуемой частотой кадров и разбирает как картинки. Со звуком - большинство агентов запускают скил на распознавание речи, но есть и исключения, где анализ более объемный


классический пайплайн выглядит так: перевести в текст - ллм анализирует вход и выдает текст - текст генерируется в речь, то есть модель получает расшифровку, а не звук, так работает например voice mode у клода. Быстро и дешево, но по дороге теряется тон, ирония, эмоции, кто говорит, неречевые события 😳


Впрочем есть и нативные аудио-модели, у которых звук подается прямо в контекст как токены, наравне с текстом. Технически это делается двумя способами: либо аудио-энкодер переводит сырой звук или спектрограмму в эмбеддинги, либо нейрокодек сжимает звук в дискретные токены - и во втором случае модель умеет не только слушать, но и говорить сама, без стороннего синтеза речи. Проще говоря, для одних ллмок для работы со звуком нужны внешние тулы (будь то простое распознавание речи или комплексный анализ эмоций и тональностей), а другие при обучении видели не только картинки и текст, но и аудио (а точнее все вместе), а это значит, что умеют с ним работать 🤑

вот пара примеров таких моделей:

• Gemini - самый универсальный вариант, разбирает музыку и не-речевые звуки (жанр, эмоция трека, шумы на фоне), различает спикеров, понимает таймстемпы. Правда, пока не настолько хорошо, чтобы стабильно разобрать любой трек на аккорды

• OpenAI - в июле выкатили апдейт, где модель слушает и говорит одновременно, поддакивает «mhmm» и перебивается как живой человек и умеет понимать простые речевые события и интонации

• Qwen3-Omni - лучший опенсорс по результатам замеров на бенчмарках - анализ музыки по стилю и ритму, 19 языков. И единственная модель, которую я все еще не попробовала в контексте музыки и звука 🤨


Предполагаю, что это активно используется в ai кол-центрах (например анализ эмоций клиента), вся работа с генерацией музыки, разметка звуковых событий, и из менее очевидного что мне запомнилось - мониторинг различных инструментов на предмет поломок на заводе (например станков) или даже подсчет птиц в лесу.


"Зачем я прочитал этот пост, если я не работаю в аудио стартапе" - могли подумать вы 😑 Мое личное предположение - использовать для поиска и генерации трендовой музыки в маркетинге, как сейчас многие уже делают с видео креативами. Ну и просто потому что 7 лет моего опыта в аудио процессинге никуда не делись и мне все равно интересно поглядывать, что там происходит 🐵

@neural_prosecco


#omni #audio


Репост из: Глеб Кудрявцев про AI
Ну что господа, релиз бесплатной OCR в браузере!

https://sotaocr.com/ru/free-ocr

Требует подгрузки модели, зато полностью локально, и ничего не нужно ставить на комп.

Производительность — всего на 25% медленнее оффлайн оригинала.

Важно — штука требует определенного железа для запуска и проверена только на макбуках. Теоретический минимум для запуска — в районе 4gb видеопамяти

На самом деле мне очень нужен испытатель, у кого есть машина с виндой и какой-то хотя бы младшенькой видеокартой, с кем мы можем это настроить для работы в windows. Пишите, если готовы быть тестером 🙂


#ocr #paddle #webgpu


Репост из: эйай ньюз
Видео недоступно для предпросмотра
Смотреть в Telegram
Clean Plate IC-LoRA для LTX-2.3

Редко выходят модели для серьезного прода и постобработки. И вот Lightricks выкатили ин-контекст модель Clean Plate для своей 22B видеомодели LTX-2.3. Нейросеть удаляет из видео людей, пешеходов и транспорт, автоматически восстанавливая чистый задний план за ними.

Все работает в режиме video-to-video LoRA и интегрируется в стандартные воркфлоу ComfyUI. Не хватает только готового плагина для Premier или DaVinci.

Веса

@ai_newz


#video


Репост из: Вайб-кодинг
Видео недоступно для предпросмотра
Смотреть в Telegram
Методы квантования LLM, которые я бы изучил, если бы мне нужно было запустить модель 70B на одной GPU:

Модель 70B в FP16 требует около 140 ГБ только под веса. В 4-битном формате этот объём уменьшается до 35 ГБ, что уже помещается на одну видеокарту.

Но простое округление значений не работает для больших моделей. Примерно 0,1% скрытых размерностей содержат значения, которые могут быть до 20 раз больше, чем остальные значения в тензоре, и они ломают квантовочную сетку для всех остальных параметров.

Каждый из этих 5 методов решает проблему выбросов на разном этапе:

1. RTN (Round-To-Nearest)
Игнорирует проблему.
Каждый вес просто округляется до ближайшего уровня квантования без использования калибровочных данных.
Самый дешёвый вариант, но самый слабый при низкой разрядности.

2. GPTQ
Исправляет последствия округления.
Квантует слой за слоем, столбец за столбцом, и после каждого шага корректирует оставшиеся веса, чтобы компенсировать возникшую ошибку, прежде чем перейти дальше.

3. AWQ (Activation-aware Weight Quantization)
Защищает важные веса до округления.
Находит примерно 1% каналов весов, которые оказывают наибольшее влияние, и масштабирует их так, чтобы они лучше переживали квантование.
При этом итоговая модель всё равно полностью работает в обычном INT4.

4. LLM.int8()
Изолирует выбросы во время инференса.
Размерности с выбросами выполняются в FP16, а остальные 99,9% параметров работают в INT8. Затем результаты объединяются.

5. QAT (Quantization-Aware Training)
Решает проблему ещё во время обучения.
Модель дообучается с учётом квантования: округление встроено в каждый forward pass, поэтому модель заранее адаптируется к возникающим потерям до фактического применения квантования.

Все пять методов создают один и тот же результат — модель, работающую с меньшей точностью представления по сравнению с исходной обученной версией.

Разница только в том, на каком этапе решается проблема выбросов.
Визуализация ниже хорошо суммирует эти подходы.

Есть отличная статья с подробным исследованием методов квантования LLM:

https://arxiv.org/abs/2411.02530


#quantization #local #inference #serving


Репост из: Пресидский залив
да кто такой этот ваш LTV/ CAC > 3?? 🤔

в прошлом посте мы порассуждали про топ воронки - а именно метрики в ads manager и из чего складывается покупочный CPA. Но CPA это только "сколько стоило привести", дальше начинается самое недооцененное - что происходит ПОСЛЕ пейвола, потому что именно там живет ретеншен, а из него складывается ваш LTV. Кейсы лютого скама где вся экономика живет только на топе фунела мы тут не обсуждаем 😅

немного цифр - в 2026м году больше половины новых подписочных приложений зарабатывают в год меньше $1000, в то время как топ-10% забирают почти всю выручку категории - и этот разрыв за пару лет только вырос. Так что LTV/CAC > 3 в 2026 это не норма, а скорее привилегия, которой мало кто может похвастаться, в то время как большинство не выходит даже в единицу, то есть просто сжигают деньги в надежде когда-нибудь окупиться продлениями

давайте шаг за шагом спускаться вглубь воронки после пейвола. Я буду приводить рекомендации из индустрии и того, что мы сами пробовали, но это не отменяет факта, что конкретно для вас все может быть иначе - экспериментировать нужно в любом случае

1. первая сессия - активация 💃
цель: чтобы человек не заскучал, понял, какую проблему решает приложение

Многие советуют ставить пейвол после того как вы показали ключевое велью и аха-момент, но на мой взгляд надо экспериментировать, как и с хард/софт пейволом. Например у нас главный когортный предиктор (наиболее важный признак попадания в хорошую когорту) отменит ли человек или продолжить платить и пользоваться - 15+ загруженных вещей и примерка на себя хотя бы одного образа, поэтому мы делаем так, чтобы онбординг и первая сессия подталкивали человека именно к такому поведению. Половина всех отмен происходит в первый день, часто это те, кто взял самую дешевую подписку и отменил, то есть поведение "я просто попробовать"

2. первая неделя - привычка 🤝
цель: сделать так, чтобы человек вернулся в приложение

тут формируется (или нет) личинка привычки. Если человек вернулся во 2-ю, 3-ю сессию и снова получил ценность - скорее всего останется еще на какое-то время, но если не открыл апп после оплаты - почти точно вы его уже потеряли, просто он еще не отменил. И здесь мы смотрим на частоту повторных сессий в первую неделю, добивать можно пушами, имейлами, стриками. Отмен всегда много на седьмой день (повторное списание у недельных)

3. продление и возврат 😎
цель: добиться регулярности сессий

те, кто отменил годовую - почти не возвращается (в то время как недельные и месячные реактивируются в ~4 раза чаще, но и там немного) зато кто пережил 2–3 продления, становятся кандидатами в суперюзеров - а ретеншен растет с каждым циклом. Получается, что задача подвести человека к осознанному второму и третьему продлению. Конечно, будут и те, кто просто забывает отменить и будет платить годами - но я бы на это сильно не надеялась 😭

что я делаю, чтобы растить наш ретеншен:
1) смотрю, кто дошел до велью момента в первой сессии и что такое велью момент и как подвести других к такой сессии
2) разбираюсь, сколько раз те кто продолжает платить и пользоваться вернулись в первую неделю и какие действия способствуют возвращению
3) стараюсь чаще тестировать пейвол, подсвечивать на нем те фичи и результаты, которые влияют на ретеншен
4) в креативах показываю результат, а не фичи - но исходя из тех велью, которые видят для себя наши супер юзеры, с некоторыми я общаюсь еженедельно

первая сессия решает вопрос активации, первая неделя - зачатка привычки, а продления влияют на LTV. Я думаю, что ключ к ретеншену - экспериментировать, изучать сессии ваших супер юзеров, а еще лучше - познакомиться и разговаривать с ними и стараться делать так, чтобы флоу в приложении подводил людей к нужным действиям для того, чтобы они тоже стали супер юзерами


@neural_prosecco


#ad #ads #cac


Репост из: Machinelearning
📌 Как дотянуть компактную модель до уровня гигантов посттрейном

AI-подразделение китайского производителя электромобилей Lixiang опубликовало интересную работу о том, как они оптимизацией насыщали компактную модель доменными знаниями.

Mach-Mind-4-Flash - итоговая MoE-модель на 35 млрд общих 3 млрд активных параметров на базе Qwen3.5-35B-A3B.


Проблема, от которой Li Auto отталкивались, состоит в том, что если учить одну модель с подкреплением сразу на смеси наград (математика, код, агентные задачи), то появляются качели - подтянули одно, просело другое.

Решение - разделить этапы и области знаний. Сначала независимо обучили более десятка RL-экспертов, каждого в своём домене: математика, код, текст, безопасность, поиск, работа с инструментами. Каждый эксперт получил свои данные, свои проверяемые награды и свою стратегию обучения.

Дальше самое интересное - как собрать экспертов обратно в одну модель. Для этого использовали методику MOPD, которую взяли у Xiaomi.

Это мультиучительская дистилляция на собственных генерациях ученика, где каждый обучающий пример по ключу маршрутизации уходит к "своему" замороженному эксперту, и тот через reverse-KL на уровне токенов подтягивает распределение ученика к своему.


Агентные навыки эксперты осваивали в исполняемых песочницах - там модель читает файлы, правит код, запускает тесты, видит ошибки и продолжает с их учётом.

Масштаб сред - более 190 предметных областей с сохранением состояния, свыше 3,5 тыс. интерфейсов инструментов, траектории программных задач до 300 шагов при контексте 256 тыс. токенов.

🟡Работает ли слияние? И да и нет.

Следование инструкциям сохранилось целиком, а на агентных бенчах ClawBench и ClawEval итоговая модель даже обошла отдельных экспертов.

Но на SWE-bench Verified результат просел с 73,80 у эксперта до 71,10 у модели.

Предполагают, что узкоспециализированное поведение в длинных задачах кодинга при дистилляции смазывается.


Финальный штрих - HMPO, собственная механика Li Auto, которая следит, чтобы модель не увлекалась в цепочках рассуждений.

Бюджет длины CoT берётся из медианы правильных ответов в группе, награду получают только верные и при этом более короткие решения, а награда собирается умножением (короткий, но неверный ответ получает строгий 0, что закрывает лазейку для взлома награды).


На выходе HMPO получается сокращение длины генерации на 19–46% при потере точности не более 0,7%, причём обучение шло только на математике, а эффект перенёсся на код и другие задачи. Правда пока это работает только для одношаговых рассуждений, к многоходовым агентным траекториям его ещё предстоит адаптировать.

🟡Итоги

92,7 на AIME'26 - тут отстает от триллионной Kimi-K2.5 меньше чем на пункт;

82,8 на IFBench - первое место с большим отрывом, ближайший конкурент Qwen3.5-122B;

75,8 на BFCL-v4 - второе место после MiMo-V2-Flash, при этом лучше чем Qwen3.5-122B и Kimi-K2.5.

Можно сказать, что результаты на уровне куда более крупных моделей. К сожалению, планы по публикации модели неизвестны, но возможно мы просто почувствуем её в следующих поколениях электромобилей Lixiang.


🟡Arxiv


@ai_machinelearning_big_data

#AI #ML #LLM #Optimisation #RL #LiAuto


#rl #mopd #rlhf #finetune #Qwen #local

Показано 20 последних публикаций.