Data, Stories and Languages


Channel's geo and language: Russia, Russian
Category: Technologies


Канал о ML/AI, изучении иностранных языков, книгах и жизни.
Контакт с автором https://t.me/Erlemar
Персональный сайт: https://andlukyane.com/
Рекламу не публикую
Забустить канал можно тут: https://t.me/boost/datastorieslanguages

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


​​Book Review: Build a DeepSeek Model (From Scratch)

Мне прислали на ревью очередную книжку, на этот раз от Manning. Идея простая: взять ключевые находки DeepSeek и собрать каждую из них с нуля в уменьшенном виде, так чтобы всё запускалось на ноутбуке.

Порядок такой: KV-кэш и его memory cost (плюс MQA и GQA как стандартные ответы), потом Multi-Head Latent Attention с decoupled RoPE и DeepSeek-MoE, потом multi-token prediction, FP8 и DualPipe, и в конце GRPO и дистилляция. Книга не для новичков: предполагается, что трансформеры вы уже понимаете.

Авторы обычно демонстрируют подходы по шагам. Например, вот так демонстрируется RoPE: сначала добавляют целые числа (ломают эмбеддинги большими значениями), потом бинарные векторы (чинят магнитуду, но дают разрывы), потом синусоиды. И заодно показывают, что бинарное кодирование — это мультичастотный сигнал (младшие биты осциллируют быстро, старшие медленно), а синусоиды просто его непрерывная версия.

Из минусов: эксперименты идут на TinyStories и на маленьком масштабе, так что разница в метриках маленькая. И архитектурная часть заканчивается на V3 и R1, а attention с тех пор ушёл в сторону sparse-стеков.

Amazon
Manning
Code

Мои обзоры:
Personal blog
Medium

#bookreview


​​Talk: breaking into machine learning - мысли по итогам

Я полторы недели назад писал, что делал доклад для пакинстанских студентов.

Участникам выдали электронные сертификаты с подписью оргов и меня. И вот уже который день они пишут в Linkedin посты об этом (приятно)

Что интересно - прям видно бимодальное распределение: почти все пишут буквально один абцаз в стиле "послушал доклад, было норм, всем спасибо". И только 2-4 написали длинные тексты о том, что конкретно им понравилось.

Первые посты я лайкаю, для вторых делаю репост

Так сказать, организовываю RLAF - Reinforcement Learning with Andrey Feedback 😁

#ai #career


​​Cayley puzzles: 666 on claude vs codex

Я уже рассказывал, что занимаюсь решением cayley головоломок. В этот раз я пошёл штурмовать головоломки 555 и 666.

Почему они сложнее предыдущих?
Дело в том, что с каждым увеличением пространства решений и диаметра нам всё сложнее решать задачу. Во-первых, модели у нас двигаются к решению итеративно - каждый дополнительный шаг увеличивает ошибку. Во-вторых, чем длиннее пути, тем сложнее собрать корректные лейблы для путей; плюс random walks чаще будут путаться и/или не достигать дальние точки.

Я начал решать 555 теми же подходами, что и прошлые головоломки - первичная тренировка модели, потом шлифовка и beam search. Трансфомер пришлось отложить - он бы работал слишком медленно. После нескольких дней тренировки на A100 мне удалось получить прилично работающую модель. Она решает головоломки не всегда, но всё-таки стабильно выдаёт хорошие решения. Результат - второе место; на первом месте - участник команды 16-го места с Santa 2015.

Дальше я попробовал сделать тоже самое для 666... и ну не работает оно. Модель учится плохо и головоломки совсем не решает - лейблы собирать тяжело, пути длинные, в общем сложно всё.

От безысходности я решил обратиться к агентам. Взял claude code + opus 5.0 max и codex + 5.6 Sol Extra High. Обоим отправил один и тот же промпт - мол вот головоломка, вот как мы решали подобное раньше, давайте попробуем её решить классическими способами. Потом подбадривал модели, чтобы они её решили.

Клод после пары итераций ответил, что решить невозможно, ваще. Решил 0 головоломок и сдался.
Кодекс подумал, сделал мелкую итерацию и остановился. Я ему поставил goal - достичь скор 180к или меньше (это суммарная длина найденных путей решенных головоломок). Он подумал, запустил процесс... и через почти 7 часов выдал топовое решение. Я попросил его пояснить, но в ответ получил сложное описание процесса решения из 7 этапов.

Я впечатлён.

#ai

1.7k 2 25 10 23



Forward from: Data Sanity Talks Serbia
Photos from Data Sanity London Talks are out.

It's been a pleasure seeing so many familiar faces — and plenty of new ones!

See more photos on our website.

This event was brought to you by:
🚀 Speakers — Maria Matveeva, Yasi Jabbari, Andrey Lukyanenko, Stas Bichenko
🚀 Data Sanity Team — Yaroslav Kopotilov, Nick Knizev, Nikita Severin, Stanislav Petrov, Tamerlan Tabolov, Katya Leonova
🚀 Partners — Sage, Civo Tech Junction

We'll release recordings of the talks soon — stay tuned, and see you next time!


Language learning after 10 years

Сегодня мне пришло уведомление, что кто-то на реддите оставил комментарий к моему сообщению 10-летней давности. Настоящий некропостинг!

Это был июнь 2016 года, за пару месяцев до моего ухода из ERP-консалтинга. На сабреддите по Anki обсуждали кто как использует этот софт для изучения языков.

Тогда я написал, что у меня есть колоды по трём языкам, с вот таким количеством карточек:
- English - 1492
- Spanish - 5397
- Japanese - 5900

Для добавления карточек с испанским языком использовал программу Learning With Text. Японский слова в основном добавлял при чтении visual novels.

Прошло десять лет. Что иронично, вскоре после этого поста мне пришлось прекратить языки лет на 5, поскольку много времени и сил уходило на изучение ML и всего связанного с ним.

Но всё равно есть явный прогресс в языках:
- Английский - твёрдый уровень C2 (я сдавал официальный тест перед переездом в Англию). Карточек особо не добавилось
- Испанский - 12к карточек. Могу болтать с носителями языка из разных стран, читать книги, слушать аудиокниги - так что около C1.
- Немецкий - 13к карточек. Читаю без проблем, аудиокниги тоже могу слушать (например, недавно слушал перевод Властелина Колец). Но говорить сложновато (давно практики не было) и грамматика хромает. Наверное разговорный B1, а по чтению/пониманию - B2. Потихоньку стараюсь закрывать гэпы знаний
- Японский - 9.5к карточек. В японском у меня самый маленький прогресс. Читать книги со словарём могу, в остальном - сложно. Планирую занятья им после шлифовки немецкого.

С инструментами/софтом тоже интересно. Learning With Text довольно устарел и, казалось, вообще помер. Но вот сегодня из любопытства посмотрел - на моё удивление, программа жива и выглядит современно. Но я давно перешёл на readlang для чтения на ноуте и на Kindle в остальное время.

В наше время существует огромное количество ресурсов и инструментов для изучения языков. Вопрос лишь в том, где найти время.

#languages


​​Talk: breaking into machine learning - recording

Пару дне назад я уже писал, что я буду делать доклад для пакистанских студентов.

В общем получилось так, что на него зарегистрировалось 450+ человек, несмотря на то, что это был праздник - день независимости.

Встреча была в google meets, но там лимит в 100 человек, так что все желащие не влезли. В результате делали трансляцию в linkedin, запись можно посмотреть тут https://www.linkedin.com/events/liveaugust147494045235434594306/

Вопросы были в основном про карьеру - как её начинать, что делать в текущей ситуации с засилием AI, как вкатываться в сферу и так далее.

Думаю, скоро напишу блогпост про это, чтобы мысли были не только в записи.

Сам доклад шёл 40 минут, потом я ещё 40 минут отвечал на вопросы.

#career #ai #datascience


​​Чатботы моей молодости

Сегодня пятница, так что немного ностальгии.

Я вспомнил как в 2018 году делал телеграм чат-бота после прохождения какого-то курса. Я 3 недели мучительно писал код на Keras и тренировал модель.

Бот мог выполнять несколько команд и что-то нечленораздельно отвечать на свободные вопросы.

За 8 лет был пройден огромный путь


​​Openai Computer History

"Computer History turns your activity across apps and websites into memories and a timeline that ChatGPT and Codex can reference. You can ask natural questions about recent work, pick up where you left off, understand patterns in how you work, and turn repeated workflows into skills or automations."

https://learn.chatgpt.com/docs/customization/computer-history

#ai


​​Talk: breaking into machine learning

Так уж получилось, что завтра я буду делать доклад для пакистанских студентов о карьере

Формочка для регистрации https://docs.google.com/forms/d/e/1FAIpQLSf2IdKIuZ9o2tDiMq-Fjfe6efKzTj4w43JMOekHrME5fTtCZg/viewform

#career


Forward from: RnD ML Team
🤟 DeepMind SL2T: мультиязычная модель перевода жестового языка в текст

📌 TL;DR
DeepMind представила SL2T — модель перевода жестового языка в текст, которая работает на потребительских устройствах (Pixel 11, Gboard, Live Transcribe). Ключевые особенности: приватность через pose-ландмарки (не сырое видео), обучение на 100K+ часов данных по 50+ жестовым языкам, и прямой перевод landmarks → text без промежуточных глоссов. На бенчмарке FLEURS-ASL модель достигает 70 BLEURT (zero-shot), значительно обгоняя предыдущие SOTA (около 50).

🧠 Зачем?
Большинство систем распознавания жестового языка до сих пор в стадии RnD-исследований: либо они требуют разметку глоссов (искусственных текстовых представлений жестов), либо работали только с одним языком и обрабатывали сырое видео, что по мнению авторов создает риск безопасности (спорный поинт).

Можно ли создать единую модель, которая (1) масштабируется на десятки жестовых языков, (2) работает в реальном времени на устройстве, (3) защищает приватность пользователей и (4) не требует промежуточных аннотаций? Ответ — да.

🗂️ Как устроена SL2T

Пайплайн обработки:
[Камера] → MediaPipe Holistic (on-device) → Pose landmarks (x, y coords) → [Server] → SL2T Model → Text


Ключевые выводы:

1) Мультиязычность улучшает качество на 50+ языках, помогает модели выявлять общие структуры, что улучшает метрики даже на редких языках;
2) Отказ от глоссов: прямой перевод позволяет модели учиться на нелинейных аспектах жестового языка (мимика, пространственные отношения), которые глоссы не передают;
3) Качество растёт с объёмом данных — нет искусственного потолка из-за ограниченного словаря глоссов.

🧪 Ограничения и открытые вопросы

— Покрытие языков: пока только американский ЖЯ в продуктах; остальные 50+ языков — в исследовательской фазе
— Бенчмарки обычно собраны на чистых данных; реальная вариативность (освещение, ракурсы, скорость жестов) могут сильно влиять на качество
— Не-мануальные компоненты: хотя модель теоретически способна их учитывать, но тема не изучена достаточно хорошо
— Культурная адаптация: жестовые языки тесно связаны с культурным контекстом. А как модель адаптируется к региональным вариациям внутри одного языка? Проблема диалектов остается открытой.

🔗Ссылка: Google DeepMind Blog, 2026
#signlanguage

905 0 12 3 15

​​Xgboost - test of time award


Forward from: Kali Novskaya
🌸Релизим Muse Glimmer 30B 🌸

Впервые за долгое время, наконец-то релизим большой командой новую открытую LLM от Meta Superintelligence Labs.
Веса под Apache 2.0!

🌸Что это за модель:
— 30B dense модель, дистиллированная версия Muse Spark для локального инференса на 1 GPU
— юз-кейсы: OpenClaw, MCP, и агентные тулзы
— общие способности (ризонинг, знания, кодинг) тоже на высоком уровне для модели такого размера.
— очень быстрый инференс: 233 токена/сек на 5090 благодаря DFlash spec decoding
— по ключевым способностям — агентные воркфлоу, swe bench, ризонинг — лучше Qwen 3.6 и Gemma 4 31B
— есть мультимодальный инпут (картинки и видео)
— больше 100 языков в претрейне
— контекст 131к токенов
— есть perception encoder (1.8B) в дополнение к модели

Пожалуйста, скачивайте, пользуйтесь, — и ждите тех репорт и доки!
На неделе постараемся выпустить инференс у партнёров и доки по деплою на llama.cpp, ExecuTorch, MLX.

🟣Блогпост https://research.meta.ai/blog/introducing-muse-glimmer-open-agentic-model
🟣 Веса https://huggingface.co/meta-models/Muse-Glimmer-30B
🟣Доки: (пока что такие же как у Muse Spark) https://dev.meta.ai/docs/cookbook


​​Генерация картинок в 2019

Я сейчас что-то вспомнил соревнование 2019 года на Kaggle по генерации изображений собак. Нашёл там тредик, где люди выкладывали, что у них получилось

https://www.kaggle.com/competitions/generative-dog-images/discussion/97753

Выглядит жутковато. Прошло каких-то 7 лет, и теперь нередко сгенерированные изображения фиг отличишь от реальных.

#ai


О локальном инференсе LLM

Регулярно встречаю блогпосты и призывы инференсить LLM на локальном железе.

Но это всегда имеет ограничения. Одни предлагают квантизировать модели в 1b, другие хитро стримить, третьи советуют брать модели поменьше.
Но квантизация заметно ухудшает качество. Мелкие модели тоже похуже

А "хитрый стриминг"...

Вот увидел я пост на медиуме: "Unbelievable! Run Kimi K3–2.8 Trillion Parameters — on a Single 4GB GPU". Думаю - не верю.
Открываю... "This is not fast. Roughly five minutes per token." - не юзабельно

#llm #ai

48k 5 172 12 25

​​Kaggle: Rogii

https://www.kaggle.com/competitions/rogii-wellbore-geology-prediction/leaderboard

В последние месяцы я впервые за несколько лет серьёзно участвовал в соревновании на каггле. Это было геодезическое соревнование. В итоге мы оказались в серебре и избежали шейкап. Моё соло решение тоже тянуло на серебро, но лишь на ~200 место.

Блогпост с деталями напишу позже, а пока вот красивые картинки от клода. Кстати, я не написал ни одной строчки кода - всё участие было через клод/кодекс.

Теперь буду отдыхать и зарекаюсь участвовать в каггле ещё на несколько лет 😅

#kaggle #ai


​​CayleyPy: Professor Tetraminx puzzle

Месяц назад я рассказывал как участвовал в ресерч соревнованиях Cayley. С тех пор я поучаствовал в ещё одном соревновании - Professor Tetraminx.

Напоминаю, что суть задачи - из рандомного состояния головоломки (после N поворотов) дойти в исходное за минимальное количество шагов.

Поскольку это по факту групповой ресерч, не были цели собрать топ-решения самостоятельно - мы хотели вместе сделать топ решение.

Я начал тогда, когда лучшее доступное решение было 28863 и улучшил его до 28467, получив новый лучший результат и обойдя мирового эксперта Tomas!

Блогпост с деталями напишу позже, но пока расскажу, что нового было сделано по сравнению с моим прошлым подходом:
- Как известно, решить такую головоломку брутфорсом нельзя. Но вполне можно с помощью BFS подсчитать все состояния после 6-9 шагов. Так что теперь мой подход не пытается дойти до финального состояния, а просто до состояния, которое находится на расстоянии 6-7 до финального. Это довольно важно, ибо иногда поиск останавливается лишь в нескольких шагах от успеха - и этот подход спасает такие кейсы
- Sparse Q - новая голова для нейронки (по предложению Vlad Kuznetsov), которая даёт скор сразу для всех возможных переходов из текущего состояния - это сильно ускоряет обчение и инференс
- многократное расширение датасета с разными подходами по сбору данных
- PieceTransformer в качестве модели и его бленд с обычным ResMLP
- V-consistency - хитрый подход для улучшения beam search. Простыми словами: если одна голова модели говорит, что мы в 10 шагах от цели, а другая голова говорит, что после одного шага мы будем в 15 шагах - это неправильно; а если головы выдают 10 и 9 - значит мы движемся в правильном направлении

Теперь продолжу участвовать в других соревнованиях этой серии и всем рекомендую :)

#kaggle #datascience


​​Kimi K3: Open Frontier Intelligence

Последний год открытые фронтир-модели сходились примерно к одному классу размеров (около 1T) и конкурировали на эффективности: test-time compute, дешёвый длинный контекст, agentic RL. Moonshot пошли в другую сторону: Kimi K3 — это MoE на 2.8T параметров (104B активных), с native vision и контекстом в 1M токенов. По заявлению авторов, первая открытая модель 3T-класса.

Архитектура собрана вокруг масштабирования "information flow" по трём осям.

- По длине последовательности — гибридное внимание: три слоя Kimi Delta Attention (linear attention с delta rule и channel-wise forget gates, фиксированный state вместо растущего KV-кэша) на один слой глобального Gated MLA. Позиционного кодирования нет вообще (NoPE) — позиция возникает из decay-гейтов KDA, поэтому расширение до 1M токенов обходится без RoPE-хаков.
- По глубине — Attention Residuals: вместо одного накопленного residual stream каждый слой формирует learned pseudo-query и через softmax выбирает, что читать из выходов предыдущих слоёв.
- По ширине — Stable LatentMoE: 896 экспертов, 16 активных на токен, роутинг в латентном пространстве вдвое меньшей размерности, а стабильность при такой sparsity держится на RMSNorm, ограниченной активации SiTU-GLU и Quantile Balancing. Всё вместе даёт примерно 2.5x scaling efficiency относительно K2.

Post-training тоже нетривиальный: после SFT авторы обучают 9 экспертных политик (3 домена на 3 уровня reasoning effort) в agentic-окружениях, а потом сливают их в одну модель через Multi-Teacher On-Policy Distillation — студент генерирует свои rollouts и получает per-token reward от подходящего учителя. Quantization-aware training с MXFP4-весами экспертов идёт с этапа SFT, так что деплой видит ту же арифметику, что и обучение.

В целом модель уступает Claude Fable 5 и GPT-5.6 Sol. Разрыв виден на research-level reasoning и knowledge-work лидербордах. Но круту то, что linear-attention гибрид без позиционного кодирования работает на фронтир-масштабе.

Paper
Code
Project

Мои обзоры:
Personal blog
Medium
Linkedin

#paperreview


​​В пятницу вечером - о насущных обсуждениях


​​Kimi K3 attention

https://arxiv.org/abs/2607.24653

Недавно вышла статья от Kimi K3. Я планирую написать на неё обзор на следующей неделе, но пока я заинтересовался механизмом attention, описанном в ней.

Kimi использует Kimi Delta Attention и Attention Residuals, которые появились ещё в Kimi Linear. По факту всё это продвинутые варианты linear/hybrid attention.

Я потихоньку веду свои ML заметки в Obsidian, на основе этой инфы обновил заметку про Attention

#ai #datascience

20 last posts shown.