EdTech, AI и HighLoad | Блог AK из Школково


Гео и язык канала: Россия, Русский
Категория: Блоги


CEO ZeroAgency, руководитель разработки онлайн-платформы Школково.
Пишу про IT, AI и HighLoad разработку.
Личный блог: @daily_ak
YT: youtube.com/@segfault_11
Контакт для связи: @bethrezen

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Блоги
Статистика
Фильтр публикаций


Кстати, Qwen3.8-27B не просто хороший релиз, но и показатель, куда движется опенсорс.
Это не только хороший качественный RL и post-training.
Лично для меня самое знаковое, это что в 3.8 появился официальный reasoning_effort={low, medium, xhigh}, причём с xhigh default.
Также по сравнению с Qwen3.6-27B, где output рекомендовали выставлять в 32768 tok для обычных задач и 81920 для сложных - в 3.8 уже прямо говорят про 262144 ток.
Т.е. фокус на агентов не просто с контролем "а сколько думать", но и действительно чтобы они выдавали как можно больше полезного контента.

Конечно же, старые добрые chat_template_kwargs с enable_thinking и preserve_thinking из чат-шаблона не выкинули, так что не забывайте про эти параметры тоже.

Ну и сразу вангую, что одним из следующих небольших направлений развития будет не просто привычное сжатие контекста, а сжатие того самого ризонинга на предыдущих шагах - либо просто как обычный compact, либо более хитрые схемы с эмбеддингами/memory/прочими трюками. Кмк, это логичное развитие в сторону решения cost/gpu проблем.


Qwen выпустили Qwen3.8-27B — и это неожиданно большой скачок относительно Qwen3.6-27B 🚀

Это всё ещё dense-модель на 27B параметров, но прирост особенно заметен не на классических knowledge-бенчмарках, а на реальных coding-, agentic- и multimodal-задачах.

Несколько примеров Qwen3.8-27B → против Qwen3.6-27B:
Terminal Bench 2.1: 63.4 → 73.0
SWE-bench Pro: 53.5 → 61.7
DeepSWE 1.1: 13.3 → 42.2 — более чем ×3
QwenSWEBench: 49.3 → 79.0
Agents' Last Exam Pass@1: 10.6 → 20.4
HLE: 24.0 → 30.8
LiveCodeBench v6: 83.9 → 90.3

Но самый интересный скачок, кажется, произошёл в мультимодальных агентах:
OSWorld: 63.9 → 84.3
WebArena: 48.8 → 64.8
RecreationBench: 29.8 → 47.1
SWE-MM: 25.7 → 38.6
Vision2Web: 45.0 → 62.9
BabyVision: 28.9 → 65.7

Причём на некоторых тестах локальная open-weight 27B уже оказывается на уровне или выше гораздо более крупных закрытых моделей из сравнительной таблицы самого Qwen.
По архитектуре всё как и у qwen3.6-27b - это 64 слоя, d_model=5120, гибрид Gated DeltaNet + Gated Attention, FFN 17,408, multi-step MTP и нативный контекст 262K с возможностью расширения до 1M.

Что особенно интересно: на GPQA прирост всего 87.8 → 89.2, зато на длинных агентских задачах местами +50–200%. Похоже, основной прогресс поколения 3.8 — уже не просто «модель стала немного умнее», а существенно лучше научилась долго планировать, пользоваться окружением, писать и исправлять код и доводить сложные задачи до конца.
На картинках ниже собрал все опубликованные Qwen метрики, сравнил с Qwen3.6-27B и, где возможно, с Qwen3.6-35B-A3B, плюс добавил Qwen3.7-Plus, Muse Glimmer-30B и Opus4.6 Max.
Очень мощный релиз для 27B.

Вот мы и определились, на базе чего будем тюнить мультимодалки ^_^
Для скорости пока что всё ещё юзаем Qwen3.6-35B-A3B, а для качественных задач новый фаворит!

🤗 Веса на HF: bf16 | fp8 | gguf

На openrouter пока что нет, но уже появилось в API на NeuralDeep.ru


Почему мне так смешно... 😂


🤖 AI-бот сделал ревью кода.
GitLab прислал письмо об этом.
Gemini в gmail сделал AI Overview.
...
What's next?

PS: ревью кажется тупорылым, потому что это тестовое ревью на тестовом репозитории, так что всё норм на самом деле - это просто PoC


Навайбкодил тут давно статус-лайн с контекстом, затратами, лимитами и прочим.
Работает на Claude Code и Codex.

Кому надо - берите, форкайте/юзайте https://github.com/bethrezen/status-line


Я научил собаку вайбкодить. А чего добился ты?

998 0 14 6 51

🔥 Бомбическое преимущество Vision LLM для простых рутинных задач

Предыстория
В прошлом году я уже занимался оцифровкой разбалловки результатов учеников для разработки модели предсказания баллов и рекомендательной системы.
Тогда я тоже запилил простой интерфейс и ручками вбивал все эти данные, потому что по-нормальному и быстро автоматизировать это тогда не удалось, а датасет для трейна нужен был срочно.
Из данных я тогда выкинул те, где дети не указали свой тестовый балл в отдельном поле. Ну и понятное дело, очень много результатов, где 10 шакалов из 10, оцифровать не удалось.

Наши дни
Наколеночное решение из поста выше помогло добавить примерно ещё треть к датасету. Это результаты, где не проставлен был балл или разбалловка трудно читалась из-за качества картинки(см. скрин, да-да, в таком качестве прислали результаты...).

+34% к объёму трейн данных - это на самом деле очень ощутимо и круто!

Да, есть риск, что нейронка криво распознала цифры на изображении. Но этот риск снимается прогоном предыдущей модели предсказания баллов по этому юзеру. Если распознавание Vision совпадает с предсказанием модели - значит всё распознано верно и историю этого пользователя можно спокойно добавлять в датасет обучения новой модельки.

Такие дела ^_^

866 0 1 10 31

Простое и очевидное решение на коленке, которое сберегло мои нервы.

Дано: тысячи результатов экзаменов учащихся в виде картинок
Задача: оцифровать разбалловку и провалидировать данные

Основная проблема в том, что дети присылают скриншоты результатов максимально странным образом. Плюс есть ещё куча разных сайтов, где эти результаты в разных форматах отображаются.

Это в этом году мы додумались просить детей забивать эти данные самим в форме. А в прошлые года вот что-то не догадались... Ну ничего, сейчас бы с ллмкой быстро всё оцифруем как надо.

Решение: прогоняем через LLM с Vision. В результате большая часть данных нуждается только в быстрой проверке и нажатии на Enter.


🖤 Zero Fest, он же "Ноль фест" в Тамбове 1 августа.

Раньше был "Рок над Студенцом", но по определенным причинам он не смог продолжиться в прежнем формате. Поэтому я решил вписаться в этот движ со своей компанией и помочь ребятам. Ну и теперь это "Ноль фест".

В этом году будут не только местные артисты, но и гости из Санкт-Петербурга.
DenDerty, которые выступали у нас на корпоративе в прошлом году, Молодость Внутри и Вася Васин из группы "Кирпичи".

Для нашего города это уникальное мероприятие, которое всем советую обязательно посетить!

Билеты по ссылке: vk.cc/cYe5vi


🎮 Самый неоднозначный девайс NVIDIA

Брал я тут в марте 7шт. DGX Spark.
Очень хотелось попробовать этот девайс давно - ещё со старта хотел его купить. Но появляться по вменяемым ценам они начали только сейчас.

NVIDIA обещала крутую производительность в FP4.

Но что мы имеем по факту?
1. Очень медленную unified memory LPDDR5x.
2. Коробки очень горячие и уходят в троттлинг. Temperature cap стоит где-то на 70C.
3. DGX Spark инференсит Qwen3.6-35B-A3B в NVFP4 со спекулятивным декодингом DFlash со скоростью 100-200 tok/s. на оптимизированном VLLM с кастомными ядрами под GB10.

Соответственно ШЕСТЬ DGX Spark в реальности у меня дают 700-1500 tok/s.
Для сравнения - ОДИН GPU RTX Pro 6000 Blackwell Workstation даёт 1000-1200 tok/s.
Нагрузка 1-в-1 одинаковая.

Простая математика
RTX Pro 6000 Blackwell стоит примерно 1-1.1M руб.
DGX Spark стоит ~500к руб.

6x DGX Spark = 3M руб. и это в лучшем случае 1500 tok/s, но 768GB памяти на скорости 273 GB/s.
Рабочая станция с 2x RTX Pro 6000 Blackwell - те же 3M руб.(дада, можно и дешевле) и 2200 tok/s, а это всего лишь 192GB VRAM на скорости 1792 GB/s.

И это я ещё не говорю про то, как в реальности работают все эти кольца из 200Gbit/s линков между тремя спарками. Спойлер: плохо.

Выводы
DGX Spark проигрывают примерно везде и по всем фронтам. Обещания NVIDIA - пустой маркетинг.
Коробки вообще никому не рекомендую даже для экспериментов, даже с QLoRa. Для трейна не годится. Для инференса - тоже.
Лучше за те же деньги собрать ПК с игровой видеокартой.

Единственное годное применение - тихий локальный AI-ассистент для дома. Вот только вопрос - сколько он прослужит с такими рабочими температурами.


На самом деле никакой нейронки нет 😂

892 0 3 17 40

Вот мы и выкатили бесплатную ИИ-проверку сочинений ЕГЭ по русскому языку для участников Щелчка.

Некоторые функции мы специально пока что скрыли, чтобы не перегружать детей перед экзаменами. Но вообще моделька очень интересно рассуждает - этими ризонингами можно зачитываться до бесконечности.

Если есть какие-нибудь вопросы - задавайте в комментариях. На что-то отвечу сразу, что-то приберегу для стрима и отвечу там.

Ура! Работаем дальше 💪

На очереди ИИ-бот для выпускников 📱


Репост из: Таня Коваль. ЕГЭ по русскому языку
БУДУЩЕЕ НАСТАЛО! ИИ ПРОВЕРИТ ТЕБЕ БЕСПЛАТНО СОЧИНЕНИЯ ПЕРЕД ЕГЭ!

Твои работы будет оценивать искусственный интеллект, обученный на проверках реальных экспертов с реального ЕГЭ. Уровень строгости будет соответствовать экзамену: без перегибов и без чрезмерной лояльности. При проверке ты получишь итоговый балл и разбалловку по всем критериям, тоже как на экзамене. Также в работе будут отмечены те места, на которые ИИ обратил внимание при проверке. Но это не значит, что он обязательно снял балл в этом месте 📒

🚩 Как и в реальной проверке, возможны небольшие расхождения и неточности — эксперты на экзамене тоже не могут оценивать работы одинаково. В этом смысле ИИ также ведёт себя очень похоже на живого проверяющего

Эта проверка поможет тебе увидеть свой текущий уровень и понять, на что стоит обратить внимание 💫

Это бонус Щелчка. Но не забывайте: если у тебя есть платный курс, то ты можешь сдавать сочинения на экспертную проверку экспертам-людям на платформе (сейчас есть 3 пробника) 🔥

ГДЕ НАЙТИ БЕСПЛАТНУЮ ПРОВЕРКУ ОТ ИИ?

Открываем меню БОБРа и выбираем «Проверка сочинений»

❕❕ Обратите внимание: пока тебе доступно 4 проверки перед ЕГЭ. Этого достаточно, чтобы проверить себя перед экзаменом. Можно сдавать в печатном виде по 1 сочинению в день.


Наконец-то! Найдены ответы на самые главные вопросы!


А блин, я в тесте ошибся. Ладно, так тоже норм


Этот простой бенчмарк не прошёл даже ChatGPT 5.5 Pro (не, в принципе то и понятно почему)

Нашёл прикольный тест для токенизатора и детектора зацикливаний генераций LLM 😃


//TODO: Придумай тут шутку-мем про то, что потенциал NVIDIA B300 до конца не раскрыт и не известен или когда 8xH200 уже не хватает


💪 Обучаешь модель - обучаешься сам

Побочный эффект от обучения LLM проверке сочинений по русскому языку - я сам подтягиваю знания.
Сидишь такой, проверяешь датасеты и смотришь, что там моделька выдаёт.
Сначала считаешь, что это галлюцинация или "притягивание за уши". А потом раз - и внезапно понимаешь, что всю жизнь писал не правильно.

В русском языке много интересных случаев.
Но самое интересное в том, что многие из них не так просто даже загуглить.

Я собирал большой датасет с правилами русского языка. Источников было много.
Но, как оказалось, у источников есть свой "срок годности".
Та же gramota.ru иногда на один и тот же вопрос в разное время давала разные ответы.

Что в таких случаях делать? Как понять, где наш великий и могучий изменился? Где правильно?

Первая инженерная мысль - majority vote. В каких источниках чаще - там и правда. Но это не работает, поскольку язык меняется со временем.
Есть реформа языка 1956 года, есть словари 1935-1940 годов, есть несколько изданий того же Лопатина и Розенталя. А есть ещё современные правила русского языка.

Правильный же подход - ранжировать источники по актуальности и достоверности. Вариант в самом свежем и достоверном источнике считаем правильным.

Ну т.е. условная gramota.ru неплоха, но если Рособрнадзор двумя годами позднее написал - считаем его приоритетным источником.

Вот такие интересные наблюдения из вселенной этих ваших искусственных интеллектов и реального мира.

Не Розенталем единым😎


😎 Отрадно, когда проекты, которые мы разрабатываем, получают такие награды



Показано 20 последних публикаций.