📮 Как разогнать LLM на Hopper, собрать Discovery как у VK, кормить GeoAI городскими графами и прокачать не только SQL, но и логику? Подборка новинок из ML-каналов: от Qwen3-ASR и автобэкапов до теста на готовность к автоматизации витрин.
📆
Data Science – сводка за 29 январяTencent разогнала инференс LLM на Hopper новой библиотекой HPC-Ops⚙️ Канал “Machinelearning” рассказывает, что HPC-Ops приносит оптимизированные CUDA-ядра внимания, квантованные операции и инструменты для распределённых запусков, давая заметный прирост скорости на Hopper по сравнению с текущими стеками. Библиотека уже дружит с vLLM и SGLang (SM90), распространяется под MIT и обещает в будущем разреженное внимание и 4-битное квантование.
VK AI собрала рекомендации, поиск и рекламу в одну Discovery-платформу🚀 По данным канала “Data Secrets”, общая инфраструктура для моделей и данных ускорила тесты идей в пять раз и позволила выкатывать новые рекомендательные системы за месяц. На метриках это видно сразу: сохранение треков в “VK Музыке” выросло на 40%, а релевантность роликов в “VK Видео” — на 70%.
City2Graph превращает геоданные в удобные графы для GeoAI и GNN🌍 Канал “Библиотека дата-сайентиста” описывает Python-библиотеку, которая стыкует GeoPandas, NetworkX и PyTorch Geometric, чтобы city- и транспортные данные сразу подавать в графовые нейросети. Это снижает боль с подготовкой пространственных данных и ускоряет эксперименты с графовыми моделями на уровне городов.
Учёные научили модели трафика дообучаться без ручной разметки предпочтений🛣️ Как пишет “Yandex For Ml”, исследователи из Калифорнийского университета используют экспертные демонстрации: модель генерирует траектории, сравнивает их с эталоном и доучивается по парам «лучше/хуже». Для оценки отличий они применяют optimal transport на фичах, так что система сама подстраивается под стиль вождения и динамику движения.
Вышли промышленные open-source ASR-модели Qwen3-ASR и ForcedAligner на десятках языков🎙️ Канал “Анализ данных” сообщает, что Qwen3-ASR распознаёт речь на 52 языках, а ForcedAligner точно совмещает текст и аудио на 11, причём обе модели поддерживают потоковую обработку. Код и веса доступны под Apache 2.0, так что их можно спокойно встраивать в продакшен-сервисы распознавания и разметки речи.
Один простой Python-скрипт спасает ваши данные регулярными бэкапами💾 В “Математика Дата Саентиста” показали минималистичный пример на shutil, который автоматически копирует каталог в отдельную папку с меткой времени. Такой скрипт удобно запускать перед опасными экспериментами с кодом или данными, чтобы всегда можно было откатиться к нужной версии.
Новая система прокачки аналитического мышления проверяет не только SQL, но и логику🧠 Канал “Клуб Анонимных Аналитиков” описывает подход из четырёх блоков: структура рассуждений, аналитическая позиция, корректная причинность и интерпретация данных. Автор даёт демо-тест и обратную связь, делая акцент на развитии метанавыков для BI и продуктовых аналитиков, а не просто на технике.
Короткий тест на 10 вопросов проверит, готовы ли вы к автоматизации витрин данных📊 В “Data Study” предлагают пройти проверку по SQL, Airflow, Git и облакам и сразу получить разбор каждого ответа. Такой формат позволяет быстро понять, где пробелы в работе с аналитическими витринами, и получить конкретные рекомендации, что подтянуть.
🤖 svodka.ai – ИИ читает каналы, вы читаете главное
💌 Кому из ваших знакомых эти новости тоже будут полезны? Перешлите им почитать
Data Science. Подписаться на ежедневную svodka.ai