DS/ML lentagram


Гео и язык канала: Россия, Русский
Категория: Технологии


Лучшие посты со всех каналов
По предложениям писать @kirillisupov

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Information Retriever
Введение в рексистемы.

Сегодня прочитал студентам первого курса ПМИ ФКН ВШЭ вводную лекцию по рекомендательным системам.

Раньше никогда не делал такие вводные лекции — обычно ограничивался парой слайдов в начале каждого доклада в духе "есть множество пользователей, множество айтемов, информационная перегрузка, хотим рекомендации".

Здесь же выпала возможность максимально подробно рассказать, зачем нужны рекомендательные системы, а также показать пару простых, интуитивно понятных рекомендательных алгоритмов.

Так как лекция была для первокурсников, в ней было больше картинок и меньше математики :)

Прикладываю в посте пару слайдов, сама презентация — в комментариях.


Репост из: Data Secrets
RL не улучшает навыки ризонинга модели

Тренд на негативные статьи о том, что "что-то не работает или работает не так, как мы думали", остается с нами. В этот раз хайпует китайская работа под названием "Does Reinforcement Learning Really Incentivize Reasoning Capacity in LLMs Beyond the Base Model?".

Мы все привыкли к тому, что в целом ризонинг – это про RL*. Но в этой статье показано, что на самом деле ничего сверхъестественного RL не вносит, а просто переупаковывает то, что уже было в распределении базовой модели.

Как это проверяли?

Основная метрика – pass@k: задача считается решенной, если среди k попыток модели (сэмплов) есть хотя бы одна правильная. Для авторской гипотезы метрика как раз очень подходит, потому что отражает именно потенциал модели решать задачу при разумном числе попыток.

И вот что получается. При малых k RLVR-модели действительно чаще попадают в правильный ответ (то есть у них выше pass@1), но при росте k базовые модели догоняют и превосходят RLVR практически на всех наборах задач и семейств моделей.

Это значит, что эти методы не расширяют границы решаемости задач (в том числе математических и кодовых), они просто повышают эффективность семплирования уже существующих траекторий aka вероятность сразу пойти по нужному пути, и поэтому работают. Плохо ли это? Нет. Но означает, что и слишком больших надежд на RLVR возлагать не стоит: все равно все опять упирается в претрен.

* Дисклеймер: в статье речь именно про RLVR, то есть Reinforcement Learning with Verifiable Rewards. RLHF, например, сюда не относится, но вот куча других популярных алгосов, типа PPO/GRPO/Reinforce++ и тд – да.


Репост из: Love. Death. Transformers.
Ну давайте мужики оправдайтесь почему она а не вы

https://t.me/enjicITmagic/5326


Репост из: Denis Sexy IT 🤖
Тоже посмотрел новый сериал «Pluribus» и тоже пребываю в восторге – это тот же самый режиссёр, который снимал «Breaking Bad» и «Better Call Saul» но в Sci-Fi жанре

Сериал особенно понравился потому что это какой-то новый взгляд на постапокалипсис, чего, честно говоря, давно не было – давно уже не появлялось новых вселенных в этом бесконечном мире зомби, где был бы и смысл и интересна сама вселенная

А ещё, сериал актуален на фоне AGI-страшилок

Короче, если ещё не смотрели, рекомендую, вышло пока только две серии, третья выходит в эту пятницу:
https://www.imdb.com/title/tt22202452/

P.S. Слово «pluribus» происходит из латыни и буквально означает «многие» или «из многих». Часто встречается в известной латинской фразе «E pluribus unum» - «Из многих - единое»


Репост из: Data Secrets
Российские исследователи нашли способ обучать LLM логическим рассуждениям быстрее и дешевле

Исследователи из T-Bank AI Research совместно с Центральным университетом представили новый метод, который позволяет развивать способность к логическим рассуждениям у больших языковых моделей без дорогостоящего полного переобучения. Исследование станет хорошим подспорьем для дальнейшего изучения интерпретируемости ИИ.

Вместо того чтобы менять миллиарды параметров, они добавили небольшие подсказки-векторы, которые усиливают логические шаги модели в нужном направлении. Такой подход сохраняет все преимущества большой модели, но требует значительно меньше вычислительных ресурсов.

Эффективность метода протестили на шести бенчмарках по математическому рассуждению: при изменении всего 0.0016% параметров сохраняется 100% качество полного дообучения. Потребление памяти сокращается с гигабайтов до сотен килобайт.

Метод уже затестили на LLM Qwen и LLaMA. Потенциально он сможет встраиваться в существующие пайплайны, например, чат-боты, системы проверки кода или аналитические платформы. Поэтому даже университетские лаборатории и небольшие компании смогут обучать reasoning-модели. Метод представили на одной из ведущих международных конференций в области ИИ по эмпирическим методам обработки естественного языка (EMNLP 2025) уровня А* в Китае.


Репост из: Machinelearning
✔️ Google выпустил новый 50-страничный документ о том, как создавать AI-агентов, которые реально работают в практических задачах

Это понятное и структурированное введение в основы агентных систем.

В гайде рассматриваются:
- архитектура агента и его основные компоненты
- роль LLM как «мозга» агента
- подключение и использование инструментов
- оркестрация нескольких агентов
- подходы к деплою и продакшн-интеграции
- метрики и способы оценки работы
- как создаются самообучающиеся и эволюционирующие агенты
- пример архитектуры AlphaEvolve

📌 Гайд: https://drive.google.com/file/d/1C-HvqgxM7dj4G2kCQLnuMXi1fTpXRdpx/view

@ai_machinelearning_big_data


#AI #Agents #Google #LLM #MachineLearning #AIResearch


Репост из: Data jobs — вакансии по data science, анализу данных, аналитике, искусственному интеллекту
Data Dojo | Москва | 27 ноября

Это мероприятие Яндекса для сообщества ML-специалистов с обсуждением трендов, прикладных кейсов и разбором реальных задач из соревнований.


Зачем участвовать:
💬 послушать выступления экспертов
💬 разобрать задачи вместе с сообществом
💬 узнать, как попасть на стажировку и начать карьеру ML’щика в Яндексе
💬 завести новые знакомства и зажечь на afterparty

👉 Заполняй форму до 16 ноября.

Data-самураи действуют поодиночке, но учатся вместе. Присоединяйся.


Репост из: Data Science 🛸 & ML Jobs за рубежом
#ml
Senior LLM-Engineer / HighSky
Remote
Salary: 8000$ - 15000$

Мы - динамично развивающийся стартап, решающий различные задачи AI в соревновательном формате: генерация текста, аудио и видео, обогащение данных, предиктивная аналитика. Мы осуществляем полный цикл работы над продуктом: от анализа бизнес-задачи до вывода в продакшен полноценного решения

Находимся в поиске эксперта по обучению LLM.

Требования к кандидату:
- Опыт обучения LLM (fine-tuning / pre-training) от 2 лет
- Опыт применения различных методов обучения LLM
- Опыт с различными pre-trained моделями
- Опыт работы с экосистемой huggingface: transformers, datasets, peft, trl
- Хорошее понимание теоретической базы: NLP, transformers, LLM.
- Понимание всех циклов предобучения и файнтюнинга RL, classic ML
- Опыт коммерческой разработки с нуля

Читать подробнее:
→ Откликнуться тут

Для связи и отправки резюме:
TG: @dybovanya


Репост из: Data Science Jobs
#vacancy #job
Вакансия: Big Data / ETL Engineer
Формат работы: Удаленный
Вилка: до 450 т.р на руки

Что мы предлагаем:
• Предлагаем оформление Контракт с UAE-компанией или самозанятость;
• Испытательный срок — до 2х месяцев (можно закрыть быстрее);
• Оплата в USDT, BTC, ETH или как тебе удобно;
• График работы гибкий;
• Удаленный формат работы из любой точки мира;

Задачи:
• Разрабатывать и оптимизировать ETL-пайплайны для обработки больших объемов данных (ClickHouse, Kafka, Airflow, Python);
• Настраивать и поддерживать стабильную работу потоков данных между системами и сервисами;
• Оптимизировать производительность хранилищ и запросов, устранять узкие места инфраструктуры;
• Проектировать и внедрять алгоритмы детекции аномалий и анализа данных;
• Следить за качеством данных: валидация, дедупликация, контроль целостности;

Чего мы ожидаем:
• ClickHouse (шардинг, репликация, агрегирующие движки, партиции, TTL, оптимизация);
• Опыт работы с бигдатой (ТБ+, миллиарды строк);
• Python (pandas/numpy) + создание и поддержка ETL/ELT-пайплайнов;
• Оркестрация данных: Apache Airflow (DAG, Sensors, Operators, XCom);
• Опыт применения на практике алгоритмов для отслеживания выбросов: статистические (z-score, iqr, q-test), машинное обучение без учителя (DBSCAN / HDBSCAN, Isolation Forest);
• Интеграция с потоковыми/сырьевыми данными: Kafka или аналог, ingestion → трансформация → загрузка;
• Работа с ончейн-данными: события блокчейна, calldata, трейсы, Web3 API;
• Архитектурная дисциплина: понимание схем данных, partitioning, latency/throughput, мониторинг и качество данных;
• Контейнеризация, CI/CD, автоматизация развертываний.

Будет плюсом:
• Rust (или готовность изучать);
• Kafka / Prefect / Arrow / Parquet;
• Опыт продакшена с ончейн-аналитикой или трейдинг-данными;
• DDD / CQRS / event-sourcing — если интересуешься архитектурой;
• Активный GitHub / pet-проекты в data-инженерии.
По любым вопросам @ValeriyaStynke


Репост из: Data Secrets
Плохая новость: сейчас больше статей в Интернете пишется ИИ, чем людьми

По графику видно, что разрыв пока небольшой, но увеличивается 👽

Аналитику нашли вот тут. Сейчас немножко расскажем о том, как это считали.

1. Взяли популярный CommonCrawl и случайно выбрали 65к страниц со статьями, написанными с 2020 по 2025 год.

2. Статьи делили на чанки и закидывали в Surfer AI Detector. Если более половины текста в статье классифицировалось как AI-made, то статья определялась как написанная ИИ, иначе – как написанная людьми.

2.1. Еще делали проверку на false-positives по датам (например, понятно, что до появления ChatGPT большинство статей должны класссифицироваться как человеческие).

Впервые доля ИИ-статей превысила человеческие в ноябре 2024, потом был короткий период надежды, и теперь ИИ снова доминирует.

Из хорошего: ИИ-статья в данном случае – это не обязательно прям от и до, возможно было какое-то ленивое редактирование человеком ( + это все еще с поправкой на точность детектора).

А еще авторы говорят, что пока таких статей довольно мало в топах поисковых выдач, что тоже не может не радовать.


Репост из: Data Science 🛸 & ML Jobs за рубежом
#ml
Machine Learning Engineer (AI) / Waibee
Remote
Salary: 5000€

Waibee is an international technology company headquartered in Prague, Czech Republic, building high-load digital products in AI and e-commerce. We develop next-gen solutions powered by LLMs, intellig

Требования к кандидату:
- 3+ years building ML/AI products in production
- Strong in Python and/or TypeScript (Node.js)
- Hands-on with LLMs, transformers, NLP workflows
- Experience with SQL/NoSQL, CI/CD, Docker
- Engineering mindset — ownership, structure
- Strong communication and product-first thinking
- Knowledge of PyTorch, TensorFlow, or JAX
- Understanding of ML theory and classical methods

Читать подробнее:
→ Откликнуться тут

Для связи и отправки резюме:
TG: @Olga_STsoy


Репост из: Machinelearning
🔎 Upscale-LoRA мощный инструмент для восстановления изображений

Модель создана на базе Qwen-Image-Edit-2509 и предназначена для улучшения качества старых или низкокачественных фотографий.

Поддерживает: улучшение резкости, удаление шума, восстановление деталей и очистку JPEG-артефактов.

Подходит для архивных снимков, скринов и любых изображений с низким разрешением.

https://huggingface.co/vafipas663/Qwen-Edit-2509-Upscale-LoRA

@ai_machinelearning_big_data

#Upscaler


Репост из: ML for Value / Ваня Максимов
➡️ Навигация по каналу v3

На связи Ваня Максимов @Ivan_maksimov - AI & Analytics Head в Яндекс.Маркете, 10+ лет в DS

Сложилось сразу 2 фактора: канал дорос до 5.5К подписчиков и наступило аж 400 дней на новом месте работы -- пора сделать апдейт про канал и меня

Чем я занимаюсь?
Магия дискавери: помогаю найти неочевидные и полезные товары в Я.Маркете.
На фотках к посту 3 неочевидных товара, которые я нашел в своих же рекомендациях

Кстати, "магия дискавери" - реальное название одной команды в я.картах!

Поформальнее, руковожу командами AI для персонализации и продуктовыми аналитиками:
60% - рексис: DL + классика + аналитика
20% - поиск и crm: персональное ранжирование + аналитика
15% - content intelligence с LLM, скажем так
5% - реклама

До этого из области RecSys построил с нуля все рекомендации в Delivery Club, внедрил R&D в Wildberries
А еще активно зарабатывал деньги для компаний классическим ML: оптимизация цен и промо-акций, автоматический заказ товаров на склады, планирование смен курьеров. Ну и конечно А/В тестировал все это дело! Довелось даже построить 2 платформы А/В: в Delivery Club и Лавке

На канале пишу о том, как преодолеть путь от ML модели до реального Value для бизнеса. И какие грабли я собрал на этом пути за 10 лет


👍 Самые залайканные / обсуждаемые посты с хэштегами
- Как впихнуть все интересы пользователя в один экран приложения? Новинки в DL RecSys: ARGUS-1B #recsys
- Серия про оптимизацию цен на товары #pricing
- Прогноз спроса и метрики регрессии: от RMSE до WAPE. Сколько товаров заказать на склад? #timeseries
- 13 способов ускорить АВ тест или “не CUPED-ом единым” #ab
- 70% фейлят ML system design собеседование #hiring #system_design
- Что тебя ждет при переходе team lead —> head of ML #career


💡Написать мне: @Ivan_maksimov
Можно позвать меня рассказать что-то интересное на конференции или в вашей компании, обсудить занятную ml-задачу, или проконсультироваться на счет ml-проекта


Репост из: Data Secrets
Видео недоступно для предпросмотра
Смотреть в Telegram
Сэм Альтман в интервью: «Думаю, все корпоративные приложения можно заменить на общую платформу на основе ИИ»

«В Slack много всего хорошего, но иногда он создает кучу фейковой работы. Думаю, что вместо этого можно создать что-то новое: что-то вроде офисного пакета на основе ИИ, который заменит docs, slides, email, Slack и тд.

Это будет что-то на основе агентов, которые выполняют основную часть работу и эскалируют ее человеку, только когда это действительно необходимо»


Маск отреагировал на новость простым лаконичным: «А я говорил, что они собираются напрямую конкурировать с Microsoft».

Напоминаем, что некоторое время назад миллиардер призывал Microsoft перестать работать с OpenAI, предупреждая компанию, что иначе стартап «съест ее заживо» ☕️


Репост из: Denis Sexy IT 🤖
Видео недоступно для предпросмотра
Смотреть в Telegram
Ну и раз у нас воскресенье AI-слопа…

Показано 15 последних публикаций.

9

подписчиков
Статистика канала