Postlar filtri


Учимся на практике: решаем реальные ML-задачки

Это рубрика #петпроект_MLinside и тут мы публикуем задачи из реальных (ну или почти реальных) проектов, чтобы лучше запомнить теорию. Плюс, упоминание об этом можно включить в портфолио, что определенно поможет вам на собеседованиях.

Шестнадцатая задача

Что нужно сделать:

На основе исторических данных о космических миссиях с 1957 года посчитать статистики запусков по каждой площадке: количество запусков, стоимость, успешность миссий и другие показатели.

Как можно сделать:
▪️Определить компанию и страну с лучшими показателями успешности миссий;
▪️Определить время года с лучшей статистикой по успешным запускам;
▪️Определить какой космодром самый неудачный (наибольший процент неудач, наибольшая стоимость ракет которые потерпели неудачу).

Данные можно взять на Kaggle

Пример ноутбука (с случайными пропусками строк)

Готовы попробовать? Делитесь своими результатами в комментариях. А другие посты этой рубрики можно посмотреть по тэгу: #петпроект_MLinside


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Как построить карьеру в ML – и не потерять интерес к технической работе?

В новом подкасте Виктор Кантор разговаривает с Кириллом Малковым — Chief Data Scientist Россельхозбанка. За свою карьеру Кирилл успел поработать в Сбере, Билайне, Росбанке и МТС, а в 21 год стал Chief Data Scientist и вошёл в лонг-лист Forbes «30 до 30».

Поговорили о карьерном росте Кирилла – от Data Scientist до руководителя крупных команд – и о том, почему с ростом ответственности его всё сильнее тянет обратно к инженерной работе. А ещё обсудили, как ML приносит бизнесу сотни миллионов рублей, зачем компаниям GenAI, можно ли обойтись без машинного обучения и какую роль в карьерном успехе играет везение.

Кирилл также стал одним из авторов специализации MLinside по AI и анализу данных и подготовил для неё модуль по Deep Learning.

Полный выпуск уже на канале – смотрите подкаст и делитесь впечатлениями в комментариях.

Смотреть в ВК
Смотреть в Дзен


ML Kata: разбираем главные вопросы

75 минут на задачу по ML System Design, случайная команда и незнакомый контекст. Такой формат закономерно вызывает вопросы у тех, кто участвует в таком формате впервые. Давайте разбираться:

▪️На кого рассчитана ML Kata?

Самое главное – ML Kata, это не экзамен для экспертов, которые знают всё наизусть. Для участия не нужно заранее готовиться именно к той задаче, которая вам достанется. И не обязательно перечитывать всю литературу по System Design.

Главное – уметь разобраться в задаче и применить свои знания на практике.

▪️А если я не работал с этим доменом?

Это нормально. Более того, именно работа с незнакомым контекстом – одна из полезных частей ML Kata. В работе легко оказаться в пузыре собственного опыта: если вы долго решаете похожие задачи, знакомые подходы начинают казаться универсальными.

На ML Kata сначала придётся разобраться в условиях задачи, а уже потом выбрать подход. Это возможность проверить, насколько вы умеете думать за пределами привычного контекста.

▪️Команду нужно собирать заранее?

Нет. Команды формируются на самой ML Kata. Вы окажетесь рядом с людьми с разным опытом и бэкграундом. Придётся быстро договориться о подходе, распределить роли и вместе собрать решение.

▪️А если в команде будут люди с разным уровнем опыта?

Это нормально и именно поэтому команды формируются случайно. У одного участника сильнее ML, у другого – архитектура, у третьего – декомпозиция, у четвёртого – коммуникация и презентация.

Задача команды – объединить эти компетенции в одно решение. Поэтому разный опыт участников становится частью тренировки, а не помехой.

▪️А если мы не успеем решить задачу за 75 минут?

Ограничение по времени – часть формата. За 75 минут важно определить главное, расставить приоритеты и понять, на каких компромиссах можно остановиться.

В незнакомой задаче легко начать искать знакомый ответ: «У *подставьте любую бигтех компанию* делают так – значит, и нам подойдёт». Но ML System Design не сводится к воспроизведению известных паттернов. Важно понять требования и ограничения именно этого кейса.

▪️Что я получу от участия?

ML Kata даёт возможность выйти за пределы привычного контекста и проверить, как вы принимаете решения, когда готового ответа перед вами нет.

А ещё – получить реальный опыт командной работы: вместе разобраться в задаче, договориться о подходе и защитить своё решение.

ML Kata — это возможность проверить, насколько хорошо вы умеете построить решение, когда готового ответа нет.

Следующая ML Kata уже скоро.

Бронируйте место и проверьте себя на практике вместе с Валерием Бабушкиным


Andrew Ng назвал 4 навыка, которые нужны AI-инженеру

14 августа Andrew Ng опубликовал в X свою AI Engineering Skills Map – карту навыков AI Engineering. Вместе с командой он проанализировал более 10 000 вакансий, провёл десятки интервью с AI-экспертами, hiring managers и рекрутерами, изучил данные опросов и другие источники, чтобы определить навыки, которые будут наиболее важны для разработчиков не только сегодня, но и в ближайшем будущем.

Andrew Ng – один из самых известных специалистов в области машинного обучения. Он преподаватель Стэнфорда, основатель Google Brain и DeepLearning.AI, сооснователь Coursera и бывший руководитель AI-направления Baidu. Его онлайн-курс по машинному обучению стал одним из первых массовых образовательных продуктов в этой области и помог сделать ML доступным для миллионов людей.

Мы перевели и собрали основные идеи его статьи:

Карта навыков AI Engineering

1. Создание и развёртывание AI-приложений

Главное отличие AI-приложений от традиционного ПО – непредсказуемость результатов. Когда мы отправляем запрос LLM, заранее неизвестно, какой ответ получим. То же самое касается моделей глубокого обучения: мы не знаем точно, какое предсказание модель сделает на новых данных.

Поэтому AI-инженеру недостаточно знать, как использовать LLM, RAG, context engineering или agentic workflows. Нужно уметь измерять, направлять и контролировать поведение AI-систем.

Ключевой навык здесь – выстраивать дисциплинированные циклы evals и error analysis, которые позволяют находить ошибки и постепенно улучшать систему.

2. Фундаментальные знания Software Engineering

AI-агенты не отменяют software engineering – наоборот, делают его ещё важнее.

Разработка ПО всегда связана с компромиссами между стоимостью, масштабируемостью, надёжностью, скоростью, безопасностью и приватностью. Понимание фундаментальных принципов помогает увидеть эти компромиссы и принимать более качественные решения при выборе стека, проектировании архитектуры, хранилищ данных и тестировании.

Andrew Ng отдельно отмечает проблему vibe coding: если разработчик не понимает основ software engineering, он не сможет эффективно направлять coding agent и оценивать решения, которые тот предлагает.

Чем лучше вы понимаете software engineering, тем точнее можете управлять AI-агентами.

3. Использование coding agents

Эффективная работа с coding agents становится ключевым навыком для каждого разработчика.

Важно понимать, как работают агенты, знать их ограничения и уметь выбирать, где дать им автономность, а где необходимо вмешаться.

Для этого нужно уметь управлять контекстом агента, находить баланс между планированием и выполнением, использовать verifiers и evals, работать с чёткими спецификациями и при необходимости координировать нескольких агентов.

При этом важно постоянно экспериментировать с новыми инструментами: agentic coding развивается настолько быстро, что лучшие практики регулярно меняются.

4. Определение того, что создавать

Если coding agent получает чёткую спецификацию, он всё лучше справляется с её реализацией. Поэтому роль инженера постепенно смещается от вопроса «как это реализовать?» к вопросу «что именно нужно создавать?»

Здесь на первый план выходят продуктовое мышление, понимание бизнес-контекста и целей клиентов.

AI даёт инженерам больше самостоятельности: можно самому находить проблемы и возможности, быстро создавать MVP и проверять идеи на пользователях. Но важно понимать, когда стоит двигаться быстро, а когда — остановиться и потратить больше времени на качественную реализацию.
Что объединяет все четыре навыка?

Постоянное обучение
AI продолжает быстро меняться, поэтому разработчикам приходится постоянно осваивать новые инструменты, подходы и best practices. Именно поэтому Andrew Ng считает, что AI Engineering – это не отдельная узкая специализация, а набор навыков, которые постепенно понадобятся всем разработчикам: от full-stack и data engineers до DevOps, ML и AI-инженеров.

А какой из этих навыков вы считаете самым важным сегодня?

804 2 31 1 12

База ML или Специализация: какой путь в ML подойдет именно вам?

В ML можно двигаться по разным траекториям – и в MLinside мы как раз предлагаем два формата обучения: «База ML» и специализацию «Искусственный интеллект и анализ данных». Они частично пересекаются по темам, но рассчитаны на разные цели, уровень подготовки и формат обучения. Поэтому сегодня разберёмся, чем они отличаются и какой вариант подойдет именно вам.

Сайт курса База ML
Сайт Специализации "Искусственный интеллект и анализ данных"


Почему одни ML-инженеры быстро растут, а другие годами стоят на месте?

Не всегда дело в знаниях, алгоритмах или количестве пройденных курсов.

У сильных инженеров есть рабочие привычки, которые со стороны могут казаться незначительными. Например, они не спешат писать код, умеют задавать «неудобные» вопросы и сначала ищут самый дешёвый способ проверить свою идею.

Именно об этом наше новое видео, рекомендуем посмотреть, если еще не видели:
Смотреть на YouTube: https://youtu.be/JAM51tM4H-g
Смотреть в ВК: https://vkvideo.ru/video-228219607_456239283
Смотреть в Дзен: https://dzen.ru/video/watch/6a7ed73ab614466c3b104ab6


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
75 минут на решение, случайная команда и разбор реальной ML-задачи с Валерием Бабушкиным

ML Kata – это возможность проверить, как вы справитесь с ML System Design в условиях, максимально приближенных к реальной работе.
Следующая ML Kata уже скоро.

Забронируйте место уже сейчас

По всем вопросам пишите менеджеру: @marinagartm


Многие считают, что хороший ML-проект – это сложная модель, десятки алгоритмов и высокий скор на Kaggle...

...но на собеседовании такой проект может не вызвать ни одного вопроса. Гораздо важнее показать, что вы понимаете данные, умеете выбирать метрики, анализировать ошибки модели и строить воспроизводимый ML-пайплайн. Именно это отличает учебный ноутбук от проекта, который действительно работает как инженерное решение.

Как вы поняли, на YouTube, в ВК и Дзен у нас вышло новое видео с Александром Дубейковским (ML Engineer в Авито, эксперт MLinside, ex-Яндекс), где он рассказывает, каким должен быть сильный ML-проект и почему на собеседованиях оценивают далеко не только качество модели.

Кому будет полезно это видео
• Тем, кто собирает первое ML-портфолио и хочет понимать, какие проекты действительно производят впечатление на работодателей.
• Студентам и начинающим ML Engineer или Data Scientist, которые готовятся к стажировкам и собеседованиям.
• Всем, кто уже умеет обучать модели, но хочет научиться оформлять проекты так, чтобы они демонстрировали инженерное мышление, а не просто знание библиотек.

Нашли себя в этом списке? Смело переходите и смотрите видео:
https://youtu.be/MB_Wv-kpP_U
https://vkvideo.ru/video-228219607_456239277
https://dzen.ru/video/watch/6a75f6a08e808e0adff09cc7


Можно ли научиться проектировать ML-системы по лекциям?

Можно понять принципы, но навык появляется только тогда, когда приходится принимать решения самому. Именно поэтому на ML Kata не будет формата «послушали спикера и разошлись». Вы получите реальную задачу, будете проектировать решение в команде, спорить, искать компромиссы и защищать свою архитектуру.

Во время воркшопа команды сопровождает Валерий Бабушкин. Но его задача – не подсказывать правильный ответ. Он будет задавать вопросы, которые заставляют посмотреть на систему глубже:
▪️действительно ли вы решаете нужную проблему;
▪️не ушли ли в детали слишком рано;
▪️какие ограничения забыли учесть;
▪️где ваше решение может не сработать в реальном продукте.

По сути, вы проходите тот же процесс, что и ML-команды в индустрии, только за несколько часов вместо недель обсуждений. Именно так и формируется насмотренность, которой невозможно научиться в теории.

Если давно хотелось попробовать себя в роли ML System Designer и плюсом получить обратную связь от человека, который строил реальные ML-системы мирового уровня, – ML Kata для вас.

Успейте занять место


В основе алгоритма, с которого начался Google – один вектор

Представьте таблицу с 500 столбцами. Где здесь главные закономерности, а где второстепенные – глазами уже не увидеть. С ростом числа признаков работать с данными становится всё сложнее — одна из причин в том самом проклятии размерности.

Способ разобраться придумали больше ста лет назад. При линейном преобразовании почти все векторы меняют и длину, и направление. Почти все, но не собственные: они сохраняют направление и только сжимаются или растягиваются. Собственный вектор – это направление, которое преобразование не поворачивает, а λ показывает, во сколько раз оно его растягивает или сжимает.

Звучит абстрактно, пока не увидишь, где это работает.

▪️ PCA
Матрица ковариаций — это своего рода паспорт формы вашего облака данных. Её собственные векторы задают новые оси, вдоль которых разброс максимален. Чем больше λ, тем больше дисперсии данных приходится на соответствующее направление. Берём несколько компонент с наибольшими λ, остальные отбрасываем. Математически именно это вы просите сделать, когда пишете PCA(n_components=10).

▪️ PageRank
Та же математика, другие данные. Страница важна, если на неё ссылаются важные страницы. Определение рекурсивное, в лоб не посчитать. Google представил переходы по ссылкам в виде огромной матрицы и стал искать вектор рейтингов, который после очередного раунда пересчёта остаётся тем же. Это собственный вектор матрицы с λ = 1. Так работает PageRank — один из алгоритмов, на которых вырос ранний Google.

▪️ Eigenfaces
А самое неожиданное было в 90-х. Учёные прогнали через PCA базу фотографий и превратили главные компоненты обратно в изображения. Получились призрачные лица — eigenfaces. Каждое из них отражало одно из главных направлений, по которым лица в базе отличались друг от друга: из-за формы лица, освещения, выражения и других особенностей. И любое лицо стало не набором из десятков тысяч пикселей, а коротким рецептом из коэффициентов.

Одна математическая идея лежит в основе и сжатия данных, и ранжирования веб-страниц, и распознавания лиц. Чтобы её понять, не нужен мехмат: достаточно базовой работы с векторами и матрицами, но именно здесь проходит граница между «умею вызвать библиотеку» и «понимаю, что она делает».

А вы уже сталкивались с PCA на практике?




Переобучать модель каждую неделю – не лучшая идея. Иногда это делает её только хуже

Но если универсального расписания не существует, как понять, что модель действительно пора обновлять? Именно этот вопрос в реальных ML-проектах оказывается гораздо сложнее, чем кажется.

И ответ на него дает Александр Дубейковский (ML Engineer в Авито, ex-Яндекс) в новом видео у нас на YouTube, в ВК и Дзен.

Посмотрев видео, вы узнаете:
▪️почему модели начинают деградировать;
▪️чем отличаются Data Drift и Concept Drift;
▪️по каким сигналам команды понимают, что модель пора обновлять;
▪️почему слишком частое переобучение может навредить.

Так что если хотите лучше разобраться в том, что происходит с ML-моделью после деплоя, этот выпуск точно стоит посмотреть.

Смотреть на YouTube: https://youtu.be/HruY9DlvfO8
Смотреть в ВК: https://vk.ru/video-228219607_456239276
Смотреть в Дзене: https://dzen.ru/video/watch/6a6884e65ea2b41354e6c050

P.S. проводим A|B-тесты обложек, как думаете, какая лучше?


Если вы говорили себе: «После отпуска наконец займусь ML», – у нас для вас хорошие новости

Лето – время отдыха, поездок и перезагрузки. А новые цели многие начинают реализовывать уже в конце августа, когда можно спокойно вернуться в привычный ритм.

Поэтому мы решили начать пятый поток курса «База ML» 31 августа.

Это время мы используем, чтобы финально подготовить курс к старту: актуализировать материалы, доработать практические задания и убедиться, что с первого занятия вы сможете полностью сосредоточиться на обучении.

Для вас это тоже хорошая возможность подготовиться к старту без спешки. За ближайший месяц можно освежить Python или школьную математику, задать нам любые вопросы о курсе и выбрать формат обучения, который подойдет именно вам.

А дальше мы проведем вас по всему пути – от базовых концепций машинного обучения до создания собственных моделей и понимания того, как ML применяется в реальных продуктах.

Если вы давно хотели войти в машинное обучение, но все время откладывали старт, возможно, сейчас как раз тот самый момент.

Старт пятого потока – 31 августа

Заполните форму предзаписи

Подробнее о программе, формате обучения и тарифах на сайте


Как научиться быстро разбираться в новых задачах, договариваться с командой и защищать выбранное решение?

Именно эти навыки отличают специалистов, которые уверенно работают над реальными проектами. Поэтому мы запускаем ML Kata – практический формат, где участники решают ML и System Design задачи в командах.

Всё происходит максимально близко к рабочему процессу. Участники объединяются в команды по пять человек, получают задачу и за 75 минут должны разобраться в условиях, обсудить возможные подходы и подготовить решение. После этого каждая команда презентует свою работу, отвечает на вопросы жюри и получает обратную связь.

В такой работе невозможно просто пересказать материал из курса или найти готовый ответ. Нужно анализировать ограничения, принимать архитектурные решения, аргументировать выбор моделей и технологий, распределять роли внутри команды и учитывать мнение коллег.

ML Kata помогает развивать навыки, которые сложно получить на обычных лекциях: системное мышление, декомпозицию сложных задач, командную работу, умение защищать свои идеи и обсуждать технические решения.

Если вам хочется попробовать себя в условиях, максимально приближенных к работе ML-команды, приходите на ML Kata.

Стоимость участия 10 000 рублей

Дата проведения пока на согласовании, но количество мест ограничено. Если хотите поучаствовать, вот страница оплаты: https://mlinside.ru/page156330066.html?utm_source=telegram&utm_medium=social&utm_campaign=anons_28_07_2026

Если у вас остались вопросы, напишите нашему менеджеру: t.me/marinagartm




Внимание-внимание, это рубрика «ML в реальной жизни» и у нас чевертая задача

Мы продолжаем нашу рубрику, где задаем ситуации, с которыми сталкиваются ML/DS-команды в продакшене. В этой рубрике нет единственно правильных ответов. Её цель – научиться рассуждать, обсуждать подходы и смотреть на проблемы с разных сторон.

Поэтому, если хотите, чтобы рубрика была вам максимально полезна, в комментариях важно не просто выбрать вариант, а объяснить:
— почему выбрали именно его
— что бы вы проверяли
— какие риски вы бы учитывали

Сегодня у нас ситуация №4:

Ситуация: Срочный запрос: модель нужна еще вчера

Контекст:
Бизнес просит запустить модель для прогноза спроса на новый товар. Данные есть, но их мало, размечены частично, а дедлайн – 3 дня. Вы понимаете, что за это время можно сделать либо простую эвристику, либо "костыльную" ML-модель без нормальной валидации.

Варианты действий:
Что будете делать в первую очередь?

Все посты этой рубрики можно будет посмотреть по тэгу: #риллайф_MLinside


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Это никакие не байки, это реальные истории

У нас на YouTube, ВКонтакте и Дзен вышел новый выпуск подкаста с Никитой Зелинским (Head of Data Science в МТС). На этот раз мы решили ненадолго отойти от привычного формата интервью и просто рассказать истории из мира Data Science. Некоторые из них звучат настолько невероятно, что в них сложно поверить. Но все они произошли на самом деле.

А в конце - отвечаем на комментарии под Reels, который уже собрал более 1 млн просмотров. Смотрите на любой удобной для вас платформе:
https://youtu.be/8S1WTfniYfg
https://vkvideo.ru/video-228219607_456239275
https://dzen.ru/video/watch/6a6370fe5055ec5396758195


Video oldindan ko‘rish uchun mavjud emas
Telegram'da ko‘rish
Тизерим новый подкаст с Никитой Зелинским и напоминаем, что курс по ML System Design уже стартовал, можете успеть запрыгнуть в самый последний вагон


Если вы давно присматривались к курсу ML System Design, но откладывали решение – сейчас тот самый момент

Уже в воскресенье стартуют занятия, и до начала обучения ещё можно успеть присоединиться к группе. Курс ведёт Валерий Бабушкин – Senior Director по Data & AI в BP, грандмастер Kaggle, автор книги Machine Learning System Design и специалист, который много лет строит ML-продукты в крупных международных компаниях.

На курсе Валерий разбирает то, как проектируются ML-системы, которые работают в production. Вы научитесь переводить бизнес-задачи в ML-решения, проектировать архитектуру, выстраивать пайплайны обучения, внедрять модели в продукт, организовывать мониторинг и оптимизировать инференс. Отдельный блок посвящён современным AI-системам и интеграции LLM в production-инфраструктуру.

За 4 месяца вас ждут 60 занятий, работа с реальными кейсами, разбор дизайн-документов, архитектурных решений из production и живые обсуждения ваших вопросов.

Курс подойдёт ML-инженерам, Data Scientists, тимлидам и руководителям AI-направлений, а также тем, кто хочет выйти за рамки обучения моделей и научиться создавать полноценные ML-системы.

Если вы уже не раз открывали страницу курса, читали программу и думали: «Запишусь позже», – позже уже почти наступило и сейчас лучшее время, чтобы оставить заявку: https://mlinside.ru/system-design/?utm_source=telegram&utm_medium=social&utm_campaign=post-last_17_07_2026


Мы начинаем вебинар, подключайтесь: https://mlinside.getcourse.ru/pl/webinar/show?id=3304004&view=1

20 ta oxirgi post ko‘rsatilgan.