DataFrog: Data Science


Гео и язык канала: Россия, Русский
Категория: Технологии


Журнал о Data Science | Machine Learning | Big Data | Deep Learning | Neural Networks | AI
@viktorreh

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


5 октября начнется 19-й поток программы Data Engineer от Newprolab

Программа для junior- и middle-дата-инженеров, аналитиков, backend-разработчиков, техлидов и тех, кто работает с data-командами и хочет лучше понимать современный стек DE

📌 Что внутри:
– 10 недель обучения
– 30 занятий: онлайн + записи
– 10 практических лабораторных работ
– облачный кластер и реальные данные
– чат участников и поддержка команды программы

📌 Что получите на выходе:
1. Научитесь решать типовые задачи DE на практике
2. Систематизируете знания и закроете пробелы в современном DE-стеке
3. Поработаете с реальными данными и инфраструктурой, а не только с учебными примерами
4. Соберете практический опыт, который можно обсуждать на собеседованиях и использовать в работе
5. Все записи и материалы останутся у вас после окончания программы

Преподаватели – практикующие специалисты из ведущих технологических компаний. На занятиях можно разбирать реальные кейсы, задавать вопросы и получать обратную связь

👉 Подробности и квиз – на сайте

Квиз покажет, насколько программа подходит именно под вашу роль и задачи, даст персональные рекомендации и промокод на скидку
___
По всем вопросам пишите Алексею @snitsa


Software Engineering for Data Scientists

Автор:
Catherine Nelson
Год издания: 2024

#ds #en

Скачать книгу


Если вы хотите войти в ML / DS, получить первый оффер или наконец перейти с Junior на Middle, а с Middle — на Senior, советую канал Лев Говорит.

Лев — Senior DS / ML Engineer в Wildberries. Он сам проводит технические собеседования и много лет помогает людям строить карьеру в IT.

В канале он пишет о том, что обычно узнаёшь только с опытом:

🗻 Карьера: как проходить собеседования, расти по грейдам, говорить о повышении и какие ошибки годами тормозят сильных специалистов.

🧠 ML / DS: реальные production-кейсы, ML System Design, эксперименты и то, как принимать инженерные решения, когда правильного ответа нет в учебнике.

📦 Экспертиза → деньги: как превращать свои знания в курсы, менторство, контент и другие активы вместо бесконечной продажи своего времени.

А ещё Лев честно разбирает собственные провалы: от ML-проектов, которые никто не захотел покупать, до 18 выпущенных курсов с нулём продаж.

Если хотите не просто учить ML, а строить вокруг своей экспертизы сильную карьеру — от первого оффера до Senior и дальше, вам сюда:

👉 https://t.me/+ednr74Af-mA3MTFi


Видео недоступно для предпросмотра
Смотреть в Telegram
Дождались: OpenAI превьюит Ultrafast mode для GPT-5.6 Sol

Это тот самый инференс на Cerebras. Ускорение обещают в 14 раз (!), модель сможет генерировать до 750 токенов в секунду.

Для такого гиганта как Sol это просто грандиозная скорость. Достигается она за счет того что Wafer-Scale Engine архитектура Cerebras держит веса модели прямо на огромных чипах, и их не приходится гонять между памятью и хранилищем.

На видео спидран HLE. На весь бенчмарк ушло чуть больше 11 часов. У Claude Fable тот же прогон занял почти 80.

Пока мод будет доступен только избранной группе пользователей в API, но может и до обычных юзеров скоро доберется (но платить придется почку, не меньше).

https://openai.com/index/previewing-ultrafast/


Работа в IT — худшая затея для новичка в 2026 году.

Мёртвые вакансии, огромная конкуренция, заоблачные требования к кандидатам, ещё и поганый AI.

Но всё ли так очевидно? Пока одни бесконечно учат Python, делают очередной пет-проект и ждут, когда станут «достаточно хороши» для первой работы, умные читают Богдана и разбираются, как получить первую работу.

Он больше 6 лет работает в бигтехе, прошёл 350+ собеседований и знает:

— Почему твоё резюме не даёт откликов
— Почему ты не зарабатываешь 400к?
— Где искать работу ML-инженеру?

И это лишь малая часть. На канале собрана целая база по всем аспектам поиска работы, от резюме до получения оффера и торга.

Подписывайся, пока это бесплатно: https://t.me/ml_cabin_destroyers

Реклама
ИП Камаев Богдан Эльмарович
ИНН 770973951244
erid:CQH36pWzJqVJCbWwsoZcg5SKA3YA6d7NSLsPKJXWzUnBe7


DeepSeek выпустили свой харнесс, и теперь это самый быстрорастущий проект на GitHub

За пару дней репа собрала уже >140к звезд. Даже быстрее, чем OpenClaw в свое время.

https://github.com/deepseek-ai/deepseek-harness (DSH)

Харнесс – это слой, который превращает голую модель в агента, то есть определяет, как происходит работа с файлами, инструментами, памятью, циклом выполнения задач и тд. Грубо говоря, это все, кроме весов.

DSH основан на мета-фреймворке Cordis и подчиняется концепции «Everything is a plugin». То есть все в системе (модели, инструменты, скиллы, сессии, песочницы, файловая система, оркестрация, UI) реализовано как плагин, и все это можно смешивать, заменять и расширять.

Кроме CLI есть еще локальный веб-интерфейс, это приятно. Также агент может вызывать Claude Code или Codex как суб-агентов внутри своего воркфлоу.

Запускается в одну строку:

npx @deepseek-ai/dsh web


Компания Stripe купила OpenRouter за 7 миллиардов долларов

OpenRouter был основан в 2023 году. В мае они подняли Series B на $113 млн при оценке $1.3 млрд. И вот сейчас их покупают за 7. При этом финальная цена может еще измениться: WSJ ранее писал о переговорах на сумму около $10 млрд.

Забавно, что раньше основатель OpenRouter сам называл свой стартап «AI-эквивалентом Stripe».


📉 На валидации 0.92. В проде 0.61.

Модель прекрасно работала в ноутбуке и развалилась, как только увидела настоящие данные. Утечка в признаках, дрейф, метрика, которая мерила не то.

Data Scientist: от данных до деплоя моделей — про весь путь после ноутбука.

⚙️ Данные и признаки: EDA, feature engineering, data leakage, стабильность признаков
📊 Обучение и оценка: baseline и gradient boosting, experiment tracking, error analysis, ложное улучшение качества
🚀 Прод: inference API, batch-инференс, quality gates, CI/CD, мониторинг data drift

▶️ 9 секций, 46 уроков. Первые уроки открыты — посмотреть можно бесплатно
🧩 Нужен Python и pandas; если просядете, тренажёры на платформе бесплатные

🏷 Внутри промокод ML_BOOKS — 30%, двое суток

➜ Открыть первый урок


Как Netflix использует ИИ?

В квартальном отчёте перед инвесторами компания рассказала, что нейросети применялись в создании примерно 300 проектов этого года. Речь об использовании на любых стадиях производства: от концептов до постпродакшена. В отчёте выделили создание «сложных сцен» с помощью ИИ для:

🟣 индийского спортивного триллера «Слава»

🟣 американского исторического мини-сериала «Американский эксперимент»

🟣 бразильской футбольной драмы «Бразилия 70’: Третья звезда».

В них нейросети использовали для прорисовки толпы, исторических баталий и экспозиционных кадров. При этом глава Netflix Тед Сарандос отметил, что не собирается заменять нейросетями креативных экспертов.

А вы стали замечать больше следов нейросетей в сериалах и фильмах?


Вышла KIMI K3

Новая мощная китайская модель, которую очень хвалят. 2,8 трлн параметров. Хвалят до того, что называют ее третьей по уровню интеллекта моделью после Fable 5 и GPT-5.6.

Я решил проверить ее на создании WebGL-сайта выдуманной студии. Один промпт, 16 мин работы, ни единой правки.

Люблю тестить новые модельки на threejs проектах, новая KIMI молодец!

Тут тестим KIMI K3
А тут можно посмотреть сайт, который я с ней сделал поближе.


✔️ В Roblox можно будет собрать игру по текстовому описанию

Игровая платформа анонсировала функцию Build, которая превращает простой запрос в готовую базу игры.

Под капотом целый набор ИИ-моделей, открытых и собственных - они отвечают за игровые механики, окружение, персонажей, визуальный стиль и звук.

В геймдеве опасаются, что когда порог входа падает до текстового запроса, платформу зальёт поток AI-слопа, а авторам придётся конкурировать с ИИ-контентом, который штампуется в разы быстрее ручной работы.

Общее настроение индустрии при этом тревожное - по свежему опросу конференции GDC, 52% профессионалов игровой отрасли считают, что генеративный ИИ вредит геймдеву.


Ответ Roblox - ранжирование по удержанию игроков, как и для обычных игр. То есть если в игру никто не играет, её никто и не найдёт.

Публичное альфа-тестирование Build стартует 28 июля в Новой Зеландии для пользователей от 9 лет с подтверждённым возрастом.

Публиковать свои творения на глобальную аудиторию смогут те, кому исполнилось 16. Будет бесплатная базовая версия и платные тарифы.

Roblox также готовит ИИ-агентов, которые помогут авторам с плейтестами и аналитикой, а ещё с ноября прошлого года обучает модель, генерирующую редактируемые 3D-сцены.

На этом фоне компания закрывает видеозвонки через аватаров Roblox Connect, запущенные в 2023 году.

Приоритеты, судя по всему, расставлены.


#news #ai #ml


Роадмап по математике для начинающих ML специалистов

Все, кто начинает путь в машинном обучении, сталкиваются с вопросом: «Какую математику нужно знать и в каком порядке?». Огромный объем информации пугает.

Автор блога The Palindrome предлагает четкий и структурированный путь, который разбивает на части эту большую задачу.

Что конкретно в ней освещается:

1. Линейная алгебра (Linear Algebra) — язык данных
Данные в ML — это векторы и матрицы. Линейная алгебра — инструмент для работы с ними.

2. Математический анализ (Calculus) — основа оптимизации
ML — это поиск оптимальных параметров модели. Анализ дает инструменты для этого поиска.

3. Многомерный анализ (Multivariable Calculus) — двигатель градиентного спуска
Реальные модели имеют тысячи параметров. Нужно уметь оптимизировать в многомерных пространствах.

4. Теория вероятностей (Probability Theory) — работа с неопределенностью
Мир данных не детерминирован. Вероятность дает язык для описания неопределенности и построения моделей, которые работают с шумом.


Главная идея роадмапа: не зубрежка, а понимание связей 🔆

Оригинал статьи с более глубоким погружением: The Roadmap of Mathematics for Machine Learning

👉 DataFrog | #datascience #ml


Pandas Workout: 200
exercises to make you
a stronger data analyst


Автор: Lerner Reuven
Год издания: 2024

#ds #en

Скачать книгу


⚠Хотите разобраться, как обучать интеллектуальных
агентов в нестандартных задачах для бизнеса? Начните обучение на курсе «Reinforcement Learning».

🎁Записывайтесь на 3 бесплатных вебинара — познакомьтесь с программой обучения и преподавателями. Задайте свои вопросы экспертам!

Вебинар 1: «Обучение с подкреплением - гибкий подход для сложных задач. Создаем собственные окружения».
⏰7 июля в 20:00 мск

Программа вебинара:

1. Краткое введение в обучение с подкреплением.
2. Обзор существующих сред и переход к созданию собственного RL-окружения на Python.
3. Напишем свою среду на основе gym.Env и подключим к ней обучающегося агента.

Вебинар 2: «Visual DQN: Как научить ИИ-модель видеть мир глазами игрока».
⏰15 июля в 20:00 мск

Программа вебинара:
1. Разберем, как DQN работает с изображениями:
как агент получает состояние не в виде чисел, а в виде сырых пикселей с экрана.
2. Изучим архитектуру DeepMind-подхода.
3. Запустим обучение DQN в среде Atari Pinball и посмотрим, как агент постепенно учится играть лучше человека.

Вебинар 3: «Алгоритм DQN - учим нейросеть принимать решение без помощи человека».
⏰21 июля в 20:00 мск

Программа вебинара:

1. Разберем устройство алгоритма DQN: как нейросеть заменяет Q-таблицу и учится выбирать лучшие действия.
2. Изучим ключевые механизмы DQN.
3. Обучим агента решать задачу в среде Gymnasium и проанализируем процесс обучения.

Записывайтесь ➡ https://clck.su/xYlCF

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576


На Stepik вышел курс — «RAG-системы на векторных базах данных».

RAG нельзя оценивать по ощущению: «вроде отвечает нормально».

Нужны тестовые вопросы, метрики retrieval, контроль порога «не знаю» и понимание, где система теряет релевантные документы.

В курсе разбираем:

- Qdrant, Weaviate, FAISS
- эмбеддинги и чанкинг
- HNSW, IVF-PQ и индексы для скорости/памяти
- hybrid search: ANN + BM25
- Recall@K, Precision@K, nDCG, MRR
- порог для отсечения нерелевантных ответов
- мониторинг качества и CI/CD для RAG

Внутри — практика с рецензированием и реальные боевые задачи: собрать RAG-пайплайн, настроить retrieval, подобрать метрики и понять, почему система теряет релевантные документы.

Курс для тех, кто хочет выкатывать AI-поиск не вслепую, а через измеримые критерии качества.

Скидка 25% действует 72 часа.

Открыть курс


❗️ Финансовая модель нестабильна? Возможно, проблема в признаках

Модель обучается, но результаты нестабильны? Метрики скачут, признаки мешают друг другу, а причина неочевидна. Часто проблема скрыта в данных: корреляция и мультиколлинеарность искажают результат.

🦾 На открытом уроке разберём, как выявлять зависимые признаки и работать с размерностью данных. Покажем, как применять метод анализа главных компонент (PCA) для выделения действительно значимой информации.

Вы увидите, как упрощать пространство признаков, повышать устойчивость моделей и улучшать качество прогнозирования, особенно в задачах временных рядов. Это важный этап, без которого сложно перейти от экспериментов к стабильным решениям.

➡️ Встречаемся 18 мая в 20:00 МСК в преддверии старта курса «Машинное обучение для финансового анализа». Принять участие: https://vk.cc/cXT8HK

Реклама. ООО «Отус онлайн-образование», ОГРН 1177746618576


🚨 Откликаешься на всё подряд, но собесов нет?

Третий месяц рассылаешь резюме на ML/DS вакансии. На hh, на Хабре, везде. В ответ тишина, даже до собеседования не доходишь. А на редкие, которые всё-таки случаются, приходишь и валишься на технике.
Знакомо?

Я Богдан, ML-инженер с 6+ годами опыта. Веду канал «Раскатываем ML кабины». Честно разбираю собесы, рынок и реальные кейсы учеников.

Например, недавно расписал кейс аналитика. 4 года в данных, зарабатывал 200к, хотел вырасти. За 7 месяцев перекатился в ML. Финал: 8 офферов от 350к, выбрал лучший на 500к на руки в крупной российской компании. Полный разбор подготовки и переговоров в канале.

А ещё у нас крутая пиратская тематика 🏴‍☠️

😐 Подписывайся 😐


Тем временем в Сан-Франциско прямо сейчас проходит OpenAI DevDay. Вот что уже показали:

➡️ Realtime api с минимальной задержкой. Это возможность встроить в свое приложение настоящий speech-to-speech. Будет доступно по цене базовой модели.

➡️ Vision файнтюнинг. Теперь можно тюнить свои модели с использованием изображений.

➡️ Завозят набор инструментов для кастомных дистилляций и ускорения моделей.

➡️ Finally: кэширование промптов, которое уже давно появилось у DeepSeek и Anthropic. На кэшированные промпты цена будет в половину меньше.

➡️ Интрумент для оценки моделей: можно будет нормально эвалить свои приложения.

👉 DataFrog | #datascience


Классика жанра по оценке ML-моделей

Нашел отличный материал для закрепления основ — статья «Model Evaluation, Model Selection, and Algorithm Selection in Machine Learning»

Это, по сути, готовый учебник на 49 страницах, где разжеваны все ключевые моменты корректной работы с моделями:
- Как правильно оценивать качество модели.
- Как избежать утечки данных (data leakage) — главной причины неработающих моделей на проде.
- Как честно сравнивать между собой разные алгоритмы.


Если чувствуете, что в фундаментальных знаниях есть пробелы, или нужно объяснить коллегам "как правильно" — эта статья идеальный вариант. Читается довольно быстро и расставляет все по полочкам.

👉 DataFrog | #datascience #machinelearning


Подготовили ML-словарик

Читайте и сохраняйте, что-то из этого наверняка вам пригодится на собеседованиях 👀

👉 DataFrog | #datascience #ml

Показано 20 последних публикаций.