📮 Как обучить ИИ без данных, почему LLM прикидываются умными, а деньги портят любопытство? Подборка каналов, свежий scikit-learn и советы по шардированию — листаем, пока инсайты горячие.
📆 Data Science – сводка за 9 июня
Как обучать модели, когда данных мало? В ход идут активное обучение, полунаблюдаемые методы и перенос знаний
🧠 В посте “Data Secrets” рассказывается, как при нехватке размеченных данных спасают ситуацию Active Learning, Semi-Supervised Learning и Transfer Learning. Также набирает обороты Weak Supervision — подход, где используют слабые источники меток: эвристики, правила, краудсорсинг и даже Distant Supervision. Такой арсенал позволяет строить рабочие модели даже в условиях дефицита данных.
Популярные LLM не думают — они просто ищут похожие примеры, выяснили в Apple
🔍 Исследование, о котором пишет “Анализ данных”, показало: даже топовые языковые модели с “цепочкой размышлений” вроде Gemini 2.5 Pro и OpenAI o3 на самом деле не рассуждают, а подбирают похожие примеры из памяти. На сложных задачах они быстро сдаются, а добавление few-shot примеров не спасает, если задача новая. Это ставит под вопрос “интеллектуальность” современных LLM.
Деньги убивают интерес: эксперимент Деси доказал, что внутренняя мотивация сильнее внешней
💡 В “Тагир Анализирует” напомнили об эксперименте 1969 года: когда студентам платили за решение задач, а потом перестали — их интерес к работе резко падал. А вот те, кто работал бесплатно, с каждым днем тратили на задачи все больше времени. Вывод: внутренняя мотивация работает куда лучше, чем внешние стимулы.
Scikit-learn 1.7: теперь пайплайны нагляднее, а ROC-кривые — из cross-validation
📊 “Библиотека дата-сайентиста” делится новостями о свежем релизе scikit-learn 1.7. Среди фишек — улучшенное отображение пайплайнов, поддержка кастомной валидации для HistGradientBoosting, рисование ROC-кривых прямо из кросс-валидации, поддержка Array API и работа с sparse arrays. Апдейт порадует всех, кто строит сложные ML-проекты.
MongoDB и Qlik: прямое подключение не всегда лучший выбор для аналитики
🗃️ В “Дашбордец” делятся опытом: если нужно делать категорийный анализ или простые агрегации, MongoDB можно подключать к Qlik напрямую. Но для ad-hoc аналитики и гибкой работы лучше использовать промежуточные слои или выгружать данные в реляционную базу — например, PostgreSQL. Такой подход экономит время и нервы аналитикам.
Avito зовёт на Database meetup: как работать с БД под нагрузкой
⚙️ “Avito Data Tech” анонсирует митап 17 июня: инженеры расскажут, как справляются с большими нагрузками и масштабами. В программе — доклады о мониторинге ресурсов в DBaaS, отказе от репликации и использовании Redpanda для масштабируемости. Отличный шанс узнать, как строят инфраструктуру в Avito.
Как масштабировать базы данных: статья о шардировании с практическими советами
🗂️ В “SQLpedia” вышел подробный разбор шардирования: какие проблемы возникают, какие есть альтернативы и как правильно масштабировать систему при росте объёма данных. Много практических рекомендаций для тех, кто работает с большими БД.
Где читать лучших ML-инженеров: собрали папку с топовыми каналами
📚 “Нескучный Data Science” подготовил подборку каналов инженеров и специалистов по ML и Data Science. Теперь не нужно тратить время на поиски — всё самое интересное и полезное собрано в одном месте.
Бенчмарки для LLM и русского языка: новые тренды на конференции ИТНОП
🤖 “Mashkka про Data Science” рассказывает о докладе с ИТНОП в Орле: обсуждали, как появление LLM меняет подходы к бенчмаркингу и как создают новые бенчмарки для русского языка. Тема актуальна для всех, кто следит за развитием AI в России.
🤖 svodka.ai – ИИ читает каналы, вы читаете главное
💌 Кому из ваших знакомых эти новости тоже будут полезны? Перешлите им почитать
Data Science. Подписаться на ежедневную svodka.ai
📆 Data Science – сводка за 9 июня
Как обучать модели, когда данных мало? В ход идут активное обучение, полунаблюдаемые методы и перенос знаний
🧠 В посте “Data Secrets” рассказывается, как при нехватке размеченных данных спасают ситуацию Active Learning, Semi-Supervised Learning и Transfer Learning. Также набирает обороты Weak Supervision — подход, где используют слабые источники меток: эвристики, правила, краудсорсинг и даже Distant Supervision. Такой арсенал позволяет строить рабочие модели даже в условиях дефицита данных.
Популярные LLM не думают — они просто ищут похожие примеры, выяснили в Apple
🔍 Исследование, о котором пишет “Анализ данных”, показало: даже топовые языковые модели с “цепочкой размышлений” вроде Gemini 2.5 Pro и OpenAI o3 на самом деле не рассуждают, а подбирают похожие примеры из памяти. На сложных задачах они быстро сдаются, а добавление few-shot примеров не спасает, если задача новая. Это ставит под вопрос “интеллектуальность” современных LLM.
Деньги убивают интерес: эксперимент Деси доказал, что внутренняя мотивация сильнее внешней
💡 В “Тагир Анализирует” напомнили об эксперименте 1969 года: когда студентам платили за решение задач, а потом перестали — их интерес к работе резко падал. А вот те, кто работал бесплатно, с каждым днем тратили на задачи все больше времени. Вывод: внутренняя мотивация работает куда лучше, чем внешние стимулы.
Scikit-learn 1.7: теперь пайплайны нагляднее, а ROC-кривые — из cross-validation
📊 “Библиотека дата-сайентиста” делится новостями о свежем релизе scikit-learn 1.7. Среди фишек — улучшенное отображение пайплайнов, поддержка кастомной валидации для HistGradientBoosting, рисование ROC-кривых прямо из кросс-валидации, поддержка Array API и работа с sparse arrays. Апдейт порадует всех, кто строит сложные ML-проекты.
MongoDB и Qlik: прямое подключение не всегда лучший выбор для аналитики
🗃️ В “Дашбордец” делятся опытом: если нужно делать категорийный анализ или простые агрегации, MongoDB можно подключать к Qlik напрямую. Но для ad-hoc аналитики и гибкой работы лучше использовать промежуточные слои или выгружать данные в реляционную базу — например, PostgreSQL. Такой подход экономит время и нервы аналитикам.
Avito зовёт на Database meetup: как работать с БД под нагрузкой
⚙️ “Avito Data Tech” анонсирует митап 17 июня: инженеры расскажут, как справляются с большими нагрузками и масштабами. В программе — доклады о мониторинге ресурсов в DBaaS, отказе от репликации и использовании Redpanda для масштабируемости. Отличный шанс узнать, как строят инфраструктуру в Avito.
Как масштабировать базы данных: статья о шардировании с практическими советами
🗂️ В “SQLpedia” вышел подробный разбор шардирования: какие проблемы возникают, какие есть альтернативы и как правильно масштабировать систему при росте объёма данных. Много практических рекомендаций для тех, кто работает с большими БД.
Где читать лучших ML-инженеров: собрали папку с топовыми каналами
📚 “Нескучный Data Science” подготовил подборку каналов инженеров и специалистов по ML и Data Science. Теперь не нужно тратить время на поиски — всё самое интересное и полезное собрано в одном месте.
Бенчмарки для LLM и русского языка: новые тренды на конференции ИТНОП
🤖 “Mashkka про Data Science” рассказывает о докладе с ИТНОП в Орле: обсуждали, как появление LLM меняет подходы к бенчмаркингу и как создают новые бенчмарки для русского языка. Тема актуальна для всех, кто следит за развитием AI в России.
🤖 svodka.ai – ИИ читает каналы, вы читаете главное
💌 Кому из ваших знакомых эти новости тоже будут полезны? Перешлите им почитать
Data Science. Подписаться на ежедневную svodka.ai