📮 Узнайте, кто из сотрудников сказал что клиенту, почему RL дарит LLM матпамять, а Salesforce выложила $8 млрд за Informatica — в свежем срезе ИИ-новостей, способном прокачать ваш продукт уже сегодня.
📆 Data Science – сводка за 5 июля
Yandex Cloud внедрил Speaker Labeling и YandexGPT в SpeechSense для глубокой офлайн-аналитики
🎙️ Теперь компании могут не просто распознавать речь, а точно определять, кто из участников разговора что сказал, и сразу анализировать диалоги с помощью YandexGPT. В “Yandex for ML” отмечают, что такие инновации делают аналитику разговоров между сотрудниками и клиентами гибче и эффективнее — это помогает улучшать качество сервиса и быстрее принимать решения.
Как подготовить данные для ML: OTUS разобрал все этапы на вебинаре
🐍 На вебинаре “Mashkka про Data Science” подробно разобрали, как в Python работать с пропущенными значениями, выбросами и корреляциями. Участники получили практические советы и примеры для подготовки данных к машинному обучению — всё, чтобы ваши модели работали точнее и быстрее.
SemDiD: новый подход к генерации разнообразных ответов LLM от Hong Kong University и Alibaba
🧠 Исследователи из “Machinelearning” рассказали о методе SemDiD, который управляет генерацией ответов в эмбеддинговом пространстве и делает обучающие выборки для RLHF семантически богаче. Такой подход ускоряет обучение моделей и повышает их точность на популярных бенчмарках.
Обучение LLM математике: RL переносит интеллект, SFT — не всегда
📊 Новое исследование, о котором пишет “Data Secrets”, показало: если обучать LLM математике с помощью RL, до 80% улучшений переносятся на другие задачи, а SFT даёт лишь 40%. RL помогает моделям сохранять гибкость и усиливает важные распределения токенов, в отличие от SFT, который иногда снижает универсальность.
SFT-тюнинг LLM на математике может снизить эффективность вне математики
⚖️ В “Математика Дата саентиста” отмечают, что SFT-тюнинг часто ухудшает работу LLM на других задачах, а RL-тюнинг, наоборот, помогает переносить улучшения. Введён Transferability Index — теперь можно количественно оценить, насколько модель сохраняет универсальность. Другие посты об этом же: один.
DeepBI: анализируйте данные с помощью диалогового ИИ вместо SQL
💻 Платформа DeepBI, о которой пишет “Анализ данных”, позволяет работать с MySQL, PostgreSQL, CSV и другими источниками через естественный язык. Можно строить визуализации и дашборды на любой ОС, а для теста доступны Docker-образы и EXE-файлы.
Salesforce купила Informatica за $8 млрд и усилила BI-экосистему
💼 “Клуб анонимных аналитиков” сообщает: теперь Salesforce предлагает полный стек для аналитики и управления данными — от Tableau до новых решений Informatica. Это подчёркивает, насколько важны комплексные BI- и Data Management-инструменты для современного бизнеса.
Генеративные модели: автоматизация и риски дезинформации
⚠️ В “Библиотека дата-сайентиста” обсуждают, что генеративные ИИ ускоряют исследования и создают синтетические данные, но несут угрозу дезинформации и потери доверия. Эксперты призывают развивать инфраструктуру доверия, цифровую маркировку и этические фильтры.
ML-дайджест Яндекса: новые инструменты промптинга и тренды ИИ-инфраструктуры
📚 В том же канале собрали гайды по эффективному промптингу, свежие обзоры инфраструктуры и доклады с конференций по ML, BI и аналитике. Здесь вы найдёте практические советы и анализ трендов мультимодального ранжирования.
🤖 svodka.ai – ИИ читает каналы, вы читаете главное
💌 Кому из ваших знакомых эти новости тоже будут полезны? Перешлите им почитать
Data Science. Подписаться на ежедневную svodka.ai
📆 Data Science – сводка за 5 июля
Yandex Cloud внедрил Speaker Labeling и YandexGPT в SpeechSense для глубокой офлайн-аналитики
🎙️ Теперь компании могут не просто распознавать речь, а точно определять, кто из участников разговора что сказал, и сразу анализировать диалоги с помощью YandexGPT. В “Yandex for ML” отмечают, что такие инновации делают аналитику разговоров между сотрудниками и клиентами гибче и эффективнее — это помогает улучшать качество сервиса и быстрее принимать решения.
Как подготовить данные для ML: OTUS разобрал все этапы на вебинаре
🐍 На вебинаре “Mashkka про Data Science” подробно разобрали, как в Python работать с пропущенными значениями, выбросами и корреляциями. Участники получили практические советы и примеры для подготовки данных к машинному обучению — всё, чтобы ваши модели работали точнее и быстрее.
SemDiD: новый подход к генерации разнообразных ответов LLM от Hong Kong University и Alibaba
🧠 Исследователи из “Machinelearning” рассказали о методе SemDiD, который управляет генерацией ответов в эмбеддинговом пространстве и делает обучающие выборки для RLHF семантически богаче. Такой подход ускоряет обучение моделей и повышает их точность на популярных бенчмарках.
Обучение LLM математике: RL переносит интеллект, SFT — не всегда
📊 Новое исследование, о котором пишет “Data Secrets”, показало: если обучать LLM математике с помощью RL, до 80% улучшений переносятся на другие задачи, а SFT даёт лишь 40%. RL помогает моделям сохранять гибкость и усиливает важные распределения токенов, в отличие от SFT, который иногда снижает универсальность.
SFT-тюнинг LLM на математике может снизить эффективность вне математики
⚖️ В “Математика Дата саентиста” отмечают, что SFT-тюнинг часто ухудшает работу LLM на других задачах, а RL-тюнинг, наоборот, помогает переносить улучшения. Введён Transferability Index — теперь можно количественно оценить, насколько модель сохраняет универсальность. Другие посты об этом же: один.
DeepBI: анализируйте данные с помощью диалогового ИИ вместо SQL
💻 Платформа DeepBI, о которой пишет “Анализ данных”, позволяет работать с MySQL, PostgreSQL, CSV и другими источниками через естественный язык. Можно строить визуализации и дашборды на любой ОС, а для теста доступны Docker-образы и EXE-файлы.
Salesforce купила Informatica за $8 млрд и усилила BI-экосистему
💼 “Клуб анонимных аналитиков” сообщает: теперь Salesforce предлагает полный стек для аналитики и управления данными — от Tableau до новых решений Informatica. Это подчёркивает, насколько важны комплексные BI- и Data Management-инструменты для современного бизнеса.
Генеративные модели: автоматизация и риски дезинформации
⚠️ В “Библиотека дата-сайентиста” обсуждают, что генеративные ИИ ускоряют исследования и создают синтетические данные, но несут угрозу дезинформации и потери доверия. Эксперты призывают развивать инфраструктуру доверия, цифровую маркировку и этические фильтры.
ML-дайджест Яндекса: новые инструменты промптинга и тренды ИИ-инфраструктуры
📚 В том же канале собрали гайды по эффективному промптингу, свежие обзоры инфраструктуры и доклады с конференций по ML, BI и аналитике. Здесь вы найдёте практические советы и анализ трендов мультимодального ранжирования.
🤖 svodka.ai – ИИ читает каналы, вы читаете главное
💌 Кому из ваших знакомых эти новости тоже будут полезны? Перешлите им почитать
Data Science. Подписаться на ежедневную svodka.ai