TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

30 Jan, 13:07

Открыть в Telegram Поделиться Пожаловаться

ETH Zurich, MIT и Stanford показали ИИ-модель учится на своих ошибках

Исследователи представили SDPO - метод похож на то, как учатся люди: сначала пробуешь сам, потом смотришь правильный ответ и понимаешь, где ошибся, в следующий раз делаешь лучше.

Как работает SDPO?

Модель выступает в двух ролях одновременно:
• Студент генерирует ответ
• Учитель - та же модель, но видящая фидбэк.

Главное отличие от обычной дистилляции - учитель не заморожен. Он улучшается вместе со студентом, и в итоге студент превосходит начального учителя, происходит bootstrapping.

Неожиданный эффект-SDPO генерирует ответы в 3-7 раз короче, чем GRPO, при более высокой точности.

Эффект масштабируется с размером модели. На Qwen3-0.6B преимущество минимально, на 8B - значительное. Способность к self-teaching - эмерджентное свойство, появляющееся вместе с сильным in-context learning.
All about AI, Web 3.0, BCI
Cool work that aligns with how humans learn. The model writes its own answers 1) without cheating 2) cheating (seeing the true answer) It learns to make (1) close to (2) by minimizing the KL divergence. This prevent catastrophic forgetting in continual learning.

2.5k 2 35 23
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot