TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Цифровое образование

8 Sep, 13:08

Открыть в Telegram Поделиться Пожаловаться

​​«Предсказатель следующего токена» — это неправильная ментальная модель для LLM
Автор Гаррин Макголдрик
Вопрос, чему современная LLM фактически обучается после предварительного обучения.
- Pretraining: модель учится повышать вероятность токена, который действительно следовал за предыдущими токенами в корпусе. Это действительно next-token prediction.
- RLVR: модель генерирует различные варианты решения, получает за них вознаграждение и повышает вероятность тех последовательностей, которые привели к хорошему результату. Здесь уже нет «правильного следующего токена» — есть цель, которую нужно оптимизировать.
- RLHF: модель дополнительно обучается вести себя как полезный ассистент, а не просто воспроизводить статистические закономерности обучающих данных.
Аналогия автора — шахматы. Можно обучить систему предсказывать ход, который обычно сделал бы гроссмейстер, а можно обучить её выбирать ход, который максимизирует вероятность победы. Внешне обе системы делают одно и то же — выбирают следующий ход, — но внутренне оптимизируют разные цели.
Отсюда главный тезис: «next-token prediction» описывает форму работы LLM, но не обязательно её функциональную сущность после постобучения.
Если воспринимать LLM только как «предсказатель следующего слова», легко прийти к выводу:
LLM = статистическая имитация существующих знаний.
А если учитывать RL, reasoning и exploration, появляется другая модель:
LLM = обучаемая система, которая может не только воспроизводить паттерны, но и искать решения в пространстве возможных последовательностей, если существует критерий качества.
Возникает очень интересный переход и для педагогики:
передать модели правильный ответ → научить модель находить правильный ответ → научить модель оптимизировать образовательный результат.
Последний шаг потенциально ведёт уже к AI-агентам и Human–AI Learning Systems, а не просто к использованию чат-ботов в обучении.
Читать 3мин)
👍
👎
Открыть комментарии

112 0 2
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot