TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Все о блокчейн/мозге/space/WEB 3.0 в России и мире

22 Oct 2025, 12:49

Открыть в Telegram Поделиться Пожаловаться

Андрей Карпатый о будущем обучения ИИ-моделей и критике RL

Мы продолжаем обозревать свежее интервью Андрея Карпатый, сооснователя OpenAI, экс-директора по ИИ Tesla. #часть3 Предыдущие части тут.

Андрей разнёс Reinforcement Learning (RL) в пух и прах, но признал, что пока это лучшее, что у нас есть. А ещё поделился мыслями о новых подходах к обучению моделей.

Почему RL — это боль, но мы всё равно его используем?
Карпатый назвал RL «ужасным» из-за его шумности и неэффективности. Как это работает:
- Модель пробует сотни путей решения задачи параллельно.
- Успешные траектории, даже если они частично случайны помечаются как «хорошие», а все шаги в них получают награду.
- Проблема - даже неправильные шаги, которые случайно привели к верному ответу, поощряются. Это как хвалить за удачу, а не за умение.

«Это как высасывать крупицы знаний через соломинку», — говорит Карпатый. Люди так не учатся: мы анализируем свои решения, выделяем хорошие и плохие шаги. У современных LLM такого «рефлексивного» процесса нет.

Но RL всё ещё используется, потому что:
1. обучение на примерах творит чудеса. Например, InstructGPT показал, как быстро модель может адаптироваться к диалогам, сохраняя знания.
2. RL позволяет «взбираться по холму» наград, находя решения, которые человек бы не придумал.

Чтобы исправить недостатки RL, пробуют process supervision — награждать за каждый шаг, а не только за финальный результат. Для этого используют LLM-судей, которые оценивают промежуточные решения.

Но есть нюанс:
- LLM-судьи — это огромные модели, и их можно «взломать».
- например, модель генерировала бессмыслицу, а судья ставил 100%. Почему? Это adversarial example, который сбивает модель с толку.
- Исправить можно, добавляя такие примеры в обучение судьи, но это бесконечный процесс. «У модели триллион параметров, всегда найдётся новый способ её обмануть», — говорит Карпатый.

Что дальше? Новые парадигмы обучения
Карпатый оптимистичен. RL — не конец пути. Новые идеи уже появляются:
- System Prompt Learning - модели начинают «рефлексировать», анализировать решения и генерировать синтетические данные для улучшения.
- Пример из реальной жизни: функция памяти в ChatGPT — это зачаток новых подходов.
- Проблема - идеи из статей на arXiv пока далеки от масштабируемых решений в больших лабораториях.


«Я верю, что скоро мы увидим прогресс в этом направлении», — подытожил Карпатый.

Будущее за подходами, которые научат модели думать и анализировать, как люди.
Andrej Karpathy — AGI is still a decade away
"The problems are tractable, but they're still difficult”

2k 1 36 22
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot