TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Всеволод Викулин

20 Dec 2024, 20:55

Открыть в Telegram Поделиться Пожаловаться

Масштабирование моделей закончилось?

Илья Суцкевер, один из основателей OpenAi, на конференции NIPS обрадовал нас, что халява прошла - просто растить модели и получать качество не получится. Почему? У нас закончились текстовые данные. Почему кончились данные, а не деньги? Закон Мура работает - железо дешевеет, а данные мы с такой скоростью не успеваем производить.

LLM учатся на данных из интернета, а интернет у нас один (внезапно) и полон мусора (но не этот канал).
Коллеги из Epoch Ai провели оценку и прикинули, что всего 20% данных интернета пригодны для обучения. В зависимости от роста потребления, мы истратим все текстовые данные между 2025 и 2028 годах. Больше данных нет. Еще и в этом смысле данные это нефть - у нас они есть, они двигают человечество, но запасы иссякают.

Как тогда достичь AGI

На этот вопрос в докладе пытается ответить Суцкевер.
Он выделил 3 направления:

1) Синтетические данные. Это данные, которые генерируют одни LLM, на которых потом обучаются другие LLM. Такой конвейер по переработке данных. Полезно, потому что можно переваривать "сырые данные", а на выход давать более качественные переботаннные. То есть финальную модель будем учить не на нефте, а уже на бензине.

2) Test-time compute или увеличение вычислений во время предсказания модели. Вы можете сразу же, с чистого листа, написать эссе, презентацию, программу? Или вам надо сначала крепко подумать? Вот, LLM тоже надо. Модель o-1 теперь перед ответом рассуждает, что офигеть как растит метрики на математике/программировании. Чтобы думать нужны вычисления, то есть тут мы растим вычисления не на обучение модели, а на предсказание.

3) Агенты. Вот мы научились рассуждать, но, для некоторых задач нужно уметь пользоваться калькулятором, узнать сегодняшнее число или даже отправлять сообщение кому-то в телеграмме. Нужно подключить LLM к внешним инструментам, которые используем мы для своих задач, иначе они тупо не будут решаться. Вот тогда вы сможете попросить GPT написать эссе, чтобы антиплагиат выдавал 95% уникальности :) Моделька будет редактировать эссе, ходить в антиплагиат и так пока не добьет до нужного процента.

Про каждую из этих тем я напишу отдельный пост, а пока расскажите в комментариях, что по-вашему самое перспективное? Где лежит highway to AGI?
Ilya Sutskever: "Sequence to sequence learning with neural networks: what a decade"
Ilya Sutskever full talk "Sequence to sequence learning with neural networks: what a decade" at NeurIPS 2024 in Vancouver, Canada. "Pre-training as we know it will end" and what comes next is superintelligence: agentic, reasons, understands and is self aware. NeurIPS 2024 — 2024 Conference on Neur...

441 0 3 3 25
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot