TGStat
TGStat
Введите текст для поиска
Расширенный поиск каналов
  • flag Russian
    Язык сайта
    flag Russian flag English flag Uzbek
  • Вход на сайт
  • Каталог
    Каталог каналов и чатов Региональные подборки Тематические подборки Платные каналы Поиск каналов
    Добавить канал/чат
  • Рейтинги
    Рейтинг каналов Рейтинг чатов Рейтинг публикаций
    Рейтинги брендов и персон
  • Аналитика
  • Поиск по публикациям
  • Мониторинг Telegram
  • Продвижение
    Реклама через Яндекс Бизнес Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
VG: VideoLab & Self-Motivated Learning

10 Feb 2025, 11:05

Открыть в Telegram Поделиться Пожаловаться

Коллеги,

Один из главных минусов LLM — это галлюцинации, когда LMM радостно и правдоподобно выдумывает ответ. 🤷‍♂️😁

Вообще мне кажется, что преподавателям общаться с LLM как-то проще. Любой преподаватель, принимавший устный экзамен, видел этих самых "галлюцинаций" море (когда ответ с самым уверенным видом выдумывается 😉). Причем особенно тема сильна на госах, где вопросы из кучи разных тем, довольно часто обновляются и заметно реже преподаватели глубоко компетентны во всех вопросах 😉

Но ровно там, кстати, у любого нормального преподавателя формируется навык по косвенным признакам (+ допвопросу) понять, это галлюцинация или нет 😂🤣😂

С моделями работа тоже идет, в том числе путем обучения моделей говорить "я не знаю" — не самая тривиальная задача, заметим. Одно из направлений — бенчмарки уровня галлюцинаций. Делать их сложно и там есть большие проблемы с разметкой и ошибками первого-второго рода, но некоторый скрининг они дают. Например, Hughes Hallucination Evaluation Model (HHEM) Benchmark, график из которого приведен на заглавной картинке. С его методикой не все волшебно (она заточена на RAG + есть вопросы к точности модели), но в целом это численная оценка и хорошо видно, как она довольно быстро снижается.

Интересно, что график уже устарел и две свежих модели от Google обогнали недельной давности модель от Open AI, т.е. соревнование идет довольно бодро 😲😲😲💪💪💪

Ну и кто пропустил, Андрей Карпаты (ранее директор по AI в Tesla и сооснователь OpenAI), про которого я довольно регулярно пишу (раз, два, три) выпустил лекцию "Deep Dive into LLMs" на 3,5 часа. Там уже полмиллиона просмотров за 4 дня и, очевидно, будет намного больше! У человека однозначно талант очень кратко, емко и достаточно четко (без серьезных искажений при упрощении) излагать материал. Это реально сложно. Я посмотрел уже больше половины (не успел все за выходные))) и весьма рекомендую, как впрочем, и предыдущие видео Андрея.

Из интересного: на обучение GPT-2 в 2019 году затратили примерно $40.000. Летом 2024 Карпаты показал, как можно примерно повторить результат, затратив $672. Сейчас, зимой 2025 он оценивает, что результат можно повторить за $100 (из-за прогресса железа, доступных почищенных данных и алгоритмов). Прогресс в 400 раз за 6 лет!!! 😲 Сильно! Интересно, через сколько лет воспроизведение GPT 3.5 можно будет давать в качестве задания спецкурса? 😉 В любом случае мне очень импонирует его сравнение обучения модели со сжатием с потерями (с очень нетривиальной оценкой качества результата, кстати).

Галлюцинациям (их причинам, а также методам по их уменьшению) Карпаты посвящает заметный кусок изложения, очень понятно объясняя, почему при использовании поиска уровень галлюцинаций сокращается, как его в принципе можно сокращать, почему это не так просто и как это будут делать.

Кстати, давно не видел комментариев типа "да что может этот стохастический попугай!".

Не знаете почему? 😉

P.S. Почему специалисты очень часто неверно прогнозируют развитие экспоненциальных процессов я когда-то подробно описывал на Хабре. Там в начале пачка примеров типа:
«У телефона слишком много недостатков, чтобы его можно было серьезно рассматривать, как средство коммуникации. Устройство не представляет для нас никакой ценности», — писали специалисты Western Union, тогда крупнейшей телеграфной компании в 1876 году.

Я бы не переоценивал потенциала LLM, но и недооценивать его не стоит. Серьезные недостатки технологии лечатся очень быстро и... оно взлетает.

Всем лучшего понимания идущих процессов! 😁

#speed_of_progress

1.1k 0 10 6
Каталог
Каталог каналов и чатов Подборки каналов Поиск каналов Добавить канал/чат
Рейтинги
Рейтинг каналов Telegram Рейтинг чатов Telegram Рейтинг публикаций Рейтинги брендов и персон
API
API статистики API поиска публикаций API Callback
Наши каналы
@TGStat @TGStat_Chat @telepulse @TGStatAPI
Почитать
Академия TGStat Исследование Telegram 2019 Исследование Telegram 2021 Исследование Telegram 2023
Контакты
Справочный центр Поддержка Почта Вакансии
Всякая всячина
Пользовательское соглашение Политика конфиденциальности Публичная оферта
Наши боты
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot