Господа!
Забавно, но я до сих пор встречаю людей, которые оценивают ситуацию с нейросетями так, как будто они не будут улучшаться. "Да, но это работает не очень", "Да, но они галлюцинируют" и т.д.
Да, галлюцинируют. Но это заявляется так, как будто люди не галлюцинируют. Я бы тоже может быть возмущался, если бы (довольно регулярно и чаще, чем хотелось бы) не ловил себя на галлюцинациях 😉 Мы же на этом основании не делаем вывод о невозможности или серьезных ограничениях использования людей. Ну по крайней мере пока 😉 Пока модели галлюцинируют чаще 😉
Короче! Прошло 4 для конференции и меня не перестает поражать масштаб. 6000 статей это реально много. Огромный зал, в котором такие улицы, на которых народ толпится как в метро в часы пик (вообще куча участников жалуется на толпы — они не зря призывали авторов постеров не приезжать — что крайне необычно для конференций). Всего таких "улиц" 23 штуки по 18 постеров с каждой стороны. И они менялись 3 раза в день 3 дня. В общем даже просто обежать все, это как весь Эрмитаж обежать, причем несколько раз) А ведь там просто обегать смысла нет. Смысл в том, чтобы останавливаться, слушать, вопросы задавать, думать (как и в Эрмитаже))). Короче! Масштаб бедствия растет на глазах! 😁
Ну и к вопросу тех же галлюцинаций. Публикаций на их счет полно. Работа по их уменьшению идет по большому спектру направлений. Тут, например:
* Все более и более сложная фильтрация обучающих данных (благо качество новых моделей это позволяет). Видел аж несколько статей, показывающих, как на меньшей обучающей выборке (но более сложно подобранной) результат оказывается лучше, чем на полном наборе.
* Целенаправленный fine-tune, как для подтягивания специфичных данных, так и для того, чтобы модель научилась "наказывать" себя за галлюцинации.
* RLHF / RLAIF с акцентом на фактическую точность, кстати, тут интересный сдвиг — если раньше фронтирные лабы специально нанимали людей для разметки таких датасетов, то сегодня много можно получить "почти бесплатно" за счет разметки пользователей, причем забавно, что часто платные пользователи оставляют лучшую обратную связь по ответам, чем бесплатные!
* Архитектурные и регуляризационные приёмы (teacher forcing, label smoothing), обучение на задачах с явным ответом «не знаю» / «нет данных», классический RAG, построение draft + judge систем.
* Большое количество post-processing методов — явная аннотация всех ключевых утверждений ссылками, сопоставление утверждений с содержимым ссылок, формирование списка проверочных вопросов и их обработка (CoVe, self-checking), оценка уверенности в отдельных утверждениях и ответе.
* Улучшение запросов и коммуникации — явное уточнение неопределенных мест в запросе (привычные вопросы модели, особенно переде deep research), разбиение сложной задачи на подзадачи, их оркестрация, инструкции снижающие галлюцинации для конкретных кейсов в промпте и скилах
И это сильно неполный список! Т.е. даже просто перечисление названий направлений работ, ведущих к уменьшению галлюцинаций, потребует несколько таких постов! И эта работа очень активно ведется в муравейнике с моих фото выше во все больших и больших масштабах (с большим количеством людей и статей). 😁
Интересно, сколько статей примут на NeuIPS и ACMMM? (в том числе наших)))
А про ICML и дождливый теплый Сеул еще напишу!)
Stay tuned! 😁
Больше про конференции:
#pro_conferences@vgcourse
Забавно, но я до сих пор встречаю людей, которые оценивают ситуацию с нейросетями так, как будто они не будут улучшаться. "Да, но это работает не очень", "Да, но они галлюцинируют" и т.д.
Да, галлюцинируют. Но это заявляется так, как будто люди не галлюцинируют. Я бы тоже может быть возмущался, если бы (довольно регулярно и чаще, чем хотелось бы) не ловил себя на галлюцинациях 😉 Мы же на этом основании не делаем вывод о невозможности или серьезных ограничениях использования людей. Ну по крайней мере пока 😉 Пока модели галлюцинируют чаще 😉
Короче! Прошло 4 для конференции и меня не перестает поражать масштаб. 6000 статей это реально много. Огромный зал, в котором такие улицы, на которых народ толпится как в метро в часы пик (вообще куча участников жалуется на толпы — они не зря призывали авторов постеров не приезжать — что крайне необычно для конференций). Всего таких "улиц" 23 штуки по 18 постеров с каждой стороны. И они менялись 3 раза в день 3 дня. В общем даже просто обежать все, это как весь Эрмитаж обежать, причем несколько раз) А ведь там просто обегать смысла нет. Смысл в том, чтобы останавливаться, слушать, вопросы задавать, думать (как и в Эрмитаже))). Короче! Масштаб бедствия растет на глазах! 😁
Ну и к вопросу тех же галлюцинаций. Публикаций на их счет полно. Работа по их уменьшению идет по большому спектру направлений. Тут, например:
* Все более и более сложная фильтрация обучающих данных (благо качество новых моделей это позволяет). Видел аж несколько статей, показывающих, как на меньшей обучающей выборке (но более сложно подобранной) результат оказывается лучше, чем на полном наборе.
* Целенаправленный fine-tune, как для подтягивания специфичных данных, так и для того, чтобы модель научилась "наказывать" себя за галлюцинации.
* RLHF / RLAIF с акцентом на фактическую точность, кстати, тут интересный сдвиг — если раньше фронтирные лабы специально нанимали людей для разметки таких датасетов, то сегодня много можно получить "почти бесплатно" за счет разметки пользователей, причем забавно, что часто платные пользователи оставляют лучшую обратную связь по ответам, чем бесплатные!
* Архитектурные и регуляризационные приёмы (teacher forcing, label smoothing), обучение на задачах с явным ответом «не знаю» / «нет данных», классический RAG, построение draft + judge систем.
* Большое количество post-processing методов — явная аннотация всех ключевых утверждений ссылками, сопоставление утверждений с содержимым ссылок, формирование списка проверочных вопросов и их обработка (CoVe, self-checking), оценка уверенности в отдельных утверждениях и ответе.
* Улучшение запросов и коммуникации — явное уточнение неопределенных мест в запросе (привычные вопросы модели, особенно переде deep research), разбиение сложной задачи на подзадачи, их оркестрация, инструкции снижающие галлюцинации для конкретных кейсов в промпте и скилах
И это сильно неполный список! Т.е. даже просто перечисление названий направлений работ, ведущих к уменьшению галлюцинаций, потребует несколько таких постов! И эта работа очень активно ведется в муравейнике с моих фото выше во все больших и больших масштабах (с большим количеством людей и статей). 😁
Интересно, сколько статей примут на NeuIPS и ACMMM? (в том числе наших)))
А про ICML и дождливый теплый Сеул еще напишу!)
Stay tuned! 😁
Больше про конференции:
#pro_conferences@vgcourse