TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
RnD ML Team

1 Oct, 11:51

Telegram'da ochish Ulashish Shikoyat qilish

🧠 Долгосрочная омнимодальная память

Нужный факт может остаться в старом диалоге, быть на фотографии или в прошедшем видео-звонке. Как его вспомнить? Просто складывать всё в один промпт — не хватит контекста.

На AI RnD Day наш сотрудник Андрей Безбородов рассказал, как команда сравнивала подходы к памяти для разных доменов и модальностей — диалогов, видео и робототехники.

📌 TLDR
В докладе память моделируется через две операции: ingest — принять и сохранить информацию, search — найти эту информацию по запросу. Большое контекстное окно LLM само по себе такой системы не даёт, но служит стартовой отправной точкой. В диалоговых тестах обычный RAG оказался достаточно успешным и сильным решением, причем более сложные схемы не всегда выигрывали.
Для других модальностей, типа видео, критично сохранять визуальную информацию, а не только текстовое саммари, иначе теряется смысл, который зачастую нельзя сохранить простым кепшенингом кадров.

⚙️ RAG
Длинный контекст разбивают на фрагменты, строят для них векторные представления и по вопросу извлекают подходящие куски. Модель получает не всю информацию, а только таргетные знания. У RAG тоже есть слабые места: сведения могут оказаться на границе фрагментов, а похожий по смыслу факт — быть устаревшим. Найти, что пользователь когда-то любил, и понять, что он любит сейчас, — разные задачи. Результаты:

SimpleRAG: На LongMemEval с Qwen3-VL-8B оценка выросла с 41,2% до 50,8%. Подход MemOS дал 53,2%: он хранит память в структуре MemCube, разделяя графовые связи и векторные данные между двумя базами. Однако такую систему сложнее развернуть!

Схема SGR + File Tools с циклом "рассуждение → действие → наблюдение" получила 32,2% — ниже обоих вариантов. То есть наличие агента с инструментами ещё не делает память лучше.

🗜 Почему не сжать найденный текст в вектор?
В xRAG вместо текста документа в модель передают его вектор через обучаемый проектор. В итоге открытая xRAG-7B незначительно обошла RAG на бенче TriviaQA: 58,9% против 56,1%. На внутреннем бенчмарке команды результат составил уже 8,8% против 50,2% у RAG. Успех на одном домене не перенёсся на другой.

🎬 Видео нельзя без потерь превратить в пересказ
WorldMM строит 3 вида памяти: эпизодическую — о конкретных событиях, семантическую — обобщённые факты и связи, визуальную — представления видеофрагментов. Видео режется на клипы по 30c. Qwen-VL описывает кадры, Whisper распознаёт речь. Из описаний формируются тройки вида "объект — отношение — объект", а визуальные представления строит VLM2Vec.

Со всеми типами памяти WorldMM оставался примерно на уровне подачи полного контекста. При отключении визуальной памяти оценка падала с 50% до 41%. Важно отметить, что текстовое описание не сохраняет каждую деталь кадра, и это проблема. Нужные редкие детали или события из кадров уже не из чего восстановить.

🤖 А если это память робота?
M3 Agent объединяет распознавание лиц, транскрибацию и записи эпизодов на базе Qwen-Omni. На бенчмарке M3-Bench-Robots оценка выросла с 18% до 33% у M3 Agent. Но обработка видео занимала примерно столько же времени, сколько оно длится, а формирование ответа — около 30 секунд. Это очень долго и для роботов может быть неприемлимо.

🔚 Выводы
Память стоит выбирать под тип информации и вопросы к ней: поиск по переписке, понимание видео и воспоминания робота требуют разных решений. Начать полезно с простого RAG и сравнения с полным контекстом. Затем можно усложнять систему, когда понятен выигрыш в качестве и его цена по времени.

🔗 Более подробно — в презентации Андрея (в комментариях файлом) и в записи выступления (тайминг: 3:04:55).

#memory #RAG #agents #conference #paperwatch

2.5k 4 43 2 8
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot