TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama Реклама в каналах через TGStat Agency Реклама на сайте TGStat.ru
Dealer.AI

13 Aug, 11:26

Telegram'da ochish Ulashish Shikoyat qilish

Про культурный код моделей и соответствие каким-то ценностям LLM.

Мне много стали присылать в лс такую новость. 😬

Тлдр. Модели AI будут проверять на соответствие культурным ценностям, для получения звания национальных или суверенных. 😐

Я очень много писал о том, почему такие проверки сделать непросто. Вот пример. 🦻

Если коротко, на просторах сети мало русских текстов в отношении доли к английским. И тк модели учатся в тч на этих текстах, их доля там превалирует, ну иначе, вам не обучить модель на 700B параметров только на ру базе, это будет не оптимально. Да есть синта, соглашусь, но синта не даёт такой буст, как мультилингв данные.

Таким образом, на этапе уже предобучения у вас лежит возможность сгенерировать не то, что соответствует культурному коду вашей страны. Особенно если перейти на запрос на английском или китайском языках.

Что же с ру LLM?

А теперь если посмотреть на все модели в ру сегменте, то это или Qwen-like модели, с инициализацией с весов (а значит часть информации уже лежало там с претрена китайцами), или модели, где 65%+ не ру дата в претрене.

Отсюда остаётся вопросы:
Как пройти проверку?
Какие эксперты, на каких сетах и на каком языке будут проверять соответствие?

В целом, тк уже на уровне языков в обучении можно пробить модель на чужой культурный код, то остаются только методы:
- гвардов сверху и спец логики рядом, тот же RAG (если обстрел по апи), но это не модель уже а система

- sft и RL элаймент модели под нужное поведение под сеты оценки, а я не уверен, что методология и сеты оценки будут закрыты от оцениваемых.

И оба способа НЕ идеальны, тк и в гардах и sft/RL есть понятие OOV примеров, те запросов, которые модель никогда не видела и даже не смогла на уровне "эмерджентности" аппроксимировать. Те вас рано или поздно пробьют всеравно. А ещё есть галлюцинации... 🚬

Таким образом, пройти проверку можно, есть и хаки, и честные способы, но и есть понятные причины рисков. И будет жутко интересно, особенно, когда какая-то модель пройдёт тесты, а потом в какой-то соц сети её пробьют, выложат скрины и скажут, ну как так. Что уже не раз бывало. 👍

#ИИзнанка
Dealer.AI
Вы спросили —Дядя отвечает. Истина находится где-то по середине. Действительно на нашем рынке можно встретить множество решений вокруг открытых моделей с huggingface или же апи модных нынче Midjourney.  Это может работать по принципу перевел с ру на ен и вкинул в апиху, далее выдал результат. Обычно...

5.2k 8 32 48 24
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot