TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
AIсповедь

18 Sep, 13:25

Telegram'da ochish Ulashish Shikoyat qilish

Дизраптор dan repost
Харнесс решает всё больше

Пару недель назад OpenAI выкатила GPT-6 Astra и пафосно объявила "эру AGI". Один из аргументов был такой: новая модель набирает 99,9% на ARC-AGI-3. Это, если что, специальный тест, где ИИшку закидывают в незнакомые мини-игры без инструкции (ни цели, ни правил, ни даже что каждая кнопка делает). И смотрят, как она будет методом ИИ-тыка разбираться и во всё это дело играть.

Авторы теста прогнали Astra и в стандартной обвязке, общей для разных провайдеров, и с Provider Adapter от OpenAI. При одинаковом максимальном уровне reasoning результат вырос с 62,7% до 98,6%. А на high - с 54,8% до 99,9%». 

Откуда такая разница? Каждый ход в игре - это отдельный запрос к модели. В стандартной обвязке между ходами выживают только заметки, которые модель сама себе написала. Представьте себе шахматиста, которому после каждого хода отшибает память, и остаются только записи в блокноте. А обвязка от OpenAI позволяла сохранять между запросами скрытое состояние reasoning и использовать compaction длинного контекста - то есть гораздо лучше переносить уже проделанную работу между ходами. Если более научно, то такую обвязку называют harness (буквально "упряжка", как у лошади).

И вот моя любимая строчка из их таблицы: в харнессе модель с ВЫКЛЮЧЕННЫМ режимом рассуждений набрала 96,7%. То есть, вообще не думая, она на 30+ процентов обошла саму себя, думающую на максимум, но в стандартной "упряжке".

И ещё один пример поближе. Алиса AI на днях начала сама выбирать модель под запрос: на всякое простое отвечает быстрая модель, а на запрос вроде "Какие вычеты положены за лечение и курсы ребёнка" включается тяжёлый режим "Эксперт". Сейчас около 80% всех запросов обрабатывает собственная Alice AI LLM. Для режима “Эксперт” Яндекс тестирует разные модели - как свои, так и общедоступные с открытыми весами, которые запускаются на инфраструктуре Яндекса. А поверх них работает собственный харнесс Алисы. 

Зачем всё это? CEO Алисы Валерий Стромов прямо сказал Forbes: как инженеру, ему важны качество и скорость, а как руководителю бизнеса - стоимость. Поэтому, гонять самую мощную модель на каждый чих - это как сажать партнёра McKinsey выравнивать иконки в презе. Там же приводят вот такую цифру: несколько десятков инженеров на оптимизации за полгода сэкономили Яндексу ~9 млрд рублей. Это эффект от толковой оптимизации инференса и вычислительной инфраструктуры. 

В одном из прошлых постов про ИИ-модели я писал про MoE - это когда роутер внутри модели под каждое слово выбирает нужную подсеть-эксперта. Тут сейчас похожий принцип, только этажом выше. Роутер выбирает не "эксперта", а целую модель под запрос. Моделей всего 3-5 штук, потому что роутер работает примерно как регистратура в поликлинике, и отправить к терапевту или хирургу ему изи, а вот выбрать нужного из 20 узких спецов по жалобе "что-то бок болит" - уже нет.

Почему харнесс имеет настолько ключевое значение, когда все модели уже подтянулись на более-менее сопоставимый уровень умности - хорошо видно по бытовому запросу а-ля "подбери робот-пылесос дешевле 40 тысяч, чтобы убирал и ковры, и шерсть кота". Внутри модели ответа нет и быть не может, потому что цены и другие нюансы меняются каждую неделю. Значит, надо сходить в поиск, вытащить характеристики, сверить с отзывами и отсеять всё дороже лимита.

И вот это "нашёл → проверил → пошёл дальше" во многом определяется харнессом.

Так что, вопрос "какая ИИшка умнее?" на самом деле потихоньку устаревает, а вот тонкие настройки вокруг неё играют всё более важную роль.

Дизраптор

47 0 0
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot