TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
Dimension AI | Dmitry Sirakov

22 Nov 2025, 19:19

Telegram'da ochish Ulashish Shikoyat qilish

GigaChat 3 Ultra - успех или провал? [Часть 2/4]

Какой вывод из этого можно сделать?


В каком-то смысле здесь сталкиваются две стратегии: Chinchilla-Optimal, DeepMind и Inference-Optimal, Meta*.

1. Chinchilla-Optimal. Суть - подобрать размер модели и объём данных так, чтобы получить минимальный LOSS за фиксированный бюджет обучения. Подробнее можно глянуть у Игоря Котенкова в его плейлисте история GPT, у него всё изложено по полочкам, в последовательном (историческом) порядке и даст понимание, какие там были интриги и разоблачения.

2. Inference-Optimal. Суть - обучение стоит очень дорого, но оно РАЗОВОЕ, а инференс - БЕСКОНЕЧНЫЙ. Поэтому давайте оверфитить модель до предела, чтобы выжать из параметров максимум, но сделать её максимально дешевой, эффективной в запуске и, как следствие, удобной для использования в продуктовых задачах.

Шиншилла:

DeepSeek (671B): должно быть 671B * 20 = 13.4T в обучении, а по факту - 14.8T. То есть максимально оптимальное обучение по Шиншилле

Kimi K2 (1T): должно быть 1000B * 20 = 20T токенов в обучении, а по факту - 15.5T. Да, модель недообучена и неэффективна, но, думаю, здесь ставка была сделана на 1T параметров с расчетом на последующее сжатие в различных форматах.

Qwen3 (235B): должно быть 235B * 20 = 4.7T токенов в обучении, а по факту - 36T токенов. То есть Qwen получил почти в 7.5 РАЗ БОЛЬШЕ ДАННЫХ, ЧЕМ НУЖНО. Лишь бы модель была ёмкой и быстрой в инференсе для пользователей и бизнеса (Alibaba Cloud, удобный инференс на одной карте - думаю, это связано).

А что делает GigaChat?
По Шиншилле - оптимально, но количество синтетики неприлично большое. Ладно бы, если бы это был в основном рерайт (как у Kimi), а так получается, что это дистилляция опенсорс-модели (в духе DeepSeek, когда они обучали Qwen и Llama на синтетике от большой модели).

В этом нет ничего плохого (даже с учетом громких заявлений, что это не Дипсик, мы не как яндекс, не путайте пжпжпж. Хотя размер претрейна - одинаковый, а по результатам +- сопоставимых моделей по размеру яндекса лучше) и вообще к нему отношения не имеет, хотя 40% данных кем-то сгенерированы), но, кажется, результат можно было сделать лучше. Либо уменьшить количество параметров и «накормить» её 15T токенов (как делал, например, Яндекс в GPT 5 Lite), либо уменьшить «синту» и уделить еще больше внимания добыче, фильтрации данных и подаче их под разными углами, как делает это Kimi K2.

* Meta признана экстремистской организацией и запрещена на территории РФ.

789 0 5 21
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot