TGStat
TGStat
Qidiruv uchun matnni kiriting
Ilg‘or kanal qidiruvi
  • flag Uzbek
    Sayt tili
    flag Russian flag English flag Uzbek
  • Saytga kirish
  • Katalog
    Kanal va guruhlar katalogi Hududiy to‘plamlar Tematik to‘plamlar Платные каналы Kanallar qidiruvi
    Kanal/guruh qo‘shish
  • Reytinglar
    Kanallar reytingi Guruhlar reytingi Postlar reytingi
    Brendlar va shaxslar reytingi
  • Analitika
  • Postlarda qidiruv
  • Telegram'ni kuzatish
  • Targ‘ibot
    Yandex Business orqali reklama TGStat Agency orqali kanallarda reklama TGStat.ru saytida reklama
Dimension AI | Dmitry Sirakov

22 Nov 2025, 19:18

Telegram'da ochish Ulashish Shikoyat qilish

GigaChat 3 Ultra - успех или провал? [Часть 1/4]

Команда GigaChat выкатила пост на Хабре про свою опенсорсную модель — GigaChat 3 Ultra Preview (целых 712B / 36B активных параметров, наравне с DeepSeek V3 (671B / 37B), чуть меньше Kimi K2 (1T / 32B) и больше Qwen3 (235B / 22B)). Очень интересный репорт, предлагаю обсудить.

Pretrain 😎

GigaChat 3 Ultra (далее - гигачат) использовал в претрейне 14T токенов, среди которых 5.5T - синтетические данные (порядка 40% от общего объема претрейна, ничего себе). Часть из них генерируются по PromptCOT. Суть: генерируем разнообразные задачи, а потом их решаем и «подкладываем» в датасет. Занимательно, что для генерации синтетики использовался кластер. Поэтому предполагаю, что применялись опенсорсные модели (а судя по архитектуре - вероятнее всего, и сам DeepSeek). Насколько это хорошее решение? Предлагаю обратиться к «старшим братьям».

Qwen3 235B - 36T токенов в претрейне. Откуда они их взяли? Давайте разбираться.
В репорте Qwen2.5-Coder есть фраза: «We used CodeQwen1.5, the predecessor of Qwen2.5-Coder, to generate large-scale synthetic datasets». Это касается Continuous Pretrain (проще говоря, инициализируют базовую модель Qwen2.5, у которой 18T токенов в претрейне, и дообучают на дополнительных 5.5T, где, судя по цитате выше, много синтетических данных).
В самом репорте Qwen2.5 пишут, что рост с 7T до 18T токенов был достигнут в том числе за счет генерации синтетики. Из этого хочется сделать вывод, что значительная часть датасета синтетическая. Здесь ребята делают ставку на то, что модель должна быть поменьше, а данных - побольше (в разных вариациях), и модель должна видеть их много раз, чтобы они «вдолбились» в такое маленькое число параметров.

Kimi K2 1T (почти в 4 раза больше, чем вышеописанный Qwen) имеет всего 15.5T токенов в претрейне. Неожиданный поворот событий. В репорте Kimi K2 поясняют это так: «Simply increasing the amount of data is not a long-term solution» (почти кидая камень в огород Qwen, у которого один из самых крупных датасетов на рынке, но это лишь мои догадки).
И что они делают? Они ПЕРЕФРАЗИРУЮТ качественные данные и учебники, подавая модели ту же информацию под другим углом, и, как заявляют, это помогает бороться с переобучением. А на параметры не обращаем внимания - главное, чтобы модель могла запомнить ту информацию, которую мы ей даем.

DeepSeek V3 671B, 14.8T в претрейне. Я не нашел в тех. репорте упоминания синтетики в контексте претрейна; вероятно, это чистые данные из доступных им источников. А «синта» использовалась на этапах SFT / RL, чего я пока не хочу касаться. Политика почти та же, что и у Kimi K2. На самом деле, архитектурно DeepSeek и Kimi K2 - практически одно и то же.

810 0 8 25
Katalog
Kanal va guruhlar katalogi Kanallar to‘plamlari Kanallar qidiruvi Kanal/guruh qo‘shish
Reytinglar
Telegram-kanallar reytingi Telegram-guruhlar reytingi Postlar reytingi Brendlar va shaxslar reytingi
API
Statistika API'si Postlar qidiruvi API'si API Callback
Kanallarimiz
@TGStat @TGStat_Chat @telepulse @TGStatAPI
O‘qish
Академия TGStat Telegram tadqiqoti 2019 Telegram tadqiqoti 2021 Telegram tadqiqoti 2023
Kontaktlar
Справочный центр Qo‘llab-quvvatlash Email Vakansiyalar
Har xil narsalar
Foydalanuvchi shartnomasi Maxfiylik siyosati Ommaviy oferta
Botlarimiz
@TGStat_Bot @SearcheeBot @TGAlertsBot @tg_analytics_bot @TGStatChatBot