Гонка за числом параметров в фундаментальных моделях постепенно уступает место борьбе за экономику вычислений.
В колонке для «Известий» исполнительный директор Ассоциации больших данных Алексей Нейман разбирает, почему масштабирование «в лоб» упирается в бюджеты и как меняется технологический стек.
В центре внимания — архитектура Mixture of Experts, где модель хранит сотни миллиардов параметров, но на каждый запрос активирует лишь малую часть. На примерах решений от Google, Z.ai и недавнего релиза от «Яндекса» автор показывает общий сдвиг: критичным становится не номинальный размер сети, а объем активных вычислений на один токен.
Для корпоративного сектора этот переход принципиален в сложных сценариях. В длинных цепочках и мультиагентных пайплайнах, где одна бизнес-задача требует десятков обращений к модели и внешним инструментам, разница в стоимости запроса начинает напрямую определять окупаемость внедрения. Полный разбор смены парадигмы — в первоисточнике.
💜 Telegram 🔴 MAX 🔴 Дзен
В колонке для «Известий» исполнительный директор Ассоциации больших данных Алексей Нейман разбирает, почему масштабирование «в лоб» упирается в бюджеты и как меняется технологический стек.
В центре внимания — архитектура Mixture of Experts, где модель хранит сотни миллиардов параметров, но на каждый запрос активирует лишь малую часть. На примерах решений от Google, Z.ai и недавнего релиза от «Яндекса» автор показывает общий сдвиг: критичным становится не номинальный размер сети, а объем активных вычислений на один токен.
Для корпоративного сектора этот переход принципиален в сложных сценариях. В длинных цепочках и мультиагентных пайплайнах, где одна бизнес-задача требует десятков обращений к модели и внешним инструментам, разница в стоимости запроса начинает напрямую определять окупаемость внедрения. Полный разбор смены парадигмы — в первоисточнике.
💜 Telegram 🔴 MAX 🔴 Дзен