Индустрия ИИ долго жила по одному правилу: больше параметров — умнее модель. Каждое следующее поколение фронтирных систем это правило подтверждает — и одновременно упирается в его потолок: больше видеопамяти, больше энергии, больше денег на инференс на каждый шаг качества.
🔎 Например, Google развивает не только флагманскую линейку Gemini, но и компактные модели Gemma — осознанно, а не как временную экономию. Gemma 3 27B на пользовательском бенчмарке LMArena обошла по оценке DeepSeek-V3 — модель на 671 млрд параметров, уступая ей в размере в 25 раз. Ещё показательнее Gemma 3 270M: компания называет её не слабой заменой большой модели, а осознанно маленьким специалистом, и продвигает идею флота небольших моделей, каждая из которых эксперт в своей узкой задаче, вместо одной большой на все случаи жизни. Дообученная под задачу компактная Gemma уже обгоняла крупные проприетарные модели именно на этой задаче.
🇯🇵 Токийская Sakana AI показала второй путь к тому же результату. Их система Fugu Ultra сама — модель всего на 7 млрд параметров, но её работа не в том, чтобы отвечать напрямую, а в том, чтобы решать, какую из чужих моделей подключить к куску задачи и как собрать их ответы в единый результат. По тестам компании, такая система выходит на уровень моделей класса Fable 5 и Mythos Preview на инженерных и научных бенчмарках — не за счёт масштаба, а за счёт маршрутизации. Sakana AI отдельно отмечает практический эффект: такая архитектура снижает зависимость от одного поставщика и обходит риски экспортных ограничений на конкретные системы.
🐳 DeepSeek показывает третий вариант той же логики внутри одной модели. V4-Flash формально насчитывает 284 млрд параметров, но на каждый токен активны только 13 млрд — по качеству модель приблизилась к куда более тяжёлой Opus 4.8, оставаясь при этом в разы дешевле в расчёте на токен.
☁️ MWS AI, входящая в МТС Web Services, формулирует общий вывод отрасли прямым текстом: их Cotype Pro 3 на 27 млрд параметров вошла в тройку лидеров бенчмарка MERA, компактная Cotype Light 3 на 9 млрд — в десятку, и дальше конкурировать одним размером параметров невыгодно ни технически, ни экономически.
У обоих путей есть свой потолок. Компактные модели заметно хуже справляются со сложными многошаговыми и мультимодальными задачами, где глубина рассуждения важнее скорости и цены, — экономия на размере оборачивается реальным потолком возможностей. А оркестраторы вроде Fugu не создают нового интеллекта: они берут в аренду чужой, оставаясь зависимыми от моделей внутри пула.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться
Предел экстенсивного роста заставляет часть индустрии двигаться в обратную сторону — не наращивать модель, а умнее её готовить и использовать. Формула здесь простая: мал да удал.
🔎 Например, Google развивает не только флагманскую линейку Gemini, но и компактные модели Gemma — осознанно, а не как временную экономию. Gemma 3 27B на пользовательском бенчмарке LMArena обошла по оценке DeepSeek-V3 — модель на 671 млрд параметров, уступая ей в размере в 25 раз. Ещё показательнее Gemma 3 270M: компания называет её не слабой заменой большой модели, а осознанно маленьким специалистом, и продвигает идею флота небольших моделей, каждая из которых эксперт в своей узкой задаче, вместо одной большой на все случаи жизни. Дообученная под задачу компактная Gemma уже обгоняла крупные проприетарные модели именно на этой задаче.
🇯🇵 Токийская Sakana AI показала второй путь к тому же результату. Их система Fugu Ultra сама — модель всего на 7 млрд параметров, но её работа не в том, чтобы отвечать напрямую, а в том, чтобы решать, какую из чужих моделей подключить к куску задачи и как собрать их ответы в единый результат. По тестам компании, такая система выходит на уровень моделей класса Fable 5 и Mythos Preview на инженерных и научных бенчмарках — не за счёт масштаба, а за счёт маршрутизации. Sakana AI отдельно отмечает практический эффект: такая архитектура снижает зависимость от одного поставщика и обходит риски экспортных ограничений на конкретные системы.
🐳 DeepSeek показывает третий вариант той же логики внутри одной модели. V4-Flash формально насчитывает 284 млрд параметров, но на каждый токен активны только 13 млрд — по качеству модель приблизилась к куда более тяжёлой Opus 4.8, оставаясь при этом в разы дешевле в расчёте на токен.
☁️ MWS AI, входящая в МТС Web Services, формулирует общий вывод отрасли прямым текстом: их Cotype Pro 3 на 27 млрд параметров вошла в тройку лидеров бенчмарка MERA, компактная Cotype Light 3 на 9 млрд — в десятку, и дальше конкурировать одним размером параметров невыгодно ни технически, ни экономически.
У обоих путей есть свой потолок. Компактные модели заметно хуже справляются со сложными многошаговыми и мультимодальными задачами, где глубина рассуждения важнее скорости и цены, — экономия на размере оборачивается реальным потолком возможностей. А оркестраторы вроде Fugu не создают нового интеллекта: они берут в аренду чужой, оставаясь зависимыми от моделей внутри пула.
💬 Тест Тьюринга. События в сфере ИИ. Подписаться