Ночью Google выпустила Gemini 4 Argon.
Модель впервые заняла первое место в Vals Index с результатом 68,9%. Этот рейтинг проверяет модели на реальных профессиональных задачах.
Что ещё в цифрах:
1) Terminal-Bench вырос с 19% до 57,6%
2) из 22 тестов индекса в 20 модель входит в топ-5
3) юридических задач решает в 7 раз больше, чем Claude Sonnet 5.5
4) по словам Google, тратит вчетверо меньше токенов и вдвое меньше времени, чем конкурент
5) вывод до 1 млн токенов
Четвёртый пункт для практики важнее рекорда. Модель меньше рассуждает и быстрее доходит до результата, а за каждый токен платите вы.
Один из исследователей Google DeepMind на радостях пошутил, что модель его переросла и ему пора идти в бариста
Но пользоваться Argon пока могут только исследователи по кибербезопасности. Остальным модель откроют позже, когда именно, не сказано.
Скорость и цена ответа сейчас решают больше, чем первое место в рейтинге.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/
Модель впервые заняла первое место в Vals Index с результатом 68,9%. Этот рейтинг проверяет модели на реальных профессиональных задачах.
Что ещё в цифрах:
1) Terminal-Bench вырос с 19% до 57,6%
2) из 22 тестов индекса в 20 модель входит в топ-5
3) юридических задач решает в 7 раз больше, чем Claude Sonnet 5.5
4) по словам Google, тратит вчетверо меньше токенов и вдвое меньше времени, чем конкурент
5) вывод до 1 млн токенов
Четвёртый пункт для практики важнее рекорда. Модель меньше рассуждает и быстрее доходит до результата, а за каждый токен платите вы.
Один из исследователей Google DeepMind на радостях пошутил, что модель его переросла и ему пора идти в бариста
Но пользоваться Argon пока могут только исследователи по кибербезопасности. Остальным модель откроют позже, когда именно, не сказано.
Скорость и цена ответа сейчас решают больше, чем первое место в рейтинге.
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-4-argon/