Не все LLM одинаково полезны: зачем мы построили собственный бенчмарк для МАГ
Мы готовимся открыть регистрацию в МАГ, но столкнулись с неожиданным вызовом. Переход на новый контур мультимодельности показал: модели, которые раньше работали стабильно, начали вести себя непредсказуемо. Причина — в следовании инструкциям и совместимости с нашей инфраструктурой.
Создать «обертку» над моделью сейчас легко (как это сделали в Yandex, встроив Claude Code в свой VibeCraft). Но мы строим открытую мультимодельную инфраструктуру. И тут оказалось, что стандартных тестов недостаточно. Нужен комплексный тест совместимости каждой модели с нашей платформой.
Так родился наш базовый бенчмарк. Результаты уже впечатляют:
Из 100+ популярных кодинг-моделей тест прошли только 11.
Особенно приятно, что отечественная YandexGPT Pro 5.1 успешно справилась с испытанием.
На скриншотах видно, как выглядит наш внутренний тест. Сейчас он состоит из 8 последовательных этапов проверки инфраструктуры. Выглядит это пока не идеально, но зато дает четкое понимание, как стабилизировать платформу под мультимодельность.
Двигаемся дальше. Следите за обновлениями!
Мы готовимся открыть регистрацию в МАГ, но столкнулись с неожиданным вызовом. Переход на новый контур мультимодельности показал: модели, которые раньше работали стабильно, начали вести себя непредсказуемо. Причина — в следовании инструкциям и совместимости с нашей инфраструктурой.
Создать «обертку» над моделью сейчас легко (как это сделали в Yandex, встроив Claude Code в свой VibeCraft). Но мы строим открытую мультимодельную инфраструктуру. И тут оказалось, что стандартных тестов недостаточно. Нужен комплексный тест совместимости каждой модели с нашей платформой.
Так родился наш базовый бенчмарк. Результаты уже впечатляют:
Из 100+ популярных кодинг-моделей тест прошли только 11.
Особенно приятно, что отечественная YandexGPT Pro 5.1 успешно справилась с испытанием.
На скриншотах видно, как выглядит наш внутренний тест. Сейчас он состоит из 8 последовательных этапов проверки инфраструктуры. Выглядит это пока не идеально, но зато дает четкое понимание, как стабилизировать платформу под мультимодельность.
Двигаемся дальше. Следите за обновлениями!