Llama 4: Новый уровень ИИ с мультимодальностью и минимальным смещением.
Meta* представила Llama 4 — новую линейку моделей, которая обещает стать революцией в мире искусственного интеллекта. Эти модели не только поддерживают беспрецедентную длину контекста (256K токенов), но и демонстрируют значительные улучшения в рассуждениях, кодировании и математике.
Llama 4 Maverick и Llama 4 Scout — первые открытые модели с архитектурой "mixture-of-experts" (MoE). Они способны работать с текстом, изображениями и другими форматами данных, что делает их универсальными инструментами для разработчиков.
Благодаря использованию iRoPE (interleaved attention layers без позиционных эмбеддингов) и температурного масштабирования внимания, модели могут эффективно обрабатывать длинные последовательности данных. Это особенно важно для задач, таких как "поиск иголки в стоге сена" или работа с большими объемами кода.
Llama 4 показывает значительное улучшение в нейтральности ответов. Процент отказов от ответов на спорные политические или социальные темы снизился до менее 1%, а проявление предвзятости стало вдвое меньше по сравнению с Llama 3.3.
Исследователи внедрили стратегию непрерывного онлайн-обучения с подкреплением (RL), где модель фильтрует и сохраняет только сложные запросы. Это позволило значительно повысить точность в таких областях, как математика, логика и программирование.
Meta разработала новый метод тестирования — Generative Offensive Agent Testing (GOAT). Этот подход имитирует многоходовые взаимодействия с "среднеквалифицированными" злоумышленниками, что помогает выявлять уязвимости быстрее и эффективнее.
Это только начало. Meta продолжает работу над Llama 4 Behemoth — моделью с почти 2 трлн параметров, которая уже превосходит GPT-4.5, Claude Sonnet 3.7 и Gemini 2.0 Pro в STEM-задачах. Результаты этой работы будут представлены на конференции LlamaCon 29 апреля.
*Meta и ее продукты (Facebook, Instagram) запрещены на территории РФ.
Meta* представила Llama 4 — новую линейку моделей, которая обещает стать революцией в мире искусственного интеллекта. Эти модели не только поддерживают беспрецедентную длину контекста (256K токенов), но и демонстрируют значительные улучшения в рассуждениях, кодировании и математике.
Llama 4 Maverick и Llama 4 Scout — первые открытые модели с архитектурой "mixture-of-experts" (MoE). Они способны работать с текстом, изображениями и другими форматами данных, что делает их универсальными инструментами для разработчиков.
Благодаря использованию iRoPE (interleaved attention layers без позиционных эмбеддингов) и температурного масштабирования внимания, модели могут эффективно обрабатывать длинные последовательности данных. Это особенно важно для задач, таких как "поиск иголки в стоге сена" или работа с большими объемами кода.
Llama 4 показывает значительное улучшение в нейтральности ответов. Процент отказов от ответов на спорные политические или социальные темы снизился до менее 1%, а проявление предвзятости стало вдвое меньше по сравнению с Llama 3.3.
Исследователи внедрили стратегию непрерывного онлайн-обучения с подкреплением (RL), где модель фильтрует и сохраняет только сложные запросы. Это позволило значительно повысить точность в таких областях, как математика, логика и программирование.
Meta разработала новый метод тестирования — Generative Offensive Agent Testing (GOAT). Этот подход имитирует многоходовые взаимодействия с "среднеквалифицированными" злоумышленниками, что помогает выявлять уязвимости быстрее и эффективнее.
Это только начало. Meta продолжает работу над Llama 4 Behemoth — моделью с почти 2 трлн параметров, которая уже превосходит GPT-4.5, Claude Sonnet 3.7 и Gemini 2.0 Pro в STEM-задачах. Результаты этой работы будут представлены на конференции LlamaCon 29 апреля.
*Meta и ее продукты (Facebook, Instagram) запрещены на территории РФ.