Репост из: Анализ данных (Data analysis)
🎉OLMo2 установили новый стандарт для релизов с открытым исходным кодом. 🫡
Пристегните ремни -
выпущен подробный репорт о OLMo 2 . В нем 50 с лишним страниц о 4 важнейших компонентах конвейера развития LLM.
Они выпустил: Модели, датасеты, код обучения и все возможные данные. А вишенкой на торте стали журналы wandb.
Итак, если вы хотите создать современный LLM? Создатели OLMo 2 делятся полным рецептом.
-----
🔧 Ключевые методы в этой статье:
→ В OLMo 2 реализован двухэтапный подход к обучению: предварительное обучение на 4-5T токенах и обучение на специализированном Dolmino Mix 1124.
→ Архитектура отличается повышенной стабильностью благодаря RMSNorm, переупорядоченной нормализации и QK-норме для вычисления внимания.
→ Трехфазный конвейер тюнинга сочетает в себе контролируемую тонкую настройку, прямую оптимизацию предпочтений и обучение с подкреплением и проверяемым вознаграждением.
→ Инфраструктура обучения включает два кластера (Jupiter и Augusta) с оптимизированным управлением рабочей нагрузкой с помощью системы Beaker.
-----
💡 Основные выводы:
→ Стабильность обучения значительно повышается за счет фильтрации повторяющихся n-грамм и использования инициализации нормальным распределением
→ Обучение в середине обучения на высококачественных данных эффективно расширяет возможности модели
→ Усреднение веса модели неизменно повышает производительность
→ Оптимизация инфраструктуры имеет решающее значение для успешного обучения LLM
-----
📊 Результаты:
→ Модели 7B и 13B соответствуют или превосходят Llama 3.1 и Qwen 2.5, используя меньшее количество FLOPs
→ Оценки GSM8K: 67,5 для 7B, 75,1 для 13B
→ Показатели MMLU: 63,7 для 7B, 67,5 для 13B
💡Подробнее про модель
💡Paper
💡Blog
💡Demo
Пристегните ремни -
выпущен подробный репорт о OLMo 2 . В нем 50 с лишним страниц о 4 важнейших компонентах конвейера развития LLM.
Они выпустил: Модели, датасеты, код обучения и все возможные данные. А вишенкой на торте стали журналы wandb.
Итак, если вы хотите создать современный LLM? Создатели OLMo 2 делятся полным рецептом.
-----
🔧 Ключевые методы в этой статье:
→ В OLMo 2 реализован двухэтапный подход к обучению: предварительное обучение на 4-5T токенах и обучение на специализированном Dolmino Mix 1124.
→ Архитектура отличается повышенной стабильностью благодаря RMSNorm, переупорядоченной нормализации и QK-норме для вычисления внимания.
→ Трехфазный конвейер тюнинга сочетает в себе контролируемую тонкую настройку, прямую оптимизацию предпочтений и обучение с подкреплением и проверяемым вознаграждением.
→ Инфраструктура обучения включает два кластера (Jupiter и Augusta) с оптимизированным управлением рабочей нагрузкой с помощью системы Beaker.
-----
💡 Основные выводы:
→ Стабильность обучения значительно повышается за счет фильтрации повторяющихся n-грамм и использования инициализации нормальным распределением
→ Обучение в середине обучения на высококачественных данных эффективно расширяет возможности модели
→ Усреднение веса модели неизменно повышает производительность
→ Оптимизация инфраструктуры имеет решающее значение для успешного обучения LLM
-----
📊 Результаты:
→ Модели 7B и 13B соответствуют или превосходят Llama 3.1 и Qwen 2.5, используя меньшее количество FLOPs
→ Оценки GSM8K: 67,5 для 7B, 75,1 для 13B
→ Показатели MMLU: 63,7 для 7B, 67,5 для 13B
💡Подробнее про модель
💡Paper
💡Blog
💡Demo