SmolLM 3: Открытая 3B модель от Huggingface с деталями тренировки
🔥 Huggingface представили SmolLM 3 — самую сильную 3B модель в своем классе, превосходящую Llama-3-3B и Qwen 2.5-3B. Главная ценность релиза — полностью открытые конфиги для тренировки и детальный блогпост, позволяющие легко воспроизвести модель.
В основе SmolLM 3 лежит гибридный ризонинг, а сам процесс тренировки включает трехстадийную схему (Web + Code + Math) с последующим mid-training для расширения контекста и ризонинга. Модель также прошла SFT на 1.8B токенов и тюнинг с Anchored Preference Optimization, сохраняя при этом 128k контекст.
Эти открытые "рецепты" тренировки крайне важны для ускорения исследований и создания новых, улучшенных моделей.
Источник: ai_newz
📌 Источник: эйай ньюз
#ai #ml #nlp #release #open_source #best_practice
📢 Канал: @aiml_daily_ru
🔥 Huggingface представили SmolLM 3 — самую сильную 3B модель в своем классе, превосходящую Llama-3-3B и Qwen 2.5-3B. Главная ценность релиза — полностью открытые конфиги для тренировки и детальный блогпост, позволяющие легко воспроизвести модель.
В основе SmolLM 3 лежит гибридный ризонинг, а сам процесс тренировки включает трехстадийную схему (Web + Code + Math) с последующим mid-training для расширения контекста и ризонинга. Модель также прошла SFT на 1.8B токенов и тюнинг с Anchored Preference Optimization, сохраняя при этом 128k контекст.
Эти открытые "рецепты" тренировки крайне важны для ускорения исследований и создания новых, улучшенных моделей.
Источник: ai_newz
📌 Источник: эйай ньюз
#ai #ml #nlp #release #open_source #best_practice
📢 Канал: @aiml_daily_ru