Ornith-1.5: новая семья open-source моделей с упором на самообучение
В линейку вошли три версии: 9B Dense, 35B MoE и 397B MoE. Авторы делают ставку не только на масштаб, но и на self-improvement: модель сама предлагает новые задачи, строит под них scaffolding и генерирует rollouts для последующего RL-обучения.
По заявленным результатам, Ornith-1.5 показывает сильные цифры на reasoning, coding и agentic-бенчмарках:
Terminal-Bench 2.1 — 86.1
SWE-Bench Verified — 86
SWE-Bench Pro — 65.1
SWE-Bench Multilingual — 79.6
HLE — 44.6
ClawEval — 81.4
Tool Decathlon — 71.2
Авторы также заявляют уровень, сопоставимый с Claude Opus 4.8 в ряде задач.
Все модели выпущены под MIT License. Есть также FP8, GGUF, MLX и NVFP4-квантизации, поэтому линейку можно использовать как для исследований, так и в коммерческих проектах.
Tech Blog:
http://ornith.ai/ornith_1_5.html
Hugging Face:
http://huggingface.co/collections/ornith-ai/ornith-15
В линейку вошли три версии: 9B Dense, 35B MoE и 397B MoE. Авторы делают ставку не только на масштаб, но и на self-improvement: модель сама предлагает новые задачи, строит под них scaffolding и генерирует rollouts для последующего RL-обучения.
По заявленным результатам, Ornith-1.5 показывает сильные цифры на reasoning, coding и agentic-бенчмарках:
Terminal-Bench 2.1 — 86.1
SWE-Bench Verified — 86
SWE-Bench Pro — 65.1
SWE-Bench Multilingual — 79.6
HLE — 44.6
ClawEval — 81.4
Tool Decathlon — 71.2
Авторы также заявляют уровень, сопоставимый с Claude Opus 4.8 в ряде задач.
Все модели выпущены под MIT License. Есть также FP8, GGUF, MLX и NVFP4-квантизации, поэтому линейку можно использовать как для исследований, так и в коммерческих проектах.
Tech Blog:
http://ornith.ai/ornith_1_5.html
Hugging Face:
http://huggingface.co/collections/ornith-ai/ornith-15