📄 Блогпост
🌵 Стартап Cactus Compute выпустил крохотную модель Needle 2 с весом чекпоинта всего 14 Mb для tool calling и работы со структурированными входа для edge устройств.
Исходная модель имеет 45M параметров, поверх нее применяется CQ-2bit квантизация (некая проприетарная техника).
Квантизация получается в процессе обучения (Quantization Aware Training).
⚡ Скорость
На префилле скорость 800+ tok/s, и 500+ tok/s на декоде на Raspberry Pi 5. Еще оно якобы быстро генерит на VR устройствах и Samsung-ах.
🏗️ Архитектура
Архитектура основана на ихней же работе Simple Attention Network. Там немало архитектурных прибамбасов:
• mHC
• Engram
• Hadamard MLP. Дабы сэкономить на параметры, параметризуют веса как произведение диагональной на Адамарову матрицу.
• GQA + Sliding Attention + синки для тулов
Needle 2 производит меньше операций на токен против традиционной трансформерной архитектуры.
📚 Обучение
На обучение потратили 115B токенов из проприетарных токенов и 38B на посттрейн, что на порядки меньше, чем у LFM.
📊 Бенчмарки
Модель оценивают на бенчмарках:
• Mobile Actions
• Droid Call
• Seal-Tools
• BFCL v4
🎯 Оно выходит по качеству близко к Function Gemma 270M, LFM 2.5 230M, Apple FM, будучи при этом гораздо меньше.
🌵 Стартап Cactus Compute выпустил крохотную модель Needle 2 с весом чекпоинта всего 14 Mb для tool calling и работы со структурированными входа для edge устройств.
Исходная модель имеет 45M параметров, поверх нее применяется CQ-2bit квантизация (некая проприетарная техника).
Квантизация получается в процессе обучения (Quantization Aware Training).
⚡ Скорость
На префилле скорость 800+ tok/s, и 500+ tok/s на декоде на Raspberry Pi 5. Еще оно якобы быстро генерит на VR устройствах и Samsung-ах.
🏗️ Архитектура
Архитектура основана на ихней же работе Simple Attention Network. Там немало архитектурных прибамбасов:
• mHC
• Engram
• Hadamard MLP. Дабы сэкономить на параметры, параметризуют веса как произведение диагональной на Адамарову матрицу.
• GQA + Sliding Attention + синки для тулов
Needle 2 производит меньше операций на токен против традиционной трансформерной архитектуры.
📚 Обучение
На обучение потратили 115B токенов из проприетарных токенов и 38B на посттрейн, что на порядки меньше, чем у LFM.
📊 Бенчмарки
Модель оценивают на бенчмарках:
• Mobile Actions
• Droid Call
• Seal-Tools
• BFCL v4
🎯 Оно выходит по качеству близко к Function Gemma 270M, LFM 2.5 230M, Apple FM, будучи при этом гораздо меньше.