Inco выпустила Splash – новый движок для локальных языковых моделей на Mac. В тесте разработчиков Qwen3.8-27B на коротких запросах генерирует примерно вдвое быстрее oMLX и втрое быстрее Ollama.
Решил проверить на своём Mac mini M4 Pro с 64 ГБ памяти. Прогнал одинаковые задания с контекстом 8K, 16K, 32K и дополнительно 128K. Как у Inco: medium и лимит 1024 токена.
У меня получились такие результаты:
• Splash генерировал быстрее Ollama: на 67% на 8K, на 69% на 16K, на 74% на 32K.
• На 128K Splash генерировал примерно в 2,8 раза быстрее Ollama. При первом чтении контекста 128K первый токен появился примерно через 38 минут у Ollama и 33 минуты у Splash.
• Проверил Pi на исправлениях кода со штатным бюджетом ответа. Оба варианта выполнили все три задания и прошли все 27 проверок. Вся цепочка со Splash заняла на 69% меньше времени.
У пакетов разное квантование; это сравнение готовых вариантов запуска.
Разбор и графики в блоге 🖥
Выводы делайте сами.
Решил проверить на своём Mac mini M4 Pro с 64 ГБ памяти. Прогнал одинаковые задания с контекстом 8K, 16K, 32K и дополнительно 128K. Как у Inco: medium и лимит 1024 токена.
У меня получились такие результаты:
• Splash генерировал быстрее Ollama: на 67% на 8K, на 69% на 16K, на 74% на 32K.
• На 128K Splash генерировал примерно в 2,8 раза быстрее Ollama. При первом чтении контекста 128K первый токен появился примерно через 38 минут у Ollama и 33 минуты у Splash.
• Проверил Pi на исправлениях кода со штатным бюджетом ответа. Оба варианта выполнили все три задания и прошли все 27 проверок. Вся цепочка со Splash заняла на 69% меньше времени.
У пакетов разное квантование; это сравнение готовых вариантов запуска.
Разбор и графики в блоге 🖥
Выводы делайте сами.