Liquid AI выпустили LFM2.5-VL-450M - vision-language модель для edge-устройств.
Обрабатывает картинку 512×512 за ~240мс на устройстве, без облака. Хватает на 4 FPS видеопоток с пониманием происходящего, а не просто детекцией.
Главное: один инференс заменяет привычную связку детектор → классификатор → эвристики. Весь multi-stage пайплайн в одном проходе.
В релизе добавили bounding box prediction (81.28 на RefCOCO-M), мультиязычный визуал на 8 языках и function calling.
Крутится на Jetson Orin, Samsung S25 Ultra, AMD 395+ Max.
Веса открыты.
huggingface.co/spaces/LiquidAI/LFM2-VL-WebGPU
Обрабатывает картинку 512×512 за ~240мс на устройстве, без облака. Хватает на 4 FPS видеопоток с пониманием происходящего, а не просто детекцией.
Главное: один инференс заменяет привычную связку детектор → классификатор → эвристики. Весь multi-stage пайплайн в одном проходе.
В релизе добавили bounding box prediction (81.28 на RefCOCO-M), мультиязычный визуал на 8 языках и function calling.
Крутится на Jetson Orin, Samsung S25 Ultra, AMD 395+ Max.
Веса открыты.
huggingface.co/spaces/LiquidAI/LFM2-VL-WebGPU