Видео недоступно для предпросмотра
Смотреть в Telegram
LLM на плате за цену шавухи
Какой-то умелец запихнул языковую модель прямо в ESP32-S3 — ардуиноподобную плату за восемь баксов. Всё крутится офлайн, на самом чипе, ничего не улетает на сервер.
Внутрь утрамбовали модельку на 28.9M параметров, занимает ~15 МБ, выдаёт примерно 10 токенов в секунду. Секрет в том, что большая таблица эмбеддингов живёт в медленной flash-памяти, а не в RAM — на каждый токен читаются только нужные строчки. Идею подсмотрели у Google (Per-Layer Embeddings из Gemma).
Яснопонятно, что это не карманный ChatGPT. Обучена на TinyStories, поэтому умеет в основном сочинять простенькие рассказы. Вопросы, код и захват человечества пока не завезли. Но сам факт годный: связный текст теперь генерится даже на железке за цену обеда.
Исходники и вся инфа — на GitHub.
🔥 — пойду паять
👀 — надо глянуть
🔥 — пойду паять
👀 — надо глянуть
@ai_for_dev
Какой-то умелец запихнул языковую модель прямо в ESP32-S3 — ардуиноподобную плату за восемь баксов. Всё крутится офлайн, на самом чипе, ничего не улетает на сервер.
Внутрь утрамбовали модельку на 28.9M параметров, занимает ~15 МБ, выдаёт примерно 10 токенов в секунду. Секрет в том, что большая таблица эмбеддингов живёт в медленной flash-памяти, а не в RAM — на каждый токен читаются только нужные строчки. Идею подсмотрели у Google (Per-Layer Embeddings из Gemma).
Яснопонятно, что это не карманный ChatGPT. Обучена на TinyStories, поэтому умеет в основном сочинять простенькие рассказы. Вопросы, код и захват человечества пока не завезли. Но сам факт годный: связный текст теперь генерится даже на железке за цену обеда.
Исходники и вся инфа — на GitHub.
🔥 — пойду паять
👀 — надо глянуть
🔥 — пойду паять
👀 — надо глянуть
@ai_for_dev