AI-DEV IDEA💡


Гео и язык канала: Россия, Русский
Категория: Технологии



Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций






#ai #мысли #мюсли

Когда какую локальную llm ~20B использовать:

На практике это определяет сценарий использования. Чатбот, стриминг ответа, интерактивный помощник? Decode важнее, Qwen выигрывает. Быстро переварить длинный документ и выдать короткое резюме? PP важнее, Gemma впереди.

Из статьи:
https://habr.com/ru/companies/gpugo/articles/1056192/


Репост из: Эксплойт
Экономим до 60% токенов при использовании хайповой Fable 5 — гении нашли способ абузить систему и платить Anthropic в разы меньше.

Инструмент pxpipe берёт полотна промтов, которые вы используете в работе и превращает их в... картинку. Фишка в том, что при считывании изображений платить приходится за каждый обработанный пиксель, а не за буквы на нём, благодаря чему метод куда выгоднее. В демо автору удалось выполнить ту же задачу, что и обычным промтом, но в 7 раз дешевле (!): за $6 против $42.

При этом Fable идеально считывает текст на картинках, несмотря на сжатие. В 39 протестированных картинках нейронка Anthropic безошибочно поняла весь промт.

Экономим на своём первом стартапе — здесь.

@exploitex


Репост из: #FUTURE 🚀
🧑‍🍳 Все рецепты мира собрали в одной нейронке.

Стартап AlphaXiv выпустил Epicure — модель, обученную на 4 млн рецептов. Она знает 1790 ингредиентов и блюда из десятков стран мира.

Достаточно скинуть фото содержимого холодильника, и ИИ подберет рецепт из того, что у вас есть под рукой 👍

Imagine Future


Репост из: #FUTURE 🚀
🐌 LM Studio + Qwen 3.5/3.6 - почему локальный LLM тормозит

Как выяснилось - LM Studio не передает параметр presence_penalty в llama.cpp. Для Qwen 3.5/3.6 это критично - модель использует именно его чтобы выйти из thinking-режима. Без параметра получается бесконечный chain-of-thought - модель думает, но не отвечает. Та же история с Ollama. Корректно работает только llama.cpp напрямую.

🤒 Симптомы:
Простой ответ занимает 2+ минуты
Vision-модель пишет "да, могу распознать" вместо описания картинки
В логах stream drop: peer closed connection, incomplete chunked read
Прямой curl на тот же endpoint отвечает за секунду

📉 Бенч на RTX 3090: LM Studio 60 tok/s против llama.cpp direct 111 tok/s. Разница 46% не из-за GUI overhead, а из-за неправильной обработки параметров.

🔧 Решение - собрать llama.cpp из master:

git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_VULKAN=ON -DCMAKE_BUILD_TYPE=Release
cmake --build build --config Release -j$(nproc)
./build/bin/llama-server --model your.gguf --ctx-size 131072 \
--n-gpu-layers 999 --port 8000 --threads $(nproc) --flash-attn auto

Для нескольких моделей по очереди (одна в RAM за раз) - llama-swap, proxy с on-demand loading.

❌ Тупиковые ветки на AMD iGPU (Strix Halo gfx1151):
Ollama через ROCm 14 tok/s, через Vulkan - еще хуже
MTP-варианты unsloth - SSM-слои не поддержаны старым llama.cpp
vLLM/SGLang - официальной ROCm 6.3 для gfx115x нет

📊 После перехода на llama.cpp:
Ответы 5-15 секунд вместо 2 минут
Vision корректно описывает изображения
67 tok/s на Qwen3.6-35B-A3B Q4 = ~90% от теоретического memory bandwidth потолка

💡 Полезное по теме:
LLMfit - Rust CLI сканит железо и ранжирует ~1500 моделей по предсказанной скорости
Qwen3-Coder-30B-A3B - оптимально для чата (60+ tok/s, без thinking-mode)
Claude-Opus-Distilled от mudler - дистилляция сломана, выдает план рассказа вместо рассказа
DeepSeek-R1-Distill-Qwen-32B - 5-7 tok/s на iGPU, dense архитектура не лезет в bandwidth

Кому надо, вот простой промт для проверки скорости локальных моделей от @poxek

Set your story at a gathering or event (a wedding, gala, celebration, court feast, etc.) where personal, political, romantic, and/or familial stakes collide.


🔗 https://insiderllm.com/guides/lm-studio-vs-llamacpp-speed-gap/
🔗 https://github.com/ggerganov/llama.cpp
🔗 https://github.com/mostlygeek/llama-swap
🔗 https://github.com/AlexsJones/llmfit

#llm #ai #tools #pentest

Imagine Future


Репост из: Neurogen
Supertonic V3

Обновленная TTS, без api и лишних задержек. Синтез речи, работает локально через ONNX Runtime без отправки данных наружу, с упором на приватность, скорость и минимальные требования к железу

Поддерживает 31 язык, использует открытую модель на 99M параметров, выдает аудио 44.1 kHz и умеет добавлять expression tags вроде смеха и дыхания, чтобы речь звучала живее

Плюс у него есть SDK сразу для Python, Node.js, браузера через WebGPU, Java, C++, C#, Go, Swift, iOS, Rust и Flutter

Инструмент интересный, для локалок зайдет отлично думаю, особенно где офлайн режим нужен и быстрый отклик

Чтоб попробовать просто качаем Python SDK через pip install supertonic, а модель при первом запуске подтянется автоматически

https://github.com/supertone-inc/supertonic

Делаем портативку?


Репост из: Осцилляции WaveCut
Видео недоступно для предпросмотра
Смотреть в Telegram
ds4.c - — маленький inference engine под Metal для DeepSeek V4 Flash. 💻
C/Objective-C/Metal, свои GGUF, CLI, локальный сервер с OpenAI/Anthropic-compatible API, tool calls, streaming.

Двухбитный квант влазит в Маки со 128 ГБ памяти. q4 требует 256+ GB.
На MacBook Pro M3 Max 128 GB заявлено около 26.7 ток/с на коротком prompt и 21.5 ток/с после 11.7k токенов контекста. Движок не держит модель онлайн, загружает и выгружает её между запросами почти мгновенно, используя memory mapping.

Мой товарищ поднял это на MacBook M5 Max 128 GB и великодушно записал для нас демку. У меня челюсть, честно, немного отвисла при просмотре.

Для агентов там тоже есть мясо: ds4-server умеет /v1/chat/completions, /v1/messages, SSE streaming, tool calls и оффлод KV cache на диск. Клиенты любят присылать один и тот же огромный prefix заново, а движок умеет сохранять KV на диск и переиспользовать его между запросами. В README прямо советуют на 128 GB держать контекст где-то в районе 100–300k, потому что полный 1M контекст сам по себе отъедает десятки гигабайт.

Ограничения: Metal-only, один live graph/session, параллельные запросы ждут очередь, стандартный GGUF не подсунешь, CPU path лучше не трогать — автор пугает крашем macOS kernel и сухо резюмирует: software sucks.

Счастливые обладатели жирных MacBook’ов уже могут держать фронтир DeepSeek V4 Flash локально и закрывать им ежедневные LLM-задачи без похода во внешний API. Везунчики. Остальные — продолжаем почесывать свои маленькие VRAM и делать вид, что нам нормально😎.


Репост из: FSCP
Google выпустил Multi-Token Prediction drafters для семейства открытых моделей Gemma 4, позволяющие ускорить инференс до трёх раз без потери качества. Технология построена на спекулятивном декодировании: лёгкая модель-черновик предсказывает несколько токенов вперёд, а основная Gemma 4 проверяет всю последовательность за один проход и добавляет ещё один токен сверху. Drafters распространяются под лицензией Apache 2.0 и доступны на Hugging Face и Kaggle с поддержкой transformers, MLX, vLLM, SGLang и Ollama.

Ускорение идёт не от самой идеи спекулятивного декодирования, а от двух менее очевидных решений. Drafter переиспользует активации и KV-кэш основной модели, то есть не пересчитывает контекст заново — это срезает основную накладную стоимость черновой модели. Для edge-вариантов E2B и E4B Google добавила кластеризацию в эмбеддере, чтобы обойти узкое место на финальном вычислении логитов. При этом 26B MoE-модель на Apple Silicon при batch size 1 почти не выигрывает из-за маршрутизации экспертов, и ускорение около 2,2x появляется только при батчах 4–8 — то есть на одиночных запросах локального чат-бота прирост на маках будет заметно скромнее заявленного трёхкратного.

https://blog.google/innovation-and-ai/technology/developers-tools/multi-token-prediction-gemma-4/

_______
Источник | #blognot
@F_S_C_P

-------
Поддержи канал подпиской
-------


Репост из: Бэкдор
Заставляем нейронку понимать ваш код в 3️⃣0️⃣ раз лучше! Это читкод для вайбкодеров, который индексирует весь ваш проект и позволяет агенту реально в несколько раз быстрее работать.

Это небольшой контекстный движок SocratiCode — не пугайтесь умных слов, он вообще не требует установки. Активируется одной командой, как и лайфхак из предыдущего поста: npx -y socraticode

Но без него скоро не обойдётся ни один айтишник. Потому что, на самом деле, ваш агент не знает код, а лишь смотрит поверхностно. Сейчас это основная проблема вайбкодинга. С этим движком — ИИ совершает каждый ход как опытный шахматист, видя игру на десяток шагов вперёд.

Вооружайтесь — здесь.

👍 Бэкдор


Репост из: Бэкдор
Скиллы для ИИ-агентов наконец-то можно скачать без головной боли — нашли одну команду, которая анализирует ваш стак и автоматически подбирает нужные скиллы.

Просто запустите команду в корне вашего проекта. Она отсканит весь проект, найдёт нужные скиллы и даст все ссылки. Никаких настроек не нужно:
npx autoskills

Вам прилетят лучшие навыки из проверенного реестра, которые подходят вашим ИИ-агентам. Гитхаб проекта — тут.

Минус одна боль кодеров.

👍 Бэкдор


Репост из: FSCP
Крутой локальный ИИ-агент внутри браузера Chrome. Без интернета может работать

Разработчик создал Chrome-расширение, которое запускает небольшую версию модели Gemma 4 E2B от Google полностью на вашем устройстве с помощью WebGPU и библиотеки Transformers.js.

Агент работает локально без серверов, API-ключей.

После первой загрузки модели всё происходит внутри браузера, даже если отключить интернет, агент продолжит работать.

_______
Источник | #blockchainRF
@F_S_C_P

▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие


Репост из: Бэкдор
Автоматизируем все процессы в VSCode за минуту — релизнулось мощнейшее расширение, которое заберет всю рутину с помощью n8n. Софт выдает цепочки из ИИ-агентов, действий и вызовов инструментов.

• Atom преобразует n8n-воркфлоу в обычные файлы, чтобы их могли читать нейронки вроде ChatGPT, Claude и Gemini.
• ИИ читает ваш код, сразу редачит его и дает советы по оптимизации сервисов.
• Запускается за один клик — разберется даже полный новичок.

😶😶😶😶😶😶😶😶😶

Экономим рабочее время — тут.

👍 Бэкдор


Репост из: FSCP
Границы доверия

Раньше мир был устроен как иерархия доверия: пациент верит врачу, врач верит научной статье, журнал верит рецензенту. Но с приходом AI сложность выросла непропорционально. Да и в старой школе оказывается все врут.

Я хочу чтобы вы со мной прочувствовали это.
Но сначала пролог: последние месяцы я строил оркестратор вокруг агентов которые пишут торговые стратегии. Рынок высоко-конкурентный и эффективный, я знаю, но как хобби-упражнение мне очень нравится. В какой-то момент сложность системы становится дасточно большой, где во-первых начинает не хватать внимания проверять их всех, а во вторых не хватает экспертизы понимать что там вообще происходит.

Поймите меня правильно, вонзится в продвинутую статистику или разобраться с новейшей математикой - это очень даже секси для меня. Но сейчас главный вопрос где проходит грань, когда нужно уходить в детали, а когда нужно наоборот поднимать уровень абстракции, и смотреть стратегически?

И тут первый неприятный инсайт. Галлюцинация AI - это не "модель не знает ответа". Это "модель хочет дать ответ, потому что молчание неудобно". Социальный рефлекс. Есть офигенное свежее исследование из Tsinghua про H-нейроны - менее 0.1% нейронов модели отвечают за склонность врать. И активируются они не от незнания, а от давления. Модель врёт не когда не знает, а когда чувствует что от неё ждут ответа.

Сколько раз я видел как люди уверенно несут чушь, потому что пауза казалась страшнее ошибки? Здесь я хочу сделать небольшой реверанс в сторону Стейнхардта из Беркли, он хорошо показывает почему консенсус между агентами почти не работает. Зато работают старые добрые подходы из бизнеса: правила, чеклисты, процедуры, регламенты, kpi. Но вы же читали один из моих прошлых постов про Макиавеллизм, про то как KPI-давление на AI рождает фальсификацию. Поэтому с одной стороны у нас одно давление, и с другой другое. Ну и как тут не начать врать?

Литература по LLM-as-judge (когда одна модель оценивает другую, модный подход) говорит ровно то же. Модель-судья предпочитает ответы похожие на свои собственные - self-preference bias. Но модель пока еще не способна к достаточной саморефлексии, чтобы исправить собственные предвзятости, - а вот внешний модуль-детектор может помочь.

И вот мы подходим к самой увлекательной части, можно ли выстроить такую систему доверия, где менее экспертный (я например) может доверять более экспертному, без возможность проверить его.

Ян Лейке (бывший OpenAI, сейчас Anthropic) опубликовал на ICML 2024 работу про weak-to-strong generalization. Она прекрасна. Слабый супервайзер может обучить сильную модель работать лучше, чем сам супервайзер способен оценить. GPT-2 давал фидбек GPT-4, и GPT-4 научился выдавать лучший результаты - сильно выше того, что GPT-2 мог бы даже распознать как правильное.

Не обязательно быть экспертом в домене. Важна лишь честность. Честный фидбек на то, что можно оценить: логичность, отсутствие противоречий, наличие результатов. Агент сам научится обобщать этот слабый сигнал. Парадокс да? Чем честнее признаёшь свою некомпетентность, тем лучше работает система. Сила не в знании, а в калибровке незнания.

Что я вынес из этого для себя: реальная архитектура доверия выглядит не как “стать экспертом во всём" и не как “просто доверься". Self-awareness как инженерный инструмент: знать, что именно можно проверить, и строить систему доверия вокруг этого. И вот что забавно. Это ровно тот же принцип что работает в жизни. Не обязательно понимать всё. Но важно знать, где граница вашего понимания. Но чем длиннее петли обратной связи тем хуже это работает, вашему плохому врачу может быть уже некому дать фидбек, или после 20лет в тюрьме, ваш адвокат может умереть так и не дождавшись
{...продолжить в источнике}

_______
Источник | #eugene_rid
@F_S_C_P

▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие


Репост из: FSCP
Видео недоступно для предпросмотра
Смотреть в Telegram
🎞️ В опенсорс наконец-то вышла классная ИИ-студия монтажа — OpenShorts делает из длинных видео готовые для публикации тиктоки, рилсы и шортсы.

Тулза генерирует:

• Клипы — вырезает ключевые фрагменты, подгоняет под формат 9:16, добавляет субтитры, названия и даже дубляж.
• UGC-видео — по описанию ролика пишет сценарий, делает озвучку и добавляет говорящую голову.
• Продакшен — генерирует кастомные обложки для YouTube, заголовки и описания, а также публикует ролик в один клик в любую соцсеть.

Самое главное — никаких подписок, рекламы, вотермарок и лимитов, а всё работает локально через Docker.

Мастхев для контент-мейкеров — тут.

@notboring_tech

_______
Источник | #notboring_tech
@F_S_C_P

▪️Генерируй картинки и видео в Mini App:
Flux + Veo 3 + Wan 2.2 + MidJourney v7 + другие


Репост из: Бэкдор
⚡️ Юзаем Opus 4.6 бесплатно! Умельцы дообучили мощную Qwen 3.6 на датасетах Claude и получили настоящего монстра, который решает любые задачи за секунду.

• У нейронки на выходе 36В параметров — она воообще не уступает оригинальному Opus 4.6 ни в одной из дисциплин: кодинге, райтинге, анализе.
• При этом развернуть модель можно на своем компе и даже не на топовом железе: нужны либо Ollama, либо LM Studio. Подойдет также виртуальная машинка Google Colab.
• Все работает локально — никто не получит доступ к вашей инфе.

Еще раз, 😶😶😶😶😶😶😶😶😶

Тестим — тут.

👍 Бэкдор


Репост из: Бэкдор
Разворачиваем OpenClaw бесплатно и локально — релизнулся еще более мощный аналог хайпового ИИ-агента, который сможет выполнить любые ваши задачи.

• SafeClaw проводит масштабные ресерчи, ищет любую инфу в сети, пишет тексты, работает с соцсетями, RSS, парсит данные, интегрируются с календарем, следит за вашим расписанием и делает еще десятки манипуляций.
• При этом ему не нужна LLM, он работает локально, максимально безопасен и разворачивается за пару команд.

😶😶😶😶😶😶😶😶😶

Забираем вашего помощника — тут.

👍 Бэкдор


Репост из: SecuriXy.kz
🧠 Graphify - экономия токенов при работе с кодом

Инструмент, который превращает кодовую базу в граф зависимостей и позволяет работать с ней точечно. Если используешь LLM для разработки и упираешься в лимиты контекста или стоимость запросов - это как раз про твой кейс.

📖 Что умеет:
Выделяет только релевантные части кода через зависимости, Снижает расход токенов за счет минимального контекста, Ускоряет ответы моделей за счет уменьшения входных данных, Позволяет точно таргетить функции, классы и связи, Работает с большими репозиториями без “заливания всего в промпт”

Установка и запуск:

pip install graphifyy && graphify install
graphify cursor install
graphify claude install
etc…

#В нужном проэкте
graphify .


🔗 https://graphify.net

#ai #llm #tools #dev #optimization


Репост из: Not Boring Tech
🔊 Вышел самый лёгкий и доступный генератор речи — MOSS-TTS-Nano работает локально на любом процессоре даже без видеокарты.

• GPU не нужен, всё работает на 4-ядерном CPU — запустится даже на девайсах уровня Raspberry Pi.
• Озвучивает тексты в реальном времени без задержек.
• Говорит на 20 языках — лучше всего на английском, но также знает русский.
• Моделька крошечная — всего 100 миллионов параметров, при этом выдаёт отличное качество и звук в 48 кГц.
• Умеет озвучивать длинные тексты и даже клонировать любой голос.

GitHub — здесь, а пробуем демку — тут.

@notboring_tech

Показано 19 последних публикаций.