Tsuev | Blog


Channel's geo and language: Russia, Russian
Category: Technologies


Блог про Frontend и не только
По всем вопросам
https://t.me/Qarimansur

Related channels  |  Similar channels

Channel's geo and language
Russia, Russian
Statistics
Posts filter


Кидаю сюда понравившиеся мне генерации из локальной модели

@aigalleryart

#петпроект


Итого за последние 2 недели мы смогли развернуть на локальной машине 3 типа ии-генераций: изображение, текст и звук.

Также поверх всех трех клиентских приложений, которые разворачивают эти модели, я написал тг ботов через которые я могу взаимодействовать со всеми из них с мобильного устройства.

Это был очень полезный и ценный опыт.

В будущем планирую написать полноценный курс по развертке таких моделей для вас!

Оставшийся гештальт – видео-генерация

#петпроект


Еле с третьей попытки записал 🤣😅




Клонированный голос


Далее на очереди VoiceStudio абсолютно бесплатный аналог ElevenLabs с открытым исходным кодом.

На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно.

Далее пришлю оригинал своего голоса, где вы сможете послушать и дать сравнительный фидбэк)

#петпроект

Единственное он сильно глушит мой кавказский акцент)


Осенний вайб от локальной модели Qwen-image 2.1

#петпроект


Video is unavailable for watching
Show in Telegram
Каждый раз когда ии-агент спрашивает разрешение


Итак Qwen3.5:9b лучше и быстрее генерирует улучшение промпта. В среднем 10-15 сек. на ответ.

Изначальный запрос был такой:
"Стол с кучей разных фруктов"


✨ Улучшенный промпт (LLM: 13.2 с):
A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant. Soft, warm morning sunlight streams from the left side, creating gentle highlights on the shiny skins and deep shadows in the crevices of the food. High-key lighting with a clean background that reserves negative space for text placement. Photorealistic texture showing fruit pores, fabric weave of napkins, and natural gravity folds. Color palette: vibrant reds, yellows, greens, and warm wood tones. Framing: eye-level close-up focusing on the center pile. No text.

🚫 Негативный промпт:
plastic skin, extra fingers, deformed hands, distorted clothing, misspelled text, random logos, watermarks, cluttered background, dark gloomy lighting, oversaturation.


Смотрим дальше...

ollama run qwen3.5:9b




Пошли дальше: поставил себе локальнуюa LLM Qwen3:14B

Вы спросите зачем?

Из данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умею раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.

А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)

Теперь техническая сторона, на схеме все просто:
промпт ➡️
тг бот ➡️
Qwen3 (улучшает ✨) ➡️
nodejs-app (промежуточное ПО) ➡️
Qwen-Image (создает изображение✨) ➡️
тг бот (отправляет изображение в чат)

Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.

Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.

Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку

Успех!

#петпроект


Самому сложно поверить, но скоро каналу будет 4 года. За это время я с вами прошел большой путь и получил ценный опыт.

Надеюсь я и дальше смогу быть полезным.


Дам доступ первым 3-м, кто напишет мне в лс или под комменты. Доступ дается для исключительно для тестирования потоковой генерации. На пока что неопределенный срок.

Также уточню. Учитывая, что изображение в среднем генерируется за 100-120 сек. То для следующего кто делает запрос это время умножается на 2 так как он будет стоять в очереди, пока первый запрос не пройдет, ибо ресурсы видюхи не резиновые)

https://t.me/qwen_image_ts_bot

UPD: менее чем за 10 секунд, после поста все 3 места заняты…

#дорогие_подпищники


Генерация от YandexArt v.2.5 с тем же промптом. Сверху еще можно различить слово North, но на второй строке творится какой-то артхаус


В продолжение темы генерации картинок.

Мое удивление, когда эта локальная модель идеально сформировала буквы без каких-либо артефактов и ошибок.

A clean modern vector illustration on a pure white background. Large centered text reading exactly "NORTHWIND", with every letter spelled correctly and clearly separated. Bold geometric sans-serif type


Еще 1-2 года назад топовая модель от OpenAI не имела такой возможности, все мы помним размазанные буквы и несуразицы. А модель от яндекса (YandexArt) до сих пор страдает от этого.

#петопроект


Один энтузиаст, который недавно начал снимать контент вокруг GTA SA, разработал симуляцию мира в соответствии с заложенной логикой поведения NPC в самой игре.

Кстати блоггер имеет только прикладные знания программирования, т.е. буквально с 0 и вручную он ничего не делал, весь проект сгенерирован через Cluade Code.

Удивительно, что могут делать последние LLM-модели!

Ссылка на проект

#интересно


Очень волнительно, мои первые issues и PR)

#петпроект


Разнес свой стартап!

Очень залипательный проект, можно разнести любой сайт в интерактивной игре 😂

https://destroy.spritefusion.com/

#интересно

20 last posts shown.