Tsuev | Blog


Гео и язык канала: Россия, Русский
Категория: Технологии


Блог про Frontend и не только
По всем вопросам
https://t.me/Qarimansur

Связанные каналы  |  Похожие каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


На Hugging Face появилась модель заточенная под переводы NLLB 3.3B. Около 200 языков, работает офлайн.

NLLB-3.3B показывает результаты на уровне Google Translate и DeepL. В тестах на английском-русском он набрал 57.47 spBLEU против 55.39 у DeepL.

Правда, если сравнивать с теми же опенсорс движками для перевода, модель будет прожорливее и медленнее.

#ai




Видео недоступно для предпросмотра
Смотреть в Telegram
Также OpenDesign умеет делать моушен дизайн для промо роликов, а если вы отдадите ему папку с sfx (звуками), то он их наложит по таймкодам, но по опыту пока лучше это делать вручную.

Видео полностью сделано с помощью OpenDesign. Тут я тестировал его возможности, все делается через плагин HyperFrames, который также идет из коробки.

#ai


Для тех кто еще не слышал про OpenDesign – бесплатная альтернатива Claude Design. Работает со всеми ии апи

Я использую вместе с opencode. Буквально недавно пришел небольшой заказ на лендинг для строительной компании.

OpenDesign сразу накидал несколько черновых прототипов и экспортировал в pdf для демонстрации заказчику, а после и html для последующего деплоя.

Пример, который мы позже согласовали:

https://shturman.alwib.ru/

#работа #ai


Кидаю сюда понравившиеся мне генерации из локальной модели

@aigalleryart

#петпроект


Итого за последние 2 недели мы смогли развернуть на локальной машине 3 типа ии-генераций: изображение, текст и звук.

Также поверх всех трех клиентских приложений, которые разворачивают эти модели, я написал тг ботов через которые я могу взаимодействовать со всеми из них с мобильного устройства.

Это был очень полезный и ценный опыт.

В будущем планирую написать полноценный курс по развертке таких моделей для вас!

Оставшийся гештальт – видео-генерация

#петпроект


Еле с третьей попытки записал 🤣😅




Клонированный голос


Далее на очереди VoiceStudio абсолютно бесплатный аналог ElevenLabs с открытым исходным кодом.

На примере мой клонированный голос, который читает введенный текст. Насколько это удивительно и точно.

Далее пришлю оригинал своего голоса, где вы сможете послушать и дать сравнительный фидбэк)

#петпроект

Единственное он сильно глушит мой кавказский акцент)


Осенний вайб от локальной модели Qwen-image 2.1

#петпроект


Видео недоступно для предпросмотра
Смотреть в Telegram
Каждый раз когда ии-агент спрашивает разрешение


Итак Qwen3.5:9b лучше и быстрее генерирует улучшение промпта. В среднем 10-15 сек. на ответ.

Изначальный запрос был такой:
"Стол с кучей разных фруктов"


✨ Улучшенный промпт (LLM: 13.2 с):
A lavish wooden table overflowing with a colorful mountain of various fruit snacks, including apples, oranges, grapes, berries, and dried fruits. The composition uses forced perspective to make the pile look massive and abundant. Soft, warm morning sunlight streams from the left side, creating gentle highlights on the shiny skins and deep shadows in the crevices of the food. High-key lighting with a clean background that reserves negative space for text placement. Photorealistic texture showing fruit pores, fabric weave of napkins, and natural gravity folds. Color palette: vibrant reds, yellows, greens, and warm wood tones. Framing: eye-level close-up focusing on the center pile. No text.

🚫 Негативный промпт:
plastic skin, extra fingers, deformed hands, distorted clothing, misspelled text, random logos, watermarks, cluttered background, dark gloomy lighting, oversaturation.


Смотрим дальше...

ollama run qwen3.5:9b




Пошли дальше: поставил себе локальнуюa LLM Qwen3:14B

Вы спросите зачем?

Из данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умею раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.

А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)

Теперь техническая сторона, на схеме все просто:
промпт ➡️
тг бот ➡️
Qwen3 (улучшает ✨) ➡️
nodejs-app (промежуточное ПО) ➡️
Qwen-Image (создает изображение✨) ➡️
тг бот (отправляет изображение в чат)

Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.

Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.

Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку

Успех!

#петпроект


Самому сложно поверить, но скоро каналу будет 4 года. За это время я с вами прошел большой путь и получил ценный опыт.

Надеюсь я и дальше смогу быть полезным.


Дам доступ первым 3-м, кто напишет мне в лс или под комменты. Доступ дается для исключительно для тестирования потоковой генерации. На пока что неопределенный срок.

Также уточню. Учитывая, что изображение в среднем генерируется за 100-120 сек. То для следующего кто делает запрос это время умножается на 2 так как он будет стоять в очереди, пока первый запрос не пройдет, ибо ресурсы видюхи не резиновые)

https://t.me/qwen_image_ts_bot

UPD: менее чем за 10 секунд, после поста все 3 места заняты…

#дорогие_подпищники


Генерация от YandexArt v.2.5 с тем же промптом. Сверху еще можно различить слово North, но на второй строке творится какой-то артхаус

Показано 20 последних публикаций.