Пошли дальше: поставил себе локальнуюa LLM Qwen3:14B
Вы спросите зачем?
Из
данных тестов, которые делались вместе с вами.
На данном этапе модель для генерации изображений имеет явный недостаток, она не умею раскрывать ваш промпт.
Условно, если вы напишете "хочу самолет", с вероятностью 90% он выкинет какой-нибудь кривой артефакт.
А теперь я поставил между промптом юзера и результатом, прослойку ввиде локальной модели Qwen3 на 14 млрд параметров (это максимум, который комфортно поддерживает мое железо)
Теперь техническая сторона, на схеме все просто:
промпт ➡️
тг бот ➡️
Qwen3 (улучшает ✨) ➡️
nodejs-app (промежуточное ПО) ➡️
Qwen-Image (создает изображение✨) ➡️
тг бот (отправляет изображение в чат)
Но на деле, видюха не может одновременно держат в себе 2 модели, потому что просто не хватает ресурсов.
Поэтому в
ollama через которую я открываю Qwen3 ставим переменную выгрузки llm из VRAM через 5 секунд после запроса, это чревато тем, что первый запуск будет долгим, но тут происходит интересная дилемма.
Если оставить Qwen3 для быстрой улучшения пропта в VRAM, то Qwen-image будет отдавать ваше изображение в 3 раза медленнее. Иначе быстрая выгрузка освобождает ресурсы видеокарты, а qwen-image может спокойно собрать ваше изображение.
Первый неоптимизированный запуск выдал порядка 6-7 минут в общем на результат по схеме выше
Второй оптимизированный в среднем 15-30 сек на улучшение промпта и 100-115 сек на картинку
Успех!
#петпроект