VAI


Гео и язык канала: Россия, Русский
Категория: Технологии


16 лет в компьютерной графике, 6 лет - арт-директор.
Работал над десятками проектов.
Изучаю ИИ для развития и собираю здесь свой опыт, находки и эксперименты.
Присоединяйтесь!
Личный контакт - @AlexBakakin
Boosty - boosty.to/vai_art
AI l ИИ

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций




Можно ещё попробовать поднимать тестовую рубрику - вещи, которые сильно вдохновили на прошлой неделе:

1.Фиджитал-игры на базе проектора и стены в комнате.
2.Карточная игра, которую превратили в полноценные AR-баталии.
3.Создание голографических карт. Очень захотелось сделать серию таких карт, пока думаю.

@VAI_ART
#VAI_Notes


Видео недоступно для предпросмотра
Смотреть в Telegram
Понравилась тема с тем, что Клод может делать видосы, и решил на этой неделе собрать на коленках пилотный дайджест в другом формате. Может, он лучше зайдёт).
Если да, то разовью дальше. Настрою всё по стилю и качеству.

Для меня дайджесты как ритуал. Я сажусь в субботу-воскресенье и смотрю, что вышло за неделю, чтобы оставаться в ритме и в форме. Поэтому я их буду продолжать выпускать в любом случае: это своего рода артефакты недели по ИИ, и всегда можно вернуться и посмотреть, что и когда было.

Текстовая версия, как и все медиа, в комментариях.

@VAI_ART
#VAI_News


Не запушил на гит много работы, которую сделал за последнее время, и много чего удалилось. Бывает, особенно когда много делаешь. Попросил восстановить. Клод поругался на меня, но полез в старые чаты/логи и восстановил всё с учётом всех правок и недочётов. Вот прям последнюю версию всего потёртого восстановил. Вот прям без единой ошибки.

@VAI_ART
#VAI_Notes


Репост из: рис. AI
Видео недоступно для предпросмотра
Смотреть в Telegram
вышел Соннет 5.5

(босс, я устал)


Кстати, ещё пример того, как модели могут сами себя презентовать. Вчера вышла Sonnet 5.5. Ниже Клод opus отпрезентовал ее. Все анимации и сюжет - его рук дело. Только в озвучку не умеет пока, тут помог ElevenLabs (скорее всего, новая модель, которая тоже вчера вышла). А исходные изображения, как написал Сергей, он сгенерировал в Гроке (хотя, я думаю такого уровня он бы тоже смог сам сгенерировать кодом). Остальное все Клод.


Рубрика самых интересных новостей в ИИ за неделю. Погнали!

🔹 Claude Opus 5.5 — уровень Fable 5.1 по цене ниже Opus 5
Вышла 22 сентября, уже в Claude, Claude Code и API. $4 / $20 за миллион токенов вместо $5 / $25. Sonnet 5.5 и Haiku 5.5 обещают в ближайшие недели.
— отвечает на 30% быстрее Opus 5; fast mode ещё в 2,5 раза быстрее, но вдвое дороже
— в Pro и Max подняли пятичасовой лимит и выдали один сброс лимита — жмёте, когда упёрлись
— подвох: рассуждение не выключается, и на максимальной глубине модель тратит на задачу больше токенов, чем Opus 5, — реальная экономия меньше заявленной

Малая часть того, что уже успели сделать:
— игра про нулевые: один заход, 1 ч 45 мин, озвучка через Gemini TTS
— картины «маслом» кодом: Python-скрипт на 7500 строк имитирует мазки кисти; похожий движок на GitHub

Графики и кейсе в комментариях.

🔹 GPT-6 Sol и Luna — облегчённые GPT-6 вдвое дешевле прошлых версий
Вышли в тот же день. Sol — рабочая лошадка за $2 / $10, Luna — самая дешёвая, $0,10 / $0,50, и есть даже на бесплатном тарифе. Обе в ChatGPT, Codex и API, контекст около 1 млн токенов.
— Sol не дотягивает до Astra, но лучше прошлой GPT-5.6 Sol за полцены
— Luna в коде почти догнала Sol, а за задачу стоит в 12 раз меньше — для массовой рутины


Графики в комментариях.

🔹 Grok 4.7 — xAI обновили флагман: новая базовая модель по старой цене
Вышла 21 сентября: $2 / $6 за миллион токенов, как у Grok 4.6, контекст 500K. Есть в API, Cursor, Grok Build и OpenRouter.
— дольше учили на задачах, которые идут часами: лучше перепроверяет себя и не теряется в длинном контексте
— в реальных задачах по коду решает 46% против 40% у Grok 4.6


График в комментариях.

🔹 Runway в DaVinci Resolve — генерация прямо на таймлайне
23 сентября вышел плагин для Resolve Studio 19+, для Premiere Pro и After Effects он есть с 8 сентября. Плагин бесплатный, генерации — из кредитов вашего тарифа.
— генерирует, продлевает и апскейлит клипы, убирает фон — результат сразу ложится под плейхед
— видео: Gen-4.5, Veo 3.1, Seedance 2.5, Kling 3.0 Pro; картинки: Gen-4 Image, Nano Banana, GPT Image 2
— рестайл клипа и перевод в HDR через Aleph 2, можно задать до пяти ключевых кадров


Презентация в комментариях

🔹 Qwen-Image-2.1 — открытая модель, которая генерит картинки сразу с прозрачным фоном
Alibaba выложили веса 20 сентября: генерация и редактирование в одной модели на 7B, нативный 2K. ComfyUI поддержал в день релиза, с квантизацией живёт на 12–16 ГБ видеопамяти.
— вырезает объект из обычного фото в отдельный прозрачный слой и правит его, не сплющивая
— до 10 референсов: собрать героев из разных портретов в один кадр
— лицензия исследовательская: в коммерческий продакшен без отдельного договора нельзя


🔹 Seedance 2.5 Draft Mode — дешёвый черновик в 480p перед дорогим 1080p
Появился 22 сентября в API BytePlus, Dreamina (там это Preview), Magnific и Artlist.
— в Dreamina черновик в 8 раз дешевле 1080p
— финал — не апскейл, а новая генерация с теми же промптом, референсами и сидом: композиция и камера держатся, лица и мелкий текст могут поплыть


Пример в комментариях.

🔹 Gemini 3.8 Flash TTS — озвучка, которую режиссируете ремарками в тексте
Google выпустили 23 сентября две модели: Flash TTS для творческих задач и Flash-Lite TTS для больших объёмов. Есть в AI Studio, API, Gemini Notebook и Google Vids.
— голос по текстовому описанию или из 2000+ готовых, 100+ языков
— диалог двух спикеров, смех, вздохи и «угу»; голос не плывёт на часах аудио
— клон голоса по 30-секундному сэмплу с подтверждением согласия; в ЕС, Великобритании и Индии не работает


Графики и кейсы в комментариях.

Из утечек недели:

🔹 Kling 4.0 — ролики до 30 секунд в 1080p
В режиме разработчика засветились Kling 4.0 и 4.0 Flash. По утечке: продление до 60 секунд, экспериментальный режим до 120 секунд, до 15 элементов в Omni Reference и три голосовых референса.

🔹 Nano Banana 2.5 — следующий генератор картинок Google
На арене давно тестируют под именами Spicy Mayo и River Flow, 24 сентября следы модели нашли в Google Flow. Google релиз пока не подтверждал.

@VAI_ART
#VAI_News


Я писал вчера, что надиктовываю голосом своим агентам, и это ещё не всё. Последние две недели вся моя работа - это просто надиктовывание в микрофон своего видения. По сути, только оно у меня и осталось, остальное всё делают агенты. С одной стороны, это классно, с другой я до сих пор не могу привыкнуть, что руками уже почти ничего не делаю в своей работе.

Просто как пример - MVP портала. Тут нет вообще ничего, что бы я сделал руками, всё сделано ИИ.

А процесс был таким:
🔹генерация концепта основы портала
🔹генерация поля для портала
🔹закинул концепт в видеогенератор, чтобы он сделал анимацию течения поля
🔹генерация модели
🔹описал всё Клоду и скормил ему все исходники
🔹небольшие правки: сделал появление плашки с надписью и звуки в том же Клоде

Время с правками и идеями в районе 6 часов на эту версию. Это ещё с несколькими итерациями правок: если заметите, концепт самого портала и портал с анимированным полем отличаются. Там было несколько полноценных анимаций поля, из которых уже выбирали нужную. Он ещё будет дорабатываться. Геометрию портала и текстуру нужно довести до ума.

Это только маленькая часть того, чем решил поделиться, а так я уже собираю всё голосом и пока не нашёл ничего, что не получилось бы сделать в связке Claude-MCP-Unity. Один из самых крутых моментов - что всё можно сделать максимально настраиваемым.

У меня всё).

Хотя нет, не всё. Последнее время разбираю практики и способы переноса видения автора на процесс. Пока с переменным успехом, скорее как исследование творческого процесса, но очень надеюсь завершить его.

P.S. Не знаю как у вас, но у меня недели летят со скоростью света. Как уже пятница!? Всем заранее хороших выходных.

@VAI_ART
#VAI_Notes


В последнее время перестал писать и чисто надиктовываю модели голосом. Чувствую себя Тони Старком.

Недавно смотрел нового Человека-паука и, когда он разговаривал со своим ИИ, поймал себя на мысли: в первых частях это смотрелось как вау, а сейчас смотришь и понимаешь, что это уже не будущее, а реальность, и ты в ней живёшь.

Очень крутое время.

@VAI_ART
#VAI_Notes


Оживший скетчбук.

Всем хорошей недели!

@VAI_ART
#VAI_Gallery


Поехали за новостями! 🦄

🔹 Runway Enhance Frame Rate — отдельная модель для интерполяции кадров
Уже в app.runway.com и API. Загружаете любой ролик, не только из Runway и получаете плавные 60 или 120 fps без дублирования кадров.
— до 4K и до 5 минут, разрешение не режет
— 1 кредит за 2 секунды видео: минута - 30 кредитов, около $0,30 через API
— целевые частоты 24,25,30,48,50,60,120 и NTSC-стандарты
— заявляют в 7 раз быстрее и в 3 раза дешевле других интерполяторов


Презентация в комментариях.

🔹 Vidu S2 — AI-видео, которое реагирует на вас в реальном времени
ShengShu показали две модели: S2-Avatar и S2-Editing.Работает через API и консоль Vidu,первым 2000 новичкам дают 5000 кредитов.
— S2-Avatar: персонаж отвечает голосом,выполняет команды; подкинули картинку товара - берёт его в руки прямо во время диалога
— S2-Editing: правит идущий видеопоток на лету - стиль,одежда,персонаж,фон - без перерендера сцены
— выход 720p вместо 540p у прошлой версии


Примеры в комментариях.

🔹 Gemini 3.8 Live — голосовая модель,которая видит и делает дела параллельно с разговором
Две версии: Live и Live Extended Thinking.Есть в API и AI Studio,раскатывают в приложение Gemini,Docs, Gmail и Keep.
— смотрит на камеру или экран почти в реальном времени и обсуждает то, что видит
— вызывает инструменты в фоне,не прерывая диалог;Extended Thinking рассуждает и говорит одновременно
— 97 языков с переключением посреди фразы
— $0,005 за минуту аудио на входе и $0,018 на выходе


Примеры в комментариях.

🔹 Claude — Anthropic убрала переключатель Chat/Cowork и добавила Docs и Slides
Теперь один интерфейс: пишете задачу, Claude сам решает, ответить сразу или запустить агента с файлами, поиском и кодом. Раскатка для Pro и Max,Free и Team позже.
— Docs и Slides в бете: документ или презентация прямо в чате,правится,открывается по ссылке,выгружается в PDF и PowerPoint
— Design, Artifacts и старые Cowork-задачи переехали в общую историю
— агентный режим прожорливее чата,а лимит общий на всё - Anthropic его размер по-прежнему не называет


🔹 Qwen3.8-Omni-Flash — модель, которая смотрит часовое видео за один запрос
Есть в API и Qwen Chat. На вход текст, картинки, аудио и видео, контекст 1 млн токенов. По аудио и видео на уровне Gemini 3.8 Flash.
— длинные ролики понимает целиком: пересказ, описание сцен, таймкоды не выдумывает
— сама решает, какие кадры смотреть, а какие пропустить - вдвое меньше токенов на запрос
— аудио на вход подешевело на 98%, видео - на 89%; $0,15 за миллион входных токенов


График в комментариях.

🔹 Arrow 2 — генерация сразу в редактируемый SVG
QuiverAI обновили модель: Arrow 2 для скорости и цены, Arrow 2 Telos для сложных брифов. Подписка от $8 в месяц, API отдельно.
— чище геометрия: меньше лишних узлов, нормальные отступы и выравнивание без танцев в промпте
— держит стиль и палитру по референсу,делает иконки, схемы,UI-графику и простую анимацию
— растровый эскиз превращает в вектор


Примеры в комментариях.

🔹 ComfyUI_Assistant — чат-ассистент прямо внутри ComfyUI
Опенсорс-плагин: читает текущий граф и установленные ноды, сам правит workflow. Работает с LM Studio, Ollama, OpenAI-совместимыми API и Anthropic; с локальной моделью бесплатно.
— добавляет, удаляет и соединяет ноды,меняет параметры и промпты - всё в обычном Undo
— видит входные и сгенерированные картинки: "посмотри на результат и поправь промпт"
— ищет custom nodes в интернете и после подтверждения сам ставит их через git/pip
— отдельный чат и память правок на каждый workflow


🔹 Jev — модель, которая не пишет текст, а сразу выбирает ответ
TypeSafe AI,стартап соавтора InstructGPT,вышел из стелса.Вы задаёте варианты,Jev возвращает вероятность каждого одним проходом,без генерации по токену.Пока по вейтлисту в API, есть плагин для Claude Code.
— классификация,разметка,выбор инструмента или субагента,проверка ответов других LLM
— в 20–200 раз быстрее обычной LLM, ответ за 70–500 мс
— $0,042 за миллион входных токенов,выход бесплатно
— код и рассуждения не умеет,контекст 32K - не замена GPT и Claude,а быстрый решатель


Презентация в комментариях.

@VAI_ART
#VAI_News

1k 1 14 13 11

Репост из: Точки над ИИ
Как создавать игры с ИИ.pdf
3.4Мб
Несу вам кое-что полезно-веселое!

Кто сидит в твиттере, видели, что творится после выхода GPT-6 Astra. Лента завалена играми, которые люди собирают с агентами.


Я тут знатно попотел (конечно, не так, как мой агент, но все же). И собрал огромную кучу материалов, практики и примеров и разобрал все в одном гайде.

😲 Встречайте! Как делать игры с агентами по шагам, даже если вы никогда не писали код и даже почти-почти совсем не вайбкодили.

Внутри там – кто уже делал игры и что у них вышло, какие шесть шагов повторяются у всех, на каких движках агенту удобно, что у него пока не получается, какие скиллы безопасно ставить. Бонусом мультфильмы кодом и музыка, которую агент пишет сам.

Внутри все кликабельно. Есть ссылки на игры, в которые можно зайти и побегать, чтобы вдохновиться и понять, какой уровень сейчас доступен любому желающему.

PDF прикрепляю, надеюсь кого-то вдохновит! И кидайте свои игры в комментарии, соберу лучшие в следующий разбор.


Я написал свой пунто-свитчер (софт для автоматического переключения раскладки)

Хотя последнее время я много надиктовываю голосом, даже когда общаюсь с кем-то, не путать с голосовыми 😬, всё надиктованное переводится в текст. Это очень удобно. Но я не перестал так же периодически печатать текст. Как же меня бесит переключать раскладку, когда пишешь, или допускать опечатки из-за быстрого набора.

Попробовал сделать его более удобным для себя и добавил функцию исправления ошибок.

Представляю вашему вниманию V.01.💪 😎

Установите, по тестируйте и напишите свой фидбэк. Я отлавливаю уже баги и правлю. Давайте сделаем наконец-то нормальный софт, который позволит писать без лагов и проблем.

upd. Уже обновил, работает почти идеально)

@VAI_ART
#VAI_TOOLS


Подсмотрел неплохой пайплайн для прокачки навыков скиллов практически в любой сфере. Понравился настолько, что делюсь.

Схема такая:

🔹 Идёшь на Amazon и Goodreads (любой другой источник), находишь лучшие книги по теме - по рейтингам и отзывам.
🔹 Из них отбираешь только те, что реально закрывают твою задачу.
🔹 Достаёшь PDF (берём с Anna's Archive).
🔹 Конвертируешь PDF в Markdown - так модель читает текст нормально.
🔹 Отдаёшь ИИ: пусть выберет релевантное, сформулирует основные принципы и обязательно цитирует первоисточник.

Последний пункт ключевой - без цитат получаешь пересказ пересказа, с цитатами каждый тезис можно проверить.

P.S. Идти и отбирать необязательно руками - можно натравить агентов. В общем, процесс можно выстроить практически на автомате, и вот у вас скилл практически под любую задачу.

@VAI_ART
#VAI_Notes


Мне очень нравится то что создают нейронки через Three.js.

Three.js - это инструмент, с помощью которого на обычной веб-странице можно показывать 3D. Не картинку и не видео, а живую сцену: её можно вращать мышью, она реагирует на действия и считается в реальном времени на видеокарте того, кто открыл страницу.

Браузер умеет работать с видеокартой напрямую (эта технология называется WebGL), но писать под неё вручную очень долго и сложно. Three.js берёт всю эту сложность на себя и даёт понятные вещи: сцена, камера, свет, материалы, объекты, постобработка - всё то же, что в 3ds Max или Blender, только задаётся кодом, а не в интерфейсе.

Хорошо подходит для интерактивных сайтов (конфигураторы, промо, портфолио, где объект крутится мышью), визуализация данных и архитектуры, игры и AR/VR без установки, генеративная графика и шейдеры.

Сделал сайт-артефакт, который частично показывает возможности. Там можно покрутить и докрутить в настройках снизу.

@VAI_ART
#VAI_Gallery


Репост из: Революция Чайных Пакетиков
Видео недоступно для предпросмотра
Смотреть в Telegram
Обновление Arcadia Effector 1.02

Всем привет друзья!
Я вернулся из отпуска, где классно отдохнул, набрался идей и впечатлений, часть из который пойдут в HEXSTORM, часть в новый проект на 3D движке. А какие-то уже реализованы в моем редакторе спецэффектов Arcadia Effector.

Что нового:
- Post FX - Pixel Art. Возможность превращать любые ваши творения в достаточно качественный и хорошо тюнингуемый пиксель-арт.
- Оптимизация GPU. Частицы считаются на CPU и достаточно шустро уже сейчас, а GPU занимается пост-обработкой, там были проблемы с производительностью, вроде решены.
- Полностью обновленный инструментарий работы с атласами, теперь есть превьюшка, можно выбирать конкретные кадры, задавать FPS плейбека.
- Добавлены всплывающие подсказки с описанием того, как действует каждая кнопка и параметр.

[Скачать Arcadia Effector с github]

В ближайшее время планирую показать интересный и экономичный пайплайн работы с 3D играми.
И если поддежите вашим огненным лайком - 🔥, то будет отдельное видео по пайплайну прозводства 2D спрайтовых анимаций, где на полную катушку применю и поделюсь всеми своими инструментами.

P.S. Приятно видеть, как в Чате Чайных Пакетиков сформировалось очень крутое комьюнити начинающих и не только разработчиков, которые вместе поддерживают друг-друга, делятся своими проектами и вместе погружаются в новый удивительный мир ИИ-геймдева. За неделю число участников выросло вдвое и собралось множество талантливых и пытливых умов. Если у вас есть вопросы о том, как начать, или есть желание показать свой проект, то добро пожаловать в чат (вступить в группу можно через комментарии).


Релизов за неделю немного, но все очень крутые. Кратко пробежимся 👾

🔹 ChatGPT Images 2.5 — генератор картинок OpenAI наконец держится за исходник при правках
Вышла 8 сентября, раскатывается на все тарифы ChatGPT, Codex и API. До 50% быстрее второй версии. В API две модели: Flare — быстрая, Sunburst — медленнее, но точнее в сложном редактировании.
— правит один элемент, не разваливая остальное: лицо, персонаж и композиция после цепочки правок держатся, фон не дёргается
— режим Sketch: рисуете каракули прямо в чате, добавляете описание — модель берёт рисунок как инструкцию
— комментарии прямо на картинке для точечных правок, шаблоны Poster и Merch
— в API произвольное разрешение до 4K и шесть уровней качества; максимум в 1024 — около $0,21 за картинку


Презентация в комментариях.

🔹 Suno v6 — три модели сразу и правка отдельных слов в готовом треке
Вышли 9 сентября: v6 и v6-wild для Pro/Premier ($10 и $30 в месяц), v6-mini — всем, включая бесплатный тариф. Старые модели отключают. Обучена на лицензированных каталогах Warner, BMG и Believe.
— меняет фрагмент песни текстовой командой, не пересобирая трек: одну строку или даже слово
— вырезает кусок аудио, например гитарный рифф, и строит вокруг него новый бит; собирает мэшап из своих треков
— на вход принимает текст, аудио, картинку и видео вместе — можно дать ролик и получить музыку под него
— v6-wild — та же модель с выкрученной непредсказуемостью: ловите странную идею там, дорабатываете в обычной v6


🔹 FLUX Video Edit — загружаете своё видео, пишете текстом что поменять, получаете тот же ролик с правкой
Black Forest Labs выпустили 10 сентября. Суть: берёте уже снятый или сгенерированный клип, пишете «замени суши на мясо» или «сделай ночь вместо дня» — и получаете тот же самый ролик, где изменилось только это, а движение камеры, актёры и всё остальное остались как были. Раньше ради одной детали приходилось перегенерировать сцену целиком. Доступно на сайте BFL и на fal, $0,03 за секунду ролика: 10-секундный клип — 30 центов, независимо от сложности правки.
— что можно менять: убрать или добавить предмет, заменить персонажа, поменять фон, материал, освещение, надпись в кадре
— можно переозвучить героя: пишете новую реплику, модель меняет речь и подгоняет губы — но фраза должна быть той же длины, что оригинал
— чего нельзя: ролик дольше 15 секунд не возьмёт, на выходе всегда 720p, показать картинкой «вот такой объект хочу» нельзя — только описать словами


Презентация в комментариях.

🔹 DeepSeek V4.1 Flash — открытая модель, которая в агентных задачах догнала Opus 5
Вышла 10 сентября, веса под MIT — можно крутить у себя или у любого хостера, не завися от API DeepSeek. Одна модель вместо трёх: быстрые ответы, глубокое рассуждение и понимание картинок, режим выбирать не нужно. Контекст 1 млн токенов.
— в задачах «сделай сам в терминале» — 74% против 74% у Opus 5 и 73% у GPT-5.6 Sol, а в автоматизации рутинных цепочек действий — первое место среди всех
— видит картинки: можно кинуть рендер или референс и обсуждать его, а не описывать словами
— глубина рассуждения регулируется по шкале от 1 до 100 — на простое отвечает мгновенно, на сложное думает долго, и это ваш выбор, а не модели
— память под длинный контекст ужали в четыре раза — большие проекты и длинные диалоги не тормозят и не забываются
— при этом стоит как самая дешёвая младшая модель: $0,15 за миллион на входе


График в комметариях.

🔹 Unity Agent Plugin — официальный плагин Unity для Claude Code и Codex
Вышел 9 сентября, ставится одной командой. 29 готовых скиллов от инженеров Unity для Unity 6+ плюс Unity CLI и MCP-сервер для управления редактором.
— задача обычным текстом: экран настроек, внутриигровые покупки, мультиплеер с голосовым чатом, шейдеры и URP
— агент сам определяет область задачи и подгружает нужные инструкции


Презентация в комментариях.

@VAI_ART
#VAI_News


Пока все пытаются примостить Astra к 3D, генераторы не отстают. В Tripo наконец-то появилась умная сетка, которая делает сетку из квадратов. На треугольниках она уже давно была.

Генерирует очень быстро, буквально секунд за 15–30. И сетку, и текстуру. Автоматом понимает, где нужно разделить, и разбивает на объекты. Полигона можно задавать. С развёрткой всё ещё беда, но тем не менее.

Как и всё, что связано с ИИ, бывает, что косячит, но в целом делает неплохо.

Найдите 10 отличий между концептом и финальной моделью с текстурой)

@VAI_ART
#VAI_Notes


Думаю, все уже знают, что вышла Imagen 2.5, но поделюсь. Зачем осенью 2026 года расписывать, что может модель, если она это может сделать сама.

@VAI_ART
#VAI_News



Показано 20 последних публикаций.