imanai | Акын


Гео и язык канала: Россия, Русский
Категория: Технологии


Увидел — запостил.

Связанные каналы

Гео и язык канала
Россия, Русский
Категория
Технологии
Статистика
Фильтр публикаций


Репост из: Метаверсище и ИИще
One Man One Day Gamedev

Одно дело восторги в твитторе, но вот когда подписчики по свежим следам приручают Фабле с одного промта - это хочется отметить здесь просто для истории.

Дима Киселев, не имея никакого опыта в геймдеве (но имея огромный опыт в кино), взял и бесстрашно сгенерил многоуровневую игрушку да еще и с редактором уровней.

Мои ощущения такие: главное не бояццо, можно все, был бы кураж.

Цитирую:

"Не, ребят, я конечно плохо разбираюсь в геймдеве, но вот что сделал Fable5 (сожрав месячную норму) еще с дух запросов.
• полноценный УДОБНЫЙ редактор уровней (попробовал - работает)
• сгенерил все картинки для пролога, интермиссий и финала (подключил его через Хигсовский плагин к своему CLI/MCP). Все персонажи консистентны от начала до конца!
• сделал подробный гайд для разработчиков с описанием всех механик и особенностей движка (этот файл можно скормить в любую LLM как инструкцию)

Все это в одном файле 1,7 мегабайт!

Бонусом сделан сложный скрытый 13 уровень который можно открыть только в редакторе, но он впечатляет.
Все работает без ошибок и запускается в любом браузере."


Исходник и промпт тут:
https://t.me/c/1262388142/204803

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Ну за риггеров.

Это уже впечатляет.
Возможно мы пропустим этап ИИ-рига, ии-ретопа, ИИ-анврапа.

Просто Большие модели станут настолько умными, что будут делать это сами, без помощи специализированных нейросеток.

В этом примере чувак сгенерил в Хуньянь 3Д модели фламинго и рояля. Сохранил их в GLB. И просто присунул в Fable 5 с промптом:

«Я хочу наложить риггинг на 3D-модели.
Ты можешь это сделать?

Фабле:

Если возможно, сообщите, в каком формате нужно предоставить файлы, а также какую минимальную информацию я должен указать в инструкциях».

Дальше небольшие уточнения и все готово. Причем он даже анимацию сам сделал.

Рояль - огонь.

Важно: никакого Блендора, MCP и прочей бесовщины тут нет.

Просто просьба засетапить 3д модель.

Впечатлен.

Сорс

@cgevent


Репост из: Метаверсище и ИИще
Ну, за геймдев.

Сегодня прям флешмоб - твиттор дружно создает с помощью Fable клоны известных игр: Minecraft, GTA 2, Pokemon, Monopoly. Пишут, что прям one shot - с первой попытки.
Особенно лютуют любители Майнкрафта.
У кого-то Fable 5 создает клон игры за 30 минут, у кого-то за 55 минут и 52.4k токенов.
• Multiple biomes
• Day/night cycle
• Ores, caves & more

Для сравнения выше в одном из примеров парное видео(второе), где GPT-5 делает то же самое 10 месяцев назад. Прогресс, так сказать, на лицо.

Что же будет через 10 месяцев?

@cgevent


Репост из: РассветAI
Так, Идеограм 4 локально в NSFW побеждён, воркфлоу в комментариях.


Репост из: RoboFuture
Когда выходит новая модель - традиционно проверяю ее на всяких смешных и дурацких промптах. Один из них - ТЗ из известного мема, где мальчик Кирилл джва года ждет игру, в которой можно грабить корованы

Для тех кто уже не помнит таких древних мемов, привожу полный текст ТЗ от Кирилла:

Здраствуйте. Я, Кирилл. Хотел бы чтобы вы сделали игру, 3Д-экшон суть такова... Пользователь может играть лесными эльфами, охраной дворца и злодеем. И если пользователь играет эльфами то эльфы в лесу, домики деревяные набигают солдаты дворца и злодеи. Можно грабить корованы... И эльфу раз лесные то сделать так что там густой лес... А движок можно поставить так что вдали деревья картинкой, когда подходиш они преобразовываются в 3-хмерные деревья[1]. Можно покупать и т.п. возможности как в Daggerfall. И враги 3-хмерные тоже, и труп тоже 3д. Можно прыгать и т.п. Если играть за охрану дворца то надо слушаться командира, и защищать дворец от злого (имя я не придумал) и шпионов, партизанов эльфов, и ходит на набеги на когото из этих (эльфов, злого...). Ну а если за злого... то значит шпионы или партизаны эльфов иногда нападают, пользователь сам себе командир может делать что сам захочет прикажет своим войскам с ним самим напасть на дворец и пойдет в атаку. Всего в игре 4 зоны. Т.е. карта и на ней есть 4 зоны, 1 - зона людей (нейтрал), 2- зона императора (где дворец), 3-зона эльфов, 4 - зона злого... (в горах, там есть старый форт...)
Так же чтобы в игре могли не только убить но и отрубить руку и если пользователя не вылечат то он умрет, так же выколоть глаз но пользователь может не умереть а просто пол экрана не видеть, или достать или купить протез, если ногу тоже либо умреш либо будеш ползать либо на коляске котаться, или самое хорошее... поставить протез. Сохранятся можно...
P.S. Я джва года хочу такую игру.


Что ж, вышла Fable 5, она же Mythos и похоже джва года ожидания закончились - Кирилл дождался! ТЗ реализовано полностью. Что могу сказать - это SOTA. Все предыдущие модели выдавали неиграбельные поделки, приходилось промптить дальше, тыкать в ошибки. А новая антропиковская модель справилась отлично с одного запроса. Интересно, настанет ли однажды время, когда по этому ТЗ сделают AAA-тайтл?

Поиграть прямо в браузере можно здесь (с ПК), там же есть и исходники. Для истории сделал еще две версии с тем же промптом - gpt-5.5 и opus 4.8. Что называется, почувствуйте разницу. Игры моделей прошлого поколения неиграбельны.

P.S. Когда не зря ждал джва года


Репост из: Psy Eyes
Nvidia: представила PiD (Pixel Diffusion Decoder), декодер на основе диффузии пикселей.

В большинстве t2i моделей генерация осуществляется в сжатом латентном пространстве, а декодер (VAE) разворачивает полученное в пиксели в нужном разрешении. Однако такой декодер ориентирован на реконструкцию без генерации дополнительных деталей, и с увеличением целевого разрешения картинки значительно растут и требования к компьюту.

PiD напрямую декодирует латенты в пиксельные изображения высокого разрешения, объединяя декод и апсемплинг в единый модуль. Это позволяет получить чёткие 2048×2048 или 4096х4096 картинки за несколько шагов. PiD декодирует 512х512 латент в 2048×2048 пикселей за ~1 сек на 5090 и потребляет 13 ГБ VRAM.

Метод совместим с существующими моделями на основе VAE / RAE (Representation Autoencoder) и Nvidia предоставила чекпоинты для Flux, Flux 2, SD3, Dino v2, и Siglip. Z-image использует VAE от Flux поэтому отдельного чекпоинта нет, зато есть демо. Веса с 2К в названии натренированы из 512 латента выдавать пискельные 2048x2048, а 4К веса из 1024 латента 4096х4096.

Kijai недавно официально присоединился к мейнтейнерам кода в Comfy. Поддержка PiD в работе, тестовый воркфлоу уже есть. И на реддите тоже появились ноды.

Демо (Z-image)
Сайт
Гитхаб
Comfy воркфлоу
Хаггинг


Репост из: Psy Eyes
Чтоб Алеф не расслаблялся, опенсорс в лице лор на LTXV 2.3 держит его на контроле.

Пара наблюдений из твиттера от человека, тренирующего IC (In-Context) лоры на LTXV:

- Качество обучающих данных важнее их количества. Даже с относительно небольшими наборами данных (10–15 пар) можно добиться отличных результатов, если данные качественные, а желаемый эффект четко сформулирован.

- first_frame_conditioning — ключевой параметр. Более высокие значения способствуют замене каждого пикселя, а более низкие — игнорированию референсных изображений. Однако использование вместе с лорами на стиль может улучшить результат. Очень важно найти правильный баланс.

- При обучении универсальных IC-лор может быть полезно использовать низкую скорость обучения (5e-5 или меньше) и большее количество шагов, особенно если цель состоит в том, чтобы изменить только часть входного видео.


Твит


Репост из: Метаверсище и ИИще
19 лучших Лор для LTX 2.3 в одном месте

С описаниями, видео-примерами и ссылками.

А то с ума можно сойти - про каждую постить отдельно.

https://www.stablediffusiontutorials.com/2026/05/ltx2.3-lora-models.html

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Молния! Igeogram 4 опенсорснулся!

По бенчам и аренам теперь это лучший опенсорсный генератор картинок.

"Ideogram 4 — это первая модель с открытыми весами от Ideogram. Это базовая модель, обученная с нуля, а не файнтюн существующей модели. Она имеет новый структурированный интерфейс промптов в формате JSON, лучшую в своем классе многоязычную отрисовку текста, глубокое понимание языка, явное управление цветовой палитрой, а также нативное 2K. Аспекты картинок до 6:1"

Всего 9.3B параметров - должно влезать в слабые видеокарты (Qwen-Image - 20B, FLUX.2 [dev] - 32B)

Две версии весов nf4(Cuda) и fp8. Обещают больше квантизаций.

Для гиков:
It is a flow-matching text-to-image model built on a fully single-stream Diffusion Transformer (DiT) architecture.
Fully single-stream DiT. Text and image tokens are concatenated into one unified sequence and processed through the same 34-layer transformer, with no separate text or image branches.
Vision-language model as text encoder. Instead of a text-only encoder like CLIP or T5, Ideogram 4 uses Qwen3-VL-8B-Instruct, a full vision-language model that provides far richer understanding of visual concepts.


Тренировали на JSON разметке, есть промпт улучшайзер и промпт гайд.

Есть какие-то заморочки с цензурой (использование https://thehive.ai/), но думаю народ сейчас быстро выкусит нужный код, если это вообще нужно.

Лицензия - некомерческая. Какая именно, надо разбирацца.

Очень круто сделан гитхаб - все веса, код, инструкции, гайды - по ссылке:

https://github.com/ideogram-oss/ideogram4

Завтра будем разбираться с анатомией, цензурой, текстом, слоями и пр.

Нелокально можно пробовать как у них на сайте, так и на всех аггрегаторах: фал, креа, комфиАПИ, рунваре, магнифик, репликейт..

Всем бессонной ночи!

P.S. Editable text, movable layers, and full image editing are coming soon.

@cgevent


Репост из: Метаверсище и ИИще
Видео недоступно для предпросмотра
Смотреть в Telegram
Gemini Omni: перевод, липсинк и дубляж с попаданием в губы.

Тут некоторые стартапы нервно закурили на лестнице, ведущей вниз.

Омни может переводить аудио, даже если в промпте не указано ни исходного, ни переведенного текста:
- попадает в губы для нового языка
- фоновая музыка остается без изменений
- при необходимости корректирует длину ролика(!).
Например, японская и испанская фразы во время крупного плана с кремом длиннее, поэтому Омни просто домонтирует пару секунд сама.

@cgevent


Репост из: Метаверсище и ИИще
Нейрорендер и нейрокомпоз в Gemini Omni

Собрал пару примеров, которые меня сильно впечатляют.

С кувшином - это настольно просто и элегантно, что видится этакий редактор шейдеров, который можно набрасывать на выбранные объекты и получать лукдев для готового материала. Прозрачный шейдер доставляет особо.

С медведем - это прям метакомпоз. И ведь пыль летит как надо и фон вроде не плывет.

Но с поездом - это прям вишенка. Поглядите до конца, он длинный. Сороконожка прекрасна, конечно.

Композ не будет прежним.

@cgevent

Показано 11 последних публикаций.

1

подписчиков
Статистика канала