Репост из: Киса | Deploy la Deploy
Картинки от нейросети: создание и ресерч (часть 1)
Вся серия постов будет в контексте AI компаньонов, артам в крипте и вообще моему любимому делу — аниме.
Это объединяющее слово и все примеры будут построены вокруг этого. Но базис применим и к генерации фотографий живых людей (женщин).
Самая ущербная генерация
Такое вы увидите в ChatGPT, делает он круто и ловко, обложки четкие. Все дела. Но в его генерации есть один четкий стиль: жирные черные линии.
Еще это почти всегда аниме, просто мультипликация, привычный "нормисный арт". Вы такого много видите в интернете и уже давно.
Предполагается, что персонаж имеет четкий образ и стиль, что и является слабым местом. Ровно как и множество артефактов: лишние пальцы, предметы в предметах, странное расположение всего в кадре. Это ведь генерация, нейросети не ведомо житие человека.
Главное — нестабильные персонажи.
В комментах к посту я скину свои примеры с моего ресерча разбора раннего проекта Koa. Где я выделил все несоответствия:
- Меняется одежда или ее детали
- Меняется прическа, стиль волос, в одном и том же ракурсе одного и того же персонажа
Если быть внимательным, это очень легко спалить. Мы чаще всего видим общую картину и восхищаемся красотой, а очевидные косяки в глаза не бросаются. Тут важно иметь привычку и быть параноиком, все вокруг нейросети..
Уровень выше: Stable Diffusion
Я уверен, что Koa делалась именно так. Там есть свой стиль, не сильно похожий на ChatGPT, но имеются упомянутые ошибки.
По хорошему их можно фиксить. При генерации можно выделить проблемные области и задать им промпт. Но кто будет тратить лишнее время и ресурсы на переделку?
Обращайте внимание на стабильность персонажа: детализацию, мелкие штуки. Иишка может слегка сломать костяшки пальцев, размазать радужку глаза.
Одежда может быть нелогичной. Юбка из футболки, разные для лямки лифчика, разные узоры/складки на спортивном топике, любой другой одежде.
Вот в моем примере из поста видно, что уши и накидка на голове это единое целое, по логике они должны быть частью волос. Я не пытался это фиксить, при внимательном взгляде выглядет.. пугающе?
Если проект дает несколько кадров с персонажем, можно увидеть несоответствие в количестве прядей волос, что самое очевидное и палевное после 6 пальцев. Художники так рисовать не будут.
И если мы говорим о качественных персонажах (AI компаньоны) там как раз готовый персонаж, который в реал тайме двигается. Там не может быть проблем, что волосы то одни, то другие.
Это готовая полноценная 3D модель или что-то из классических 2д витуб персонажей. Где картинка порезана на слои и деформируется нужным образом.
Хард уровень: "Я вижу LoRA"
Лора это модель, которая обучена поверх другой. Ее задача: закрыть какую-то область генерации.
- Поза
- Дизайн персонажа
- Стиль одежды
- Окружение/сцена
- Диалоги
Есть LoRA модели, которые повторяют один сюжет, один стиль фрейма (манга, комикс). Здесь решает ваш опыт, как часто и много вы видели примеров генерации с ними.
То есть челики под свою модель могут отобрать нужную LoRA и просто нагенерить себе картинок в формате комикса, берем пример Koa.
Напоминаю: Для полноценных компаньонов (на примере Grok, от студии Animation Inc) это просто невозможно. Под капотом отдельная технология.
Смотрите в интернете примеры с Ani, про нее был пост. Там про технологии и мемкоины.
Этой базы должно быть достаточно, чтобы отсеивать AI от художника, а халтурную генерацию от искусства, пердолинг от души с множеством моментов, проб и ошибок.
С вас реакции, комменты и репосты. Не забываем, пжлст.
Начнем мы с конца, люблю начинать с конца. Как запалить говно проект?
Вся серия постов будет в контексте AI компаньонов, артам в крипте и вообще моему любимому делу — аниме.
Это объединяющее слово и все примеры будут построены вокруг этого. Но базис применим и к генерации фотографий живых людей (женщин).
Самая ущербная генерация
Такое вы увидите в ChatGPT, делает он круто и ловко, обложки четкие. Все дела. Но в его генерации есть один четкий стиль: жирные черные линии.
Еще это почти всегда аниме, просто мультипликация, привычный "нормисный арт". Вы такого много видите в интернете и уже давно.
Предполагается, что персонаж имеет четкий образ и стиль, что и является слабым местом. Ровно как и множество артефактов: лишние пальцы, предметы в предметах, странное расположение всего в кадре. Это ведь генерация, нейросети не ведомо житие человека.
Главное — нестабильные персонажи.
В комментах к посту я скину свои примеры с моего ресерча разбора раннего проекта Koa. Где я выделил все несоответствия:
- Меняется одежда или ее детали
- Меняется прическа, стиль волос, в одном и том же ракурсе одного и того же персонажа
Если быть внимательным, это очень легко спалить. Мы чаще всего видим общую картину и восхищаемся красотой, а очевидные косяки в глаза не бросаются. Тут важно иметь привычку и быть параноиком, все вокруг нейросети..
Уровень выше: Stable Diffusion
Я уверен, что Koa делалась именно так. Там есть свой стиль, не сильно похожий на ChatGPT, но имеются упомянутые ошибки.
По хорошему их можно фиксить. При генерации можно выделить проблемные области и задать им промпт. Но кто будет тратить лишнее время и ресурсы на переделку?
Обращайте внимание на стабильность персонажа: детализацию, мелкие штуки. Иишка может слегка сломать костяшки пальцев, размазать радужку глаза.
Одежда может быть нелогичной. Юбка из футболки, разные для лямки лифчика, разные узоры/складки на спортивном топике, любой другой одежде.
Вот в моем примере из поста видно, что уши и накидка на голове это единое целое, по логике они должны быть частью волос. Я не пытался это фиксить, при внимательном взгляде выглядет.. пугающе?
Если проект дает несколько кадров с персонажем, можно увидеть несоответствие в количестве прядей волос, что самое очевидное и палевное после 6 пальцев. Художники так рисовать не будут.
И если мы говорим о качественных персонажах (AI компаньоны) там как раз готовый персонаж, который в реал тайме двигается. Там не может быть проблем, что волосы то одни, то другие.
Это готовая полноценная 3D модель или что-то из классических 2д витуб персонажей. Где картинка порезана на слои и деформируется нужным образом.
Хард уровень: "Я вижу LoRA"
Лора это модель, которая обучена поверх другой. Ее задача: закрыть какую-то область генерации.
- Поза
- Дизайн персонажа
- Стиль одежды
- Окружение/сцена
- Диалоги
Есть LoRA модели, которые повторяют один сюжет, один стиль фрейма (манга, комикс). Здесь решает ваш опыт, как часто и много вы видели примеров генерации с ними.
Смотрите вот здесь: https://civitai.com/models
Но вот примеры от меня: поза из бойца баки, Mai из файтингов от SNK, раскадровка для манги (фреймы, персонажи, текст).
То есть челики под свою модель могут отобрать нужную LoRA и просто нагенерить себе картинок в формате комикса, берем пример Koa.
Напоминаю: Для полноценных компаньонов (на примере Grok, от студии Animation Inc) это просто невозможно. Под капотом отдельная технология.
Смотрите в интернете примеры с Ani, про нее был пост. Там про технологии и мемкоины.
Этой базы должно быть достаточно, чтобы отсеивать AI от художника, а халтурную генерацию от искусства, пердолинг от души с множеством моментов, проб и ошибок.
Ну и ожидайте вторую часть, где я уже дам полноценный гайд на установку, настройку и генерацию картинок (пикрил для затравки).
С вас реакции, комменты и репосты. Не забываем, пжлст.