Репост из: Метаверсище и ИИще
Похоже в области видеогенерации прогресса больше, чем на плато генераторов картинок.
Тут вот реддит и цивитай активно обсуждают новый проект Chroma
Разработчик в одно лицо делает файнтюн Flux Schnell (из-за лицензии).
Его уже окрестили как Pony for Flux ну или: Chroma for Flux is like Pony for SDXL (если вы понимаете о чем я).
Если в общих чертах, это Flux с нормальной анатомией и без цензуры.
Обучен на 5M наборе картинок, тщательно выбранных из 20M образцов, включая аниме, фурри, художественные материалы и фотографии.
Полностью очищен от цензуры, восстанавливает недостающие анатомические понятия.
Тренировка еще идет - уже потрачено 5000 с лишним часов на H100, поэтому автор собирает донаты: уже собрал 3500$, хочет собрать 50 000$.
Я сильно рекомендую почитать вот этот тред тем, кто в теме, там есть хорошие оценки стоимости тренировки моделей:
~18img/s on 8xh100 nodes
training data 5M so roughly 77h for 1 epoch
so for the price of 2USD / h100 gpu 1 epoch cost 1234 USD
to make the model converge strongly on tags and instruction tuned 50 epochs is preferred
but if it converged faster then the money will be allocated to do pilot test fine tuning on WAN 14B
и хорошие ссылки на статьи про стоимость тренировки:
https://www.databricks.com/blog/stable-diffusion-2
https://civitai.com/articles/12223 (How many computation hours does it take to train a Flux from zero?)
Там уже есть ссылки на Комфи воркфлоу, хотя тренировка продолжается, и даже ггуф:
https://huggingface.co/Clybius/Chroma-GGUF/tree/main
Но есть один момент. Как пишет этот автор (и другие), такие модели тренируются на синтетической разметке. Ну то есть подписи к картинкам генерит LLM.
Насколько я знаю из общения с NSFW-проектами, есть проблема в том, что LLM просто не в курсе очень многих очень специальных, своебразных, хотя и распространенных терминов для определенных поз, частей анатомии, действий и, скажем так, композиций. Поэтому текстовый энкодер может быть немного "глуховат" или "туговат".
Но в любом случае, это довольно амбициозный проект. Более того, автор обещает хорошие арт стили (чего не хватает Флюксу), имена селебрити и художников без купюр, и тщательно отобранный анатомический датасет.
После выхода CogView4 (который анатомически туповат) - это хорошая новость.
Hugging Face Repo: https://huggingface.co/lodestones/Chroma
ComfyUI Inference node [WIP]: https://github.com/lodestone-rock/flux-mod
ComfyUI workflow: https://huggingface.co/lodestones/Chroma/resolve/main/simple_workflow.json
Training code!: https://github.com/lodestone-rock/flow
CivitAi gallery: https://civitai.com/posts/13766416
@cgevent
Тут вот реддит и цивитай активно обсуждают новый проект Chroma
Разработчик в одно лицо делает файнтюн Flux Schnell (из-за лицензии).
Его уже окрестили как Pony for Flux ну или: Chroma for Flux is like Pony for SDXL (если вы понимаете о чем я).
Если в общих чертах, это Flux с нормальной анатомией и без цензуры.
Обучен на 5M наборе картинок, тщательно выбранных из 20M образцов, включая аниме, фурри, художественные материалы и фотографии.
Полностью очищен от цензуры, восстанавливает недостающие анатомические понятия.
Тренировка еще идет - уже потрачено 5000 с лишним часов на H100, поэтому автор собирает донаты: уже собрал 3500$, хочет собрать 50 000$.
Я сильно рекомендую почитать вот этот тред тем, кто в теме, там есть хорошие оценки стоимости тренировки моделей:
~18img/s on 8xh100 nodes
training data 5M so roughly 77h for 1 epoch
so for the price of 2USD / h100 gpu 1 epoch cost 1234 USD
to make the model converge strongly on tags and instruction tuned 50 epochs is preferred
but if it converged faster then the money will be allocated to do pilot test fine tuning on WAN 14B
и хорошие ссылки на статьи про стоимость тренировки:
https://www.databricks.com/blog/stable-diffusion-2
https://civitai.com/articles/12223 (How many computation hours does it take to train a Flux from zero?)
Там уже есть ссылки на Комфи воркфлоу, хотя тренировка продолжается, и даже ггуф:
https://huggingface.co/Clybius/Chroma-GGUF/tree/main
Но есть один момент. Как пишет этот автор (и другие), такие модели тренируются на синтетической разметке. Ну то есть подписи к картинкам генерит LLM.
Насколько я знаю из общения с NSFW-проектами, есть проблема в том, что LLM просто не в курсе очень многих очень специальных, своебразных, хотя и распространенных терминов для определенных поз, частей анатомии, действий и, скажем так, композиций. Поэтому текстовый энкодер может быть немного "глуховат" или "туговат".
Но в любом случае, это довольно амбициозный проект. Более того, автор обещает хорошие арт стили (чего не хватает Флюксу), имена селебрити и художников без купюр, и тщательно отобранный анатомический датасет.
После выхода CogView4 (который анатомически туповат) - это хорошая новость.
Hugging Face Repo: https://huggingface.co/lodestones/Chroma
ComfyUI Inference node [WIP]: https://github.com/lodestone-rock/flux-mod
ComfyUI workflow: https://huggingface.co/lodestones/Chroma/resolve/main/simple_workflow.json
Training code!: https://github.com/lodestone-rock/flow
CivitAi gallery: https://civitai.com/posts/13766416
@cgevent