Дальше появляется камера, и тебе уже недостаточно написать в промпте cinematic shot. Тебе нужно понимать, зачем здесь крупный план, почему здесь камера двигается, а здесь должна стоять, какой объектив тебе нужен, какая перспектива будет работать, где должна находиться точка внимания зрителя и что вообще этим кадром ты пытаешься рассказать. Потом появляется актёрская игра, потому что персонаж должен не просто двигать ртом и руками, а испытывать конкретную эмоцию внутри конкретной драматической ситуации, причём следующий кадр должен продолжать предыдущий, а не начинать новую жизнь.
И дальше всё это начинает наслаиваться друг на друга: монтаж, цвет, звук, continuity, физика движения, одежда, волосы, окружение, соответствие эпохе, свет, композиция, ритм сцены. В какой-то момент оказывается, что ты несколько часов делал охуенный кадр, а потом ставишь его на таймлайн и понимаешь, что он вообще не монтируется с соседним. И всё, можешь его выкинуть, потому что отдельно он прекрасный, а внутри фильма он не работает.
Вот примерно в этот момент заканчивается «я умею пользоваться нейросетями» и начинается профессия.
Причём самое забавное, что практически вся техническая информация сегодня лежит бесплатно. YouTube забит туториалами, есть Discord, Reddit, статьи, курсы, breakdown'ы, готовые workflow. Можно найти, как делать консистентного персонажа, как работать с reference images, как фиксировать лицо, как собирать ComfyUI, как работать с LoRA, как делать image-to-video и как контролировать камеру. Если у тебя есть голова и время, технически ты можешь изучить практически всё.
Но есть одна вещь, которую тебе не передаст ни один YouTube-канал и ни один учитель. Это насмотренность и твои внутренние ориентиры того, что хорошо, а что хуйня.
И вот это, мне кажется, сейчас вообще недооценивают. Иногда ты смотришь на изображение, вроде человек красивый, свет красивый, композиция хорошая, качество охуенное, технически вообще не к чему придраться, но ты всё равно понимаешь, что это пластик и ты в это не веришь. А дальше начинаешь разбирать, почему именно не веришь: кожа слишком идеальная, свет стерильный, глаза не работают, глубина пространства странная, поза постановочная, фокусное расстояние создаёт ощущение рекламного рендера, в одежде нет нормальной физики, а в самом кадре нет той случайности и несовершенства, которые существуют в реальном мире.
И самое смешное, что чем больше ты этим занимаешься, тем в каком-то смысле становится хуже, потому что ты начинаешь видеть вообще всё. То, мимо чего ещё год назад спокойно прошёл бы, сейчас начинает тебя бесить, и ты можешь потратить полдня на какую-то деталь, которую девяносто процентов зрителей вообще не заметят. Но именно из таких деталей в конечном итоге и складывается ощущение дорогого продукта.
Поэтому мне кажется очень смешной вся эта гонка вокруг инструментов. Какая модель вышла, что сейчас лучше, где круче skin texture, где лучше motion, какая нейронка лучше держит персонажа, кто сегодня кого обогнал. Через какое-то время модели плюс-минус сравняются, сегодня одна лучше делает одно, завтра другая выпускает обновление и делает это ещё лучше. И знание конкретной кнопки перестанет иметь вообще какую-либо серьёзную ценность.
Ценность будет в том, что именно ты заставляешь эту кнопку делать и что находится у тебя в голове до того, как ты написал промпт. Что ты знаешь про кино, фотографию, композицию, свет, драматургию, монтаж, человеческие эмоции, одежду, архитектуру, движение, историю и культуру. Потому что нейронка сама по себе ничего этого за тебя не решает, она просто очень быстро материализует твоё решение. И если внутри головы у тебя нихуя нет, она просто очень быстро материализует это нихуя в красивом разрешении.
И вот здесь, кстати, есть хорошая новость для всех, кого последние несколько лет пугали тем, что ИИ сейчас уничтожит половину профессий. Что больше не нужны будут операторы, монтажёры, колористы, художники, специалисты по свету и вообще все люди, которые годами занимались каким-то конкретным ремеслом.
Нихуя этого не произошло.