Как мы сделали 33-секундное видео на трек Хаски «Танцы на снегу»: придумали историю викинга, собрали сцену в Blender и превратили серые болванки в кино с помощью нейросети. Шесть шагов, которые можно повторить на своём проекте.
Что понадобится
Мы не начинали с картинок. Сначала взяли трек и придумали, про что будет клип: викинг на заснеженном мосту, один против толпы. Сеттинг даёт всё остальное — костюмы, оружие, погоду и цвет.
Дальше текст песни превращается в раскадровку. Выпиши строчки и под каждую придумай один кадр: кто в кадре, что делает и откуда смотрит камера.


Проверка шага. У тебя есть список кадров, и про каждый понятно, какой строчке песни он отвечает.
Нейросеть не помнит, как выглядел персонаж в прошлом кадре. Чтобы внешность не «плыла», под каждого героя и важный предмет делаем карточку: один и тот же объект с нескольких ракурсов на нейтральном фоне.



Character sheet, [кто это: возраст, внешность, костюм, материал и состояние одежды], full body front view, full body back view, close-up portrait, same character in all views, neutral grey studio background, even soft light, photorealistic, no text
Отдельно генерируем место действия. У нас это деревянный мост над рекой, снег и туман. Локация задаёт палитру и свет для всех кадров, поэтому её лучше утвердить до того, как появится первый ролик.
Полезно сделать несколько видов одного места: общий план, вид снизу и вид сверху. Они пригодятся как референсы для разных ракурсов камеры.


[Место: что это и из чего сделано], [эпоха и регион], [погода и время суток], [план: wide shot / low angle / top-down], muted cold palette, overcast light, cinematic still, photorealistic, no people, no text
Здесь решается главное: ракурс, тайминг и движение. Красоты на этом шаге не нужно. Мост собран из простых досок, вместо актёров стоят болванки, у нужных предметов вообще кубики.
У нас получилось 12 шотов длиной от одной до шести секунд, рендер прямо из вьюпорта в 1920×1080.




Почему не сразу в нейросеть. Текстом сложно объяснить, где стоит камера и на какой секунде персонаж падает. В Blender это ставится руками и не меняется от генерации к генерации.
Каждый ролик из Blender отправляем в Video Edit вместе с референсами: карточками персонажей и кадром локации. Нейросеть берёт из превиза движение и камеру, а внешний вид — из карточек.


Keep the camera movement and character motion from the input video. Replace the blue mannequin with [персонаж из карточки 1], the red mannequin with [персонаж из карточки 2]. Replace the grey set with [локация из референса]. [Что происходит в кадре одним предложением]. [Погода, свет], cinematic, photorealistic
Готовые шоты собираем в After Effects под трек в том же порядке, что и превиз. Дальше каждый кадр раскладывается на слои.
Чтобы строчки песни стояли внутри кадра, а не поверх него, героя вырезаем ротоскопом. Текст кладём между фоном и вырезанным героем и анимируем под строчки трека. Шрифт с руническим характером поддерживает сеттинг.
Сверху общий цвет: уводим картинку в чёрно-белую с зерном, чтобы все кадры выглядели как один фильм и мелкие расхождения между генерациями перестали бросаться в глаза. Красными остаются только титры.
01 Кадр из нейросети
02 Типографика
03 Ротоскоп героя
Сравнение до и после — в начале страницы: Blender, нейросеть и финал идут синхронно.
Итог
Per Aspera Ad Astra · школа дизайна