most-AI.com

Раскадровка нейросетью: разложить ролик на кадры до генерации

Денис Коростелёв8 мин

Почему «просто сгенерировать ролик» превращается в серию перегенераций

Типичный порядок работы выглядит так: открыть видеомодель, написать одним абзацем всё, что хочется увидеть, нажать кнопку, посмотреть результат, поморщиться, переписать формулировку, повторить. На четвёртом заходе обычно приходит понимание, что модель не поняла не промт, а замысел. В голове автора ролик состоит из нескольких смысловых кусков, а в поле ввода эти куски сжаты в один абзац, где они конкурируют друг с другом.

Дело в устройстве самих моделей. Видеомодель генерирует короткий отрезок связного движения — несколько секунд, внутри которых камера и объекты меняются согласованно. Она не рассчитана на то, чтобы «сначала показать общий план, потом крупный». Всё, что написано в промте, она попытается уместить в один непрерывный кадр. Поэтому запрос вида «девушка заходит в кофейню, заказывает кофе, садится у окна и улыбается» почти всегда даёт мешанину: четыре действия и минимум две смены плана в одном отрезке.

Раскадровка снимает эту проблему до того, как потрачена первая генерация. Ролик разбирается на кадры сначала текстом, каждый кадр получает опорный визуал, и только потом видеомодель оживляет уже утверждённые кадры по одному. Переделки при таком порядке остаются в самом дешёвом слое работы — в тексте, где итерация не стоит ничего и занимает секунды.

Что такое раскадровка применительно к нейросетям

В классическом кино раскадровка — это серия рисунков, по одному на план, с пометками о движении камеры и продолжительности. В работе с генеративными моделями смысл тот же, но роль каждого элемента меняется.

Кадр раскадровки становится единицей генерации. Один кадр — один запуск видеомодели, один отрезок в 4–10 секунд, одно ведущее движение. Если в кадре хочется два действия подряд, это признак, что кадров на самом деле два.

Рисунок раскадровки становится опорным изображением. Он нужен не для того, чтобы «показать заказчику», а для того, чтобы зафиксировать композицию, ракурс, свет и внешность объекта до того, как включится видеомодель. Дальше видео строится от этого изображения, а не с чистого листа.

Пометки о движении становятся промтом для видеомодели. Опорный кадр уже отвечает на вопрос «что в кадре», поэтому текстовый запрос сокращается до «что здесь происходит и как движется камера».

Шаг 1. Текстовая модель пишет сценарий по кадрам

Первый этап — разбор идеи на кадры. Здесь работает любая текстовая модель каталога: ChatGPT доступен без ограничения по количеству запросов, для более длинных и структурных сценариев удобны GPT-5.5, Claude Opus 4.8 или Gemini 3.1 Pro Preview. Задача этапа — превратить размытое «хочу ролик про кофейню» в таблицу кадров с внятными границами.

Важная деталь: просить нужно не «сценарий», а именно раскадровку с жёсткой структурой. Иначе модель выдаст литературный текст с диалогами и переходами, из которого потом всё равно придётся выковыривать кадры вручную.

Ты помогаешь собрать раскадровку для короткого ролика.
Задача: ролик 20-25 секунд для соцсетей о городской кофейне.
Разбей его на 4-5 кадров. Для каждого кадра дай ровно:
1) номер и длительность в секундах;
2) что в кадре — объект, план (общий/средний/крупный), обстановка;
3) одно движение камеры;
4) одно движение внутри кадра;
5) свет — источник, направление, характер;
6) смысл кадра одной фразой: зачем он в ролике.
Не описывай монтажные переходы и звук. Не объединяй два действия
в один кадр. Если действий больше — добавь отдельный кадр.

Дальше сценарий читается и правится в диалоге. Именно здесь стоит быть придирчивым: убрать кадры, которые ничего не добавляют, слить два похожих в один, проверить, что между соседними кадрами есть логика, а не просто перечисление красивых видов. Такая правка стоит нескольких минут, а на этапе видео та же правка означала бы повторную генерацию.

Полезный приём — попросить модель проверить собственный результат: «Найди кадры, где больше одного действия, и разбей их».

Шаг 2. Картиночная модель собирает опорные кадры

Когда сценарий утверждён, каждый кадр превращается в изображение. Это ключевой этап, который чаще всего пропускают, и именно из-за его пропуска возникают переделки: без опорного кадра видеомодель каждый раз заново придумывает внешность героя, цвет стен и характер света, и два соседних отрезка выглядят как куски из разных роликов.

Для опорных кадров подходят модели из раздела генерации изображений. Nano Banana входит в бесплатную дневную квоту — 4 изображения в день, этого хватает на короткую раскадровку целиком. Для более требовательных сцен есть GPT Image 2, Seedream 5.0, Flux 2 Pro и Nano Banana Pro. Промт для опорного кадра собирается прямо из полей раскадровки — объект, план, обстановка, свет — без описания движения, потому что изображение статично.

Средний план: бариста в тёмном фартуке за деревянной стойкой
городской кофейни, в руках стеклянный питчер с молоком.
Задний план размыт: полки с зерном, тёплые лампы.
Свет: мягкий боковой от окна слева, тёплая температура,
без жёстких теней.
Кадр горизонтальный, композиция с запасом слева под движение камеры.
Без текста и логотипов в кадре.

Дальше начинается работа, ради которой этот этап и нужен. Опорные кадры собираются в одном стиле: та же цветовая гамма, тот же характер света, тот же герой. Если во втором кадре бариста внезапно в светлом фартуке — это правится генерацией картинки, а не видео. Удобный приём — сначала довести до ума первый кадр, а потом использовать его как референс для остальных: модели с поддержкой изображения на входе принимают готовый кадр и достраивают следующий в той же стилистике.

Отдельно стоит проверить композицию под будущее движение. Если по раскадровке камера отъезжает, объект должен стоять не впритык к краю. Если планируется наезд, в кадре нужна цель, к которой камера пойдёт. Эти вещи видны на статичном изображении за секунду и почти не видны в тексте.

Шаг 3. Видеомодель оживляет утверждённые кадры

К этому моменту у вас есть набор изображений и короткие описания движения. Видеомодели остаётся самая узкая задача — привести в движение то, что уже утверждено. Промт на этом этапе получается коротким, и это нормально: композицию и свет объясняет картинка.

Модели из раздела видеогенерации распределяются по задачам примерно так. Когда траектория камеры принципиальна — проезд вдоль стойки, облёт объекта, — логично начинать с Kling 3.0 или режима Motion Control, рассчитанного именно на управляемое движение. Когда нужен ролик со звуком без отдельного этапа озвучки — Veo 3.1. Когда важна связность происходящего в кадре — Sora 2. Когда нужно быстро прогнать много вариантов одного кадра — Seedance 2, включая облегчённую версию Mini. Актуальную стоимость по каждой модели удобно смотреть на странице тарифов до того, как запускать серию.

Черновые прогоны разумно делать в бесплатной дневной квоте: Veo 3.1 Fast (Relax) даёт 2 видео в день, Grok Video — ещё 2. Этого достаточно, чтобы проверить, как ведёт себя движение в самом сложном кадре раскадровки, прежде чем гнать всю серию. Подробнее про формулировки движения — в разборе формулы промта для видео, а про сильные стороны конкретных моделей — в сравнении видеомоделей.

Этап Чем делается Что на выходе Цена ошибки
Сценарий по кадрам Текстовая модель Список кадров с планом, движением и светом Минута на переписывание строки
Опорные кадры Картиночная модель Утверждённые изображения в едином стиле Одна перегенерация картинки
Оживление Видеомодель Отрезки видео по одному на кадр Полная перегенерация ролика

Таблица объясняет весь смысл порядка: чем раньше поймана ошибка, тем дешевле она обходится. Все три этапа живут в одном кабинете, в Студии, поэтому переключение между текстом, картинкой и видео не требует отдельных сервисов и оплаты в разных местах.

Где именно раскадровка убирает переделки

Первое — расхождение между кадрами. Без опорных изображений герой, интерьер и палитра меняются от отрезка к отрезку, и склеенный ролик выглядит как нарезка из разных источников. Опорные кадры фиксируют внешность до генерации видео.

Второе — перегруженный кадр. Если в описании два действия, модель либо выберет одно, либо попытается показать оба и сломает движение. На этапе текста такой кадр видно сразу: в поле «движение внутри кадра» оказывается два глагола.

Третье — композиция, несовместимая с движением. Отъезд камеры от объекта, который и так прижат к краю, даёт обрезанный кадр. На картинке это заметно до того, как отрезок сгенерирован.

Четвёртое — лишние кадры. Раскадровка честно показывает, что из пяти задуманных планов два ничего не добавляют. Убрать их в тексте — это одна правка, убрать после генерации — две выброшенные генерации.

Частые вопросы

Сколько кадров нужно для короткого ролика?

Для 20–30 секунд обычно достаточно 4–6 кадров: при типичной длине отрезка в несколько секунд этого хватает, чтобы закрыть хронометраж без спешки. Больше кадров имеет смысл, если ролик рассказывает историю с несколькими сменами места. Меньше — если задача показать один объект с разных ракурсов.

Обязательно ли делать опорные картинки, если промт хороший?

Не обязательно, но именно опорные кадры дают повторяемость. Текстовый промт описывает сцену словами, и каждая генерация трактует слова чуть по-своему. Изображение фиксирует композицию однозначно, поэтому соседние отрезки получаются похожими друг на друга, а не просто одинаково описанными.

Какую текстовую модель брать для сценария?

Для черновой разбивки достаточно ChatGPT — он доступен без ограничения по числу запросов. Если сценарий длинный и в нём важна структура и последовательность, удобнее модели с более сильной работой над длинным контекстом — GPT-5.5, Claude Opus 4.8, Gemini 3.1 Pro Preview. Разница заметна не в красоте текста, а в том, насколько аккуратно модель держит заданный формат по всем кадрам.

Можно ли собрать раскадровку целиком в бесплатной квоте?

Частично. Текстовый этап проходит без ограничений, на опорные кадры хватает 4 изображений Nano Banana в день, на видео остаётся 2 генерации Veo 3.1 Fast (Relax) и 2 Grok Video. Полный ролик из пяти кадров за один день так не собрать, но проверить самый сложный кадр и убедиться, что подход работает, — вполне.

Что делать, если видеомодель всё равно ломает движение?

Скорее всего, кадр перегружен: в нём осталось два конкурирующих движения — например, камера едет в одну сторону, а объект в другую. Разделите его на два кадра или оставьте одно ведущее движение, а второе уберите. Если движение простое, а результат всё равно нестабилен, попробуйте другую модель: у Kling, Veo, Sora и Seedance разные сильные стороны.

Подходит ли этот порядок, если исходник — готовое фото?

Да, и он даже короче: первый этап сокращается до описания того, что должно происходить, а роль опорного кадра играет само фото. Картиночная модель тогда нужна не для создания кадра с нуля, а для подготовки — кадрирования, чистки фона, приведения серии снимков к общему виду перед оживлением.

Осталось собрать на своём кадре

Повторите разобранное в кабинете: приложите фото или опишите сцену — и получите готовый ролик за пару минут, без монтажной программы.

Собрать видеоОплата в рублях, без VPN

Денис Коростелёв

Продуктовый аналитик

Сравнивает модели на одинаковых промтах и считает себестоимость результата. Не верит сравнениям без методики — включая собственные.