most-AI.com

Формула промпта для видео: 5 рабочих схем

Денис Коростелёв8 мин

Почему у видео другая логика промпта, чем у фото

Промпт для картинки описывает состояние: кто в кадре, в какой позе, какой свет, какая композиция. Модель рисует один момент — и если в описании что-то лишнее, результат просто получится не совсем таким, как задумано.

С видео сложнее. Модель должна сгенерировать последовательность кадров, в которой субъект, камера и окружение согласованно меняются во времени. Если промпт требует, чтобы камера облетала объект по кругу, объект вращался в другую сторону, а свет менялся с тёплого на холодный — модель физически не может увязать всё это за 4-10 секунд ролика. Получается рассинхрон: камера дёргается, объект деформируется, свет "плывёт".

Поэтому для видео работает другой принцип: не "чем подробнее, тем лучше", а "один промпт — одно связное движение". Ниже — рабочая формула из пяти частей и пять готовых примеров под разные задачи.

Универсальная формула: пять слагаемых

Формула строится линейно — от объекта к деталям исполнения:

Субъектдвижение камерыдвижение в кадресветзапреты

Часть формулы Что описывает Типичная ошибка
Субъект Кто/что в кадре, внешность, материал, окружение Слишком много деталей, которые не относятся к движению
Движение камеры Как перемещается точка съёмки: наезд, отъезд, панорама, облёт Два и более движения камеры в одном промпте
Движение в кадре Что двигается внутри кадра: волосы, ткань, жидкость, объект Движение конфликтует с направлением камеры
Свет Источник, температура, направление, характер (мягкий/жёсткий) Смена света посреди ролика без причины
Запреты Что нужно исключить: текст, лишние руки, тряска, искажения Запреты забыты вовсе — модель добавляет артефакты сама

Разберём каждую часть.

Субъект — статичное описание: кто или что в кадре, из какого материала, в какой обстановке. Это тот же слой, что и в фото-промптах: чем конкретнее (материал, цвет, фактура), тем меньше модель додумывает сама.

Движение камеры — единственный параметр, который отвечает за то, как зритель "смотрит" на сцену: медленный наезд (dolly in), отъезд (dolly out), панорама (pan), облёт по дуге (orbit), статичный кадр с лёгким покачиванием (handheld). Здесь правило простое: один ролик — одно движение камеры. Даже "наезд с одновременным облётом" — это уже перегрузка.

Движение в кадре — то, что происходит с самим субъектом или окружением независимо от камеры: ветер треплет волосы, дым поднимается, жидкость льётся, товар медленно вращается на подставке. Это тоже должно быть одно ведущее движение, максимум с одним второстепенным (например, "лёгкое покачивание листьев на фоне" — это фон, не конкурирующее действие).

Свет — источник (естественный, студийный, неоновый), направление (боковой, контровой, верхний) и характер (мягкий рассеянный или жёсткий контрастный). Для видео важно, чтобы свет был неизменным на протяжении всего ролика или менялся предсказуемо (например, "мягкое утреннее солнце, тени медленно удлиняются") — без резких перепадов.

Запреты — короткий список того, чего быть не должно: без текста на экране, без лишних пальцев и конечностей, без тряски камеры, без искажения логотипа, без резких склеек. Этот блок часто пропускают, а зря — именно он убирает большую часть типичных артефактов генеративного видео.

Какую модель выбрать под сценарий

Под формулу подходит любая видео-модель каталога Most AI, но у задач есть свои сильные стороны. Для плавного облёта товара и портретов с естественной мимикой хорошо ведут себя Kling 3.0 и Veo 3.1 Fast — вторая доступна и в бесплатном дневном лимите (Relax — 2 видео в день). Для сцен с чётко заданной траекторией камеры пригодится Kling Motion Control — она рассчитана именно на управляемое движение, а не на "додумывание" сцены. Sora 2 и Seedance 2 дают более кинематографичную атмосферу для пейзажных роликов. Grok Video тоже входит в бесплатную дневную квоту — 2 видео в день, удобно для быстрых тестов формулы. Все модели — в разделе видеогенерации, актуальные цены — на странице тарифов.

Пять готовых промптов

Ниже — примеры под разные сценарии. Каждый построен строго по формуле: один субъект, одно движение камеры, одно движение в кадре, один источник света, короткий список запретов.

1. Продуктовый ролик

Субъект: стеклянный флакон сыворотки с золотой крышкой на белом
мраморном подиуме, капли конденсата на стекле.
Камера: медленный наезд (dolly in) с уровня стола к флакону, без поворота.
Движение в кадре: флакон медленно вращается вокруг своей оси на подиуме.
Свет: мягкий верхний студийный свет, лёгкий блик на стекле.
Запреты: без текста на этикетке, без посторонних предметов в кадре,
без резкой тряски камеры.

Здесь единственное движение камеры — наезд, единственное движение в кадре — вращение флакона. Такое сочетание модель считывает однозначно.

2. Портретное видео

Субъект: женщина 30 лет в бежевом свитере, сидит у окна, смотрит
в кадр со спокойной полуулыбкой.
Камера: статичный кадр с едва заметным покачиванием (subtle handheld).
Движение в кадре: лёгкий ветер шевелит прядь волос, моргание, дыхание.
Свет: естественный дневной свет из окна сбоку, мягкие тени.
Запреты: без резких движений головой, без искажения черт лица,
без посторонних звуков в кадре.

Для портретов особенно важно не перегружать движение в кадре: моргание и дыхание — это уже достаточно, чтобы видео выглядело живым. Больше об этом — в статье про промпты для портретов.

3. Пейзаж и атмосфера

Субъект: сосновый лес на рассвете, туман стелется между деревьями,
солнечные лучи пробиваются сквозь кроны.
Камера: медленная панорама слева направо на уровне глаз.
Движение в кадре: туман плавно перемещается, листья слегка колышутся
от ветра.
Свет: тёплый рассветный свет, направленный сквозь деревья, контровой.
Запреты: без резких смен освещения, без появления людей или техники
в кадре, без ускорения движения тумана.

Атмосферные ролики прощают чуть больше — движение тумана и листвы читается как единое "дыхание" сцены, а не как два конфликтующих действия.

4. Анимация текста и логотипа без слов на экране

Видео-модели плохо и непредсказуемо рендерят читаемый текст — буквы часто искажаются или "плывут". Поэтому для анимации логотипа стоит описывать форму и движение, а не сами буквы, оставляя добавление текста поверх готового ролика для монтажа.

Субъект: абстрактная светящаяся геометрическая эмблема из тонких
линий на тёмном фоне, минималистичная, без надписей.
Камера: медленный облёт по дуге вокруг эмблемы.
Движение в кадре: линии эмблемы плавно собираются из отдельных
частиц в единую форму.
Свет: неоновое свечение самой эмблемы, синие и фиолетовые оттенки,
без внешних источников.
Запреты: без текста и букв на экране, без резких вспышек,
без смены цвета эмблемы посреди ролика.

Такой ролик получается чистым и предсказуемым, а название бренда или слоган добавляются уже отдельно — при монтаже или наложением из инструментов для видео.

5. Оживление статичного фото

Если исходный материал — уже готовое фото (товара, портрета, пейзажа), проще не писать промпт с нуля, а оживить сам кадр: приложение «Оживление фото» добавляет естественное движение без текстового описания. Для более точного контроля траектории — например, когда нужно, чтобы камера двигалась строго заданным образом вокруг объекта на фото, — подойдёт Kling Motion Control, которая берёт статичное изображение и требует такую же короткую формулу: одно движение камеры, одно движение в кадре, свет без изменений.

Субъект: фото загружено как референс (портрет человека у окна).
Камера: лёгкий наезд, без поворота и без смены угла.
Движение в кадре: моргание, лёгкое движение плеч при дыхании.
Свет: остаётся как на исходном фото, без изменений.
Запреты: без искажения лица, без появления посторонних объектов,
без ускорения кадра.

Подробнее о том, как превратить фото в видео пошагово, — в статье «Как сделать видео из фото».

Частая ошибка: слишком много движений в одном промпте

Самая частая причина испорченного видео — не плохое описание субъекта, а перегрузка движением. Типичный неудачный промпт выглядит так: "камера облетает модель по кругу, одновременно приближаясь, модель поворачивает голову и идёт навстречу, волосы развеваются на ветру, на фоне мигают огни, свет меняется с холодного на тёплый". На бумаге это звучит как эффектный кадр. На практике модели нужно согласовать пять независимых движений за несколько секунд ролика — и она этого не может: камера дёргается на стыках кадров, лицо "плывёт", а свет либо не меняется вовсе, либо меняется рывками.

Механика простая: генеративное видео строится кадр за кадром с ограниченным "окном" согласованности. Каждое дополнительное движение — это ещё одна переменная, за которой модели нужно уследить одновременно с остальными. Два движения (одно камеры, одно в кадре) модель обычно удерживает стабильно. Три и больше — начинаются рассинхрон и артефакты, особенно на лицах и руках.

Что делать вместо нагромождения:

  • Оставить одно ведущее движение камеры — наезд, отъезд, панораму или облёт, но не комбинацию.
  • Оставить одно ведущее движение в кадре — то, что действительно важно показать (вращение товара, дыхание человека, движение тумана).
  • Второстепенные детали (лёгкое покачивание фона, блики, дым) описывать как фоновый эффект, а не как отдельное действие с направлением и скоростью.
  • Если сцена требует нескольких этапов движения (например, персонаж сначала стоит, потом идёт) — лучше сделать два отдельных ролика и склеить их при монтаже, чем пытаться уместить оба этапа в один промпт.
  • Использовать блок запретов, чтобы явно исключить артефакты, которые чаще всего возникают при перегруженных промптах: тряску камеры, искажение конечностей, резкую смену света.

Формула "субъект + одна камера + одно движение + свет + запреты" — это не ограничение, а способ дать модели ровно столько задачи, сколько она может выполнить за один проход, не разваливая сцену.

Частые вопросы

Сколько движений можно указывать в одном промпте?

Оптимально — одно движение камеры и одно движение в кадре. Модель уверенно держит именно такую комбинацию. Три и больше движений почти всегда приводят к рассинхрону: камера дёргается, объекты деформируются, свет "плывёт" между кадрами.

Нужно ли расписывать сценарий по кадрам, как в раскадровке?

Нет, для роликов в 4-10 секунд это избыточно. Достаточно описать начальное состояние (субъект, свет) и одно связное действие на протяжении всего клипа. Если сцена требует смены этапов — лучше сгенерировать два коротких ролика и склеить их при монтаже.

Как добавить текст или название на видео, если модель плохо его рисует?

Не описывать буквы в промпте видео-модели, а генерировать чистый ролик (абстрактную форму, движение, свет) и накладывать текст уже при монтаже. Так текст остаётся читаемым и не искажается генерацией.

Какая модель лучше подходит для портретного видео с лицом крупным планом?

Для естественной мимики и стабильного лица хорошо работают Kling 3.0 и Veo 3.1 Fast. Если нужно оживить уже готовое фото человека с точным контролем движения — подойдёт Kling Motion Control.

Можно ли протестировать формулу бесплатно перед платной генерацией?

Да, в бесплатную дневную квоту входят Veo 3.1 Fast Relax (2 видео в день) и Grok Video (2 видео в день) — этого достаточно, чтобы проверить, как модель считывает вашу формулу, прежде чем тратить платные генерации.

Чем промпт для видео принципиально отличается от промпта для фото?

Промпт для фото описывает один статичный момент, поэтому в нём можно перечислять много деталей одновременно. Промпт для видео описывает изменение во времени, и каждое дополнительное движение — это дополнительная переменная, которую модели нужно согласовать с остальными. Отсюда правило: для видео меньше движений в промпте — стабильнее результат.

Денис Коростелёв

Продуктовый аналитик

Сравнивает модели на одинаковых промптах и считает себестоимость результата. Не верит сравнениям без методики — включая собственные.