Промо-ролик мероприятия за вечер: сценарий, озвучка, субтитры
Катя Долгих9 мин

Ситуация знакомая: до мероприятия неделя, афиша есть, а видео нет. Нужен короткий анонс на 15–25 секунд, который можно положить в сторис, в Telegram-канал и в шапку сообщества. Бюджета на съёмку нет, времени тоже — есть один свободный вечер.
За вечер это собирается. Но не «одной кнопкой», а в определённом порядке, где каждый следующий шаг опирается на утверждённый предыдущий. Ниже — этот порядок, промты для каждого этапа и честный список того, что придётся упростить, потому что генеративное видео пока умеет не всё.
Почему порядок важнее выбора модели
Главная ошибка при работе в дедлайне — начать с видео. Человек открывает видеогенератор, пишет «промо-ролик концерта, красиво, динамично», получает восемь секунд чего-то абстрактного, не понимает, что с этим делать, и запускает ещё десять генераций подряд. Вечер уходит, ролика нет.
Причина в том, что видеомодель — самый дорогой и самый медленный шаг в цепочке. Одна генерация занимает минуты, а не секунды, и стоит заметно больше, чем текст или картинка (сравнить порядок цен между собой можно на странице прайсинга). Значит, к моменту запуска видео у вас уже должно быть решено всё, что можно решить дешевле: что именно происходит в кадре, сколько кадров, в каком порядке, какой текст звучит поверх.
Отсюда рабочая последовательность: сценарий → опорные кадры → оживление → голос → субтитры. Каждый этап заканчивается результатом, который вы утверждаете, прежде чем идти дальше. Если кадр не нравится в виде картинки — он не понравится и в виде видео, только выяснится это дороже.
Шаг 1. Сценарий текстовой моделью
Первое, что нужно, — не «текст ролика», а раскладка по сценам. Просите модель сразу в той форме, в которой будете работать дальше: сцена, что в кадре, что звучит.
Здесь подойдёт любая текстовая модель из каталога — ChatGPT в бесплатном безлимитном чате, GPT-5.5, Claude Sonnet 4.6, Gemini 3.1 Pro Preview. На такой задаче разница между ними невелика, важнее качество вводных.
Ты сценарист коротких промо-роликов. Сделай раскладку анонса
мероприятия на 20 секунд, 4 сцены по 5 секунд.
Мероприятие: [название, формат, дата, место].
Для кого: [аудитория].
Главное, что должен запомнить зритель: [одна мысль].
Формат ответа — таблица: номер сцены, что происходит в кадре
(без текста на экране), закадровая реплика (не больше 12 слов),
надпись для субтитров.
Требования: первая сцена без объяснений, сразу образ.
Последняя сцена — дата и призыв. Без восклицательных знаков.
Ограничение по словам в реплике — не придирка. Диктор проговаривает примерно 2–2,5 слова в секунду в спокойном темпе; двенадцать слов на пятисекундную сцену — это уже плотно. Если модель выдала абзац на сцену, попросите сократить, а не пытайтесь потом ускорить озвучку.
Из четырёх сцен обычно две оказываются рабочими, одна спорной и одна пустой. Попросите три варианта раскладки и соберите свою из лучших сцен — это дешевле, чем править одну неудачную по кругу.
Шаг 2. Опорные кадры картиночной моделью
Дальше каждая сцена превращается в статичную картинку. Это ключевой приём всего вечера: картинка генерируется быстро, стоит дешевле видео, и её можно перегенерировать десять раз, пока композиция не станет той самой.
Для опорных кадров подойдут GPT Image 2, Nano Banana Pro, Seedream 5.0 Lite, Flux 2 Pro, Midjourney v7. Если хочется уложиться в бесплатную дневную квоту — Nano Banana даёт четыре изображения в день, этого хватит на первый черновой прогон.
Горизонтальный кадр 16:9 для промо-ролика.
Сцена: полутёмный зал, ряды пустых кресел, на сцену падает
один тёплый луч света, в воздухе видна пыль.
Стиль: кинематографичный, приглушённые цвета, мягкий контраст.
Камера: широкий план от последнего ряда.
Без людей в кадре, без текста и надписей, без логотипов.
Два правила для этого шага. Первое: «без текста в кадре» пишите всегда — надписи мы добавим сами, и генерации они только мешают. Второе: держите единый визуальный язык. Проще всего повторять в каждом промте одну и ту же строку про стиль, свет и палитру — тогда четыре кадра будут выглядеть как один ролик, а не как четыре разные работы. Подробнее про формулу описания сцены — в разборе промтов для видео.
Когда четыре кадра готовы, разложите их подряд и посмотрите как на раскадровку. На этом этапе ещё не поздно выкинуть слабую сцену — вы потратили на неё минуты, а не генерацию видео.
Шаг 3. Оживление видеомоделью
Теперь утверждённые кадры превращаются в движение. В каталоге для этого есть Kling 3.0 и Kling 2.5 Pro, Veo 3.1 Fast, Sora 2, Seedance 2.5, Wan 2.6, Hailuo 2.3 Fast и готовое приложение «Оживление фото» — оно как раз рассчитано на сценарий «есть картинка, нужно движение». В бесплатной дневной квоте доступны Veo 3.1 Fast (Relax) и Grok Video — по два видео в день, так что черновой прогон можно сделать бесплатно, а чистовой уже платно.
Промт к оживлению пишется коротко и про одно движение, а не про всю сцену заново.
Оживи кадр. Камера медленно наезжает вперёд.
Луч света слегка колеблется, пылинки плавно движутся в воздухе.
Без смены плана, без резких движений камеры,
без появления людей и предметов в кадре.
Три вещи, которые экономят вечер. Первое: одно движение на кадр. Модель, которой велели одновременно наезжать, поворачивать и менять план, обычно ломает картинку. Второе: медленное движение выглядит дороже быстрого — наезд и лёгкий дрейф камеры почти всегда безопаснее, чем облёт. Третье: закладывайте две-три попытки на сцену. Это нормальный рабочий коэффициент, а не признак того, что вы что-то делаете не так; выбор модели под свой тип картинки удобно свериться по сравнению видеомоделей.
Шаг 4. Озвучка
Голос пишется по утверждённому тексту из первого шага — тому самому, где реплики уже уложены в тайминг. Для дикторской озвучки в каталоге есть ElevenLabs V3 в режимах «Диктор» и «Диалог» и Gemini 3.1 TTS («Диктор»). Фоновая музыка — Suno.
Практические мелочи, которые слышны сразу. Пишите числа и даты словами: «двадцать восьмого августа» вместо «28.08» — иначе модель прочитает дату так, как ей покажется правильным. Аббревиатуры и названия площадок проверяйте на слух отдельным коротким прогоном, прежде чем озвучивать весь текст. Паузы ставьте точками и абзацами, а не многоточиями. Если голос звучит слишком бодро — попросите более ровный, «информационный» тон: анонс мероприятия не должен звучать как реклама распродажи. Подробный разбор настроек — в материале про озвучку для роликов.
Музыку берите тише голоса и без выраженной мелодии в тех местах, где идёт речь. Двадцать секунд — слишком мало, чтобы трек успел раскрыться, его задача здесь чисто фоновая.
Шаг 5. Субтитры и текст на экране
Дальше — сборка в любой монтажной программе, включая бесплатные и мобильные. И тут главный совет вечера: субтитры, дату, время и название площадки не генерируйте. Наберите их текстом в монтажке.
Причина простая: генеративные модели по-прежнему ненадёжны с русским текстом внутри кадра. Буквы могут поплыть, цифры — измениться, а ошибка в дате мероприятия — это не стилистический дефект, а испорченный анонс. Набранный вручную титр всегда читается, всегда правильный и правится за секунду.
Что стоит вынести в титры: название мероприятия, дату и время, место, короткий призыв. Что стоит вынести в субтитры: всю закадровую речь — большинство зрителей смотрят сторис без звука, и без субтитров ролик для них немой.
Что придётся упростить
Честный список ограничений, который лучше принять заранее, чем обнаружить в одиннадцать вечера.
Люди в кадре. Крупные планы лиц, движения рук, много людей в одном кадре — самая ненадёжная часть генеративного видео. Пальцы, глаза и мимика ломаются чаще всего. Рабочий обход: планы со спины и силуэты, средние и общие планы вместо крупных, толпа в расфокусе, руки за пределами кадра. Если нужен конкретный человек — спикер, ведущий, музыкант, — это всё ещё территория съёмки или фотографии, а не генерации.
Текст на экране. См. предыдущий раздел: всё, что должно быть прочитано буквально, набирается в монтажке.
Узнаваемая площадка. Модель не знает, как выглядит ваш конкретный зал или парк. Она сделает похожее по настроению, но не то же самое. Либо честно берите обобщённый образ, либо оживляйте собственную фотографию площадки.
Сложная хореография. «Толпа аплодирует, потом камера отъезжает, потом выходит ведущий» — это три сцены, а не одна. Разбивайте на отдельные короткие генерации и склеивайте.
Общее правило: чем проще действие в одном кадре, тем выше шанс попасть с первой-второй попытки. За вечер выигрывает не тот, кто задумал сложнее, а тот, кто задумал так, чтобы это сгенерировалось.
Примерный план вечера
| Этап | Что делаете | Сколько занимает |
|---|---|---|
| Сценарий | Раскладка на 4 сцены, правки текста | 20–30 минут |
| Опорные кадры | 4 картинки с перегенерациями | 30–40 минут |
| Оживление | 4 сцены по 2–3 попытки | 40–60 минут |
| Голос и музыка | Озвучка текста, фоновый трек | 20–30 минут |
| Сборка | Монтаж, титры, субтитры, экспорт | 30–40 минут |
Итого — около трёх часов при первом заходе и заметно меньше со второго раза, когда промты для стиля уже подобраны и их можно переиспользовать для следующего мероприятия.
Частые вопросы
Сколько сцен оптимально для анонса на 20 секунд?
Три-четыре. Каждая сцена — это отдельная генерация видео, и чем их больше, тем дольше и дороже вечер. К тому же короткие склейки по две секунды выглядят суетливо, а ровные пять секунд на сцену дают зрителю время рассмотреть кадр.
Можно ли уложиться в бесплатную дневную квоту?
Полностью — вряд ли, а вот черновик вполне. Бесплатно доступны безлимитный чат ChatGPT для сценария, Nano Banana на четыре изображения в день, Veo 3.1 Fast (Relax) и Grok Video по два видео в день. Этого хватит, чтобы собрать пробную версию и понять, работает ли идея, а чистовые генерации сделать уже платно.
Что делать, если видеомодель искажает картинку при оживлении?
Чаще всего дело в слишком сложном запросе на движение. Уберите всё лишнее, оставьте одно медленное движение — наезд, отъезд или лёгкий дрейф камеры — и явно запретите смену плана и появление новых объектов. Если не помогает, попробуйте другую модель: на разных типах картинок они ведут себя по-разному.
Обязательно ли делать опорные кадры, если можно генерировать видео сразу по тексту?
Не обязательно, но с кадрами вечер проходит спокойнее. Картинка перегенерируется быстрее и дешевле видео, поэтому композицию, свет и стиль выгоднее утвердить на статике. Генерация видео сразу по тексту хорошо работает, когда вам не принципиально, что именно окажется в кадре.
Как сделать так, чтобы все сцены выглядели единообразно?
Повторяйте в каждом промте одинаковый блок про стиль: палитру, тип света, характер камеры. Помогает и другой приём — сгенерировать первый кадр, добиться нужного вида, а остальные делать в той же модели, опираясь на него как на референс стиля.
Нужна ли музыка, если есть закадровый голос?
Не всегда. Двадцать секунд речи прекрасно живут и без подложки, а плохо подобранный трек только мешает разобрать слова. Если музыка всё же нужна, держите её заметно тише голоса и без резких акцентов в местах, где идёт речь.
Осталось собрать на своём кадре
Повторите разобранное в кабинете: приложите фото или опишите сцену — и получите готовый ролик за пару минут, без монтажной программы.



