Рекламный ролик целиком нейросетью: от идеи до файла за вечер
Катя Долгих9 мин

Да, короткий рекламный ролик на 15–30 секунд для таргета или VK Клипов реально собрать нейросетями за один вечер и без подрядчика. Но не одной кнопкой: это цепочка из шести шагов — оффер и сценарий, ключевые кадры, сцены, музыка, голос, сборка с апскейлом. Каждый шаг делает своя модель, и все они лежат в одном кабинете Most AI. Ниже — как пройти цепочку по порядку, где она чаще всего рвётся и сколько попыток закладывать, чтобы вечер не превратился в неделю.
Что реально получится за вечер
Сразу договоримся о формате. За вечер получается вертикальный или квадратный ролик из четырёх–шести сцен по 3–6 секунд, с музыкой, закадровым голосом или репликой в кадре и финальной плашкой с оффером. Это ровно то, что нужно для рекламы в ленте и клипах: зритель всё равно не досматривает дольше.
Чего за вечер не получится: длинного сюжета с одним и тем же актёром в десяти локациях, точного воспроизведения вашей упаковки с мелким текстом на этикетке, сложной хореографии. Эти задачи решаемы, но требуют куда больше попыток и терпения. Для первого ролика берите простую историю: проблема — продукт — результат — призыв.
Если вы хотите сначала прикинуть деньги на месяц роликов, у нас есть отдельный разбор бюджета видео для соцсетей бренда. Здесь же — производство одного ролика от начала до конца.
Шаг 1. Оффер и сценарий в ChatGPT
Самая частая ошибка — начинать с видео. Сначала текст. ChatGPT в Most AI бесплатный и без лимита по количеству запросов, так что на этом шаге можно не экономить и гонять варианты сколько нужно.
Попросите три вещи по очереди: сформулировать оффер одной фразой, разложить ролик на сцены с хронометражем и сочинить закадровый текст под эти сцены. Главное — задать жёсткие рамки по длине. Я всегда прошу всё сразу одним сообщением, а потом правлю по кусочку: «сцена 3 скучная, дай три варианта», «оффер короче». Так раскадровка не разъезжается с текстом.
Ты — сценарист коротких рекламных роликов. Продукт: доставка готовых завтраков
в офис, город Казань, заказ до 9 утра — доставка к 10. Аудитория: офисные
сотрудники 25–40 лет. Площадка: VK Клипы, вертикаль 9:16, 20 секунд.
Сделай:
1. Оффер одной фразой до 8 слов.
2. Раскадровку из 5 сцен: номер, длительность в секундах, что в кадре,
движение камеры. Сумма длительностей — ровно 20 секунд.
3. Закадровый текст: не больше 45 слов, по строке на сцену.
4. Текст финальной плашки: до 6 слов.
Без людей крупным планом, без узнаваемых брендов в кадре.
Это условный сценарий: подставьте свой продукт и город. Отдельно поработайте над первой сценой — именно она решает, пролистнут ролик или нет. Как придумать сильный заход, мы подробно разбирали в статье про первые три секунды рекламного ролика.
Хронометраж закадрового текста проверяйте вслух с таймером. Нейросеть часто пишет чуть больше, чем помещается в отведённые секунды, и это вылезет позже, когда голос не влезет в сцену.
Шаг 2. Ключевые кадры в GPT Image 2 или Nano Banana Pro
Не просите видеомодель придумать картинку с нуля. Сначала сделайте по одному опорному кадру на каждую сцену картиночной моделью, а уже потом оживляйте. Так вы заранее видите композицию, свет и цвет, а видеомодель отвечает только за движение.
GPT Image 2 удобна для аккуратных предметных сцен и кадров, где нужна короткая надпись. Nano Banana Pro выручает, когда нужно держать один и тот же объект или персонажа в нескольких кадрах: загрузите первый удачный кадр как референс и просите следующие «в том же стиле, тот же стол, та же коробка».
Вертикальный кадр 9:16. Офисный стол у окна, утренний мягкий свет слева.
На столе крафтовая коробка с завтраком: омлет, круассан, стакан кофе.
Коробка открыта, от кофе поднимается пар. Фон размыт, в фоне монитор
и зелёное растение. Тёплая палитра, реалистичная фотография, без текста.
Практическое правило: делайте все ключевые кадры в одной сессии, с одинаковым описанием света и палитры. Если кадры сняты «в разную погоду», ролик будет выглядеть как нарезка из разных рекламных кампаний.
Свой товар лучше снять на телефон и загрузить как референс, чем описывать словами. Упаковку с мелким текстом нейросеть перерисует по-своему — это нормально, логотип и надписи потом поставите на плашку при монтаже.
Шаг 3. Сцены: Kling 3.0, Veo 3.1 Fast или Seedance 2.5
Теперь оживляем кадры в режиме «видео из изображения». Какую модель брать, зависит от того, что происходит в сцене.
| Задача сцены | Что брать | Почему |
|---|---|---|
| Продукт, движение камеры, пар, свет | Kling 3.0 | Хороша для спокойных предметных планов, генерирует со звуком |
| Персонаж говорит фразу на русском | Veo 3.1 Fast | Русская озвучка в кадре, разрешение до 4K |
| Живая сцена с несколькими действиями | Seedance 2.5 | Понимает русский промт, генерирует со звуком |
В промте для видео описывайте только движение и камеру — всё остальное уже есть в кадре.
Камера медленно наезжает на коробку с завтраком. Пар от кофе плавно
поднимается вверх. Свет из окна чуть усиливается. Никаких новых
объектов, стол и коробка остаются неподвижными. 5 секунд.
Для сцены с репликой в Veo 3.1 Fast пишите фразу прямо в промт в кавычках-ёлочках и указывайте, кто её произносит. Короткая реплика в несколько слов обычно выходит чище длинной: в сцену на пять секунд длинная фраза просто не помещается. Если в кадре человек — это сгенерированный персонаж: не пытайтесь добиться сходства с реальной знаменитостью, а чужое лицо используйте только с согласия его владельца.
Когда какая-то сцена не выходит третий раз подряд, не упирайтесь в одну модель. Перегенерируйте ключевой кадр попроще или отдайте сцену другой модели — это быстрее, чем десятая попытка с тем же промтом.
Шаг 4. Музыка в Suno
Музыку генерируйте после того, как сцены готовы и вы знаете точную длительность ролика. Suno делает трек по описанию жанра, темпа и настроения. Для рекламы чаще всего нужна инструменталка без вокала, иначе она будет спорить с голосом.
Инструментальный трек без вокала, 110 BPM, лёгкий фанк с электропиано
и мягким басом. Бодрое утреннее настроение, яркое начало,
чистая концовка без затухания.
Точную секунду акцента модель не выставит, поэтому генерируйте с запасом по длине: обрезать проще, чем растягивать. Пик трека совместите при монтаже со сменой сцены, где появляется продукт. Подробнее про промты для фоновой музыки — в разборе музыки для видео без слов.
Шаг 5. Голос в ElevenLabs V3
Закадровый текст из первого шага озвучивайте в ElevenLabs V3 — в варианте «Диктор». Для рекламы обычно работает бодрый, но не кричащий голос. Отдельно озвучьте каждую строку сценария — так проще подогнать реплики под сцены при сборке и переозвучить одну фразу, не трогая остальные.
Знаки препинания здесь работают как режиссёрские пометки: запятая — короткая пауза, точка — длинная, многоточие — тянущаяся интонация. Если модель ставит ударение не туда, перепишите слово иначе или замените синонимом. Клонирования голоса в каталоге нет, выбирайте из готовых голосов.
Шаг 6. Сборка и апскейл
Сцены, музыку и голос складываете в любом монтажном редакторе, включая мобильный. Порядок простой: сначала видеоряд по раскадровке, потом голос, потом музыка на пониженной громкости под голосом, в конце — плашка с оффером, логотипом и ценой, если она нужна.
Если какие-то сцены вышли в невысоком разрешении, прогоните их через инструмент «Увеличить размер видео» — он поднимает качество до 4K и сохраняет длительность. Делайте апскейл уже для финальных версий сцен, а не для всех черновиков подряд.
Где цепочка чаще всего ломается
Сценарий длиннее ролика. Текст на 60 слов не помещается в 20 секунд. Проверка вслух с таймером на первом шаге экономит час на пятом.
Кадры в разном стиле. Одна сцена тёплая, другая холодная, третья мультяшная. Лечится общим описанием света и палитры и референсом первого удачного кадра.
Модель добавляет лишнее. Появляются руки, люди, второй стакан кофе. Лечится фразой «никаких новых объектов» и более простым исходным кадром.
Продукт деформируется в движении. Коробка «плывёт», надписи меняются. Уменьшайте амплитуду движения: медленный наезд камеры вместо вращения предмета.
Голос не попадает в сцену. Правится не растягиванием видео, а переозвучкой строки короче.
Про типовые сбои и способы их чинить подробнее — в разборе частых сбоев видеогенерации, здесь же важен вывод: большинство проблем решаются на шаг раньше, чем проявились.
Сколько попыток закладывать
Точных цифр для всех случаев нет: всё зависит от сложности сцены. Рабочий ориентир для планирования такой. Сценарий — несколько заходов в чате, это бесплатно и быстро. Ключевые кадры — две-три попытки на кадр. Сцены — три-четыре попытки на каждую, для сцены с человеком и репликой закладывайте больше. Музыка — две-три генерации, чтобы было из чего выбрать. Голос — одна-две попытки на строку.
Платите вы за каждую генерацию, а не подпиской, поэтому черновики сцен имеет смысл гонять на более бюджетных моделях и только финальную версию делать флагманской. Актуальная стоимость каждой модели — на странице прайсинга.
Чек-лист перед запуском
- Первая секунда цепляет без звука: зритель в ленте часто смотрит с выключенным звуком.
- Оффер и призыв продублированы текстом на экране.
- Все сцены в одной палитре и одном свете.
- В кадре нет узнаваемых чужих брендов и лиц без согласия.
- Голос разборчив поверх музыки, громкость выровнена.
- Формат соответствует площадке: для клипов вертикаль 9:16.
- Длительность в рамках требований площадки, финальная плашка держится хотя бы две секунды.
- Ролик пересмотрен на телефоне, а не только на мониторе.
Частые вопросы
Можно ли сделать весь ролик одной генерацией?
Нет, для рекламы так не работает. Одна генерация — это один короткий план, а ролику нужны смена сцен, оффер и призыв. Собирайте ролик из четырёх–шести сцен и склеивайте их при монтаже.
Какую видеомодель выбрать, если персонаж должен говорить по-русски?
Для реплик на русском в кадре берите Veo 3.1 Fast — она умеет русскую озвучку. Seedance 2.5 тоже понимает русский промт и генерирует со звуком. Если речь нужна только закадровая, удобнее озвучить её отдельно в ElevenLabs V3.
Нужна ли подписка, чтобы собрать ролик?
Подписки в Most AI нет, вы платите за каждую генерацию. Сценарий в ChatGPT бесплатный и без лимита по количеству запросов. Стоимость видео, картинок, музыки и голоса смотрите на странице прайсинга.
Как войти в кабинет?
Вход в кабинет Most AI — через Яндекс или VK. VPN не нужен, оплата в рублях. После входа все модели из этой статьи доступны в одном месте.
Можно ли использовать в ролике своё лицо или голос сотрудника?
Своё фото можно загрузить как референс для ключевого кадра. Фото и голос другого человека используйте только с его согласия. Клонирования голоса в каталоге нет, поэтому для озвучки выбирайте готовые голоса ElevenLabs V3.
Как сделать так, чтобы ролик не выглядел как нейросетевой?
Держите единый свет и палитру во всех кадрах, не перегружайте сцены движением и выбирайте простые планы. Нейросеть сильнее всего выдают деформации предметов и рук, поэтому их лучше вообще не показывать крупно. И обязательно пересматривайте финал на телефоне.
Рекламный ролик нейросетью — это не магия одной кнопки, а обычное производство, только очень быстрое: текст, кадры, движение, звук, сборка. Пройдите цепочку по порядку, закладывайте попытки заранее, и первый ролик действительно поместится в один вечер.
Осталось собрать на своём кадре
Повторите разобранное в кабинете: приложите фото или опишите сцену — и получите готовый ролик без монтажной программы.



