most-AI.com
Войти

Рекламный ролик целиком нейросетью: от идеи до файла за вечер

Катя Долгих9 мин

Да, короткий рекламный ролик на 15–30 секунд для таргета или VK Клипов реально собрать нейросетями за один вечер и без подрядчика. Но не одной кнопкой: это цепочка из шести шагов — оффер и сценарий, ключевые кадры, сцены, музыка, голос, сборка с апскейлом. Каждый шаг делает своя модель, и все они лежат в одном кабинете Most AI. Ниже — как пройти цепочку по порядку, где она чаще всего рвётся и сколько попыток закладывать, чтобы вечер не превратился в неделю.

Что реально получится за вечер

Сразу договоримся о формате. За вечер получается вертикальный или квадратный ролик из четырёх–шести сцен по 3–6 секунд, с музыкой, закадровым голосом или репликой в кадре и финальной плашкой с оффером. Это ровно то, что нужно для рекламы в ленте и клипах: зритель всё равно не досматривает дольше.

Чего за вечер не получится: длинного сюжета с одним и тем же актёром в десяти локациях, точного воспроизведения вашей упаковки с мелким текстом на этикетке, сложной хореографии. Эти задачи решаемы, но требуют куда больше попыток и терпения. Для первого ролика берите простую историю: проблема — продукт — результат — призыв.

Если вы хотите сначала прикинуть деньги на месяц роликов, у нас есть отдельный разбор бюджета видео для соцсетей бренда. Здесь же — производство одного ролика от начала до конца.

Шаг 1. Оффер и сценарий в ChatGPT

Самая частая ошибка — начинать с видео. Сначала текст. ChatGPT в Most AI бесплатный и без лимита по количеству запросов, так что на этом шаге можно не экономить и гонять варианты сколько нужно.

Попросите три вещи по очереди: сформулировать оффер одной фразой, разложить ролик на сцены с хронометражем и сочинить закадровый текст под эти сцены. Главное — задать жёсткие рамки по длине. Я всегда прошу всё сразу одним сообщением, а потом правлю по кусочку: «сцена 3 скучная, дай три варианта», «оффер короче». Так раскадровка не разъезжается с текстом.

Ты — сценарист коротких рекламных роликов. Продукт: доставка готовых завтраков
в офис, город Казань, заказ до 9 утра — доставка к 10. Аудитория: офисные
сотрудники 25–40 лет. Площадка: VK Клипы, вертикаль 9:16, 20 секунд.
Сделай:
1. Оффер одной фразой до 8 слов.
2. Раскадровку из 5 сцен: номер, длительность в секундах, что в кадре,
   движение камеры. Сумма длительностей — ровно 20 секунд.
3. Закадровый текст: не больше 45 слов, по строке на сцену.
4. Текст финальной плашки: до 6 слов.
Без людей крупным планом, без узнаваемых брендов в кадре.

Это условный сценарий: подставьте свой продукт и город. Отдельно поработайте над первой сценой — именно она решает, пролистнут ролик или нет. Как придумать сильный заход, мы подробно разбирали в статье про первые три секунды рекламного ролика.

Хронометраж закадрового текста проверяйте вслух с таймером. Нейросеть часто пишет чуть больше, чем помещается в отведённые секунды, и это вылезет позже, когда голос не влезет в сцену.

Шаг 2. Ключевые кадры в GPT Image 2 или Nano Banana Pro

Не просите видеомодель придумать картинку с нуля. Сначала сделайте по одному опорному кадру на каждую сцену картиночной моделью, а уже потом оживляйте. Так вы заранее видите композицию, свет и цвет, а видеомодель отвечает только за движение.

GPT Image 2 удобна для аккуратных предметных сцен и кадров, где нужна короткая надпись. Nano Banana Pro выручает, когда нужно держать один и тот же объект или персонажа в нескольких кадрах: загрузите первый удачный кадр как референс и просите следующие «в том же стиле, тот же стол, та же коробка».

Вертикальный кадр 9:16. Офисный стол у окна, утренний мягкий свет слева.
На столе крафтовая коробка с завтраком: омлет, круассан, стакан кофе.
Коробка открыта, от кофе поднимается пар. Фон размыт, в фоне монитор
и зелёное растение. Тёплая палитра, реалистичная фотография, без текста.

Практическое правило: делайте все ключевые кадры в одной сессии, с одинаковым описанием света и палитры. Если кадры сняты «в разную погоду», ролик будет выглядеть как нарезка из разных рекламных кампаний.

Свой товар лучше снять на телефон и загрузить как референс, чем описывать словами. Упаковку с мелким текстом нейросеть перерисует по-своему — это нормально, логотип и надписи потом поставите на плашку при монтаже.

Шаг 3. Сцены: Kling 3.0, Veo 3.1 Fast или Seedance 2.5

Теперь оживляем кадры в режиме «видео из изображения». Какую модель брать, зависит от того, что происходит в сцене.

Задача сцены Что брать Почему
Продукт, движение камеры, пар, свет Kling 3.0 Хороша для спокойных предметных планов, генерирует со звуком
Персонаж говорит фразу на русском Veo 3.1 Fast Русская озвучка в кадре, разрешение до 4K
Живая сцена с несколькими действиями Seedance 2.5 Понимает русский промт, генерирует со звуком

В промте для видео описывайте только движение и камеру — всё остальное уже есть в кадре.

Камера медленно наезжает на коробку с завтраком. Пар от кофе плавно
поднимается вверх. Свет из окна чуть усиливается. Никаких новых
объектов, стол и коробка остаются неподвижными. 5 секунд.

Для сцены с репликой в Veo 3.1 Fast пишите фразу прямо в промт в кавычках-ёлочках и указывайте, кто её произносит. Короткая реплика в несколько слов обычно выходит чище длинной: в сцену на пять секунд длинная фраза просто не помещается. Если в кадре человек — это сгенерированный персонаж: не пытайтесь добиться сходства с реальной знаменитостью, а чужое лицо используйте только с согласия его владельца.

Когда какая-то сцена не выходит третий раз подряд, не упирайтесь в одну модель. Перегенерируйте ключевой кадр попроще или отдайте сцену другой модели — это быстрее, чем десятая попытка с тем же промтом.

Шаг 4. Музыка в Suno

Музыку генерируйте после того, как сцены готовы и вы знаете точную длительность ролика. Suno делает трек по описанию жанра, темпа и настроения. Для рекламы чаще всего нужна инструменталка без вокала, иначе она будет спорить с голосом.

Инструментальный трек без вокала, 110 BPM, лёгкий фанк с электропиано
и мягким басом. Бодрое утреннее настроение, яркое начало,
чистая концовка без затухания.

Точную секунду акцента модель не выставит, поэтому генерируйте с запасом по длине: обрезать проще, чем растягивать. Пик трека совместите при монтаже со сменой сцены, где появляется продукт. Подробнее про промты для фоновой музыки — в разборе музыки для видео без слов.

Шаг 5. Голос в ElevenLabs V3

Закадровый текст из первого шага озвучивайте в ElevenLabs V3 — в варианте «Диктор». Для рекламы обычно работает бодрый, но не кричащий голос. Отдельно озвучьте каждую строку сценария — так проще подогнать реплики под сцены при сборке и переозвучить одну фразу, не трогая остальные.

Знаки препинания здесь работают как режиссёрские пометки: запятая — короткая пауза, точка — длинная, многоточие — тянущаяся интонация. Если модель ставит ударение не туда, перепишите слово иначе или замените синонимом. Клонирования голоса в каталоге нет, выбирайте из готовых голосов.

Шаг 6. Сборка и апскейл

Сцены, музыку и голос складываете в любом монтажном редакторе, включая мобильный. Порядок простой: сначала видеоряд по раскадровке, потом голос, потом музыка на пониженной громкости под голосом, в конце — плашка с оффером, логотипом и ценой, если она нужна.

Если какие-то сцены вышли в невысоком разрешении, прогоните их через инструмент «Увеличить размер видео» — он поднимает качество до 4K и сохраняет длительность. Делайте апскейл уже для финальных версий сцен, а не для всех черновиков подряд.

Где цепочка чаще всего ломается

Сценарий длиннее ролика. Текст на 60 слов не помещается в 20 секунд. Проверка вслух с таймером на первом шаге экономит час на пятом.

Кадры в разном стиле. Одна сцена тёплая, другая холодная, третья мультяшная. Лечится общим описанием света и палитры и референсом первого удачного кадра.

Модель добавляет лишнее. Появляются руки, люди, второй стакан кофе. Лечится фразой «никаких новых объектов» и более простым исходным кадром.

Продукт деформируется в движении. Коробка «плывёт», надписи меняются. Уменьшайте амплитуду движения: медленный наезд камеры вместо вращения предмета.

Голос не попадает в сцену. Правится не растягиванием видео, а переозвучкой строки короче.

Про типовые сбои и способы их чинить подробнее — в разборе частых сбоев видеогенерации, здесь же важен вывод: большинство проблем решаются на шаг раньше, чем проявились.

Сколько попыток закладывать

Точных цифр для всех случаев нет: всё зависит от сложности сцены. Рабочий ориентир для планирования такой. Сценарий — несколько заходов в чате, это бесплатно и быстро. Ключевые кадры — две-три попытки на кадр. Сцены — три-четыре попытки на каждую, для сцены с человеком и репликой закладывайте больше. Музыка — две-три генерации, чтобы было из чего выбрать. Голос — одна-две попытки на строку.

Платите вы за каждую генерацию, а не подпиской, поэтому черновики сцен имеет смысл гонять на более бюджетных моделях и только финальную версию делать флагманской. Актуальная стоимость каждой модели — на странице прайсинга.

Чек-лист перед запуском

  • Первая секунда цепляет без звука: зритель в ленте часто смотрит с выключенным звуком.
  • Оффер и призыв продублированы текстом на экране.
  • Все сцены в одной палитре и одном свете.
  • В кадре нет узнаваемых чужих брендов и лиц без согласия.
  • Голос разборчив поверх музыки, громкость выровнена.
  • Формат соответствует площадке: для клипов вертикаль 9:16.
  • Длительность в рамках требований площадки, финальная плашка держится хотя бы две секунды.
  • Ролик пересмотрен на телефоне, а не только на мониторе.

Частые вопросы

Можно ли сделать весь ролик одной генерацией?

Нет, для рекламы так не работает. Одна генерация — это один короткий план, а ролику нужны смена сцен, оффер и призыв. Собирайте ролик из четырёх–шести сцен и склеивайте их при монтаже.

Какую видеомодель выбрать, если персонаж должен говорить по-русски?

Для реплик на русском в кадре берите Veo 3.1 Fast — она умеет русскую озвучку. Seedance 2.5 тоже понимает русский промт и генерирует со звуком. Если речь нужна только закадровая, удобнее озвучить её отдельно в ElevenLabs V3.

Нужна ли подписка, чтобы собрать ролик?

Подписки в Most AI нет, вы платите за каждую генерацию. Сценарий в ChatGPT бесплатный и без лимита по количеству запросов. Стоимость видео, картинок, музыки и голоса смотрите на странице прайсинга.

Как войти в кабинет?

Вход в кабинет Most AI — через Яндекс или VK. VPN не нужен, оплата в рублях. После входа все модели из этой статьи доступны в одном месте.

Можно ли использовать в ролике своё лицо или голос сотрудника?

Своё фото можно загрузить как референс для ключевого кадра. Фото и голос другого человека используйте только с его согласия. Клонирования голоса в каталоге нет, поэтому для озвучки выбирайте готовые голоса ElevenLabs V3.

Как сделать так, чтобы ролик не выглядел как нейросетевой?

Держите единый свет и палитру во всех кадрах, не перегружайте сцены движением и выбирайте простые планы. Нейросеть сильнее всего выдают деформации предметов и рук, поэтому их лучше вообще не показывать крупно. И обязательно пересматривайте финал на телефоне.

Рекламный ролик нейросетью — это не магия одной кнопки, а обычное производство, только очень быстрое: текст, кадры, движение, звук, сборка. Пройдите цепочку по порядку, закладывайте попытки заранее, и первый ролик действительно поместится в один вечер.

Осталось собрать на своём кадре

Повторите разобранное в кабинете: приложите фото или опишите сцену — и получите готовый ролик без монтажной программы.

Собрать видеоОплата в рублях, без VPN

Катя Долгих

Маркетинг и контент

Разбирает, как нейросети встраиваются в рабочие процессы: контент, презентации, карточки товара. Считает не только время, но и что с этим делать дальше.