most-AI.com
Войти

Промты для Veo 3.1: камера, реплики на русском и звук в кадре

Денис Коростелёв9 мин

Хороший промт для Veo 3.1 отличается от промта для «немой» видеомодели одним: в нём три дорожки, а не одна. Картинка, речь и звук описываются отдельными блоками, и у каждого свои правила. Реплика пишется в «ёлочках» с пометкой, кто говорит и каким голосом, звуковой фон — отдельной строкой, движение камеры — одним глаголом на план, а длина реплики подгоняется под длину ролика. Ниже — как это устроено, десять готовых промтов с разбором и когда брать Veo 3.1 Fast Relax вместо Fast.

Если вы только выбираете между режимами, сначала загляните в разбор Veo 3.1 Fast и Relax. Общая формула видеопромта есть в статье про пять рабочих схем. Здесь только то, что касается именно Veo.

Из чего состоит промт для Veo

Veo 3.1 генерирует видео сразу со звуком, поэтому пустой звуковой блок — это не «тишина», а решение, которое модель примет за вас. Иногда она подложит музыку, которая вам не нужна, иногда добавит закадровый голос. Чтобы этого не происходило, промт удобно собирать из пяти частей в фиксированном порядке:

  1. Кадр. Кто или что в кадре, где, какой свет и время суток.
  2. Действие. Что происходит за время плана, одно основное событие.
  3. Камера. Крупность, ракурс и одно движение.
  4. Речь. Кто говорит, как говорит и точный текст реплики.
  5. Звук. Фон, отдельные шумы, есть ли музыка.

Порядок важен не потому, что модель читает строго сверху вниз, а потому, что так проще проверять себя. Когда блоки разделены, видно, где вы забыли указать главное, а где противоречите сами себе: например, написали «тихий вечер», а в звуке попросили «шумную улицу».

Я держу под рукой заготовку и каждый раз просто заполняю пустые места:

[Место, время суток, свет]. [Кто в кадре: возраст, одежда, где стоит].
[Одно действие за план].
[Крупность], [одно движение камеры или «камера неподвижна»].
[Кто говорит] говорит [каким голосом]: «[точный текст реплики]».
Звук: [фон места], [шум от действия]. [Музыка или «без музыки»].

Если в плане никто не говорит, строка речи не удаляется, а заменяется на «Речи нет». Пустое место модель заполнит сама, а явный запрет оставляет ей меньше свободы.

Реплики на русском: как писать, чтобы звучало

Veo 3.1 в каталоге Most AI озвучивает русскую речь, и для роликов, где герой говорит в кадре, это его главный козырь. Но результат сильно зависит от того, как оформлена реплика.

Текст — только в кавычках и только дословно

Модель должна понять, какие слова произнести вслух, а какие просто описывают сцену. Поэтому реплику ставим в «ёлочки» и перед ней пишем, кто говорит: «Женщина за прилавком говорит спокойно и приветливо: …». Если написать без кавычек что-то вроде «она рассказывает про скидку», модель сочинит текст сама, и он почти наверняка будет не тем, что нужно.

Длина реплики привязана к длине плана

Ориентир такой: за восемь секунд живой человек спокойно произносит одну-две короткие фразы. Если вложить в восьмисекундный план абзац текста, модель либо ускорит речь до скороговорки, либо оборвёт её на полуслове. Практическое правило: одна мысль на план. Длинный текст лучше разбить на несколько планов и склеить на монтаже.

Числа, аббревиатуры и имена — прописью

Цифры и сокращения модель может прочитать по-разному. «15%» лучше написать как «пятнадцать процентов», «ТЦ» — как «торговый центр», а редкую фамилию снабдить ударением через заглавную букву или заменить на более простую. Это не гарантия, но заметно снижает шанс странного прочтения.

Один говорящий на план

Когда в кадре двое и оба говорят, модель может перепутать, чьи губы двигаются под какую реплику. Надёжнее строить диалог как последовательность планов: в первом говорит один, во втором отвечает другой. Если без двух голосов в одном кадре не обойтись, опишите персонажей максимально различимо: пол, возраст, одежда, положение в кадре слева или справа.

Голос описывайте словами, а не именами

Тембр задаётся прилагательными: «низкий спокойный мужской голос», «быстрая весёлая речь молодой девушки». Не просите голос конкретного актёра или блогера: модель не обязана его воспроизвести, а использовать чужой узнаваемый голос без согласия его владельца нельзя.

Звуковой фон: три слоя

Звук в Veo удобно думать как три слоя, и каждый стоит назвать явно.

  • Атмосфера. Общий фон места: гул кафе, ветер на набережной, тишина офиса с кондиционером.
  • Точечные шумы. Звуки, привязанные к действию: щелчок замка, звон чашки, шаги по гравию.
  • Музыка. Либо конкретное описание, либо прямой запрет.

Если вы собираетесь накладывать собственный трек или закадровый голос на монтаже, в промте стоит прямо написать «без музыки, без закадрового голоса». Иначе придётся вычищать лишнее или перегенерировать. Логика тут простая: если реплика короткая и звучит в кадре, пусть её делает сама модель; если текст длинный и идёт поверх нарезки, его удобнее озвучить отдельно и подложить на монтаже.

Камера и длина плана

Типичная ошибка — описать в одном промте три движения камеры: «наезд, потом облёт, потом отъезд». В короткий план это не помещается, и модель выберет что-то одно или смешает всё в мутное дрожание. Правило то же, что с репликами: одно движение на план.

Полезные формулировки, которые однозначно читаются:

  • медленный наезд на лицо;
  • плавный отъезд, открывающий обстановку;
  • камера неподвижна, штатив;
  • ручная камера, лёгкое покачивание;
  • панорама слева направо по витрине;
  • съёмка сверху, камера неподвижна.

Длину плана в тексте промта не просят: она задаётся настройками генерации. У Veo 3.1 Fast Relax она фиксирована и составляет восемь секунд, поэтому весь промт стоит писать под эту длину: одно действие, одно движение, одна реплика. Для Fast проверьте, какие варианты длины доступны в кабинете, и подгоняйте объём реплики под выбранный.

Fast или Relax: когда что брать

Оба режима озвучивают русскую речь. Разница — в скорости, настройках и цене; актуальные цифры смотрите на странице прайсинга.

Veo 3.1 Fast Veo 3.1 Fast Relax
Русская озвучка есть есть
Длина плана смотрите настройки в кабинете восемь секунд
Разрешение до 4K см. настройки в кабинете
Скорость быстрее возможна долгая генерация
Когда брать финальная версия, срочная задача черновики, подбор формулировок, серии без спешки

Логика выбора простая. Пока вы подбираете формулировки реплики и движения камеры, результат нужен не сразу, а вариантов будет несколько. Это работа для Relax: отправили три версии промта, занялись другими делами, вернулись и выбрали. Когда формулировка найдена и нужен финальный ролик в высоком разрешении к конкретному сроку, переходите на Fast. Подробнее о модели — на странице Veo 3.1.

Десять готовых промтов с разбором

Все примеры — условные сценарии. Подставляйте свои детали, но сохраняйте структуру.

1. Продавец приглашает в магазин

Небольшая цветочная лавка утром, мягкий свет из окна. Женщина лет сорока в зелёном фартуке стоит за прилавком с букетами, смотрит в камеру и улыбается.
Камера неподвижна, средний план.
Она говорит тёплым спокойным голосом: «Доброе утро! Сегодня у нас свежие пионы — заходите посмотреть».
Звук: тихий уличный фон за окном, лёгкий шелест упаковочной бумаги. Без музыки.

Разбор: реплика короткая и укладывается в план, камера стоит на месте, и ничто не отвлекает модель от губ и мимики. Запрет на музыку оставляет место под ваш трек.

2. Эксперт на фоне офиса

Мужчина лет тридцати пяти в светлой рубашке сидит за столом в современном офисе, за ним размытые окна.
Медленный наезд с среднего плана на крупный.
Он говорит уверенным низким голосом: «Три ошибки в договоре аренды, которые стоят дороже всего».
Звук: тихий гул кондиционера, никаких других шумов. Без музыки, без субтитров.

Разбор: такая фраза работает как заход к серии. «Без субтитров» нужно, чтобы модель не нарисовала в кадре текст, который потом не уберёшь.

3. Диалог в два плана — первый план

Уютная кухня вечером, тёплый свет лампы. Девушка лет двадцати пяти в сером свитере стоит у плиты слева в кадре и оборачивается.
Камера неподвижна, средний план.
Она спрашивает удивлённо и весело: «Ты что, правда сам испёк этот пирог?»
Звук: тихое шипение сковороды, тиканье часов. Без музыки.

4. Диалог в два плана — ответ

Та же кухня, тот же тёплый свет. Мужчина лет тридцати в клетчатой рубашке сидит за столом справа в кадре, перед ним пирог на тарелке.
Камера неподвижна, крупный план.
Он отвечает с гордостью, чуть смущённо: «Сам. По бабушкиному рецепту».
Звук: тиканье часов, звон вилки о тарелку. Без музыки.

Разбор третьего и четвёртого: диалог разнесён на два плана, у каждого героя свой кадр и своя сторона. Совпадение обстановки обеспечивается повтором описания кухни и света слово в слово.

5. Товар без людей, только звук

Керамическая кружка на деревянном столе у окна, в неё наливают горячий кофе, поднимается пар. Утро, мягкий боковой свет.
Макросъёмка, медленный наезд на кружку.
Речи нет.
Звук: журчание наливаемого кофе, тихое пение птиц за окном. Без музыки.

Разбор: здесь прямо сказано «речи нет», иначе модель может добавить закадровый голос. Точечный звук привязан к действию, поэтому воспринимается естественно.

6. Закадровый голос поверх пейзажа

Набережная на рассвете, туман над водой, одинокий бегун вдалеке.
Плавная панорама слева направо.
Закадровый голос, спокойный женский, без человека в кадре: «Каждое утро начинается с одного решения».
Звук: плеск воды, крики чаек вдалеке. Тихая фортепианная музыка на фоне.

Разбор: пометка «закадровый голос, без человека в кадре» не даёт модели искать говорящего среди прохожих и шевелить кому-то губы.

7. Обучающий ролик с демонстрацией

Руки крупным планом завязывают галстук на белой рубашке, светлый фон.
Съёмка сверху, камера неподвижна.
Спокойный мужской голос за кадром: «Сначала широкий конец перекидываем через узкий».
Звук: лёгкий шорох ткани. Без музыки.

Разбор: один шаг инструкции на план. Всю инструкцию целиком лучше разложить на серию таких планов.

8. Эмоциональная реакция

Молодая женщина открывает коробку с подарком в гостиной, праздничные гирлянды на заднем плане, вечер.
Ручная камера, лёгкое покачивание, средний план.
Она восклицает радостно, почти шёпотом: «Не может быть…»
Звук: шуршание обёрточной бумаги, смех за кадром. Без музыки.

Разбор: ручная камера добавляет ощущение домашнего видео. Короткая реплика оставляет время на реакцию лица, а оно здесь важнее слов.

9. Вертикальный заход для соцсетей

Вертикальный кадр. Парень лет двадцати в худи стоит на фоне кирпичной стены, резко поворачивается к камере.
Быстрый наезд на лицо.
Он говорит энергично: «Стоп. Не покупай наушники, пока не посмотришь это».
Звук: городской шум, щелчок пальцев в начале. Без музыки.

Разбор: соотношение сторон выставляется в настройках генерации, а слова «вертикальный кадр» в начале промта помогают строить композицию под узкий экран: лицо по центру, без важных деталей по краям. Сама фраза-заход короткая, чтобы уложиться в первые секунды.

10. Атмосферная сцена без реплик

Старая библиотека ночью, лунный свет падает через высокие окна на ряды книг, в воздухе пыль.
Очень медленный отъезд, открывающий зал.
Речи нет.
Звук: скрип половиц, далёкий бой часов, тишина. Без музыки.

Разбор: хороший пример промта для проверки формулировок в Relax. Результат не срочный, а звук и свет можно подбирать в нескольких версиях.

Как отлаживать промт, если результат не тот

Меняйте за раз один блок. Если сбилась реплика, трогайте только строку речи: сократите её, замените числа словами, уточните голос. Если камера ведёт себя странно, упростите движение до «камера неподвижна» и проверьте, что проблема ушла. Если в кадре появился лишний текст, добавьте «без субтитров, без надписей». Сохраняйте версии промтов рядом с результатами, иначе через час не вспомните, какая формулировка что дала.

Частые вопросы

Понимает ли Veo 3.1 реплики на русском языке?

Да, оба режима Veo 3.1 в каталоге Most AI поддерживают русскую озвучку. Лучше всего работают короткие реплики, приведённые дословно в кавычках с указанием, кто говорит. Длинный текст модель может ускорить или оборвать.

Сколько текста помещается в один план?

Для восьмисекундного плана ориентир — одна-две короткие фразы в спокойном темпе. Если текста больше, разбейте его на несколько планов. Это надёжнее, чем просить модель говорить быстрее.

Как убрать музыку, которую Veo добавляет сам?

Прямо напишите в звуковом блоке «без музыки». Если нужен и чистый фон без голоса, добавьте «речи нет» или «без закадрового голоса». Явный запрет надёжнее, чем расчёт на то, что модель сама догадается.

Можно ли попросить голос известного человека?

Не стоит. Модель не обязана воспроизвести конкретный голос, а использовать чужой узнаваемый голос без согласия владельца нельзя. Описывайте тембр словами: низкий, спокойный, быстрый, весёлый.

Когда выбирать Relax, а когда Fast?

Relax подходит, когда результат не срочный: черновики, подбор формулировок, серии роликов. Fast стоит брать для финальной версии и в высоком разрешении, когда ролик нужен к сроку. Разницу в цене смотрите на странице прайсинга.

Как сделать диалог двух персонажей?

Надёжнее всего разнести реплики на отдельные планы: в каждом говорит один герой, а обстановка описана одинаково. Если нужны двое в одном кадре, сделайте их максимально различимыми и укажите, кто стоит слева, а кто справа.

С Veo 3.1 аккуратный промт себя оправдывает: три дорожки, одно движение, одна реплика на план. Отладьте формулировки в Relax, а финальный вариант соберите в Fast.

Проверьте промт в деле

Вставьте промт из статьи и поправьте под свою задачу: результат видно сразу, а удачный вариант можно дорабатывать дальше.

Открыть Veo 3.1 FastОплата в рублях, без подписки

Денис Коростелёв

Продуктовый аналитик

Сравнивает модели на одинаковых промтах и считает себестоимость результата. Не верит сравнениям без методики — включая собственные.