Закадровый голос для вертикальных роликов: лимиты и склейки
Маша Семёнова9 мин

Чем вертикальный ролик отличается от любого другого
Общая механика озвучки везде одинаковая: пишем текст, отдаём его голосовой модели, получаем аудиодорожку, кладём её на видео. Если вы этого ещё ни разу не делали, начните с базового разбора — как озвучить готовый видеоролик, там про разметку по сценам, выбор голоса и подгонку по таймингу. Здесь речь не об этом, а о том, что ломается именно в вертикальном формате.
А ломается многое. Вертикальный ролик почти всегда короткий: пятнадцать, двадцать, тридцать секунд, редко больше минуты. Смотрят его чаще всего с телефона, часто в шумном месте, часто со звуком на минимальной громкости или вовсе без него — с одними субтитрами. Монтаж в таком ролике быстрый: кадр меняется каждые две-три секунды, иногда чаще. И почти всегда поверх играет музыка, потому что без неё короткое видео кажется пустым.
Получается, что закадровый голос здесь живёт в очень тесной комнате. Ему нужно уместиться в считанные секунды, не разъехаться с быстрыми склейками, нормально лечь на автоматические субтитры площадки и при этом не утонуть в музыке. Каждая из этих четырёх вещей решается отдельно, и ни одна не решается «на слух после генерации» — все они закладываются ещё на этапе текста.
Сначала секунды, потом слова
Главная ошибка новичка — сначала написать хороший текст, а потом попытаться впихнуть его в ролик. В коротком вертикальном видео так не работает: у вас нет запаса длительности, чтобы растянуть кадр под лишнюю фразу. Порядок обратный — сначала считаем, сколько секунд у нас есть, и только потом решаем, сколько слов туда влезет.
Ориентир простой. Спокойная дикторская речь — примерно два слова в секунду, бодрая и энергичная — чуть больше, около двух с половиной. То есть на пятнадцатисекундный ролик у вас есть примерно тридцать-сорок слов вместе с паузами. Это два-три коротких предложения. Не абзац, не «вступление, основная часть и вывод», а буквально несколько фраз.
| Хронометраж | Примерный объём текста | Что реально успевает зритель |
|---|---|---|
| 15 секунд | 30–40 слов | Одна мысль и короткий призыв |
| 30 секунд | 60–80 слов | Проблема, решение, вывод |
| 60 секунд | 120–150 слов | Три-четыре смысловых блока |
Цифры в таблице — не закон, а способ не обманывать себя. Пока текст не написан, всегда кажется, что «ну ещё одна фраза точно влезет». Когда вы заранее знаете лимит в словах, лишнее отсекается на этапе черновика, а не после третьей перегенерации.
Отдельно про первые секунды. В вертикальном формате зритель решает, смотреть дальше или листать, буквально сразу. Значит, первая фраза не может быть разгоном вроде «сегодня мы поговорим о том, как» — на такое вступление уходит две секунды из пятнадцати, а смысла в нём ноль. Начинайте с сути: с вопроса, с проблемы, с результата.
Темп речи под быстрый монтаж
Дальше начинается специфика. В длинном горизонтальном видео голос может вести зрителя ровно и размеренно — это даже плюс. В вертикальном ролике с монтажом каждые две секунды ровный размеренный голос звучит странно: картинка скачет, а звук будто из другого видео.
Темп речи должен примерно совпадать с ритмом монтажа. Быстрая нарезка — более собранная, плотная подача, короткие фразы без длинных придаточных. Медленные, «дышащие» кадры — более спокойный голос с воздухом между предложениями. Совсем идеально совпадать не обязательно, но грубого расхождения быть не должно.
Практический приём — писать текст фразами, а не предложениями. Одна фраза = один кадр = одна мысль. Тогда при монтаже вы просто раскладываете куски по кадрам, а не пытаетесь разрезать длинное предложение пополам.
Озвучь текст энергично, как для короткого вертикального ролика.
Темп быстрый, но без тараторенья, каждая фраза звучит отдельно.
Три вещи, которые убивают короткое видео.
Первое — длинное вступление.
Второе — голос, который никуда не спешит.
Третье — музыка громче диктора.
Задавать характер подачи прямо словами удобно в ElevenLabs V3: у модели есть режимы «Диктор» и «Диалог», и во втором можно развести реплики на разные голоса, если ролик построен как мини-сценка. Для ровного информационного закадра часто достаточно Gemini 3.1 TTS в режиме диктора — там подача спокойнее, и это хорошо ложится на обучающие и бытовые сюжеты.
Ещё один момент, про который забывают: генерировать лучше кусками, а не одним файлом на весь ролик. В пятнадцати секундах каждая перегенерация всего текста ради одной неудачной фразы — это потерянное время. Если каждая фраза лежит отдельным файлом, вы переделываете только её.
Паузы на склейках
Самая заметная ошибка в озвучке коротких роликов — голос говорит поперёк монтажа. Кадр сменился, а фраза продолжается, потом заканчивается уже внутри следующего кадра. Технически всё нормально, звук не рвётся, но ощущение — будто голос и видео записывали разные люди, не договорившись.
Лечится это паузами в правильных местах. Правило простое: смысловая точка в тексте должна приходиться на склейку, а не на середину кадра. Если на монтаже есть акцентная смена плана — там же должна быть либо точка, либо короткая пауза перед следующей мыслью.
Как этого добиться на практике:
- Разбивайте текст на такое же количество кусков, сколько у вас смысловых кадров, а не сколько предложений вам нравится.
- Ставьте точки вместо запятых там, где нужна пауза, — голосовые модели ориентируются на пунктуацию, и точка даёт заметно более длинную паузу.
- Не начинайте фразу за полсекунды до склейки: лучше дать кадру начаться, а голосу вступить чуть позже.
- Оставляйте паузу в конце ролика. Если голос договаривает последнее слово ровно в момент, когда видео обрывается, ощущение получается скомканное.
Паузы полезны и сами по себе, без привязки к склейкам. В коротком ролике пауза перед выводом работает как ударение: зритель успевает понять, что дальше главное. Только не увлекайтесь — в пятнадцати секундах две-три паузы это уже много.
Как текст ложится на автосубтитры
Значительная часть зрителей смотрит вертикальные ролики без звука. Площадки это знают и сами подставляют автоматические субтитры, распознавая речь из дорожки. Для нас это значит одну простую вещь: текст, который вы написали для голоса, будет ещё и читаться глазами — и не в том виде, в каком вы его писали, а в том, как его нарежет площадка.
Отсюда несколько практических следствий. Длинные предложения в автосубтитрах разъезжаются на несколько экранов, и зритель теряет мысль на середине. Короткие фразы, наоборот, помещаются целиком и читаются одним взглядом. То есть требование «пиши фразами» работает сразу на две задачи: и на монтаж, и на субтитры.
Дальше — распознавание. Автоматика хуже справляется с редкими словами, названиями, аббревиатурами и числами. Если в ролике есть слово, которое важно показать правильно, у вас два варианта: либо проговорить его максимально чётко и отдельно от соседних слов, либо не полагаться на автосубтитры и вынести это слово в текст на экране при монтаже. Второе надёжнее.
И третье — темп. Если голос тараторит, субтитры мелькают быстрее, чем их можно прочитать. Это ещё одна причина не пытаться уместить сорок слов туда, где помещается тридцать: страдает не только звук, но и текстовый слой.
Где голос спорит с музыкой
Музыка в вертикальном ролике почти обязательна, и именно она чаще всего съедает закадровый голос. Проблема не в громкости как таковой, а в том, что музыка и речь занимают похожий частотный диапазон — особенно если в треке есть вокал или плотная середина.
Что помогает:
- Выбирать под озвученные ролики инструментальную музыку без вокала. Два голоса одновременно — это всегда каша.
- Приглушать музыку там, где говорит диктор, и возвращать громкость в паузах и на финальном кадре. В любом видеоредакторе это делается ключевыми точками громкости.
- Оставлять музыке место: первые секунды до вступления голоса и последние секунды после последней фразы. Ролик от этого только выигрывает.
- Не подбирать трек с резкими акцентами ровно там, где идёт важная фраза.
Порядок работы удобнее такой: сначала голос, потом музыка. Голос задаёт хронометраж и паузы, музыка под него подстраивается. Если сделать наоборот, придётся переписывать текст под чужой ритм.
Всё перечисленное — это несколько генераций голоса по паре предложений каждая, а не гигантский проект. Озвучка коротких роликов вообще одна из самых дешёвых задач: тарификация в рублях, актуальные ставки — на странице прайсинга, а первые пробы по паре предложений обходятся в несколько рублей каждая, так что формат можно спокойно попробовать до того, как вы начнёте делать ролики регулярно.
Частые вопросы
Сколько слов помещается в вертикальный ролик на 15 секунд?
Ориентировочно тридцать-сорок слов вместе с паузами — это два-три коротких предложения. Считать удобно так: количество секунд умножить на два. Если текст получается длиннее, сокращайте его, а не ускоряйте голос: ускоренная речь плохо читается на слух и превращает автосубтитры в мельтешение.
Нужно ли генерировать озвучку одним файлом или кусками?
Кусками, по фразе или по смысловому кадру. Так вы переделываете только неудачный фрагмент, а не весь ролик, и заодно получаете готовые куски, которые проще разложить по таймлайну. Для короткого видео это почти всегда быстрее, чем возиться с одной длинной дорожкой.
Что выбрать — ElevenLabs V3 или Gemini 3.1 TTS?
Зависит от задачи. У ElevenLabs V3 есть режим диалога на несколько голосов — это удобно, если ролик построен как сценка или переписка. Gemini 3.1 TTS работает как диктор и хорошо подходит для ровного информационного закадра. Попробуйте оба на одном и том же тексте и сравните на слух — на пятнадцати секундах это займёт пару минут.
Как сделать, чтобы голос не разъезжался со склейками?
Пишите текст кусками под кадры, а не сплошным абзацем, и ставьте смысловые точки ровно там, где меняется план. Точка в тексте даёт паузу в озвучке, и эта пауза совпадёт со склейкой. Начинать фразу лучше чуть позже начала кадра, а не одновременно с ним.
Что делать, если музыка забивает голос?
Берите инструментальные треки без вокала и приглушайте музыку на тех участках, где говорит диктор, возвращая громкость в паузах. Сначала собирайте голос, потом подкладывайте музыку под него — так ритм ролика задаёт речь, а не наоборот.
Можно ли положиться на автосубтитры площадки?
Для обычной речи чаще всего да, но редкие слова, названия и числа автоматика распознаёт неуверенно. Если конкретное слово важно, продублируйте его текстом на экране при монтаже и произносите отчётливо, отделяя паузой от соседних слов. Короткие фразы распознаются и читаются заметно лучше длинных.
Озвучьте свою фразу сейчас
Вставьте текст в генератор голоса и подберите подачу — диктора или диалог. Не понравилось — перегенерируйте абзац, а не весь ролик.



