Режиссура ИИ-голоса: эмоция, темп и ударения в озвучке
Катя Долгих9 мин

Если ИИ-голос звучит ровно, спотыкается на ударениях и делает паузы не там, дело почти никогда не в модели. Дело в том, что вы дали ей текст, но не дали режиссуру. Живая подача собирается из трёх слоёв: разметки самого текста (пунктуация, абзацы, ударения), аудиотегов, которые подсказывают эмоцию и действие, и словесного описания тона. И ещё из одной привычки — править на коротких пробах, а не гонять весь сценарий целиком.
Базу о том, как выбрать голос и подготовить текст к озвучке, мы разбирали в статье про нейросеть для озвучки текста. Здесь следующий шаг: вы уже что-то озвучивали, результат «почти», и хочется довести его до уровня, за который не стыдно перед заказчиком.
Три рычага подачи
Прежде чем крутить что-то наугад, разложим, чем вообще можно управлять.
Текст. Модель читает то, что видит. Запятая даёт короткую остановку, точка — длиннее, многоточие — задумчивость, тире — смысловой перелом. Абзац — это вдох. Короткие предложения звучат энергичнее длинных. Половина проблем с темпом лечится правкой пунктуации, без единой настройки.
Аудиотеги. В ElevenLabs V3 можно вставлять в текст подсказки в квадратных скобках: эмоцию, манеру, действие. Например, [шёпотом], [смеётся], [с воодушевлением], [вздыхает]. Тег действует на фразу после него, и модель старается изменить подачу. Модель лучше понимает теги на английском ([whispers], [laughs], [excited]), поэтому, если русский тег не сработал, попробуйте английский вариант.
Описание тона. Gemini 3.1 TTS хорошо слушается словесной инструкции: перед текстом вы описываете, кто говорит и как. «Спокойный голос ведущего утреннего подкаста, говорит тепло, без спешки». Это грубее тегов по точности, зато задаёт общий характер всей записи.
Удобно, что эти рычаги друг другу не мешают. Пунктуация работает в любой модели, теги дают точечные акценты, описание задаёт фон.
ElevenLabs V3: Диктор и Диалог
В каталоге Most AI ElevenLabs V3 есть в двух режимах, и режиссировать их нужно немного по-разному.
Диктор
Режим для монолога: закадр, рекламный текст, урок, сказка. Здесь вы работаете как режиссёр с одним актёром. Главная ошибка — пытаться «накрутить» эмоцию, расставив теги в каждой строке. Модель начинает переигрывать, и запись звучит как пародия. Правило простое: один-два тега на абзац, в тех местах, где подача действительно меняется.
[спокойно] Каждое утро начинается одинаково: будильник, кофе, почта.
Сорок писем, из них важных — три.
[с лёгкой иронией] Знакомо?
[уверенно] Мы сделали так, чтобы эти три письма находили вас сами.
Обратите внимание: вопрос «Знакомо?» вынесен в отдельный абзац. Это даёт паузу до и после, и слово звучит как обращение, а не как проходная реплика.
Диалог
Режим для сценки на несколько голосов: рекламный диалог продавца и покупателя, разговор героев в сказке, интервью. Каждой реплике назначается свой голос, а теги работают внутри реплики. Здесь особенно полезны теги реакций: [перебивает], [смеётся], [удивлённо]. Они делают разговор разговором, а не двумя поочерёдно читающими дикторами.
Совет по диалогам: пишите реплики короче, чем в книге. Живые люди не произносят монологи по пять строк друг другу. Если реплика длиннее двух предложений, подумайте, нельзя ли разбить её вставкой собеседника («Серьёзно?», «Ну да»).
Стабильность
У самой ElevenLabs есть параметр стабильности. Если в настройках модели вы его видите, помните логику: чем он ниже, тем выразительнее и непредсказуемее подача, чем выше, тем ровнее и ближе к «дикторскому» чтению. Для рекламы и сказки разумно сдвигаться к выразительности, для учебного материала — к ровности. И если теги вдруг перестали действовать, первым делом загляните сюда: при высокой стабильности модель слушается их хуже. Если такого параметра под рукой нет, та же логика переносится на теги: меньше тегов — ровнее чтение.
Gemini 3.1 TTS: режиссура словами
Gemini 3.1 TTS работает в режиме «Диктор», и главный инструмент здесь — инструкция перед текстом. По сути это бриф для актёра: кто говорит, кому, в какой ситуации и с каким настроением.
Прочитай как ведущая короткого обучающего ролика.
Говорит с новичками, дружелюбно и спокойно, в среднем темпе.
Перед важными выводами делает небольшую паузу.
Не торопится на терминах.
Текст:
Сегодня разберём, как настроить уведомления. Это займёт пять минут.
Сначала откройте раздел «Профиль»...
Модель хорошо понимает описание роли («ведущая», «рассказчик сказки», «голос в рекламе кофейни»), аудитории и темпа. Хуже — сверхточные указания вроде «на третьем слове повысь тон». Для точечных правок лучше вернуться к тексту и пунктуации.
Ударения: как заставить модель читать правильно
Неверное ударение — самая раздражающая ошибка, потому что она сразу выдаёт синтез. Действуйте по нарастающей.
- Знак ударения над гласной. Поставьте акут над ударной гласной: «звони́т», «догово́р», «ката́лог». Модели часто учитывают этот знак, но не всегда, поэтому проверяйте на пробе.
- Фонетическая запись. Если знак не помог, напишите слово так, как оно звучит. Редкую фамилию или название бренда можно записать с удвоением или дефисом, чтобы модель услышала нужный слог.
- Замена слова. Если слово упорно читается неправильно и это не имя собственное, перефразируйте. Слушатель не знает, что было в исходнике, а кривое ударение он слышит.
Для серийной работы заведите словарик произношения: термин — как записывать в тексте для модели. Через месяц он сэкономит вам кучу перегенераций. Отдельно следите за числами, сокращениями и англицизмами: числа пишите словами, аббревиатуры — так, как их произносят.
Паузы и темп
Паузы — это то, что отличает чтение от речи. Инструменты по надёжности:
- Перенос строки и новый абзац — самая длинная и предсказуемая пауза.
- Многоточие — пауза с интонацией недосказанности.
- Тире — короткий смысловой разрыв: «Это просто — если знать как».
- Теги паузы в ElevenLabs V3 вроде
[пауза]или[short pause]модель обычно понимает, но результат менее предсказуем, чем у пунктуации.
Темп регулируется длиной предложений и описанием. Хотите быстрее — дробите на короткие фразы и добавьте в тег или инструкцию «энергично», «бодро». Хотите медленнее — длинные плавные предложения и «спокойно, без спешки».
Таблица: проблема — что поправить
| Что слышно | Что поправить |
|---|---|
| Голос ровный, без эмоции | Тег эмоции перед ключевой фразой; снизить стабильность, если она настраивается; описать настроение в инструкции |
| Переигрывает, звучит как пародия | Убрать половину тегов; повысить стабильность, если она настраивается; заменить «очень радостно» на «тепло» |
| Нет паузы перед главным | Вынести главную фразу в отдельный абзац или поставить многоточие перед ней |
| Тараторит | Разбить длинные фразы; добавить «спокойно, без спешки»; больше абзацев |
| Неверное ударение | Знак ударения над гласной, затем фонетическая запись, затем замена слова |
| Спотыкается на числах и сокращениях | Писать числа словами, аббревиатуры — как произносятся |
| Диалог звучит как два диктора | Короче реплики, теги реакций, вставки собеседника |
Три примера разметки
Реклама
Короткий рекламный текст держится на ритме и одном эмоциональном пике. Условный сценарий: 20 секунд для кофейни.
[бодро] Понедельник. Семь сорок пять.
Вы ещё не проснулись — а мы уже сварили.
[тепло] Капучино на овсяном, круассан из печи.
[с улыбкой] Заходите по дороге. Мы рядом.
Пик — во второй строке, на тире. Финал короткий и тёплый, без крика. Громкая реклама на ИИ-голосе быстро превращается в карикатуру.
Аудиокурс
Для учебного материала задача обратная: ровная подача, которая не утомляет за двадцать минут. Эмоции минимум, паузы — максимум.
Прочитай как спокойный преподаватель, средний темп, без эмоциональных всплесков.
Делай заметную паузу между смысловыми блоками.
Текст:
В этом уроке три части.
Первая — что такое воронка продаж.
Вторая — где она обычно протекает.
Третья — как это измерить.
Начнём с первой.
Каждая часть — своя строка. Модель читает перечисление с паузами, и слушатель успевает разложить план в голове.
Сказка
Сказке нужна игра: шёпот, удивление, смена голоса у персонажей. Здесь хорошо работает режим «Диалог», если героев несколько, или «Диктор» с тегами, если читает один рассказчик. Идеи по выбору голоса для детей есть в статье про сказку на ночь AI-голосом.
[мягко, неспешно] Ёжик долго стоял у края леса...
и никак не решался сделать шаг.
[шёпотом] А в траве что-то шуршало.
[удивлённо] «Кто здесь?» — спросил Ёжик.
Многоточие в первой фразе растягивает момент, шёпот создаёт напряжение, удивление разряжает его. Три тега на эпизод — достаточно.
Работайте короткими пробами
Главный рабочий приём режиссуры — не озвучивать сразу весь текст. Возьмите кусок на 30 секунд, самый сложный: с эмоциональным пиком, трудным термином и репликой персонажа. Прогоните его, послушайте, поправьте одну вещь, прогоните снова.
Почему одну вещь за раз? Если вы одновременно поменяете тег, пунктуацию и стабильность, вы не поймёте, что именно сработало. Через три-четыре итерации у вас будет рабочая «формула» подачи: голос, настройки, стиль тегов, инструкция. Запишите её и применяйте к остальному тексту. Я правлю в одном и том же порядке: сначала пунктуация и абзацы, потом теги или инструкция, и только в последнюю очередь настройки. Так меньше соблазна лечить ползунком то, что чинится одной запятой.
Что слушать на каждой пробе, чтобы не распыляться:
- Первая фраза. Задаёт ли она нужное настроение с первых секунд или голос «разгоняется» только к середине.
- Пик. Звучит ли главная мысль сильнее остального текста, есть ли перед ней пауза.
- Трудные слова. Термины, имена, числа — все ли прочитаны так, как вы бы сказали сами.
- Финал. Не обрывается ли последняя фраза и не уходит ли интонация вверх, как будто текст не закончен.
Слушайте в наушниках и хотя бы раз — с телефона, на обычной громкости. Многие огрехи интонации слышны именно в том устройстве, на котором запись потом будут слушать.
Это ещё и экономно. Оплата в Most AI идёт за генерацию, без подписки, и перегенерировать тридцать секунд дешевле, чем пятиминутный текст, в котором не понравилась одна интонация. Актуальные цены на голосовые модели — на странице прайсинга.
После того как проба устроила, делите длинный текст на смысловые куски и озвучивайте их с одной формулой. Стыки проще склеить в монтаже, а перегенерировать неудачный фрагмент — легче.
Частые вопросы
Аудиотеги работают на русском тексте?
Да, теги можно ставить в русский текст. Сами теги модель иногда лучше понимает на английском, поэтому, если [шёпотом] не сработал, попробуйте [whispers]. Проверяйте на короткой пробе.
Можно ли вставлять теги в Gemini 3.1 TTS?
Основной способ управлять Gemini 3.1 TTS — словесная инструкция перед текстом: роль, аудитория, настроение, темп. Пунктуация и абзацы работают так же, как в любой модели. Для точечных эмоциональных акцентов в отдельных фразах удобнее ElevenLabs V3.
Почему знак ударения не сработал?
Модели учитывают знак ударения не во всех словах и не в каждом прогоне. Если после знака ударение всё равно неверное, перепишите слово фонетически или замените его синонимом. Для имён собственных ведите словарик удачных написаний.
Сколько тегов ставить на абзац?
Один-два, там, где подача действительно меняется. Если тег стоит перед каждой фразой, модель переигрывает, и запись звучит неестественно. Лучше меньше тегов и точнее пунктуация.
Можно ли озвучить текст голосом конкретного человека?
Клонирования голоса в каталоге Most AI нет — вы выбираете из готовых синтетических голосов. Подражать голосу известного человека через описание не стоит. Если нужен голос реального человека, записывайте его самого и с его согласия.
Что делать, если проба хорошая, а весь текст звучит хуже?
Скорее всего, в длинном тексте появились места, которых не было в пробе: новые термины, другой ритм, длинные абзацы. Разбейте текст на куски, прогоните каждый с той же формулой подачи и перегенерируйте только неудачные фрагменты.
Режиссура ИИ-голоса — это не магия настроек, а внимательная работа с текстом: пунктуация задаёт ритм, теги дают эмоцию, инструкция — характер. Короткие пробы превращают это из лотереи в процесс, который можно повторить на следующем проекте.
Озвучьте свою фразу сейчас
Вставьте текст в генератор голоса и подберите подачу — диктора или диалог. Не понравилось — перегенерируйте абзац, а не весь ролик.



