most-AI.com
Войти

Режиссура ИИ-голоса: эмоция, темп и ударения в озвучке

Катя Долгих9 мин

Если ИИ-голос звучит ровно, спотыкается на ударениях и делает паузы не там, дело почти никогда не в модели. Дело в том, что вы дали ей текст, но не дали режиссуру. Живая подача собирается из трёх слоёв: разметки самого текста (пунктуация, абзацы, ударения), аудиотегов, которые подсказывают эмоцию и действие, и словесного описания тона. И ещё из одной привычки — править на коротких пробах, а не гонять весь сценарий целиком.

Базу о том, как выбрать голос и подготовить текст к озвучке, мы разбирали в статье про нейросеть для озвучки текста. Здесь следующий шаг: вы уже что-то озвучивали, результат «почти», и хочется довести его до уровня, за который не стыдно перед заказчиком.

Три рычага подачи

Прежде чем крутить что-то наугад, разложим, чем вообще можно управлять.

Текст. Модель читает то, что видит. Запятая даёт короткую остановку, точка — длиннее, многоточие — задумчивость, тире — смысловой перелом. Абзац — это вдох. Короткие предложения звучат энергичнее длинных. Половина проблем с темпом лечится правкой пунктуации, без единой настройки.

Аудиотеги. В ElevenLabs V3 можно вставлять в текст подсказки в квадратных скобках: эмоцию, манеру, действие. Например, [шёпотом], [смеётся], [с воодушевлением], [вздыхает]. Тег действует на фразу после него, и модель старается изменить подачу. Модель лучше понимает теги на английском ([whispers], [laughs], [excited]), поэтому, если русский тег не сработал, попробуйте английский вариант.

Описание тона. Gemini 3.1 TTS хорошо слушается словесной инструкции: перед текстом вы описываете, кто говорит и как. «Спокойный голос ведущего утреннего подкаста, говорит тепло, без спешки». Это грубее тегов по точности, зато задаёт общий характер всей записи.

Удобно, что эти рычаги друг другу не мешают. Пунктуация работает в любой модели, теги дают точечные акценты, описание задаёт фон.

ElevenLabs V3: Диктор и Диалог

В каталоге Most AI ElevenLabs V3 есть в двух режимах, и режиссировать их нужно немного по-разному.

Диктор

Режим для монолога: закадр, рекламный текст, урок, сказка. Здесь вы работаете как режиссёр с одним актёром. Главная ошибка — пытаться «накрутить» эмоцию, расставив теги в каждой строке. Модель начинает переигрывать, и запись звучит как пародия. Правило простое: один-два тега на абзац, в тех местах, где подача действительно меняется.

[спокойно] Каждое утро начинается одинаково: будильник, кофе, почта.
Сорок писем, из них важных — три.

[с лёгкой иронией] Знакомо?

[уверенно] Мы сделали так, чтобы эти три письма находили вас сами.

Обратите внимание: вопрос «Знакомо?» вынесен в отдельный абзац. Это даёт паузу до и после, и слово звучит как обращение, а не как проходная реплика.

Диалог

Режим для сценки на несколько голосов: рекламный диалог продавца и покупателя, разговор героев в сказке, интервью. Каждой реплике назначается свой голос, а теги работают внутри реплики. Здесь особенно полезны теги реакций: [перебивает], [смеётся], [удивлённо]. Они делают разговор разговором, а не двумя поочерёдно читающими дикторами.

Совет по диалогам: пишите реплики короче, чем в книге. Живые люди не произносят монологи по пять строк друг другу. Если реплика длиннее двух предложений, подумайте, нельзя ли разбить её вставкой собеседника («Серьёзно?», «Ну да»).

Стабильность

У самой ElevenLabs есть параметр стабильности. Если в настройках модели вы его видите, помните логику: чем он ниже, тем выразительнее и непредсказуемее подача, чем выше, тем ровнее и ближе к «дикторскому» чтению. Для рекламы и сказки разумно сдвигаться к выразительности, для учебного материала — к ровности. И если теги вдруг перестали действовать, первым делом загляните сюда: при высокой стабильности модель слушается их хуже. Если такого параметра под рукой нет, та же логика переносится на теги: меньше тегов — ровнее чтение.

Gemini 3.1 TTS: режиссура словами

Gemini 3.1 TTS работает в режиме «Диктор», и главный инструмент здесь — инструкция перед текстом. По сути это бриф для актёра: кто говорит, кому, в какой ситуации и с каким настроением.

Прочитай как ведущая короткого обучающего ролика.
Говорит с новичками, дружелюбно и спокойно, в среднем темпе.
Перед важными выводами делает небольшую паузу.
Не торопится на терминах.

Текст:
Сегодня разберём, как настроить уведомления. Это займёт пять минут.
Сначала откройте раздел «Профиль»...

Модель хорошо понимает описание роли («ведущая», «рассказчик сказки», «голос в рекламе кофейни»), аудитории и темпа. Хуже — сверхточные указания вроде «на третьем слове повысь тон». Для точечных правок лучше вернуться к тексту и пунктуации.

Ударения: как заставить модель читать правильно

Неверное ударение — самая раздражающая ошибка, потому что она сразу выдаёт синтез. Действуйте по нарастающей.

  1. Знак ударения над гласной. Поставьте акут над ударной гласной: «звони́т», «догово́р», «ката́лог». Модели часто учитывают этот знак, но не всегда, поэтому проверяйте на пробе.
  2. Фонетическая запись. Если знак не помог, напишите слово так, как оно звучит. Редкую фамилию или название бренда можно записать с удвоением или дефисом, чтобы модель услышала нужный слог.
  3. Замена слова. Если слово упорно читается неправильно и это не имя собственное, перефразируйте. Слушатель не знает, что было в исходнике, а кривое ударение он слышит.

Для серийной работы заведите словарик произношения: термин — как записывать в тексте для модели. Через месяц он сэкономит вам кучу перегенераций. Отдельно следите за числами, сокращениями и англицизмами: числа пишите словами, аббревиатуры — так, как их произносят.

Паузы и темп

Паузы — это то, что отличает чтение от речи. Инструменты по надёжности:

  • Перенос строки и новый абзац — самая длинная и предсказуемая пауза.
  • Многоточие — пауза с интонацией недосказанности.
  • Тире — короткий смысловой разрыв: «Это просто — если знать как».
  • Теги паузы в ElevenLabs V3 вроде [пауза] или [short pause] модель обычно понимает, но результат менее предсказуем, чем у пунктуации.

Темп регулируется длиной предложений и описанием. Хотите быстрее — дробите на короткие фразы и добавьте в тег или инструкцию «энергично», «бодро». Хотите медленнее — длинные плавные предложения и «спокойно, без спешки».

Таблица: проблема — что поправить

Что слышно Что поправить
Голос ровный, без эмоции Тег эмоции перед ключевой фразой; снизить стабильность, если она настраивается; описать настроение в инструкции
Переигрывает, звучит как пародия Убрать половину тегов; повысить стабильность, если она настраивается; заменить «очень радостно» на «тепло»
Нет паузы перед главным Вынести главную фразу в отдельный абзац или поставить многоточие перед ней
Тараторит Разбить длинные фразы; добавить «спокойно, без спешки»; больше абзацев
Неверное ударение Знак ударения над гласной, затем фонетическая запись, затем замена слова
Спотыкается на числах и сокращениях Писать числа словами, аббревиатуры — как произносятся
Диалог звучит как два диктора Короче реплики, теги реакций, вставки собеседника

Три примера разметки

Реклама

Короткий рекламный текст держится на ритме и одном эмоциональном пике. Условный сценарий: 20 секунд для кофейни.

[бодро] Понедельник. Семь сорок пять.
Вы ещё не проснулись — а мы уже сварили.

[тепло] Капучино на овсяном, круассан из печи.

[с улыбкой] Заходите по дороге. Мы рядом.

Пик — во второй строке, на тире. Финал короткий и тёплый, без крика. Громкая реклама на ИИ-голосе быстро превращается в карикатуру.

Аудиокурс

Для учебного материала задача обратная: ровная подача, которая не утомляет за двадцать минут. Эмоции минимум, паузы — максимум.

Прочитай как спокойный преподаватель, средний темп, без эмоциональных всплесков.
Делай заметную паузу между смысловыми блоками.

Текст:
В этом уроке три части.

Первая — что такое воронка продаж.
Вторая — где она обычно протекает.
Третья — как это измерить.

Начнём с первой.

Каждая часть — своя строка. Модель читает перечисление с паузами, и слушатель успевает разложить план в голове.

Сказка

Сказке нужна игра: шёпот, удивление, смена голоса у персонажей. Здесь хорошо работает режим «Диалог», если героев несколько, или «Диктор» с тегами, если читает один рассказчик. Идеи по выбору голоса для детей есть в статье про сказку на ночь AI-голосом.

[мягко, неспешно] Ёжик долго стоял у края леса...
и никак не решался сделать шаг.

[шёпотом] А в траве что-то шуршало.

[удивлённо] «Кто здесь?» — спросил Ёжик.

Многоточие в первой фразе растягивает момент, шёпот создаёт напряжение, удивление разряжает его. Три тега на эпизод — достаточно.

Работайте короткими пробами

Главный рабочий приём режиссуры — не озвучивать сразу весь текст. Возьмите кусок на 30 секунд, самый сложный: с эмоциональным пиком, трудным термином и репликой персонажа. Прогоните его, послушайте, поправьте одну вещь, прогоните снова.

Почему одну вещь за раз? Если вы одновременно поменяете тег, пунктуацию и стабильность, вы не поймёте, что именно сработало. Через три-четыре итерации у вас будет рабочая «формула» подачи: голос, настройки, стиль тегов, инструкция. Запишите её и применяйте к остальному тексту. Я правлю в одном и том же порядке: сначала пунктуация и абзацы, потом теги или инструкция, и только в последнюю очередь настройки. Так меньше соблазна лечить ползунком то, что чинится одной запятой.

Что слушать на каждой пробе, чтобы не распыляться:

  • Первая фраза. Задаёт ли она нужное настроение с первых секунд или голос «разгоняется» только к середине.
  • Пик. Звучит ли главная мысль сильнее остального текста, есть ли перед ней пауза.
  • Трудные слова. Термины, имена, числа — все ли прочитаны так, как вы бы сказали сами.
  • Финал. Не обрывается ли последняя фраза и не уходит ли интонация вверх, как будто текст не закончен.

Слушайте в наушниках и хотя бы раз — с телефона, на обычной громкости. Многие огрехи интонации слышны именно в том устройстве, на котором запись потом будут слушать.

Это ещё и экономно. Оплата в Most AI идёт за генерацию, без подписки, и перегенерировать тридцать секунд дешевле, чем пятиминутный текст, в котором не понравилась одна интонация. Актуальные цены на голосовые модели — на странице прайсинга.

После того как проба устроила, делите длинный текст на смысловые куски и озвучивайте их с одной формулой. Стыки проще склеить в монтаже, а перегенерировать неудачный фрагмент — легче.

Частые вопросы

Аудиотеги работают на русском тексте?

Да, теги можно ставить в русский текст. Сами теги модель иногда лучше понимает на английском, поэтому, если [шёпотом] не сработал, попробуйте [whispers]. Проверяйте на короткой пробе.

Можно ли вставлять теги в Gemini 3.1 TTS?

Основной способ управлять Gemini 3.1 TTS — словесная инструкция перед текстом: роль, аудитория, настроение, темп. Пунктуация и абзацы работают так же, как в любой модели. Для точечных эмоциональных акцентов в отдельных фразах удобнее ElevenLabs V3.

Почему знак ударения не сработал?

Модели учитывают знак ударения не во всех словах и не в каждом прогоне. Если после знака ударение всё равно неверное, перепишите слово фонетически или замените его синонимом. Для имён собственных ведите словарик удачных написаний.

Сколько тегов ставить на абзац?

Один-два, там, где подача действительно меняется. Если тег стоит перед каждой фразой, модель переигрывает, и запись звучит неестественно. Лучше меньше тегов и точнее пунктуация.

Можно ли озвучить текст голосом конкретного человека?

Клонирования голоса в каталоге Most AI нет — вы выбираете из готовых синтетических голосов. Подражать голосу известного человека через описание не стоит. Если нужен голос реального человека, записывайте его самого и с его согласия.

Что делать, если проба хорошая, а весь текст звучит хуже?

Скорее всего, в длинном тексте появились места, которых не было в пробе: новые термины, другой ритм, длинные абзацы. Разбейте текст на куски, прогоните каждый с той же формулой подачи и перегенерируйте только неудачные фрагменты.

Режиссура ИИ-голоса — это не магия настроек, а внимательная работа с текстом: пунктуация задаёт ритм, теги дают эмоцию, инструкция — характер. Короткие пробы превращают это из лотереи в процесс, который можно повторить на следующем проекте.

Озвучьте свою фразу сейчас

Вставьте текст в генератор голоса и подберите подачу — диктора или диалог. Не понравилось — перегенерируйте абзац, а не весь ролик.

Открыть ElevenLabs V3Оплата в рублях, без VPN

Катя Долгих

Маркетинг и контент

Разбирает, как нейросети встраиваются в рабочие процессы: контент, презентации, карточки товара. Считает не только время, но и что с этим делать дальше.