Озвучить текст голосом
Маша Семёнова6 шагов4 мин
Сверено с интерфейсом
- Что понадобится:
- Аккаунт Most AI, баланс и готовый текст
- Сколько стоит:
- От 4 ₽ за генерацию — считается за озвучку, а не за секунду
Озвучка — самая дешёвая часть сервиса после текста. Одна генерация стоит от 4 ₽, и считается она за генерацию, а не за секунду, как видео.
Главное, что стоит знать заранее: настройки у модели есть, и их немало — голос, язык и четыре параметра подачи. Просто живут они не справа, а в форме под лентой генераций, в середине экрана.
Шаг 1. Откройте вкладку «Аудио» и выберите Диктора
Наведите курсор на вкладку «Аудио» в верхней панели. Моделей там немного:
- ElevenLabs V3 (Диктор) — «Самая выразительная модель преобразования текста в речь», от 4 ₽;
- ElevenLabs V3 (Диалог) — для разговора нескольких голосов, от 5 ₽;
- Gemini 3.1 TTS (Диктор) — озвучка Google с управлением стилем, от 4 ₽;
- Suno — песни и музыка, 19 ₽.
Для обычной озвучки текста нужен первый.
Шаг 2. Не ищите настройки справа
Откройте модель — и не удивляйтесь правой панели: там только название модели и кнопка запуска с ценой. Это нормально, у всех аудиомоделей она такая.
Настройки не пропали: они в центре экрана. Промотайте ленту вниз — форма дорисована в её конце.
УвеличитьШаг 3. Разберитесь в форме под лентой
Здесь и происходит вся работа:
- поле «Введите текст для озвучки…» — сюда идёт сам текст, до 5000 знаков;
- «Голос» — список готовых голосов, по умолчанию Rachel;
- «Язык» — по умолчанию русский;
- «Стабильность» — три положения: 0, 0.5, 1.0. Ниже — живее и непредсказуемее, выше — ровнее и монотоннее;
- «Схожесть» — насколько точно держаться выбранного голоса;
- «Стиль» — выразительность подачи, по умолчанию 0;
- «Скорость» — темп речи, по умолчанию 1.00.
Кнопка «Сгенерировать» — там же, под ползунками.
УвеличитьШаг 4. Вставьте текст, а не задание
В поле идёт то, что должно прозвучать, — слово в слово. Не «озвучь мне вот это красивым голосом», а сам текст: модель прочитает ровно написанное.
Здесь списываются деньги: от 4 ₽ за генерацию. Цена показана и на кнопке справа, и строкой внизу экрана.
УвеличитьШаг 5. Подготовьте текст так, чтобы он хорошо звучал
Написанное для глаз и написанное для уха — разные вещи. Что стоит поправить перед озвучкой:
- сократите длинные предложения — на слух они разваливаются;
- раскройте сокращения: «т. д.» диктор может прочитать буквами;
- числа пишите словами, если важно произношение: «две тысячи двадцать шестой» вместо «2026»;
- расставьте знаки препинания — паузы модель берёт из них;
- уберите скобки и сноски — вслух они звучат как обрывки.
Шаг 6. Проверьте на слух и правьте по одному
Результат появится в ленте, оттуда его можно скачать. Прослушайте целиком: ошибки в ударениях и интонации видны только на слух.
Если звучит не так — сначала попробуйте другой голос, потом двигайте по одному параметру. Меняя всё сразу, вы не поймёте, что подействовало.
Что дальше
Если нужен разговор двух голосов — отдельный гайд. Если нужно управлять эмоциями и паузами прямо в тексте — Gemini TTS, там для этого есть теги.
Подборка приёмов есть в блоге: шпаргалка по голосу и аудио.
Частые вопросы
Где выбрать голос?
В форме под лентой, строка «Голос». По умолчанию стоит Rachel, но список раскрывается — голосов в нём несколько.
Почему справа пусто?
Так устроены все аудиомодели: правая панель показывает только модель и кнопку с ценой, а настройки вынесены в форму в центре экрана.
Что делает «Стабильность»?
Задаёт, насколько ровно читает диктор. 0 — живее, но результат от раза к разу разный; 1.0 — ровнее и предсказуемее, но монотоннее. По умолчанию 0.5.
Можно ли озвучить длинный текст?
До 5000 знаков за раз. Длинное лучше разбивать: короткие фрагменты проще проверять и переделывать.
Чем Диктор отличается от Диалога?
Диктор — один голос и сплошной текст. Диалог — несколько реплик, у каждой свой голос.
