most-AI.com
Войти

Академия Most-AI

Русская озвучка в Seedance: как заставить губы попадать в речь

Пишете реплику по-русски — персонаж бормочет с акцентом, глотает окончания, а губы двигаются не по тем звукам. Путей ровно два: приложить готовое аудио или явно потребовать русское произношение в промпте. Первый даёт точность, второй — скорость.

01

Почему Seedance коверкает русскую речь

Дело в том, на чём модель училась. Её фонетическая база собрана в основном на английском и китайском материале. Когда в промпт попадает кириллица, модель не знает, как это звучит, — и начинает достраивать по аналогии с тем, что знает. Отсюда весь набор: ударение уезжает не на тот слог, гласные приобретают металлический призвук, окончания съедаются, поверх всего ложится акцент.

Артикуляция при этом остаётся английской. Губы двигаются по английским звукам, а звучит русский текст — получается ощущение, что иностранный актёр читает реплику по транскрипции. Даже когда слова разобрать можно, кадр всё равно выглядит подделкой.

Почему это нельзя починить на монтаже

У Seedance 2.5 единая архитектура аудио и видео: звук не накладывается поверх готовой картинки, он рождается вместе с ней. Поэтому кривое произношение — это брак всего кадра целиком, а не звуковой дорожки. Переозвучить отдельно нечего: движение губ уже вшито в изображение. Остаётся перегенерировать сцену — и заплатить за неё второй раз.

Значит, вопрос произношения нужно закрывать до генерации. Дальше — два способа это сделать.


02

Почему «записать латиницей по звучанию» — костыль

Самый распространённый совет — записать русскую реплику латинскими буквами так, как она слышится, чтобы модель прочитала звук, а не незнакомые символы. Приём иногда срабатывает, и именно поэтому он разошёлся по статьям. Но это способ уговорить модель, а не управлять ею, и у него четыре встроенные проблемы.

Что ломается

Результат невоспроизводим: одна и та же запись в двух генерациях звучит по-разному. Голос достаётся случайный — выбрать тембр, пол или возраст нечем. Интонацию задать тоже нечем, кроме описания сцены. Длинная фраза рассыпается, и реплику приходится держать в пяти-шести словах.

Во что это обходится

Каждая попытка подобрать написание — отдельная генерация. Вы платите за перебор вариантов произношения, а не за кадр. И даже удачный вариант нельзя переиспользовать: в другой сцене та же строка прозвучит иначе.

Оба способа ниже обходятся без фонетических игр: в одном произношение приносите вы файлом, в другом — задаёте требованиями.


03

Два пути — и когда какой брать

Разница между ними — не в качестве промпта, а в том, кто произносит реплику. В первом случае звук приходит готовым, и модели остаётся подогнать под него губы. Во втором произносит сама модель, а вы задаёте рамки, в которых ей можно это делать.

Путь 1Аудио-референс — готовый файл

К генерации прикладывается mp3 с записанной репликой. Голос, интонация и тайминг решены заранее; модель синхронизирует артикуляцию под звук и ничего не придумывает.

Берите, когда результат важен: клиентский ролик, серия сцен с одним персонажем, длинная реплика, конкретный голос. Разобран в разделах 04–07.

Путь 2Требования к произношению в промпте

Файла нет: реплика пишется прямо в промпте, а рядом ставится блок требований — носитель языка, без акцента, произносить окончания, ничего не добавлять от себя.

Берите, когда важнее скорость: проба идеи, короткая фраза, черновик раскадровки. Разобран в разделе 08.

Честно про разницу

Путь 2 сужает коридор, но не меняет фонетическую базу модели: произношение остаётся вероятностным, и от генерации к генерации оно плавает. Путь 1 снимает вопрос совсем — потому что произносит не модель. Если сцена идёт клиенту, берите первый.


04

Путь 1: как работает аудио-референс

Аудио-референс — это готовый файл .mp3 или .m4a с записью реплики, который прикладывается к генерации вместе с промптом. Модель получает не текст, который надо произнести, а звук, под который надо подогнать движение губ.

Это принципиально другая задача. Синтезировать русскую фразу из незнакомых символов модель не умеет — а синхронизировать артикуляцию под готовую дорожку умеет: здесь она работает с формой звука, а не со значением слов, и языковая база перестаёт мешать.

Голос выбираете вымужской, женский, возраст, тембр — всё решено до генерации, а не выпало жребием
Интонацию задаёте выпаузы, нажим, шёпот, смешок — они уже в файле, модели не нужно их угадывать по описанию сцены
Тайминг предсказуемдлительность реплики известна заранее — её видно в файле, и под неё сразу планируется длина кадра
Результат повторяемтот же файл в другой сцене даст то же произношение — реплику можно переиспользовать в серии роликов

Дальше по шагам: где взять файл, куда его положить и что дописать в промпт, чтобы модель поняла, что с ним делать.


05

Где взять mp3 — два способа

Оба дают файл, пригодный для референса. Разница в том, кто задаёт интонацию — вы голосом или параметры синтеза.

Способ 1Записать себя, потом сменить голос

Проговариваете реплику в диктофон телефона — с нужными паузами, нажимом, эмоцией. Это и есть режиссура звука: вы показываете, где злость, где усмешка, где человек осекается. Затем прогоняете запись через смену голоса (speech-to-speech) — та же интонация звучит другим тембром.

Берите, когда реплика несёт эмоцию: спор, признание, угроза, шутка. Синтез такую подачу собирает хуже, чем живой голос.

Способ 2Сгенерировать из текста

Вставляете текст реплики, выбираете голос из каталога, получаете готовый файл. Записывать ничего не нужно, тихая комната не нужна, результат повторяем: тот же текст с тем же голосом звучит одинаково.

Берите для ровной подачи: закадровый текст, обращение к зрителю, реклама, короткий призыв в финале ролика.

Что для этого есть в Most-AI

Отдельный сервис не нужен — озвучка живёт в разделе Аудио кабинета, рядом с генерацией видео:

ElevenLabs Диктортекст в речь, от 4 ₽ за генерацию — счёт идёт за озвучку, а не за секунду. Основной инструмент под референс
ElevenLabs Диалогреплики добавляются карточками, у каждой свой голос — удобно, чтобы сразу услышать, как персонажи звучат вместе
Gemini 2.5 Flash TTSбыстрый синтез с чёткой дикцией и поддержкой русского — когда нужен ровный дикторский тон без актёрской игры
Смена голосазагружаете свою запись и выбираете целевой тембр — интонация ваша, голос чужой

Пошагово по интерфейсу — в гайдах: озвучить текст голосом и диалог двух голосов. Обзор моделей — в разделе «Текст в речь».

Требования к файлу

Формат mp3 или m4aподойдёт любой источник — диктофон, синтез, нарезка из другого видео
Чистый голос, без фонашум улицы или музыка под речью сбивают синхронизацию: модель принимает посторонний звук за артикуляцию
Длина не больше сценыфайл длиннее кадра обрежется на середине слова — подрезайте реплику под хронометраж заранее
Один говорящий — один файлдве реплики в одной дорожке модель по персонажам не разведёт; как собирать диалог — в разделе 09

06

Куда положить файл в Seedance

Аудио прикладывается в режиме Reference — том же, где живут референсы персонажей и локаций. Поле для звука там отдельное от полей для картинок: файл кладётся именно в него, иначе модель просто не увидит дорожку.

После загрузки аудио закреплено за будущим роликом. Само по себе это ещё ничего не даёт — модели нужно сказать, что с файлом делать; об этом следующий раздел.

Совет по деньгам

Пока подбираете кадр и формулировки, держите минимальное разрешение и минимальную длину. Проверять синхронизацию губ на 480p так же удобно, как на 4K, а стоит это в разы дешевле. Поднять качество имеет смысл, когда сцена уже собралась.


07

Что дописать в промпт под аудио

Файл приложен, но модель не обязана догадываться, что это реплика персонажа, а не фоновый звук. Нужна строка-якорь: она связывает дорожку с лицом в кадре и запрещает модели добавлять речь от себя.

RU — что делает каждая строка
БЛОК ЗВУКА — отдельной секцией, чтобы не потерялся среди описания сцены.

Реплика: синхронизируется с приложенным аудио. Говорит персонаж с картинки-референса. Текст реплики дан для контекста — произносится он по файлу.

Движение губ повторяет приложенное аудио точно.

Никакой добавочной речи: модель не дописывает фразы, которых нет в файле.

Артикуляция русская, без иностранного акцента — страховка на случай, если модель попробует «помочь».
EN — вставлять в генератор
AUDIO SYNC:

Dialogue: synced to the attached audio reference — the figure from the image reference speaks: "Я тебя не боюсь" (Russian voice track).

Lip movement follows the attached audio exactly.

Do NOT generate additional speech — no lines beyond the attached track.

Native Russian articulation, zero foreign accent.

Блок вставляется рядом с описанием кадра. Остальная структура промпта — планы, движение камеры, свет — разобрана в материале «Seedance как режиссёр».

Минимальная рабочая строка

Если места под целый блок нет, хватит одной строки — она держит главное: что это липсинк под приложенный звук, а не фоновая дорожка.

Dialogue: synced to the attached audio reference — "Я тебя не боюсь" (Russian voice track)

08

Путь 2: требовать произношение прямо в промпте

Когда файла нет, реплика пишется в промпте обычной кириллицей, а рядом ставится блок требований к произношению. Он не меняет фонетическую базу модели, но убирает большую часть типовых поломок: проглоченные окончания, отсебятину и «международный» акцент.

RU — что требуем и зачем
ПРОИЗНОШЕНИЕ — отдельным блоком, рядом с описанием сцены.

Говорит носитель русского языка. Никакого иностранного акцента, чистая нейтральная интонация.

Каждый слог произносится отчётливо, особенно окончания — последний звук не глотать. Это ровно то, на чём модель ломается чаще всего.

Ничего не добавлять: произносится только то, что стоит в кавычках, ни одного лишнего слова.

Слова ЗАГЛАВНЫМИ произносятся с нажимом — так задаётся смысловое ударение.

Многоточие между словами — короткая пауза.
EN — вставлять в генератор
RUSSIAN SPEECH RULE:

The speaker is a NATIVE Russian speaker with ZERO foreign accent, clean neutral intonation.

Pronounce EVERY syllable clearly, especially final endings — do not drop or slur the last sound.

Do NOT add words that are not written. Speak only what is inside the quotes.

Words in CAPITAL LETTERS receive vocal stress. "..." between words means a short pause.

LINE TO SPEAK:
"Я тебя не боюсь" — calm, low voice, no smile

Четыре правила, без которых блок не спасёт

Короткая репликапять-шесть слов. На длинной фразе модель начинает глотать окончания и досочинять слова — блок требований это лишь отодвигает, но не отменяет
Прямые кавычкиграницу прямой речи модель ищет по ним. Русские «ёлочки» она может не распознать и зачитает реплику как часть описания сцены
Сцена по-английски, реплика по-русскиописание кадра, камеры и света пишется на английском; русским остаётся только текст внутри кавычек
Эмоция — через действиене «злобно», а «сжимает челюсть и делает шаг вперёд». Модель подберёт интонацию под то, что видит в кадре
Чего этот путь не умеет

Выбрать конкретный голос. Повторить ту же подачу в следующей сцене. Удержать длинную реплику. Дать предсказуемый тайминг. Если хоть один из этих пунктов важен — возвращайтесь к пути 1: файл решает все четыре разом.


09

Диалог двоих и пение

С диалогом пути расходятся сильнее всего, и здесь важно не усложнять.

Путь 1: один говорящий на генерацию

Аудио-референс описывает одну дорожку, поэтому диалог собирается по кадрам: реплика первого — своя генерация со своим файлом, ответ второго — следующая. Это не обходной манёвр, а нормальная монтажная логика: смена говорящего в кино почти всегда совпадает со склейкой, и правило двойного контраста требует на этой склейке сменить ещё и крупность плана.

Кадр 1 — MS, @герой_1 говорит: аудио-референс 1
Кадр 2 — CU, @герой_2 отвечает: аудио-референс 2

Каждая реплика генерируется отдельно и со своим файлом. Склейка — на монтаже, как с обычной съёмкой.

Путь 2: обе реплики в одном промпте

Без файлов диалог помещается в один кадр: описываете, кто спрашивает, кто отвечает, и ставите реплики подряд в кавычках. Блок требований к произношению из раздела 08 остаётся тем же — он действует на обе реплики.

Two friends at a cafe table, warm evening light.
The first leans in and asks: "Ты это видел?"
The second nods and answers: "Видел. И не поверил."

RUSSIAN SPEECH RULE applies to both lines — native pronunciation, clear endings, no added words.

Держите реплики короткими: две длинные фразы подряд модель сводит хуже, чем две коротких.

Если персонаж поёт

Пение надёжно работает только первым путём: вокал приходит файлом, модель подгоняет под него артикуляцию. Стоит отдельно указать характер движения губ — пение и речь артикулируются по-разному.

Singing in Russian, lips sync to the attached audio reference. Sustained vowels, open mouth shapes on held notes.

10

Частые ошибки и что с ними делать

ПроблемаЧто происходитРешение
Губы не попадают в словаФайл приложен, но в промпте нет строки-якоряДобавить блок AUDIO SYNC — иначе дорожка читается как фоновый звук
Модель добавляет свои фразыВ промпте нет запрета на добавочную речьСтрока «Do NOT generate additional speech» — работает на обоих путях
Окончания проглоченыПуть 2 без требования к финальным звукам — модель обрывает слово«Pronounce EVERY syllable clearly, especially final endings»
Реплика зачитана как описаниеТекст взят в «ёлочки» вместо прямых кавычекТолько прямые кавычки вокруг прямой речи
Речь обрывается на серединеФайл длиннее, чем сценаПодрезать аудио под хронометраж кадра до генерации
Артикуляция дёргаетсяВ файле фоновый шум или музыка под голосомПерезаписать в тишине, музыку накладывать после генерации
Длинная фраза рассыпаетсяРеплика длиннее пяти-шести слов на пути 2Сократить или разбить на два кадра; для длинной реплики — путь 1
Подбор съедает бюджетВарианты перебираются на финальном качествеИскать на 480p и минимальной длине, финал — отдельной генерацией

Порядок действий на пути 1

Записать или сгенерировать mp3Проверить: чисто, короче сценыReference → поле аудиоБлок AUDIO SYNC в промптПроба на 480pФинал в полном качестве

Порядок действий на пути 2

Сократить реплику до 5–6 словПрямые кавычкиБлок RUSSIAN SPEECH RULEЭмоция через действиеПроба на 480pФинал в полном качестве

Соберите сцену с русской репликой

Озвучка и генерация видео — в одном кабинете: файл из раздела «Аудио» кладётся в референс Seedance без выгрузки на диск

Открыть Most-AI
Академия Most-AI