Академия Most-AI
Русская озвучка в Seedance: как заставить губы попадать в речь
Пишете реплику по-русски — персонаж бормочет с акцентом, глотает окончания, а губы двигаются не по тем звукам. Путей ровно два: приложить готовое аудио или явно потребовать русское произношение в промпте. Первый даёт точность, второй — скорость.
Почему Seedance коверкает русскую речь
Дело в том, на чём модель училась. Её фонетическая база собрана в основном на английском и китайском материале. Когда в промпт попадает кириллица, модель не знает, как это звучит, — и начинает достраивать по аналогии с тем, что знает. Отсюда весь набор: ударение уезжает не на тот слог, гласные приобретают металлический призвук, окончания съедаются, поверх всего ложится акцент.
Артикуляция при этом остаётся английской. Губы двигаются по английским звукам, а звучит русский текст — получается ощущение, что иностранный актёр читает реплику по транскрипции. Даже когда слова разобрать можно, кадр всё равно выглядит подделкой.
У Seedance 2.5 единая архитектура аудио и видео: звук не накладывается поверх готовой картинки, он рождается вместе с ней. Поэтому кривое произношение — это брак всего кадра целиком, а не звуковой дорожки. Переозвучить отдельно нечего: движение губ уже вшито в изображение. Остаётся перегенерировать сцену — и заплатить за неё второй раз.
Значит, вопрос произношения нужно закрывать до генерации. Дальше — два способа это сделать.
Почему «записать латиницей по звучанию» — костыль
Самый распространённый совет — записать русскую реплику латинскими буквами так, как она слышится, чтобы модель прочитала звук, а не незнакомые символы. Приём иногда срабатывает, и именно поэтому он разошёлся по статьям. Но это способ уговорить модель, а не управлять ею, и у него четыре встроенные проблемы.
Результат невоспроизводим: одна и та же запись в двух генерациях звучит по-разному. Голос достаётся случайный — выбрать тембр, пол или возраст нечем. Интонацию задать тоже нечем, кроме описания сцены. Длинная фраза рассыпается, и реплику приходится держать в пяти-шести словах.
Каждая попытка подобрать написание — отдельная генерация. Вы платите за перебор вариантов произношения, а не за кадр. И даже удачный вариант нельзя переиспользовать: в другой сцене та же строка прозвучит иначе.
Оба способа ниже обходятся без фонетических игр: в одном произношение приносите вы файлом, в другом — задаёте требованиями.
Два пути — и когда какой брать
Разница между ними — не в качестве промпта, а в том, кто произносит реплику. В первом случае звук приходит готовым, и модели остаётся подогнать под него губы. Во втором произносит сама модель, а вы задаёте рамки, в которых ей можно это делать.
К генерации прикладывается mp3 с записанной репликой. Голос, интонация и тайминг решены заранее; модель синхронизирует артикуляцию под звук и ничего не придумывает.
Берите, когда результат важен: клиентский ролик, серия сцен с одним персонажем, длинная реплика, конкретный голос. Разобран в разделах 04–07.
Файла нет: реплика пишется прямо в промпте, а рядом ставится блок требований — носитель языка, без акцента, произносить окончания, ничего не добавлять от себя.
Берите, когда важнее скорость: проба идеи, короткая фраза, черновик раскадровки. Разобран в разделе 08.
Путь 2 сужает коридор, но не меняет фонетическую базу модели: произношение остаётся вероятностным, и от генерации к генерации оно плавает. Путь 1 снимает вопрос совсем — потому что произносит не модель. Если сцена идёт клиенту, берите первый.
Путь 1: как работает аудио-референс
Аудио-референс — это готовый файл .mp3 или .m4a с записью реплики, который прикладывается к генерации вместе с промптом. Модель получает не текст, который надо произнести, а звук, под который надо подогнать движение губ.
Это принципиально другая задача. Синтезировать русскую фразу из незнакомых символов модель не умеет — а синхронизировать артикуляцию под готовую дорожку умеет: здесь она работает с формой звука, а не со значением слов, и языковая база перестаёт мешать.
Дальше по шагам: где взять файл, куда его положить и что дописать в промпт, чтобы модель поняла, что с ним делать.
Где взять mp3 — два способа
Оба дают файл, пригодный для референса. Разница в том, кто задаёт интонацию — вы голосом или параметры синтеза.
Проговариваете реплику в диктофон телефона — с нужными паузами, нажимом, эмоцией. Это и есть режиссура звука: вы показываете, где злость, где усмешка, где человек осекается. Затем прогоняете запись через смену голоса (speech-to-speech) — та же интонация звучит другим тембром.
Берите, когда реплика несёт эмоцию: спор, признание, угроза, шутка. Синтез такую подачу собирает хуже, чем живой голос.
Вставляете текст реплики, выбираете голос из каталога, получаете готовый файл. Записывать ничего не нужно, тихая комната не нужна, результат повторяем: тот же текст с тем же голосом звучит одинаково.
Берите для ровной подачи: закадровый текст, обращение к зрителю, реклама, короткий призыв в финале ролика.
Что для этого есть в Most-AI
Отдельный сервис не нужен — озвучка живёт в разделе Аудио кабинета, рядом с генерацией видео:
Пошагово по интерфейсу — в гайдах: озвучить текст голосом и диалог двух голосов. Обзор моделей — в разделе «Текст в речь».
Требования к файлу
Куда положить файл в Seedance
Аудио прикладывается в режиме Reference — том же, где живут референсы персонажей и локаций. Поле для звука там отдельное от полей для картинок: файл кладётся именно в него, иначе модель просто не увидит дорожку.
После загрузки аудио закреплено за будущим роликом. Само по себе это ещё ничего не даёт — модели нужно сказать, что с файлом делать; об этом следующий раздел.
Пока подбираете кадр и формулировки, держите минимальное разрешение и минимальную длину. Проверять синхронизацию губ на 480p так же удобно, как на 4K, а стоит это в разы дешевле. Поднять качество имеет смысл, когда сцена уже собралась.
Что дописать в промпт под аудио
Файл приложен, но модель не обязана догадываться, что это реплика персонажа, а не фоновый звук. Нужна строка-якорь: она связывает дорожку с лицом в кадре и запрещает модели добавлять речь от себя.
БЛОК ЗВУКА — отдельной секцией, чтобы не потерялся среди описания сцены. Реплика: синхронизируется с приложенным аудио. Говорит персонаж с картинки-референса. Текст реплики дан для контекста — произносится он по файлу. Движение губ повторяет приложенное аудио точно. Никакой добавочной речи: модель не дописывает фразы, которых нет в файле. Артикуляция русская, без иностранного акцента — страховка на случай, если модель попробует «помочь».
AUDIO SYNC: Dialogue: synced to the attached audio reference — the figure from the image reference speaks: "Я тебя не боюсь" (Russian voice track). Lip movement follows the attached audio exactly. Do NOT generate additional speech — no lines beyond the attached track. Native Russian articulation, zero foreign accent.
Блок вставляется рядом с описанием кадра. Остальная структура промпта — планы, движение камеры, свет — разобрана в материале «Seedance как режиссёр».
Минимальная рабочая строка
Если места под целый блок нет, хватит одной строки — она держит главное: что это липсинк под приложенный звук, а не фоновая дорожка.
Dialogue: synced to the attached audio reference — "Я тебя не боюсь" (Russian voice track)
Путь 2: требовать произношение прямо в промпте
Когда файла нет, реплика пишется в промпте обычной кириллицей, а рядом ставится блок требований к произношению. Он не меняет фонетическую базу модели, но убирает большую часть типовых поломок: проглоченные окончания, отсебятину и «международный» акцент.
ПРОИЗНОШЕНИЕ — отдельным блоком, рядом с описанием сцены. Говорит носитель русского языка. Никакого иностранного акцента, чистая нейтральная интонация. Каждый слог произносится отчётливо, особенно окончания — последний звук не глотать. Это ровно то, на чём модель ломается чаще всего. Ничего не добавлять: произносится только то, что стоит в кавычках, ни одного лишнего слова. Слова ЗАГЛАВНЫМИ произносятся с нажимом — так задаётся смысловое ударение. Многоточие между словами — короткая пауза.
RUSSIAN SPEECH RULE: The speaker is a NATIVE Russian speaker with ZERO foreign accent, clean neutral intonation. Pronounce EVERY syllable clearly, especially final endings — do not drop or slur the last sound. Do NOT add words that are not written. Speak only what is inside the quotes. Words in CAPITAL LETTERS receive vocal stress. "..." between words means a short pause. LINE TO SPEAK: "Я тебя не боюсь" — calm, low voice, no smile
Четыре правила, без которых блок не спасёт
Выбрать конкретный голос. Повторить ту же подачу в следующей сцене. Удержать длинную реплику. Дать предсказуемый тайминг. Если хоть один из этих пунктов важен — возвращайтесь к пути 1: файл решает все четыре разом.
Диалог двоих и пение
С диалогом пути расходятся сильнее всего, и здесь важно не усложнять.
Путь 1: один говорящий на генерацию
Аудио-референс описывает одну дорожку, поэтому диалог собирается по кадрам: реплика первого — своя генерация со своим файлом, ответ второго — следующая. Это не обходной манёвр, а нормальная монтажная логика: смена говорящего в кино почти всегда совпадает со склейкой, и правило двойного контраста требует на этой склейке сменить ещё и крупность плана.
Кадр 1 — MS, @герой_1 говорит: аудио-референс 1 Кадр 2 — CU, @герой_2 отвечает: аудио-референс 2
Каждая реплика генерируется отдельно и со своим файлом. Склейка — на монтаже, как с обычной съёмкой.
Путь 2: обе реплики в одном промпте
Без файлов диалог помещается в один кадр: описываете, кто спрашивает, кто отвечает, и ставите реплики подряд в кавычках. Блок требований к произношению из раздела 08 остаётся тем же — он действует на обе реплики.
Two friends at a cafe table, warm evening light. The first leans in and asks: "Ты это видел?" The second nods and answers: "Видел. И не поверил." RUSSIAN SPEECH RULE applies to both lines — native pronunciation, clear endings, no added words.
Держите реплики короткими: две длинные фразы подряд модель сводит хуже, чем две коротких.
Если персонаж поёт
Пение надёжно работает только первым путём: вокал приходит файлом, модель подгоняет под него артикуляцию. Стоит отдельно указать характер движения губ — пение и речь артикулируются по-разному.
Singing in Russian, lips sync to the attached audio reference. Sustained vowels, open mouth shapes on held notes.
Частые ошибки и что с ними делать
| Проблема | Что происходит | Решение |
|---|---|---|
| Губы не попадают в слова | Файл приложен, но в промпте нет строки-якоря | Добавить блок AUDIO SYNC — иначе дорожка читается как фоновый звук |
| Модель добавляет свои фразы | В промпте нет запрета на добавочную речь | Строка «Do NOT generate additional speech» — работает на обоих путях |
| Окончания проглочены | Путь 2 без требования к финальным звукам — модель обрывает слово | «Pronounce EVERY syllable clearly, especially final endings» |
| Реплика зачитана как описание | Текст взят в «ёлочки» вместо прямых кавычек | Только прямые кавычки вокруг прямой речи |
| Речь обрывается на середине | Файл длиннее, чем сцена | Подрезать аудио под хронометраж кадра до генерации |
| Артикуляция дёргается | В файле фоновый шум или музыка под голосом | Перезаписать в тишине, музыку накладывать после генерации |
| Длинная фраза рассыпается | Реплика длиннее пяти-шести слов на пути 2 | Сократить или разбить на два кадра; для длинной реплики — путь 1 |
| Подбор съедает бюджет | Варианты перебираются на финальном качестве | Искать на 480p и минимальной длине, финал — отдельной генерацией |
Порядок действий на пути 1
Порядок действий на пути 2
Соберите сцену с русской репликой
Озвучка и генерация видео — в одном кабинете: файл из раздела «Аудио» кладётся в референс Seedance без выгрузки на диск
Открыть Most-AI