Как перевести ролик на другой язык: субтитры, закадр или аватар
Катя Долгих9 мин

Перевести свой ролик на другой язык можно тремя способами: наложить переведённые субтитры, сделать новую закадровую дорожку синтезированным голосом или пересобрать говорящую голову как аватар, который произносит текст уже на новом языке. Все три пути начинаются одинаково — с расшифровки и перевода, адаптированного под тайминг. Дальше они расходятся по трудоёмкости и по тому, насколько «своим» ролик покажется зрителю. Разберу каждый путь, порядок работы и то, где нейросеть помогает, а где остаётся ручная часть.
Сразу про ожидания. В кабинете Most AI нет кнопки «загрузи видео — получи дубляж на английском». И нет клонирования голоса: ваш собственный тембр на другом языке не воспроизвести. Локализацию вы собираете из нескольких шагов сами. Зато каждый шаг под контролем, и вы видите, что именно говорит ролик на чужом языке.
Кому и зачем нужна вторая языковая версия
Типичные сценарии такие. Блогер хочет выйти на англоязычную аудиторию с уже снятыми роликами. Автор онлайн-курса продаёт программу в Казахстане и Узбекистане, и там просят уроки на родном языке. Малый бизнес делает рекламный ролик для маркетплейса или соцсетей соседней страны. Эксперт провёл вебинар и хочет нарезку для зарубежной конференции.
Во всех случаях видеоряд уже есть, переснимать его не хочется. Меняется только то, что звучит, и надписи на экране. Если вам нужно озвучить ролик на том же языке, на котором он снят, — это соседняя задача, про неё у нас есть отдельный гайд по закадровому тексту. Здесь речь именно о локализации.
Три пути и чем они отличаются
| Путь | Что видит и слышит зритель | Трудоёмкость | Когда подходит |
|---|---|---|---|
| Субтитры | Оригинальный голос, перевод внизу кадра | Низкая | Экспертные ролики, интервью, соцсети с просмотром без звука |
| Новая закадровая дорожка | Другой голос на новом языке, видеоряд прежний | Средняя | Обучающие ролики, обзоры, реклама без лица в кадре |
| Говорящий аватар | Ведущий в кадре говорит на новом языке с движением губ | Высокая | Короткие обращения, приветствия курса, ролики «лицом к камере» |
Коротко: субтитры сохраняют ваш голос и интонацию, но зритель читает. Закадр даёт полное погружение, но голос будет не ваш. Аватар решает проблему «губы не совпадают со звуком», но это уже новое видео, а не перевод старого.
Шаг 1. Расшифровка: получить исходный текст
Всё начинается с текста того, что звучит в ролике. Источников три.
- Сценарий. Если вы писали текст заранее, возьмите его, но сверьте с тем, что реально произнесли — в кадре люди часто импровизируют.
- Автоматические субтитры. Площадки и видеоредакторы умеют расшифровывать речь сами. Выгрузите их в файл с таймкодами — это лучший вариант, потому что тайминг уже размечен.
- Ручная расшифровка. Для коротких роликов до минуты иногда быстрее просто набрать текст на слух самой.
Автоматическая расшифровка почти всегда содержит ошибки в терминах, названиях и именах. Прогоните её через текстовую модель, чтобы вычистить мусор, но проверьте результат глазами: модель не слышала ролик и может «исправить» правильное слово на похожее.
Вот автоматическая расшифровка моего ролика с таймкодами.
Тема ролика: как выбрать беговые кроссовки для новичка.
Исправь очевидные ошибки распознавания, особенно в терминах
(амортизация, дроп, пронация). Таймкоды не трогай.
Если слово непонятно и ты не уверен в исправлении,
пометь его [?] — я проверю сама.
[вставьте расшифровку]
Шаг 2. Перевод под тайминг, а не дословно
Это самый важный шаг, и тот, на котором чаще всего ошибаются. Перевод для видео — это не перевод документа. Фраза на английском, казахском или узбекском должна уложиться примерно в ту же паузу, что и оригинал, иначе закадр будет отставать от картинки, а субтитры — висеть на экране дольше сцены.
Для этого шага подойдут Claude Sonnet 4.6, Gemini 3.1 Pro Preview или GPT-5.5. Все три в каталоге Most AI и хорошо держат длинный контекст с таймкодами. Задайте модели роль локализатора, а не переводчика, и сразу объясните ограничения.
Ты локализатор видео. Переведи расшифровку на английский
для закадровой озвучки.
Правила:
- каждый блок с таймкодом переводи отдельно, таймкоды сохрани;
- длина перевода не больше длины оригинала по слогам,
английский текст должен уместиться в тот же отрезок;
- если фраза не влезает — сократи, сохранив смысл;
- разговорный тон, как в оригинале, без канцелярита;
- русские реалии (рубли, названия сервисов) замени
на понятные зарубежному зрителю или поясни коротко;
- в конце дай список мест, где ты сильно сократил или
заменил смысл, чтобы я их проверила.
[вставьте вычищенную расшифровку]
Список «что я поменял» в конце — обязательная часть. Он показывает, где модель приняла решение за вас, и туда стоит посмотреть в первую очередь. Если после этого текст всё равно звучит как подстрочник, попросите модель прочитать его глазами зрителя из той страны и переписать места, где так никто не говорит.
Для казахской и узбекской версий добавьте одну проверку: покажите перевод носителю языка. Модель может выдать грамматически правильный, но книжный текст, а в роликах нужна живая речь. Условный сценарий: автор курса по выпечке отправляет перевод знакомой из Алматы, она правит пару оборотов — и урок звучит по-человечески.
Путь А. Субтитры
Самый быстрый путь. Попросите модель собрать перевод в формат субтитров SRT: номер блока, таймкод начала и конца, текст. Готовый файл загружается на площадку или импортируется в видеоредактор.
Собери перевод в формат SRT.
Правила: не больше двух строк на блок, не больше 42 знаков
в строке, блок на экране не меньше 1 секунды.
Если реплика длинная — разбей на два блока по смыслу,
пересчитав таймкоды внутри исходного отрезка.
Что проверить перед публикацией: разрывы строк не посреди словосочетания, имена везде одинаковые, цифры и единицы измерения переведены в привычный для страны формат. Субтитры сохраняют главное — ваш голос и интонацию. Для экспертов и блогеров, у которых узнаваемая подача, это часто весомее, чем полноценный закадр.
Путь Б. Новая закадровая дорожка
Здесь переведённый текст превращается в голос, а оригинальная речь в ролике заменяется или приглушается.
Выбор голоса. В каталоге для этого есть ElevenLabs V3 в режимах Диктор и Диалог и Gemini 3.1 TTS (Диктор). Режим Диктор подходит для монолога, Диалог — если в ролике разговаривают двое. Работают они в разделе озвучки текста. Перед тем как озвучивать весь ролик, прогоните одну-две фразы и послушайте произношение на нужном языке. С английским обычно проще, а казахский и узбекский обязательно дайте послушать носителю — ударения и звуки проверяются только на слух.
Озвучка по блокам. Не отправляйте весь текст одним куском. Озвучивайте блоками по таймкодам: так проще подогнать каждый кусок к своему месту в монтаже и переделать одну фразу, а не всю дорожку. Если блок звучит длиннее отрезка, сократите текст, а не ускоряйте голос — ускорение слышно сразу.
Сборка. В видеоредакторе приглушите или уберите оригинальную речь, положите новые блоки по таймкодам, верните фоновую музыку и шумы, если они были на отдельной дорожке. Если музыка была вшита вместе с голосом, придётся либо оставить её тихо под новым голосом, либо подложить новый трек.
Голос будет не ваш — это важно принять заранее. Клонирования голоса в каталоге нет, а озвучивать ролик чужим голосом без согласия владельца нельзя в любом случае. Для обучающих роликов и обзоров смена голоса обычно не мешает. Для личного блога, где зрители приходят к вам, лучше подумать о субтитрах.
Путь В. Говорящий аватар для роликов «лицом к камере»
Если в кадре вы сами и говорите в камеру, закадр создаёт заметный разрыв: губы движутся по-русски, а звучит английский. Решение — Липсинк Kling Avatar: на вход он принимает фото и аудиодорожку и выдаёт видео, где человек с фото произносит этот текст с движением губ.
Порядок такой:
- Возьмите чёткий кадр своего лица из ролика или отдельное фото в том же образе.
- Озвучьте переведённый текст в ElevenLabs V3 или Gemini 3.1 TTS, как в пути Б.
- Загрузите фото и аудио в Липсинк Kling Avatar и получите новый отрезок.
- Смонтируйте: аватар в кадрах «лицом к камере», оригинальный видеоряд в перебивках, где лица не видно.
Честно о границах. Это не перевод существующего видео, а новое видео по одному фото: жесты, повороты головы и живая мимика оригинала не сохранятся. Поэтому путь хорошо работает для коротких обращений — приветствие в начале курса, минутное интро, призыв в конце рекламы. Растягивать аватар на двадцатиминутный урок обычно не стоит. Используйте только своё лицо или лицо человека, который дал согласие. Подробнее о формате — в статье про говорящий аватар вместо съёмки.
Как выбрать путь под задачу
Подсказка по ситуациям:
- Интервью, подкаст, вебинар — субтитры. Там ценен живой голос, а зрители привыкли читать.
- Урок курса с экраном или слайдами — закадр. Лица в кадре почти нет, голос меняется незаметно.
- Рекламный ролик с продуктом — закадр плюс переведённые надписи на экране.
- Короткое обращение автора — аватар или субтитры, если хочется сохранить свой голос.
Пути можно смешивать. Условный сценарий для курса: вступление к каждому модулю делается аватаром на казахском, сами уроки — с закадром, а живые эфиры с вопросами — с субтитрами. Так главное лицо курса говорит со зрителем на его языке, а большой объём материала не превращается в месяц монтажа.
Про бюджет: вы платите за генерации, а не подпиской. Как правило, дешевле всего обходится работа с текстом, а самая затратная часть — видео с аватаром. Актуальные цены за генерацию — на странице прайсинга.
Частые вопросы
Можно ли в Most AI загрузить видео и получить дубляж в один клик?
Нет, такой функции в кабинете нет. Локализация собирается из шагов: перевод в текстовой модели, озвучка в голосовой, при необходимости аватар в Липсинк Kling Avatar и финальный монтаж в вашем видеоредакторе.
Будет ли закадровый голос звучать как мой?
Нет. Клонирования голоса в каталоге нет, поэтому новая дорожка будет звучать одним из готовых голосов ElevenLabs V3 или Gemini 3.1 TTS. Если ваш голос — часть узнаваемости, выберите субтитры.
Какую модель взять для перевода?
Подойдут Claude Sonnet 4.6, Gemini 3.1 Pro Preview или GPT-5.5. Важнее не модель, а задание: попросите перевод под тайминг, с сохранением таймкодов и списком мест, где смысл сокращён.
Справятся ли голосовые модели с казахским и узбекским?
Проверьте на двух-трёх фразах до того, как озвучивать весь ролик. С английским обычно меньше сюрпризов, а казахское и узбекское произношение обязательно стоит дать послушать носителю языка.
Почему озвучка не совпадает по длине с картинкой?
Скорее всего, перевод длиннее оригинала. Сократите текст блока или перефразируйте его короче, а не ускоряйте голос. Поэтому на этапе перевода и стоит сразу просить модель укладываться в длину исходной фразы.
Можно ли сделать аватар с лицом другого человека?
Только если этот человек дал согласие на такое использование своего лица и голоса. Для личных роликов и курсов безопаснее всего использовать собственное фото.
Вторая языковая версия — это не отдельный проект, а те же четыре шага: расшифровать, перевести под тайминг, выбрать подачу и собрать. Начните с одного короткого ролика и субтитров: так вы увидите, как ваш материал звучит на другом языке, прежде чем вкладываться в голос и аватар.
Осталось собрать на своём кадре
Повторите разобранное в кабинете: приложите фото или опишите сцену — и получите готовый ролик без монтажной программы.


