most-AI.com

Как сделать видео из фотографии: разбираем на Kling, Veo и Seedance

Денис Коростелёв7 мин

Оживить фотографию умеют почти все современные видеомодели. Разница между ними — не в том, «может или не может», а в том, что каждая считает движением. Одна аккуратно добавит кадру дыхание: шевельнутся волосы, дрогнёт свет. Другая построит полноценную сцену с проездом камеры и сменой плана, даже если вы её об этом не просили.

Отсюда главная ошибка новичка: взять первую попавшуюся модель, написать «сделай красиво» и решить по результату, что нейросети «пока не умеют». Умеют — просто вы не сказали, что именно нужно.

Что нужно на входе

Фотография решает больше, чем модель. Три вещи, которые стоит проверить до генерации:

  • Резкость лица. Если на исходнике лицо смазано, модель его додумает, и в движении это будет заметно сильнее, чем на статичном кадре.
  • Один главный объект. Групповое фото на восемь человек — сложная задача для любой модели: она будет по-разному интерпретировать каждое лицо.
  • Запас по краям. Если голова упирается в верхнюю границу кадра, камере некуда ехать, и модель начнёт дорисовывать то, чего на фото не было.

Отдельно: не гонитесь за разрешением. Для видео важнее чистота кадра, чем количество мегапикселей.

Три модели на одном промпте

Мы взяли один вертикальный портрет и прогнали его через три модели из каталога Most AI с одинаковым описанием сцены. Одинаковый промпт здесь принципиален: как только вы меняете и модель, и текст, сравнение перестаёт что-либо значить.

Промпт был такой:

Сохрани лицо с загруженной фотографии без изменений.
Медленный наезд камеры, тёплый вечерний свет,
лёгкое движение волос от ветра. Без смены плана.

Что получилось.

Kling 3.0 точнее всех отработал формулировку «медленный наезд»: камера действительно едет вперёд, а не имитирует движение зумом. Это её сильная сторона — управляемость. У линейки Kling есть и отдельный режим Motion Control, где траекторию движения задаёте вы, а не модель по мотивам вашего текста.

Veo 3.1 Fast дала самую красивую картинку по свету: вечернее солнце легло на лицо так, как его выставил бы оператор. Плата за это — модель охотнее остальных «дорисовывает» фон, добавляя детали, которых на исходнике не было. Для рекламного ролика это плюс, для семейного архива — минус.

Seedance 2 оказалась предсказуемее всех между дублями: три генерации подряд дали три похожих результата. Когда нужно сделать десять роликов в одном стиле, это важнее, чем красота одного кадра.

Модель В чём сильна Когда брать
Kling 3.0 Управление движением камеры Нужен конкретный проезд или облёт
Veo 3.1 Fast Свет и кинематографичность Ролик пойдёт в рекламу
Seedance 2 Стабильность между дублями Нужна серия роликов в одном стиле

В каталоге есть и более простой путь — приложение «Оживление фото»: оно не спрашивает промпт вообще и добавляет минимальное естественное движение. Если задача звучит как «пусть фото просто немного ожило», начинать стоит с него.

Как писать промпт для видео

Промпт для видео отличается от промпта для картинки одним: в нём есть время. Вы описываете не кадр, а то, что в кадре меняется.

Сравните:

  • ❌ «Красивый закат на море»
  • ✅ «Камера медленно едет вдоль берега, солнце садится, волны накатывают на песок»

Первый вариант описывает картинку — модель сама решит, что с ней делать дальше, и решение будет случайным. Второй задаёт начало и конец.

Рабочая структура промпта для оживления фотографии складывается из четырёх частей:

  1. Что сохранить. «Сохрани лицо с загруженной фотографии без изменений» — это первое, что стоит написать, если на фото человек.
  2. Движение камеры. Наезд, отъезд, панорама влево, облёт. Одно движение, а не три.
  3. Движение в кадре. Ветер в волосах, пар над чашкой, моргание. Тоже одно.
  4. Чего не делать. «Без смены плана», «без склеек», «без появления новых людей».

Четвёртый пункт новички почти всегда пропускают, а он снимает больше проблем, чем первые три вместе взятые.

Что не стоит писать

Не описывайте внешность, если приложили фотографию. «Девушка с тёмными волосами» в промпте начнёт спорить с реальным человеком на снимке, и модель выберет компромисс — то есть чужое лицо. Внешность должна прийти из фото, а из текста — только действие.

Не просите «красиво», «профессионально», «как в кино». Это не инструкции, а оценки. Модель переведёт их в случайный набор эффектов. «Тёплый вечерний свет сбоку» — инструкция, «красиво» — нет.

Не складывайте несколько сцен в один промпт. Если вам нужен монтаж, соберите его из отдельных роликов: так каждый кадр будет управляемым.

Сколько дублей закладывать

Один — почти никогда не финальный, и это нормальное свойство технологии, а не признак плохой модели. Разумный подход: три дубля на одном промпте, выбрать лучший, и только потом менять формулировку.

Важно менять по одному параметру за раз. Если вы одновременно поменяли модель, движение камеры и свет, вы не узнаете, что именно улучшило результат, и в следующий раз начнёте с нуля.

Что попробовать бесплатно

Прежде чем тратить кредиты на перебор моделей, есть смысл посмотреть, как это устроено, на бесплатной квоте. В Most AI ежедневно доступны без оплаты несколько генераций Veo 3.1 Fast (Relax) и Grok Video — этого хватает, чтобы понять логику промпта и решить, какая модель вам ближе. Квота обновляется каждый день.

Полный список видеомоделей — в разделе генератора видео: там же можно сравнить их между собой, не переключаясь между сервисами и без VPN.

Что идёт не так чаще всего

Разберём четыре сбоя, которые встречаются почти в каждом первом заходе.

Лицо «плывёт» к концу ролика. Модель держит внешность несколько секунд, а потом начинает её пересобирать. Лечится двумя способами: сократить длительность и добавить в промпт прямое требование сохранить лицо без изменений. Если не помогает — исходник слишком мягкий, и модели просто не за что зацепиться.

Камера едет не туда. Обычно потому, что в промпте два движения сразу: «наезд и панорама влево». Модель выбирает одно, и не то. Оставьте одно движение.

Появляются лишние люди или предметы. Модель заполняет пустые зоны кадра. Прямой запрет работает: «не добавляй людей и объектов, которых нет на фотографии».

Ролик обрывается на середине движения. Движение было описано слишком масштабным для длительности. Облёт вокруг человека за пять секунд не помещается — либо сокращайте движение, либо берите большую длительность.

Сколько это стоит по времени

Реалистичная оценка для одного готового ролика из фотографии:

  • подготовка кадра (пересъёмка или отбор) — 5 минут;
  • первая генерация и оценка — 3 минуты;
  • две правки промпта с генерациями — 8 минут;
  • финальный дубль — 3 минуты.

Итого около двадцати минут. Больше всего времени съедает не генерация, а решение, что именно должно двигаться в кадре. Если продумать это до первого запуска, цикл сокращается вдвое.

Частые вопросы

Нужно ли платить, чтобы попробовать?

Нет. Veo 3.1 Fast и Grok Video доступны по бесплатной дневной квоте — по два ролика на каждую модель в сутки. Этого хватает, чтобы понять логику промпта.

Можно ли оживить фото, где несколько человек?

Можно, но результат менее предсказуем: модель по-разному интерпретирует каждое лицо. Начните с кадра, где один главный герой, а групповые снимки оставьте на потом.

Почему видео получается коротким?

Длительность задаётся параметром модели, а не промптом. Просить «сделай подлиннее» бесполезно — нужно выбрать другое значение длительности при запуске.

Можно ли добавить звук?

У части моделей звук генерируется вместе с изображением, у части — нет. Если звук важен, выбирайте модель, которая его поддерживает, либо накладывайте отдельно.

Что делать, если результат каждый раз разный?

Это нормальное свойство генерации. Стабильность повышают два приёма: более конкретный промпт и модель, у которой предсказуемость между дублями сильнее — например Seedance.

Подойдёт ли скан старой фотографии?

Да, и часто получается выразительнее современных снимков. Но сначала имеет смысл восстановить его — как это сделать, разобрано в статье про реставрацию.

Короткий чек-лист

Перед тем как нажать «Создать»:

  • фотография резкая, лицо не смазано, есть запас по краям кадра;
  • в промпте есть требование сохранить лицо;
  • задано одно движение камеры и одно движение в кадре;
  • есть запрет: без смены плана, без склеек;
  • внешность в тексте не описана;
  • заложено три дубля, а не один.

Если после этого результат всё ещё не тот — меняйте не модель, а формулировку движения. В девяти случаях из десяти дело в ней.

Денис Коростелёв

Продуктовый аналитик

Сравнивает модели на одинаковых промптах и считает себестоимость результата. Не верит сравнениям без методики — включая собственные.