Какое видео создаём?
Замена речи в готовом видео (Volcengine): губы подстраиваются под новое аудио. Режимы Lite и Basic для сложных сцен.
Что умеет Volcengine Lip Sync
Volcengine Lip Sync заменяет речь в готовом видео: вы загружаете ролик и новую аудиодорожку — модель перестраивает движение губ под этот звук. Это video-to-video, а не аватар из фото: исходная съёмка, свет и монтаж остаются, меняется только то, что говорит человек.
Два режима закрывают разные исходники. Lite заточен под одного человека анфас — быстрее и умеет зациклить короткое видео, если озвучка длиннее картинки. Basic разбирает сложные сцены: несколько персонажей, склейки, опционально сегментирует планы и ищет говорящего. Отдельно можно вычистить голос из шумной дорожки, чтобы липсинк не плясал под музыку.
Цена — примерно от 20 токенов за секунду, заметно ниже генерации говорящего аватара «с нуля». Типичные задачи: локализация рекламы, дубляж интервью, новая озвучка AI-ролика, который уже снят в Kling, Seedance или PixVerse.
Когда выбирать Volcengine Lip Sync
- Ролик уже есть. Нужно сказать другой текст или на другом языке, не переснимая и не перегенерируя сцену.
- Дешёвая переозвучка. 20 токенов/сек против 68 у OmniHuman и сотен у Kling AI Avatar за новый клип.
- Сложный исходник — Basic. Несколько людей в кадре, нарезка сцен, смена говорящего.
- Только фото, нет видео — OmniHuman / InfiniteTalk. Если исходника-ролика нет, сначала соберите говорящий аватар, а не липсинк.
Как получить хороший результат
- Для Lite берите фронтальный крупный план одного человека; профиль и толпа — сразу Basic.
- Новую дорожку делайте чистой; если чистить нечем, включите выделение голоса.
- Слайдер длительности поставьте по реальной длине, чтобы оценка цены совпала с списанием.
- Озвучку генерируйте в Gemini TTS и склеивайте с роликом в Flow-конструкторе App Flow — один пайплайн «видео → речь → липсинк».
Скопируйте и подставьте в форму выше — или измените под свою задачу.
Переозвучка ведущего
Replace the speech of a single front-facing presenter: upload the original talking-head video and a clean new voiceover, then run Lite mode so lip motion matches the new audio.
Локализация рекламы
Dub an existing ad into another language. Use Basic mode when the clip has cuts or more than one person, and turn on speaker detection so the right face is synced.
Дубляж шумной дорожки
New voiceover mixed with music or room noise: enable vocal isolation so the model locks onto speech, not the soundtrack. Source video 360p–1080p, mp4 or mov.
Сколько стоит Volcengine Lip Sync?
Примерно от 20 токенов за секунду результата — одна из самых доступных цен на замену речи. Слайдер длительности нужен только для оценки: фактическая длина ≈ длина видео/аудио. Оплата токенами по факту, без подписки.
Чем это отличается от OmniHuman и InfiniteTalk?
Те модели оживляют фото. Volcengine берёт готовое видео и подгоняет губы под новую дорожку — локализация, дубляж, переозвучка уже снятого ролика, а не создание аватара с нуля.
Чем Lite отличается от Basic?
Lite — один фронтальный персонаж, быстрее, умеет зациклить видео, если аудио длиннее. Basic — сложные сцены: несколько людей, склейки, опциональная сегментация сцен и поиск того, кто говорит.
Какое видео и аудио подойдут?
Видео 360p–1080p, mp4/mov, до 500 МБ. Аудио — чистый голос, mp3/wav/aac, до 10 МБ. Если в дорожке есть шум, включите выделение голоса.
Где взять новую озвучку?
Запись с микрофона или Gemini TTS на App Flow. В Flow-конструкторе сгенерированная речь сразу подаётся в Volcengine вместе с роликом из другой видеомодели.
OmniHuman 1.5
Говорящий персонаж из фото и аудио (ByteDance OmniHuman 1.5). Реалистичный lip-sync для людей, питомцев и аниме, до 60 сек в 720p/1080p.
~от 68 токенов/сек
InfiniteTalk
Говорящий персонаж из фото и аудио (InfiniteTalk). Реалистичный lip-sync до 15 сек в 480p/720p.
~от 8 токенов/сек
Gemini 3.1 Flash TTS
Естественная и выразительная озвучка от Google: 30 голосов, inline-теги эмоций, управление стилем, темпом и акцентом.
~от 2 токенов/100 симв.