Какое видео создаём?
Говорящий персонаж из фото и аудио (InfiniteTalk). Реалистичный lip-sync до 15 сек в 480p/720p.
Что умеет InfiniteTalk
InfiniteTalk превращает фото и аудиодорожку в видео говорящего персонажа: модель анимирует лицо с реалистичным липсинком — губы, мимика и движения головы синхронизируются с речью. Ролики до 15 секунд в разрешении 480p или 720p, цена — примерно от 8 токенов за секунду.
Это самый экономичный способ получить говорящего аватара на платформе. Текстовый промпт при этом остаётся в вашем распоряжении: им можно задать манеру подачи — энергичные жесты блогера, спокойный рассказ, эмоциональные акценты в нужных местах.
Сильнейший сценарий — полностью виртуальный ведущий, собранный внутри App Flow: персонаж генерируется в Seedream или Nano Banana, речь — в Gemini TTS, а InfiniteTalk сводит их в говорящее видео. В Flow-конструкторе эта цепочка запускается одним действием — конвейер контента без камер и микрофонов.
Когда выбирать InfiniteTalk
- Регулярный контент. Цена от 8 токенов/сек позволяет озвучивать ролики сериями — дайджесты, новости, обучение.
- Виртуальные ведущие. Сгенерированное лицо плюс синтезированный голос — персонаж, которого не существует.
- Локализация. Одно фото и разные аудиодорожки — тот же ведущий говорит на любом языке.
- Максимум детализации — Kling AI Avatar Pro. Для крупных планов премиального качества есть более дорогая альтернатива.
Как получить хороший результат
- Берите портрет с чётким, хорошо освещённым лицом анфас — липсинк будет точнее.
- Используйте чистую аудиодорожку без музыки и шумов: модель читает именно речь.
- Промптом задавайте манеру: «спокойный рассказ» и «энергичная подача» дают заметно разные ролики.
- Собирайте конвейер в Flow-конструкторе: персонаж из Seedream → озвучка в Gemini TTS → липсинк здесь.
Скопируйте и подставьте в форму выше — или измените под свою задачу.
Ведущий обзора
The person speaks directly to the camera with confident energy, natural head movements and hand gestures emphasizing key points, friendly engaged expression, blogger-style delivery synced to the audio.
Спокойный рассказчик
The character narrates calmly, subtle facial expressions, occasional thoughtful pauses matching the audio rhythm, soft eye movements, minimal head motion, warm storytelling mood.
Эмоциональное обращение
The speaker delivers the message with rising enthusiasm, expressive eyebrows and smile appearing at the emotional peaks of the audio, animated but natural gestures, direct eye contact with the viewer.
Сколько стоит InfiniteTalk?
Примерно от 8 токенов за секунду видео — одна из самых доступных цен среди говорящих аватаров. Итог зависит от длительности (до 15 секунд) и разрешения (480p/720p). Оплата токенами по факту, без подписки.
Как это работает?
Загружаете фото персонажа и аудиодорожку с речью — модель оживляет лицо с реалистичной синхронизацией губ под звук. Промпт опционально уточняет манеру: жесты, эмоции, движения головы.
Чем InfiniteTalk отличается от Kling AI Avatar?
Задача та же — говорящий персонаж из фото и аудио, — но InfiniteTalk ощутимо дешевле (от 8 токенов/сек против 200 токенов за ролик у Kling AI Avatar). Для максимальной детализации лица есть Kling AI Avatar Pro, для регулярного контента выгоднее InfiniteTalk.
Где взять аудио для озвучки?
Запишите голос сами или сгенерируйте его в TTS-моделях App Flow — например, Gemini 3.1 Flash TTS с 30 голосами и управлением эмоциями. В Flow-конструкторе озвучка и липсинк собираются в одну цепочку.
Какое фото подойдёт?
Портрет с хорошо видимым лицом — фронтально или в лёгкий поворот. Подойдёт и сгенерированный персонаж из Seedream или Nano Banana: так можно создать полностью виртуального ведущего.
OmniHuman 1.5
Говорящий персонаж из фото и аудио (ByteDance OmniHuman 1.5). Реалистичный lip-sync для людей, питомцев и аниме, до 60 сек в 720p/1080p.
~от 68 токенов/сек
Kling AI Avatar
Говорящий аватар из фото и аудио. Загрузи фото лица и любую аудиодорожку — Kling оживит персонажа с реалистичной мимикой и синхронизацией губ.
от 200 токенов
Gemini 3.1 Flash TTS
Естественная и выразительная озвучка от Google: 30 голосов, inline-теги эмоций, управление стилем, темпом и акцентом.
~от 2 токенов/100 симв.