Какое видео создаём?
Говорящий персонаж из фото и аудио (ByteDance OmniHuman 1.5). Реалистичный lip-sync для людей, питомцев и аниме, до 60 сек в 720p/1080p.
Что умеет OmniHuman 1.5
OmniHuman 1.5 — говорящий персонаж ByteDance из фото и аудио: модель оживляет портрет с реалистичным липсинком. На вход — изображение (человек, питомец, аниме) и дорожка до 60 секунд; на выход — видео в 720p или 1080p, где губы, мимика и лёгкие движения головы совпадают с речью.
Шестьдесят секунд — редкий запас среди аватаров на платформе: InfiniteTalk и большинство конкурентов обрываются на 15. Для подкаст-врезки, объясняющего ролика или длинного обращения не нужно резать звук на куски. При этом ByteDance умеет не только «говорящую голову» человека — кошка, собака и рисованный персонаж тоже открывают рот в такт.
Промпт необязателен и короткий (до 300 символов): им задают манеру, а не сцену. Озвучку удобно снять самим или сгенерировать в Gemini TTS на App Flow — в Flow-конструкторе портрет, речь и OmniHuman собираются в одну цепочку.
Когда выбирать OmniHuman 1.5
- Длинная речь. До минуты липсинка без склейки из нескольких 15-секундных кусков.
- Не только люди. Питомец-«ведущий» или аниме-маскот, которые реально говорят, а не просто качают головой.
- Виртуальный спикер. Герой из Seedream + голос из Gemini TTS + OmniHuman — ролик без камеры.
- Массовый дешёвый контент — InfiniteTalk. Если хронометраж короткий и бюджет жёсткий, от 8 токенов/сек выгоднее InfiniteTalk.
Как получить хороший результат
- Лицо анфас, ровный свет, без рук у рта и тёмных очков — липсинк сядет точнее.
- Аудио — чистая речь без музыки; до 15 секунд модель отрабатывает стабильнее, чем полную минуту.
- Промптом задайте характер («спокойно», «эмоционально»), не пересказывайте внешность.
- Слайдер длительности выставьте по реальной длине файла, чтобы оценка цены не врала. Цепочку TTS → OmniHuman запускайте из Flow-конструктора.
Скопируйте и подставьте в форму выше — или измените под свою задачу.
Спокойный ведущий
The character speaks calmly and confidently, light hand gestures, steady eye contact with the camera, soft studio light, podcast host energy.
Эмоциональная речь
Expressive delivery, lively facial motion matching the emotional peaks of the audio, direct gaze, natural head movement, warm storytelling mood.
Аниме-персонаж
The illustrated character talks to the camera with gentle nods and blinks synced to the speech, keep the original art style, simple upper-body motion.
Сколько стоит OmniHuman 1.5?
Примерно от 68 токенов за секунду результата. Длина ролика ≈ длина аудио (до 60 секунд, комфортнее до 15). Разрешение 720p или 1080p на цену не влияет. Оплата токенами по факту, без подписки.
Чем OmniHuman отличается от InfiniteTalk и Kling AI Avatar?
OmniHuman 1.5 от ByteDance анимирует не только людей, но и питомцев и аниме-портреты, а аудио принимает до 60 секунд. InfiniteTalk дешевле (от 8 токенов/сек) и ограничен 15 секундами; Kling AI Avatar сильнее на крупных планах лица, но дороже за ролик.
Какое фото подойдёт?
Портрет человека, животного или аниме-персонажа до 10 МБ, лицо хорошо видно. Сгенерированный герой из Seedream или Nano Banana работает так же, как фото с камеры.
Зачем слайдер длительности, если есть аудио?
Слайдер только оценивает цену до запуска: модель всё равно синхронизирует ролик с длиной дорожки. Поставьте значение близко к реальной длительности файла — сумма в форме совпадёт с фактом.
Что даёт быстрый режим?
pe_fast_mode ускоряет генерацию ценой детализации мимики. Для черновика и проверки губ — включайте; для финального ролика оставляйте выключенным.
InfiniteTalk
Говорящий персонаж из фото и аудио (InfiniteTalk). Реалистичный lip-sync до 15 сек в 480p/720p.
~от 8 токенов/сек
Kling AI Avatar
Говорящий аватар из фото и аудио. Загрузи фото лица и любую аудиодорожку — Kling оживит персонажа с реалистичной мимикой и синхронизацией губ.
от 200 токенов
Gemini 3.1 Flash TTS
Естественная и выразительная озвучка от Google: 30 голосов, inline-теги эмоций, управление стилем, темпом и акцентом.
~от 2 токенов/100 симв.