Какое видео создаём?
MiniMax H3 (Hailuo-03): видео по референсам — до 9 изображений, 3 видео и 3 аудио. До 15 сек в 768p/2K.
Что умеет MiniMax H3 R2V
MiniMax H3 R2V (Hailuo-03) собирает видео по референсам: до 9 изображений, до 3 видео и опциональное аудио. На выходе — ролик 4–15 секунд в 768p или 2K, где герои, объекты и ритм камеры узнаваемы, а сцена при этом новая, по вашему промпту.
Это самый «режиссёрский» инструмент тройки H3. T2V придумывает всё сам, I2V привязан к композиции фото, R2V ставит ваших персонажей в любую локацию и может подхватить движение с референс-ролика. Аудио идёт только вместе с картинкой или видео — звук без визуального якоря модель не примет.
Физика Hailuo здесь работает на узнаваемых людях и предметах: ткань, шаг, рука, облёт продукта выглядят собранными, а не «резиновыми». Для серийного контента это способ не терять героя от ролика к ролику.
Когда выбирать MiniMax H3 R2V
- Узнаваемый персонаж в новых сценах. Один герой — разные локации, без привязки к исходному кадру.
- Референс движения. Короткое видео задаёт ритм камеры, фото — кто в кадре.
- Продукт плюс человек. До 9 изображений: товар, руки, фон в одной рекламной постановке.
- Просто оживить фото — I2V. Если композиция уже идеальна, MiniMax H3 I2V короче по усилиям.
Как получить хороший результат
- Без визуального референса запрос не уйдёт: сначала фото или видео, аудио — только поверх них.
- В промпте распределяйте роли: «герой с первого референса идёт по локации со второго».
- Референс-видео держите коротким и чистым — суммарно до 15 секунд на все ролики.
- Собирайте исходники в Flow-конструкторе: картинки из Seedream, черновик движения из H3 T2V, сборка здесь.
Скопируйте и подставьте в форму выше — или измените под свою задачу.
Персонаж в локации
Continuous cinematic shot: the character from the first reference walks through the location from the second reference, smooth camera follow, matching wardrobe and face, natural daylight.
Продукт в динамике
The product from the reference in a dynamic commercial scene, studio light sweeping across the surface, a hand from the second reference entering the frame, 2K, slow orbit.
Сцена под референс-видео
Recreate the camera rhythm of the reference video with the people and objects from the still references, same pacing, cinematic grade, consistent characters throughout.
Сколько стоит MiniMax H3 R2V?
Примерно от 57 токенов за секунду в 768p и около 92 в 2K. Длительность 4–15 секунд. За входные медиа провайдер может добавить небольшую надбавку — ориентир виден в форме. Оплата токенами по факту, без подписки.
Какие референсы принимает модель?
До 9 изображений, до 3 видео (суммарно до 15 секунд) и референс-аудио на 2–15 секунд. Нужен хотя бы один визуальный референс — фото или видео. Аудио без картинки или ролика не принимается.
Чем R2V отличается от I2V?
I2V анимирует ваши кадры как первый/последний кадр ролика. R2V строит новую сцену по промпту и переносит в неё внешность, движение и звук с референсов. Свобода постановки при узнаваемом герое — это R2V.
Чем это отличается от Seedance?
Seedance 2.5 берёт ещё больше исходников и умеет 30 секунд, но в 720p. MiniMax H3 R2V сильнее в физике Hailuo и даёт 2K на 15 секундах — удобнее, когда важна детализация, а не полуминутный хронометраж.
Как собрать референсы?
Персонажа и продукт сгенерируйте в Seedream или Qwen3, короткое видео движения — в MiniMax H3 T2V. В Flow-конструкторе App Flow всё это сходится в один узел R2V.
MiniMax H3 T2V
MiniMax H3 (Hailuo-03): генерация видео из текста до 15 сек в 768p/2K.
~от 57 токенов/сек
MiniMax H3 I2V
MiniMax H3 (Hailuo-03): оживление изображений до 15 сек в 768p/2K. Первый и/или последний кадр.
~от 57 токенов/сек
Wan 2.7 R2V
Wan 2.7 Reference-to-Video: видео по референсам изображений и видео с сохранением внешности и голоса. До 10 сек в 1080p.
~от 40 токенов/сек