
MiniMax внедрит в H3 возможность использования аудиореференсов при создании видео. В официальном релизе компания продемонстрировала, как модель переносит тембр мужского голоса из аудиотрека на речь персонажа в сгенерированном ролике.
Аудиореференсы могут быть использованы совместно с изображениями и видео. Текстовый запрос остаётся частью промпта: в нём описываются сцена, персонажи и необходимые действия. Подробности можно найти в материале Postium.
Читайте также: 7 лучших нейросетей для генерации видео
Как функционируют аудиореференсы в MiniMax H3
MiniMax H3 позволяет добавлять в запрос до трёх аудиореференсов. Модель также поддерживает изображения и видео, что позволяет сохранить внешний вид персонажа, композицию или другие элементы исходной сцены.
В текстовом запросе можно указать роль каждого референса: какой голос использовать для реплики, какому персонажу соответствовать и что должно происходить в кадре.
MiniMax H3 генерирует видео и стереозвук одновременно. Максимальная длительность ролика составляет 15 секунд, а в облачной версии заявлено разрешение до 2K.
Как использовать
Для работы с аудиореференсами выберите MiniMax H3 на платформе Hailuo AI или в другом сервисе, где доступен режим генерации по референсам.

Добавьте текстовое описание сцены, аудиозапись с нужным голосом и, при необходимости, изображение или видео. В промпте укажите роль каждого референса и опишите ожидаемый результат.
Ограничения по форматам файлов, их длительности и количеству могут варьироваться в зависимости от платформы или API, через которые используется MiniMax H3.
Что это меняет? Аудиозапись задаёт голосовой ориентир для речи в видео, а изображения и видео помогают сохранить персонажа и особенности сцены в одной генерации.
Напоминаем, 31 июля MiniMax представила H3 — новую ИИ-модель для генерации видео с открытыми весами. Она принимает в одном запросе текст, изображения, видео и аудио и создает ролики длительностью до 15 секунд со звуком.
Итог: MiniMax H3 получит поддержку аудиореференсов, которые можно будет использовать вместе с изображениями и видео для генерации речи и звука в роликах.


