Skip to main content
MiniMax H3 позволит использовать аудиореференсы для голосов

MiniMax внедрит в H3 возможность использования аудиореференсов при создании видео. В официальном релизе компания продемонстрировала, как модель переносит тембр мужского голоса из аудиотрека на речь персонажа в сгенерированном ролике.

Аудиореференсы могут быть использованы совместно с изображениями и видео. Текстовый запрос остаётся частью промпта: в нём описываются сцена, персонажи и необходимые действия. Подробности можно найти в материале Postium.

Читайте также: 7 лучших нейросетей для генерации видео

Как функционируют аудиореференсы в MiniMax H3

MiniMax H3 позволяет добавлять в запрос до трёх аудиореференсов. Модель также поддерживает изображения и видео, что позволяет сохранить внешний вид персонажа, композицию или другие элементы исходной сцены.

В текстовом запросе можно указать роль каждого референса: какой голос использовать для реплики, какому персонажу соответствовать и что должно происходить в кадре.

MiniMax H3 генерирует видео и стереозвук одновременно. Максимальная длительность ролика составляет 15 секунд, а в облачной версии заявлено разрешение до 2K.

Как использовать

Для работы с аудиореференсами выберите MiniMax H3 на платформе Hailuo AI или в другом сервисе, где доступен режим генерации по референсам.

MiniMax H3 позволит использовать аудиореференсы для голосов

Добавьте текстовое описание сцены, аудиозапись с нужным голосом и, при необходимости, изображение или видео. В промпте укажите роль каждого референса и опишите ожидаемый результат.

Ограничения по форматам файлов, их длительности и количеству могут варьироваться в зависимости от платформы или API, через которые используется MiniMax H3.

Что это меняет? Аудиозапись задаёт голосовой ориентир для речи в видео, а изображения и видео помогают сохранить персонажа и особенности сцены в одной генерации.

Напоминаем, 31 июля MiniMax представила H3 — новую ИИ-модель для генерации видео с открытыми весами. Она принимает в одном запросе текст, изображения, видео и аудио и создает ролики длительностью до 15 секунд со звуком.

Итог: MiniMax H3 получит поддержку аудиореференсов, которые можно будет использовать вместе с изображениями и видео для генерации речи и звука в роликах.

MiniMax Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий