Skip to main content
MiniMax открыла веса Music 3 — модель генерирует песни до пяти минут

MiniMax представила на платформе Hugging Face веса Music 3 — модели, предназначенные для генерации музыки. Она создает полноценные композиции длиной до пяти минут, основываясь на тексте и подробном описании музыкального произведения.

Результат сохраняется в формате стерео WAV с частотой 32 кГц и битностью 16 бит. Веса доступны для скачивания; для их запуска разработчик рекомендует использовать SGLang-Omni, Diffusers и ComfyUI. Дополнительные сведения можно найти в материале Postium.

Читайте также: Как бесплатно использовать нейросеть Dreamina AI — руководство

MiniMax Music 3 — характеристики и возможности

В текст песни можно включать теги, обозначающие части композиции: [Intro], [Verse], [Chorus], [Bridge] и прочие. Отдельное описание задает жанр, темп, тональность, вокал, инструменты, аранжировку и динамику настроения.

Архитектура модели разделяет процесс работы над структурой композиции и акустическими нюансами. Глобальная языковая модель с 8 миллиардами параметров отвечает за организацию песни, а локальная модель на 0,6 миллиарда параметров — за звуковые детали. Затем их скрытые состояния передаются в модель Flow Matching с 2,4 миллиарда параметров и декодируются в аудио.

MiniMax Music 3 — возможности и характеристики

Генерация требует наличия CUDA. Разработчик сообщает, что для точного запуска требуется менее 24 ГБ видеопамяти; при выгрузке компонентов в CPU модель может функционировать на 22 ГБ, а с послойной выгрузкой — на 8 ГБ, хотя и с замедлением. Модель не гарантирует строгое соответствие заданным темпу, тональности, инструментам, тексту и структуре композиции. Потоковая генерация в настоящее время не поддерживается.

Как начать использовать

Скачайте веса с страницы MiniMax Music 3 на Hugging Face и запустите модель через SGLang-Omni, Diffusers или ComfyUI. Для Diffusers в данный момент требуется версия с исправлениями из отдельного PR, пока они не были интегрированы в основную ветку. В текстовом поле укажите слова песни и теги её частей, а в описании — стиль, вокал и аранжировку. Модель вернет WAV-файл.

Почему это важно? Веса Music 3 доступны для самостоятельного развертывания согласно лицензии MiniMax-Music3 Community License: разработчик может запускать генерацию в своей среде и передавать модели не только краткий промпт, но и полный текст, структуру и параметры композиции.

Облачная генерация Music 3.0 также доступна через API: стоимость составляет $0,15 за песню. Для бесплатного режима предусмотрено ограничение в три запроса в минуту.

Ранее мы сообщали, что MiniMax H3 позволит использовать аудиореференсы для голосов — в официальном анонсе компания продемонстрировала, как модель переносит тембр мужского голоса из аудиозаписи на речь персонажа в сгенерированном видео.

Итог. MiniMax выпустила веса Music 3 для генерации песен длительностью до пяти минут с управлением текстом, вокалом и аранжировкой.

MiniMax Нейросети

Close Menu
Новости интернет маркетинга, сайтов, новости нейросетей и технологий