MiniMax выложила в открытый доступ Music 3 — модель, которая генерирует полные песни до пяти минут с вокалом, аранжировкой и структурой. Восемь миллиардов параметров, открытые веса, тридцать два килогерца стерео. И главное — её можно запустить локально.
До сих пор генеративная музыка держалась на двух подходах. Первый — облачные сервисы вроде Suno: быстро, но без контроля над данными и с привязкой к подписке. Второй — исследовательские модели с открытыми весами, которые выдавали фрагменты по тридцать секунд и звучали как демо-запись. Music 3 закрывает разрыв: полная песня с вокалом и аранжировкой, открытая архитектура.
Модель вышла 13 августа 2026 года. Веса доступны на HuggingFace под именем MiniMaxAI/MiniMax-Music3, а API работает через платформу MiniMax по цене пятнадцать центов за песню.
Что умеет
Music 3 принимает два входа: описание трека и текст песни. Описание задаёт жанр, темп, настроение, инструменты, вокальный стиль и характер сведения. Текст — это структурированные стихи с тегами: [Verse], [Chorus], [Bridge], [Pre-Chorus], [Outro]. Модель раскладывает их по времени и выстраивает полноценную композицию.
- До пяти минут непрерывной генерации — не фрагмент, а готовая песня с интро, куплетами, припевами и бриджем.
- Вокал с управлением: пол вокалиста, тембр, стиль исполнения, бэк-вокал, гармоники. Новый вокальный движок убирает высокочастотный цифровой шум, который выдавал ИИ в предыдущих версиях.
- Инструментальные треки — через параметр is_instrumental. Если текст не нужен, модель работает только с описанием стиля.
- Автоматическая генерация текста — параметр lyrics_optimizer: модель сама пишет стихи из описания трека, если у вас нет своих.
- Выход: 32 kHz, 16-bit stereo WAV. На API доступен также MP3 с битрейтом 256 кбит/с.
Важно: 32 kHz на выходе модели — это не аудиофильское качество. Но для подкастов, заставок, игр и демо-записей запаса хватает. Для коммерческого релиза частоту придётся пересводить.
Как устроена архитектура
Music 3 работает на гибридной схеме из двух языковых моделей и синтезатора. Это не один гигантский нейросетевой блок, а три связанных слоя, каждый из которых отвечает за свой масштаб.
- Global LLM (8B) — предсказывает музыкальную структуру кадр за кадром. Инициализирована из Qwen3-8B, адаптирована под музыкальные токены. Отвечает за то, чтобы песня не распадалась: темы, ритм, вокальная идентичность держатся от начала до конца.
- Local LLM (0.6B) — дорабатывает акустические детали внутри каждого кадра. Мелкая зернистость: артикуляция, тембр инструмента, переходы между нотами.
- Flow Matching + Flow-VAE — синтезатор, который превращает скрытые состояния обеих моделей в звук. 2.4 миллиарда параметров в Flow Matching и 123 миллиона в декодере. Архитектура адаптирована из речевой модели MiniMax Speech и перенастроена под динамический диапазон музыки.
Ключевое решение — синтез работает не из дискретных токенов, а из непрерывных скрытых состояний. Это сохраняет больше акустической информации: артикуляция вокалиста, текстура инструмента, плавность переходов. На выходе не «склейка кусков», а связный звуковой поток.
Токенизатор использует восемь уровней квантования. Первый уровень — семантический, 16 384 записи, ловит структуру и смысл музыки. Остальные семь — акустические, по 1024 записи, восстанавливают тембр и детали.
Где запускать
Три пути. Первый — официальный API MiniMax. Модель music-3.0 стоит $0.15 за песню до пяти минут, лимит 120 запросов в минуту. Есть бесплатный tier music-3.0-free — три запроса в минуту, без оплаты. Для пробы хватает, для продакшена — нет.
Второй — локальный запуск через SGLang-Omni. Веса свободно скачиваются с HuggingFace, модель помещается в 24 ГБ видеопамяти. С CPU-офлоудом — в 8 ГБ, но медленнее. Для тех, кому важна приватность данных и нет зависимости от облака, это рабочий путь.
Третий — diffusers и ComfyUI. Модель интегрирована в библиотеку diffusers от HuggingFace, есть пайплайн для ComfyUI. Для тех, кто уже работает в этих инструментах, порог входа минимальный.
Совет: если хотите попробовать без затрат — начните с music-3.0-free на API. Три запроса в минуту достаточно, чтобы понять, подходит ли качество под вашу задачу. Потом решайте: платить за API или разворачивать локально.
Где смысл, а где рано
Music 3 сильна там, где нужна готовая песня с вокалом и структурой: заставки для подкастов, фоновые треки для игр, демо-записи для продюсеров, тематические песни для видео. Пятнадцать центов за песню — это дешевле, чем стоковая музыка с лицензией.
Но модель не заменит аранжировщика и звукорежиссёра. Выход 32 kHz — не студийный стандарт. Управление структурой есть, но тонкий контроль за каждым инструментом в реальном времени отсутствует. Для финального релиза трек придётся дорабатывать в DAW.
Главный риск я вижу в другом: открытые веса снижают порог входа, но не снижают порог качества. Модель генерирует технически правильную песню, но музыкальный вкус — по-прежнему работа человека. Описание трека — это новый навык: чем точнее вы опишете жанр, темп, вокал и аранжировку, тем меньше шансов получить усреднённый результат.
Если вы работаете с контентом — попробуйте Music 3 на одной задаче: заставка для подкаста или фоновый трек для видео. Опишите жанр, темп и настроение в одну строку, добавьте структуру через теги [Verse] и [Chorus], запустите генерацию. Если результат годится без доработки — у вас есть рабочий конвейер. Если нет — вы потратили пятнадцать центов и пять минут, чтобы понять, где модель не дотягивает.
Ссылки
Ссылки
- Репозиторий: MiniMaxAI/MiniMax-Music3
- Документация: Music Generation API
- Тарифы: MiniMax API Pricing
- GitHub: MiniMax-Music3