MiniMax H3 — мультимодальная модель с открытыми весами 33B. Генерирует короткое видео до 15 секунд и изображения с читаемым текстом на 11 языках. Единая архитектурная основа, три модуля, API и локальный запуск. Открытые веса опубликованы 3 августа 2026 года.
До H3 создатели контента работали по частям: один инструмент делал картинку, второй оживлял её в видео, третий добавлял звук. Между этапами терялось единообразие — лицо персонажа менялось от кадра к кадру, надписи на плакатах превращались в бессмыслицу, стиль не дотягивал до исходного кадра. H3 обучается на видео, изображениях и звуке одновременно в едином трансформере. Веса открыты под лицензией MiniMax H3 Community License.
Что умеет модель
H3 — плотный трансформер на 33 миллиарда параметров с одним потоком обработки. Плотный — значит без разреженных блоков: все параметры участвуют в каждом проходе. Текст, изображения, видео и звук проходят через единый трансформер без модульных веток. Модель принимает текстовый запрос, до девяти изображений, до трёх видеофрагментов и до трёх аудиодорожек — всего до двенадцати файлов ввода.
Выходные форматы:
- видео 4–15 секунд с разрешением 768P или 2K
- частота 24 кадра в секунду
- встроенное стереозвучание 32 кГц — генерируется вместе с видео, не отдельным этапом
- соотношения сторон: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
- текст в кадре на 11 языках: арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский, испанский
Инсайт: H3 рендерит читаемый текст прямо в кадре — надписи на плакатах, упаковке, вывесках. Это было слабым местом прошлых генеративных моделей: буквы плыли, слова превращались в бессмысленные символы. Для продуктовых кадров и инфографики это меняет правила игры.
Генерация изображений
H3 генерирует статичные изображения с тем же качеством текста, что и в видео. Текстовый запрос описывает сцену — модель выдаёт готовую картинку с чёткой типографикой на любом из 11 поддерживаемых языков.
Это полезно для:
- продуктовых кадров с читаемой упаковкой и ценниками
- постеров и афиш с наборным текстом
- инфографики и обучающих материалов
- рекламных баннеров с заголовками
Поддерживается загрузка референсного изображения — модель использует его как визуальный якорь: композицию, палитру, стиль, персонажа. Дальше можно менять детали текстовым запросом, сохраняя исходную композицию.
Три модуля — один конвейер
Полная система H3 состоит из трёх модулей. Открыт только один.
H3-Context-IR — препроцессор. Принимает произвольный пользовательский текст, картинки, видео и звук, разбирает их по смыслу и превращает в структурированное промежуточное представление. Без него качество генерации падает. Модуль доступен только через API — веса не открыты.
H3-Base — генератор. На входе получает промежуточное представление, на выходе отдаёт видео 768p. Этот модуль открыт на Hugging Face под лицензией MiniMax H3 Community License. Для локального запуска нужны четыре видеокарты.
H3-Regenerate-2K — апскейлер. Берёт результат H3-Base и перегенерирует его в разрешении 2K, используя исходный контекст. Модуль доступен через API, веса не открыты.
Важно: H3-Context-IR и H3-Regenerate-2K доступны только через API MiniMax. Локально можно запустить только H3-Base для генерации в 768p.
API: тарифы и лимиты
Официальный API работает по модели pay-as-you-go — оплата за секунду сгенерированного видео.
| Разрешение | Цена | Примечание |
|---|---|---|
| 768P | $0.08 за секунду | базовый режим |
| 2K | $0.13 за секунду | через Regenerate-2K |
Дополнительные вводные материалы: первые пять изображений бесплатно, каждое следующее — $0.04. Вводное видео тарифицируется по длительности и разрешению выхода. Вводный аудиоматериал — бесплатно.
Модель доступна через глобальную платформу platform.minimax.io и китайскую platform.minimaxi.com. Идентификатор модели в API — MiniMax-H3.
Локальный запуск
Для самостоятельного развёртывания H3-Base поставляется в двух вариантах:
- FL2VA — режим первого и последнего кадра. Ноль, одна или две картинки на входе. Текст-в-видео, если нет картинок; первый кадр-в-видео, если одна; первый и последний кадр, если две.
- Ref2VA — режим универсальных референсов. До девяти картинок, до трёх видео, до трёх аудио. Все типы файлов суммарно — не более двенадцати.
Рекомендуемые фреймворки для запуска: SGLang, vLLM, diffusers, ComfyUI. Для запуска FL2VA на SGLang нужны четыре видеокарты с флагом --ulysses-degree 4.
Совет: для воспроизведения качества 2K, которое показывает официальный API, нужен полный конвейер — H3-Context-IR через API, затем H3-Base локально, затем H3-Regenerate-2K через API. Только локальный H3-Base даёт 768p без препроцессинга.
Где это применимо
H3 подходит для коротких форматов, где визуал и текст должны работать вместе:
- рекламные ролики с титрами и продуктовой съёмкой
- продуктовые кадры с читаемой упаковкой и ценниками
- образовательные фрагменты с инфографикой и подписями
- сториборды для режиссёрской раскадровки
- контент для соцсетей с диалогами на разных языках
Модель стабильно поддерживает 11 языков. Это значит, что можно задать текст реплики на русском, и персонаж в кадре произнесёт её с синхронизацией губ.
Ограничения
Ограничения
4–15 секунд — это потолок длительности. Модель не делает длинные ролики. Для многосценарного видео придётся генерировать кадры по отдельности и склеивать.
Полный конвейер с 2K требует обращения к API за этапами, которые не открыты. Локальный запуск без H3-Context-IR теряет в качестве — препроцессор существенно улучшает результат, добавляя детали и структуру, которые пользователь не указал явно.
Sparse attention — механизм разреженного внимания, который снижает вычислительную стоимость длинных последовательностей, — заявлен в архитектуре, но не включён в открытые веса. В текущем релизе доступен только full attention. Обновление ожидается отдельно.
H3-Regenerate-2K пока не открыт. На Hugging Face указано: «We will release it once it is ready».
Что проверить первым
Если есть доступ к видеокартам — скачайте H3-Base с Hugging Face и запустите один из трёх примеров из README репозитория: текст-в-видео, первый кадр-в-видео или референс-в-видео. Сравните результат с 768p через официальный API, чтобы понять разницу в качестве между локальным запуском и полным конвейером.
Если видеокарт нет — начните с бесплатных кредитов на платформе MiniMax. Сгенерируйте один ролик в 768p, затем тот же запрос в 2K. Разница в деталях покажет, нужен ли вам этап регенерации для конкретного сценария.
Ссылки
Ссылки
- Репозиторий: MiniMax-AI/MiniMax-H3
- Документация: MiniMax API Docs
- Тарифы: Pay as You Go
- Hugging Face: MiniMaxAI/MiniMax-H3
- Веб-приложение: Hailuo AI Video