MiniMax H3 — мультимодальная модель с открытыми весами 33B. Генерирует короткое видео до 15 секунд и изображения с читаемым текстом на 11 языках. Единая архитектурная основа, три модуля, API и локальный запуск. Открытые веса опубликованы 3 августа 2026 года.

До H3 создатели контента работали по частям: один инструмент делал картинку, второй оживлял её в видео, третий добавлял звук. Между этапами терялось единообразие — лицо персонажа менялось от кадра к кадру, надписи на плакатах превращались в бессмыслицу, стиль не дотягивал до исходного кадра. H3 обучается на видео, изображениях и звуке одновременно в едином трансформере. Веса открыты под лицензией MiniMax H3 Community License.

Что умеет модель

H3 — плотный трансформер на 33 миллиарда параметров с одним потоком обработки. Плотный — значит без разреженных блоков: все параметры участвуют в каждом проходе. Текст, изображения, видео и звук проходят через единый трансформер без модульных веток. Модель принимает текстовый запрос, до девяти изображений, до трёх видеофрагментов и до трёх аудиодорожек — всего до двенадцати файлов ввода.

Выходные форматы:

  • видео 4–15 секунд с разрешением 768P или 2K
  • частота 24 кадра в секунду
  • встроенное стереозвучание 32 кГц — генерируется вместе с видео, не отдельным этапом
  • соотношения сторон: 21:9, 16:9, 4:3, 1:1, 3:4, 9:16
  • текст в кадре на 11 языках: арабский, китайский, английский, французский, немецкий, итальянский, японский, корейский, португальский, русский, испанский

Инсайт: H3 рендерит читаемый текст прямо в кадре — надписи на плакатах, упаковке, вывесках. Это было слабым местом прошлых генеративных моделей: буквы плыли, слова превращались в бессмысленные символы. Для продуктовых кадров и инфографики это меняет правила игры.

Генерация изображений

H3 генерирует статичные изображения с тем же качеством текста, что и в видео. Текстовый запрос описывает сцену — модель выдаёт готовую картинку с чёткой типографикой на любом из 11 поддерживаемых языков.

Это полезно для:

  • продуктовых кадров с читаемой упаковкой и ценниками
  • постеров и афиш с наборным текстом
  • инфографики и обучающих материалов
  • рекламных баннеров с заголовками

Поддерживается загрузка референсного изображения — модель использует его как визуальный якорь: композицию, палитру, стиль, персонажа. Дальше можно менять детали текстовым запросом, сохраняя исходную композицию.

Три модуля — один конвейер

Полная система H3 состоит из трёх модулей. Открыт только один.

H3-Context-IR — препроцессор. Принимает произвольный пользовательский текст, картинки, видео и звук, разбирает их по смыслу и превращает в структурированное промежуточное представление. Без него качество генерации падает. Модуль доступен только через API — веса не открыты.

H3-Base — генератор. На входе получает промежуточное представление, на выходе отдаёт видео 768p. Этот модуль открыт на Hugging Face под лицензией MiniMax H3 Community License. Для локального запуска нужны четыре видеокарты.

H3-Regenerate-2K — апскейлер. Берёт результат H3-Base и перегенерирует его в разрешении 2K, используя исходный контекст. Модуль доступен через API, веса не открыты.

Важно: H3-Context-IR и H3-Regenerate-2K доступны только через API MiniMax. Локально можно запустить только H3-Base для генерации в 768p.

API: тарифы и лимиты

Официальный API работает по модели pay-as-you-go — оплата за секунду сгенерированного видео.

РазрешениеЦенаПримечание
768P$0.08 за секундубазовый режим
2K$0.13 за секундучерез Regenerate-2K

Дополнительные вводные материалы: первые пять изображений бесплатно, каждое следующее — $0.04. Вводное видео тарифицируется по длительности и разрешению выхода. Вводный аудиоматериал — бесплатно.

Модель доступна через глобальную платформу platform.minimax.io и китайскую platform.minimaxi.com. Идентификатор модели в API — MiniMax-H3.

Локальный запуск

Для самостоятельного развёртывания H3-Base поставляется в двух вариантах:

  • FL2VA — режим первого и последнего кадра. Ноль, одна или две картинки на входе. Текст-в-видео, если нет картинок; первый кадр-в-видео, если одна; первый и последний кадр, если две.
  • Ref2VA — режим универсальных референсов. До девяти картинок, до трёх видео, до трёх аудио. Все типы файлов суммарно — не более двенадцати.

Рекомендуемые фреймворки для запуска: SGLang, vLLM, diffusers, ComfyUI. Для запуска FL2VA на SGLang нужны четыре видеокарты с флагом --ulysses-degree 4.

Совет: для воспроизведения качества 2K, которое показывает официальный API, нужен полный конвейер — H3-Context-IR через API, затем H3-Base локально, затем H3-Regenerate-2K через API. Только локальный H3-Base даёт 768p без препроцессинга.

Где это применимо

H3 подходит для коротких форматов, где визуал и текст должны работать вместе:

  • рекламные ролики с титрами и продуктовой съёмкой
  • продуктовые кадры с читаемой упаковкой и ценниками
  • образовательные фрагменты с инфографикой и подписями
  • сториборды для режиссёрской раскадровки
  • контент для соцсетей с диалогами на разных языках

Модель стабильно поддерживает 11 языков. Это значит, что можно задать текст реплики на русском, и персонаж в кадре произнесёт её с синхронизацией губ.

Ограничения

Ограничения

4–15 секунд — это потолок длительности. Модель не делает длинные ролики. Для многосценарного видео придётся генерировать кадры по отдельности и склеивать.

Полный конвейер с 2K требует обращения к API за этапами, которые не открыты. Локальный запуск без H3-Context-IR теряет в качестве — препроцессор существенно улучшает результат, добавляя детали и структуру, которые пользователь не указал явно.

Sparse attention — механизм разреженного внимания, который снижает вычислительную стоимость длинных последовательностей, — заявлен в архитектуре, но не включён в открытые веса. В текущем релизе доступен только full attention. Обновление ожидается отдельно.

H3-Regenerate-2K пока не открыт. На Hugging Face указано: «We will release it once it is ready».

Что проверить первым

Если есть доступ к видеокартам — скачайте H3-Base с Hugging Face и запустите один из трёх примеров из README репозитория: текст-в-видео, первый кадр-в-видео или референс-в-видео. Сравните результат с 768p через официальный API, чтобы понять разницу в качестве между локальным запуском и полным конвейером.

Если видеокарт нет — начните с бесплатных кредитов на платформе MiniMax. Сгенерируйте один ролик в 768p, затем тот же запрос в 2K. Разница в деталях покажет, нужен ли вам этап регенерации для конкретного сценария.

Ссылки

Ссылки