MiniMax представила мультимодальную модель H3 с генерацией 2K-видео длиной до 15 секунд

Компания MiniMax представила мультимодальную генеративную модель MiniMax H3. Она умеет работать с общим контекстом из текста, изображений, видео и звука, а также генерировать аудио и видео с нативным двухканальным звуком. Максимальные параметры генерации предусматривают создание видео длительностью до 15 секунд в разрешении 2K.
Как сообщает IT Home, предварительное тестирование показало коммерческий уровень генерации контента для разных сценариев. В MiniMax отдельно выделили качество следования инструкциям, корректное отображение текста и брендовой информации, а также работу функции V2V Motion Transfer, которая переносит движения между видео. Модель ориентирована на задачи в рекламе, e-commerce, брендинге, продуктовом дизайне, UI/UX и игровой индустрии.
В техническом описании компания упомянула добавление возможностей Caption, создание специализированной модели и единого пайплайна мультимодального понимания. По данным MiniMax, обработка большинства материалов требует около 100K Token на этапе инференса, после чего итоговый объём составляет в среднем примерно 4K Token.
Для вывода видео в 2K MiniMax H3 не использует традиционный модуль суперразрешения. Вместо этого базовая модель H3 повторно генерирует собственный результат в низком разрешении в режиме in-context, чтобы задействовать уже имеющиеся генеративные способности модели. Также компания заявила, что в ближайшие дни откроет веса модели.
Ключевые факты
MiniMax H3 поддерживает единое понимание контекста из текста, изображений, видео и звука
Модель может генерировать аудио и видео с нативным двухканальным звуком
Для большинства материалов инференс требует около 100K Token, а итоговый объём составляет в среднем примерно 4K Token
MiniMax планирует открыть веса модели в ближайшие дни
Вопросы и ответы
- Для каких бизнес-задач MiniMax H3 уже позиционируют, а не просто показывают как исследовательскую модель?
MiniMax заявляет коммерческий уровень генерации контента для рекламы, e-commerce, брендинга, продуктового дизайна, UI/UX и игровой индустрии. Отдельно компания выделяет качество следования инструкциям, отображение текста и брендовой информации, а также функцию V2V Motion Transfer для переноса движений между видео.
- Что отличает генерацию видео в H3 от типичного апскейла через суперразрешение?
Для вывода 2K-видео длиной до 15 секунд модель не использует отдельный модуль суперразрешения. H3 повторно генерирует собственный низкоразрешённый результат в режиме in-context, используя свои же генеративные способности.
- Какие требования к обработке данных у H3 и что это значит для инфраструктуры?
По данным MiniMax, инференс для большинства материалов требует около 100K Token, а итоговый объём после обработки составляет в среднем примерно 4K Token. Модель работает с единым контекстом из текста, изображений, видео и звука.
Контекст по теме
- ByteDance представила в Китае видеомодель Seedance 2.5 с генерацией роликов до 30 секунд31 июля 2026 г.
- ModelBest представила локальную модель MiniCPM5-2B для устройств с контекстом 512K19 июля 2026 г.
- ByteDance планирует открыть API для видеомодели Seedance 2.5 через неделю после запуска демо3 июля 2026 г.
- MiniMax выпустила M3 с контекстом до 1 млн токенов и нативной мультимодальностью9 июня 2026 г.