К содержанию
Новости

MiniMax представила мультимодальную модель H3 с генерацией 2K-видео длиной до 15 секунд

Спираль прозрачной киноплёнки с пустыми цветными кадрами на тёмном столе.
Иллюстрация создана hegai.media с помощью ИИ

Компания MiniMax представила мультимодальную генеративную модель MiniMax H3. Она умеет работать с общим контекстом из текста, изображений, видео и звука, а также генерировать аудио и видео с нативным двухканальным звуком. Максимальные параметры генерации предусматривают создание видео длительностью до 15 секунд в разрешении 2K.

Как сообщает IT Home, предварительное тестирование показало коммерческий уровень генерации контента для разных сценариев. В MiniMax отдельно выделили качество следования инструкциям, корректное отображение текста и брендовой информации, а также работу функции V2V Motion Transfer, которая переносит движения между видео. Модель ориентирована на задачи в рекламе, e-commerce, брендинге, продуктовом дизайне, UI/UX и игровой индустрии.

В техническом описании компания упомянула добавление возможностей Caption, создание специализированной модели и единого пайплайна мультимодального понимания. По данным MiniMax, обработка большинства материалов требует около 100K Token на этапе инференса, после чего итоговый объём составляет в среднем примерно 4K Token.

Для вывода видео в 2K MiniMax H3 не использует традиционный модуль суперразрешения. Вместо этого базовая модель H3 повторно генерирует собственный результат в низком разрешении в режиме in-context, чтобы задействовать уже имеющиеся генеративные способности модели. Также компания заявила, что в ближайшие дни откроет веса модели.

Ключевые факты

  • MiniMax H3 поддерживает единое понимание контекста из текста, изображений, видео и звука

  • Модель может генерировать аудио и видео с нативным двухканальным звуком

  • Для большинства материалов инференс требует около 100K Token, а итоговый объём составляет в среднем примерно 4K Token

  • MiniMax планирует открыть веса модели в ближайшие дни

Вопросы и ответы

Для каких бизнес-задач MiniMax H3 уже позиционируют, а не просто показывают как исследовательскую модель?

MiniMax заявляет коммерческий уровень генерации контента для рекламы, e-commerce, брендинга, продуктового дизайна, UI/UX и игровой индустрии. Отдельно компания выделяет качество следования инструкциям, отображение текста и брендовой информации, а также функцию V2V Motion Transfer для переноса движений между видео.

Что отличает генерацию видео в H3 от типичного апскейла через суперразрешение?

Для вывода 2K-видео длиной до 15 секунд модель не использует отдельный модуль суперразрешения. H3 повторно генерирует собственный низкоразрешённый результат в режиме in-context, используя свои же генеративные способности.

Какие требования к обработке данных у H3 и что это значит для инфраструктуры?

По данным MiniMax, инференс для большинства материалов требует около 100K Token, а итоговый объём после обработки составляет в среднем примерно 4K Token. Модель работает с единым контекстом из текста, изображений, видео и звука.

Контекст по теме