テキスト・画像・動画・音声を一つの文脈として扱い、ネイティブステレオ音声付きの動画を最大 2K・15 秒まで生成する。API モデル名は MiniMax-H3。出力解像度は 768P / 2K、尺は 4〜15 秒(整数秒)。法令・規制に従い、近日中にモデル重みを公開する予定。

入力では、参照動画のカメラワーク・参照画像の人物・参照音声のボーカルを自然言語で関係づけて指示できる。出力は既定で 2K。768P から 2K への再生成(In-Context Regeneration)もあり、参照音声は無料、参照画像は最初の 5 枚まで無料でそれ以降は 1 枚あたり 0.04 ドル。H3-Context-IR は入力 0.90 / 出力 3.60 ドル(百万トークンあたり)。

#性能

モデルText-to-Video Elo(音声あり)Video Editing Elo(音声あり)
Gemini Omni Flash12441122
MiniMax H312371130
Dreamina Seedance 2.0 720p12241037

Artificial Analysis の音声あり Arena では Text-to-Video で Omni Flash に僅差 2 位、Video Editing では 1 位。

#API 価格の比較

モデル解像度出力 ($/秒)
MiniMax H32K0.13
MiniMax H3768P0.08
Gemini Omni Flash720p(実効)約 0.10
Veo 3.1 Fast720p0.10

H3 の 2K 単価は Omni Flash / Veo 3.1 Fast の 720p 帯より高いが、既定解像度が 2K で、768P なら同帯より安い。

#参考文献