MiniMax H3——動画も音声も一括生成するAIが登場
動画生成AIって、映像と音声を別々に作って後から合わせるのが当たり前だと思っていませんか? 私もそう思っていたので、MiniMax H3の話を聞いたときはちょっと驚いてしまいました。
2026年7月31日に上海のMiniMaxが発表したH3は、テキスト・画像・動画・音声をひとつのモデルでまとめて扱う「オムニモーダルモデル」です。映像と音声を同時に生成・編集できるのが大きな特徴で、Artificial AnalysisのAI動画リーダーボード(音声あり部門)では1位を獲得しています。
解像度も注目ポイントで、ショートエッジ1,440ピクセルのネイティブ2K出力に対応。5〜15秒のクリップを24FPSで生成します。さらに最大12ファイルの画像・動画・音声を同時に参照できるので、複数の素材を組み合わせた制作もできます。
もうひとつ気になったのが、オープンウェイト(モデルの重みが公開されている状態)での提供です。2026年8月2日に公開され、ローカル環境での実行も可能になりました。コミュニティではすでに、15秒という生成限界を超えて一貫性を保ちながら動画を延ばす「Context Loop」という手法まで発見されているとか。オープンにするとこんなに早く発展するんだ、と感じました。
Robbitsでも映像コンテンツを扱う機会があるので、音声込みで一括生成できるこの仕組みは制作の流れをかなり変えてくれそうで、今後の使いどころがとても楽しみです。みなさんも、動画制作の現場でどう活用できるか、一緒に考えてみませんか?
#MiniMaxH3 #動画生成AI #オープンウェイト