Meta Superintelligence Labs は、メディア生成モデルとして Muse Image を公開し、Muse Video をプレビューした。いずれも同 Labs 初のメディア生成モデルである。Muse Image は指示追従、精密な編集、複数参照画像からの合成に対応し、検索やコーディングなどのツール利用、自己改良、推論時計算の拡大を組み合わせたエージェント的な画像生成を行う。Muse Spark とツールや計画を共有できる。公開向けの従量制 API 単価は示されていない。

Muse Image は Meta AI アプリと meta.ai、米国の Instagram Stories、一部地域の WhatsApp で利用でき、Facebook への展開も予定されている。Muse Video はネイティブ音声付きの動画生成で、クリエイター向けと Meta AI への提供が予定されている。Meta AI アプリと meta.ai で生成した画像には、不可視の Content Seal 透かしが付与される。切り抜きや圧縮、スクリーンショット後も残り、検出ツールのプレビューもある。

主な能力は次のとおり。

  • コーディングツールでプロットや QR コードを生成し、レンダリング結果を条件に画像精度を上げる
  • Web 検索で事実や最新情報、視覚参照を取り込む
  • 連鎖的思考のなかで局所編集や再生成、ツール切替による自己改良が強化学習中に現れた
  • 推論時の計算を増やすほど人間選好の Elo がおおむね対数線形に改善する。Best-of-N より意図的な推論への配分が効きやすい
  • 複数参照画像とテキストをインターリーブした合成、複数ターンの編集でも一貫性を保つ

#性能

モデルElo(Text-to-Image)
GPT Image 2 (medium)1385
Reve 2.11302
Muse Image1280
Reve 2.01271
Gemini 3.1 Flash Image (Nano Banana 2)1261
MAI Image 2.51257
モデルElo(Text-to-Video)
Gemini Omni Flash1527
Dreamina Seedance 2.0 720p1482
Muse Video1459
HappyHorse 1.01430
Sora 2 Pro1366

Text-to-Image では GPT Image 2 との差が大きく、直下の Reve 系・Gemini・MAI とは近い。Text-to-Video では Gemini Omni Flash と Seedance 2.0 に続く。

#参考文献