Meta Superintelligence Labs は、メディア生成モデルとして Muse Image を公開し、Muse Video をプレビューした。いずれも同 Labs 初のメディア生成モデルである。Muse Image は指示追従、精密な編集、複数参照画像からの合成に対応し、検索やコーディングなどのツール利用、自己改良、推論時計算の拡大を組み合わせたエージェント的な画像生成を行う。Muse Spark とツールや計画を共有できる。公開向けの従量制 API 単価は示されていない。
Muse Image は Meta AI アプリと meta.ai、米国の Instagram Stories、一部地域の WhatsApp で利用でき、Facebook への展開も予定されている。Muse Video はネイティブ音声付きの動画生成で、クリエイター向けと Meta AI への提供が予定されている。Meta AI アプリと meta.ai で生成した画像には、不可視の Content Seal 透かしが付与される。切り抜きや圧縮、スクリーンショット後も残り、検出ツールのプレビューもある。
主な能力は次のとおり。
- コーディングツールでプロットや QR コードを生成し、レンダリング結果を条件に画像精度を上げる
- Web 検索で事実や最新情報、視覚参照を取り込む
- 連鎖的思考のなかで局所編集や再生成、ツール切替による自己改良が強化学習中に現れた
- 推論時の計算を増やすほど人間選好の Elo がおおむね対数線形に改善する。Best-of-N より意図的な推論への配分が効きやすい
- 複数参照画像とテキストをインターリーブした合成、複数ターンの編集でも一貫性を保つ
性能
| モデル | Elo(Text-to-Image) |
|---|---|
| GPT Image 2 (medium) | 1385 |
| Reve 2.1 | 1302 |
| Muse Image | 1280 |
| Reve 2.0 | 1271 |
| Gemini 3.1 Flash Image (Nano Banana 2) | 1261 |
| MAI Image 2.5 | 1257 |
| モデル | Elo(Text-to-Video) |
|---|---|
| Gemini Omni Flash | 1527 |
| Dreamina Seedance 2.0 720p | 1482 |
| Muse Video | 1459 |
| HappyHorse 1.0 | 1430 |
| Sora 2 Pro | 1366 |
Text-to-Image では GPT Image 2 との差が大きく、直下の Reve 系・Gemini・MAI とは近い。Text-to-Video では Gemini Omni Flash と Seedance 2.0 に続く。