MetaがMuse Glimmer 30Bオープンウェイトモデルを公開——コンシューマー向けGPU1枚での動作に対応

MetaはMuse Glimmer 30Bパラメータのマルチモーダルモデルを公開し、Apache 2.0ライセンスのもとでウェイトを開放した。同モデルはMuse Sparkから蒸留されており、常時稼働のローカルエージェントワークフロー向けに最適化され、コンシューマー向けGPU1枚またはMac上でネットワーク呼び出しなしに動作する。

事実の整理

Muse Glimmerの総パラメータ数は約30Bで、ビジョンタワーを含む。モデルは密な因果的Transformerアーキテクチャを採用し、グループクエリアテンションは32個のクエリヘッドと2個のKVヘッドを使用、アテンションパターンは[Local, Local, Local, Global]、スライディングウィンドウは2048となっている。ビジョンエンコーダは約1.8BのViT-G/14で、1枚の画像につき最大4096個のビジョントークンをサポートする。コンテキスト長は131072以上、語彙サイズは202048、知識のカットオフは2026年1月4日。入力はテキストと画像に対応し、出力はテキストとなる。

学習は3段階で実施される。事前学習ではMuse Sparkの出力を用いたlogit蒸留を行う。中期学習ではより長いコンテキストとエージェント密度の高いデータが追加され、より豊富な推論トレースが含まれる。事後学習では教師あり微調整、ポリシー蒸留、強化学習を組み合わせ、汎用・推論・コーディング・エージェントの各領域をカバーする。

メカニズムの解説

フル精度ではモデルに55GB超のメモリが必要となる。Metaはウェイトを約4ビット精度に量子化し、言語モデル部分を20GB未満に抑え、残りの領域をKVキャッシュ、知覚エンコーダ、drafterに充てている。2種類の量子化バージョンが公開されており、K-Quant-Dynamicは32GB VRAMを対象とし平均劣化0.2%、K-Quant-17GBは24GB VRAMを対象とし平均劣化1.0%となっている。ブロック単位の投機的デコーディングにより速度がさらに向上し、実際のエージェントループへの組み込みが可能となっている。

モデルはHugging Face上でBF16ウェイト、GGUF k-quants、ExecuTorchビルド、DFlash drafterを提供している。llama.cpp、MLX、ExecuTorchの最適化統合は近日公開予定となっている。

産業への影響

開発者にとっては、オープンウェイトとローカル実行の特性により参入障壁が低下する。個人開発者やスタートアップは、24GB VRAMのGPU1枚またはM4/M5 Max搭載のMac上でデプロイでき、トークンごとの料金を支払う必要がない。すでに複数のユーザーがローカルのマルチエージェントアーキテクチャにおいてツール呼び出しと多段階推論をテストしている。

エンタープライズユーザーにとっては、オフライン動作とデータ常駐に対応しており、医療・法務・金融サービス・防衛・公共部門・製造業・フィールドサービスなどのシナリオに適している。規制対象企業はエアギャップ環境でのエージェントデプロイを実現できる。Metaは、裸のエンドポイントとして直接公開するのではなく、システムレベルのガードレールを追加することを推奨している。

競争環境においては、オープンウェイトのライセンスが従来のLlamaライセンスよりも寛容であり、ローカルエージェントデプロイに新たな選択肢をもたらす。Simon Willisonは自身のブログで18.16GBの量子化バージョンをコーディングエージェントや画像説明用途でテストし、32GB以上のRAMを搭載したマシンで他のアプリケーションと同時に動作することを確認している。

比較と先例

同モデルはDeepSearch QA、MCP-Atlas、τ-Bench、SWE-Benchなどの全タスクベンチマークで高い成功率を示しており、スキャフォールド内での作業、デバッグコードの記述、複数ターンのリクエスト処理における能力を測定している。ツール使用においては幅広い関数呼び出しを処理でき、拡張ワークフロー内で正確なツール呼び出しが可能となっている。

戦略的評価

現時点の情報に基づけば、Muse Glimmerはローカルエージェントのツールチェーンにおいて迅速な採用が進む可能性が最も高い。

開発者への選定アドバイス:オフライン・マルチエージェント・データ機密性が求められるシナリオでは、量子化バージョンと既存ツールチェーンとの互換性を優先的に検証することを推奨する。エンタープライズにおいては、クラウドソリューションへの切り替えを判断する前に、制御された環境で長コンテキストエージェントタスクの実際のパフォーマンスを検証すべきである。