EmbeddingGemma 2発表:7.4億パラメータで5モダリティを統合、オープンソースのエッジ側埋め込みモデルが新段階へ

2026年10月6日、Google DeepMindはEmbeddingGemma 2を発表した。同社初のネイティブマルチモーダルオープンソース埋め込みモデルであり、エッジデバイスでのローカル実行を専門に設計されている。総パラメータ数は7億4,000万で、テキスト・コード・画像・動画フレーム・音声の5つのモダリティを同一の768次元ベクトル空間に統合してマッピングする。Apache 2.0ライセンスのもとで公開され、即日よりHugging FaceおよびKaggleからダウンロード可能となっている。

EmbeddingGemma 2はGemma 4をベースに構築され、独立したモジュール式エンコーダ構造を採用している。7億パラメータの総量は3つの独立したコンポーネントで構成される:2億7,000万パラメータのテキストモデル(1億3,000万パラメータのTransformerバックボーンと1億4,000万パラメータの埋め込み層を含む)、1億7,000万パラメータのビジョンエンコーダ、および3億パラメータの音声エンコーダである。3つのエンコーダはそれぞれ独立しているが、同一の768次元出力空間を共有している。

実際の展開時、開発者は必要な部分のみをロードできる:テキストとコードのみのシナリオでは2億7,000万パラメータのロードで足り、テキスト+ビジョンは4億4,000万、テキスト+音声は5億7,000万、全モダリティで完全な7億4,000万となる。Google Pixel 11 Proでは、テキストモードで必要なアクティブメモリは約191MB、全モダリティ構成では約567MBとなる。

この設計により、従来は画像キャプションモデル・音声テキスト変換モデル・テキスト埋め込みモデルの3本の独立したパイプラインを直列接続する必要があったプロセスが、1つの共有ベクトル空間に圧縮された。開発者は1つのモデルを呼び出すだけで、クエリとコンテンツを同一空間内で直接コサイン類似度を比較できる。

8,192トークンウィンドウにどれだけのコンテンツが収まるか

モデルのコンテキストウィンドウは8,192トークンで、第1世代EmbeddingGemmaの4倍となる。モダリティごとのトークン消費率は明確な固定比率が定められている:画像1枚あたり280トークン、動画フレーム1枚あたり140トークン、音声1秒あたり25トークンとなる。この換算に基づくと、1回の入力で最大29枚の画像、58動画フレーム、または5.5分の音声を収容できる。テキスト・画像・音声を混在させた入力も可能で、画像の位置はプレースホルダーでマークされる。

コンテキスト容量の拡大により、「音声メモで特定の動画クリップを検索する」といった操作を複数ステップに分割することなく、単一の推論内で完結させることが可能となった。

過小評価されているゼロショットルーティング能力

EmbeddingGemma 2は、ユーザー入力を分類ラベルや説明と直接マッチングでき、トレーニングデータやファインチューニングを一切必要とせず、ミリ秒レベルのレイテンシでゼロショットの意図ルーティングを実現する。これにより、超低レイテンシなエッジ側の意思決定エンジンとして機能し、ユーザー入力がどの意図カテゴリに属するかを判断した上で対応するローカルワークフローをトリガーする。この全プロセスはクラウドを経由しない。

ベンチマーク:優位点と弱点

Googleの公式モデルカードのデータによると、EmbeddingGemma 2のコード検索におけるMTEB Codeスコアは第1世代の68.76から78.68に向上し、9.92ポイントの上昇を記録した。多言語テキストでは、MTEB多言語v2スコアが61.36で第1世代と同水準を維持している。その他のモダリティのスコアは:MIEB lite 64.64、MMEB v2画像検索57.28、ビジュアル文書検索67.84、動画検索50.67、MSEB音響検索69.54、MAEB音声タスク49.39となっている。

同モデルはパラメータ数10億以下のマルチモーダル埋め込みモデルの中でトップレベルに達しており、一部の専門タスクでは自身の2倍以上の規模を持つ専用モデルを上回っている。競合製品との横断比較では、アリババのQwen3-VL-Embedding-8BがMMEB-V2で77.8点を達成しているが、パラメータ数は約80億と、EmbeddingGemma 2の11倍となっている。

動画検索の50.67点は現在の各評価項目の中で最も低いスコアであり、音声の2項目はスコアの分布が広く(MSEB 69.54対MAEB 49.39)、音声タスクの種類によってパフォーマンスに差がある。

前世代モデルの2,000万ダウンロードというベース

2025年にリリースされた第1世代EmbeddingGemmaはすでに2,000万ダウンロードを超えており、主な利用シナリオはエッジ側検索ツールとプライバシーを重視したRAG(検索拡張生成)パイプラインに集中している。第1世代はテキスト埋め込みのみをサポートしていた。今回のマルチモーダルへのアップグレードは、市場需要が実証済みのダウンロードベースの上に展開される拡張となる。

EmbeddingGemmaはエッジ側テキスト埋め込み分野において一定の開発者慣性を築いており、EmbeddingGemma 2は同一チェックポイント内で直接マルチモーダル能力を提供することで、インターフェースの習慣を変えずに移行コストを低減している。

今後数週間:ML KitとNPUアクセラレーション

Google AI Edgeチームは、今後数週間以内にML KitをとおしてEmbeddingGemma 2をAndroid開発者向けサービスとして提供し、NPUアクセラレーションを有効化することで、より幅広いデバイス機種をカバーする計画を明らかにした。NPUアクセラレーションにより推論時の消費電力とレイテンシがさらに低下し、バッテリー容量が限られたスマートフォンデバイスにとって特に重要な意味を持つ。

ML KitはAndroid開発者が最もよく利用する機械学習統合フレームワークの1つであり、開発者がモデルの展開を手動で管理する必要がない。EmbeddingGemma 2がML Kitサービスとして提供されれば、ターゲットユーザーが機械学習エンジニアからより広範なAndroidアプリ開発者コミュニティへと拡大することになる。

評価

EmbeddingGemma 2が解決するコアな課題は、エッジ側マルチモーダル検索をエンジニアリングの観点から実現可能にすることである。従来、スマートフォン上でテキスト・画像・音声の統合ローカル検索を実現するには、複数のモデルを維持し、複数の推論パイプラインを調整する必要があり、開発の複雑さはほとんどのアプリケーションチームの許容範囲をはるかに超えていた。EmbeddingGemma 2はこの複雑さを567MBのモデルファイル1つとApache 2.0ライセンスに圧縮した。

EmbeddingGemma 1の2,000万ダウンロードは、エッジ側埋め込みへの需要が実在することを示している。EmbeddingGemma 2はこの需要をテキストから5つのモダリティへと拡張した。動画検索スコアの低さと音声タスクのパフォーマンスのばらつきは、この統合ベクトル空間が時系列的に密度の高いコンテンツを処理する際にはまだコストが伴うことを示唆している。