Gemini 3.7 Flashなど複数モデルにエージェント型動画理解機能が登場――Token消費量最大88%削減

2026年9月1日、GoogleはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルに対し、エージェント型動画理解機能を同時リリースした。Gemini APIを通じてGoogle AI Studioおよびエンタープライズプラットフォームで利用可能となり、標準的な動画解析ベンチマークにおいてToken消費量は最大88%、コストは最大66%削減され、精度は最大7%向上した。

事実の整理

今回のアップデートはGemini 3.7 Flash、3.6 Flash、3.5 Flash-Liteの3モデルを対象とする。動画のアップロードおよびYouTube動画の処理に対応しており、開発者はAPI設定でprocessingを「agentic」に指定することで有効化できる。公式ベンチマークによると、長尺動画シナリオで効率改善が最も顕著に現れ、Gemini 3.7 Flashは有効化後に精度とコストのパレート最前線を達成した。

仕組みの解説

従来の静的処理では、固定フレームレート(デフォルト1 FPSなど)で動画ストリームを取り込んでいた。エージェント型動画理解では、モデルが内部ツールのループを通じて、どの区間を視聴するか・どの速度でスキャンするか・映像・音声・字幕のどのチャンネルを選択するかを自律的に判断し、必要なセグメントのみを読み込む。Gemini 3.7 Flashは必要に応じてFPSを動的に調整でき、サブ秒単位の時刻検索や高速な動作カウントを実現しながら、全量のToken消費を回避する。

産業への影響

AIビデオエージェントを構築する開発者にとって、長尺動画の処理コストが大幅に圧縮される。10分のチュートリアルから数時間に及ぶ録画まで、静的処理では高コストとフレーム欠落のトレードオフを迫られることが多かったが、新機能は目的志向のスキャンによってコストを抑えつつ、異常検知や物体カウントなどの用途もサポートする。早期アクセスパートナーは、数時間に及ぶ動画への複雑なクエリにおいてToken削減効果をすでに確認している。

戦略的評価

【分析】Gemini 3.7 Flashがこの機能によって精度―コスト曲線上で占める位置は、動画理解エージェントの開発優先度を変える可能性がある。開発者はインフラではなくモデルの改善により多くの予算を振り向けられるようになるが、実際の導入においては具体的なタスクを通じた長期的な安定性の検証が依然として必要だ。従来の静的処理モデルと比較すると、今回のアップデートは受動的な取り込みから能動的なツール呼び出しへのパラダイムシフトを体現している。

本機能は標準のGemini API料金体系のもとで追加費用なく公開されており、開発者は公式ガイドを参照して迅速に導入できる。