2026年9月30日、arXivに一本の論文が公開された。インド工科大学などの機関に所属する6名の研究者がVideoMSNフレームワークを提案した。画像分類器を改造することなく動画を直接処理でき、動画向けに設計された先行手法を3つの標準ベンチマークすべてで上回り、事前学習コストを100分の1以上削減した。本論文はBMVC 2026に採択されている。
VideoMSN-DINO(ViT-Bサイズ)は、Kinetics-400の行動認識ベンチマークで83.3% top-1精度を達成し、事前学習エポック数はわずか10エポックである。VideoMAEが81.5%を達成するには1600エポック、SMILEが83.1%を達成するには600エポックを要する。UCF101ベンチマークでは、VideoMSNが10エポックで95.4%を達成したのに対し、VideoMAEの91.3%には3200エポックが必要だった。HMDB51では、VideoMSNが10エポックで70.4%を達成し、VideoMAEの62.6%には4800エポックを要している。VideoMSNの浮動小数点演算量はVideoMAEの約1/8.9であり、実時間は12.3倍高速である。
動画を「平坦化」して画像にする
VideoMSNは動画の複数フレームをグリッド状に並べて一枚の大きな画像に合成し、これを「スーパー画像(super image)」と呼ぶ。この操作により3次元時空間データが2次元画像入力に変換され、既製の画像ViTがそのまま処理できるようになる。
同一の動画から生成されたスーパー画像から2つのビューを構築する。一方は空間位置のパッチをマスクし(空間マスク)、もう一方は時間次元の複数フレームをマスクする(時間マスク)。両者の間に情報漏洩はない。共有のViTエンコーダが2つのビューを処理し、マスクドシャムロスによって埋め込みを整合させる。デコーダは不要であり、ピクセルレベルの再構築も行わない。
基盤エンコーダにはMetaのDINO-v3とDeiT-v3を採用している。DINO-v3は2025年夏に公開され、70億パラメータの教師モデルを17億枚の画像で学習した、最も性能の高い画像自己教師あり視覚エンコーダの一つである。VideoMSNはこれらのエンコーダを基盤として動画ファインチューニングを行い、画像理解の事前知識を時系列シナリオへ転移する。
直感に反する結果
動画理解分野における過去10年の主流的見解は、画像モデルは運動を真に理解できず、3次元畳み込みや時系列アテンションの導入が必須であるというものだった。VideoMAEやTimeSformerなどの手法はこの方針に沿ってアーキテクチャを設計している。VideoMSNの実験結果はこの見解と矛盾する。
複数フレームを同一のスーパー画像に並べると、空間上の相対位置が時系列情報を保持し、フレーム間の位置関係が運動方向や速度変化を暗黙的にエンコードする。ViTのグローバルアテンション機構が2次元平面内でパッチ間の関係を捉えることで、フレーム横断の運動パターンを学習できる。時間マスクはフレームの一部が欠損した状態で埋め込みを再構築することをモデルに強制し、エンコーダにフレーム間の連続性を学習させる。
VideoMSNは画像モデルを改造するのではなく、動画の問題を画像モデルがすでに得意とする問題として再定式化した。
効率性の源泉
VideoMSNの効率性は3つの要因に由来する。DINO-v3などのエンコーダが大量の画像から堅牢な視覚的意味論をすでに学習しているため、動画ファインチューニングでは時系列情報の補完のみが必要である。デコーダが不要であり、VideoMAEのマスク領域ピクセル再構築に伴う計算を省ける。スーパー画像が複数フレームを一度のフォワード計算にまとめるため、フレームごとに処理する3D方式よりバッチ効率が高い。
VideoMAEがKinetics-400で競争力のある水準に達するにはデフォルトで800エポック、最良の構成では1600エポックを要する。VideoMSNは同じViT-Bサイズで、10エポックでVideoMAE 1600エポックの精度を上回る。UCF101とHMDB51での差はさらに大きい。学習サンプル数が1000件のみのUCF101低データ実験では、VideoMSN-DINOが89.0%を達成し、SMILEを2.6ポイント上回った。
計算資源の参入障壁の変化
動画自己教師あり学習における計算資源の要求は、スケールアップの主要な障壁となっている。VideoMAEがKinetics-400で800エポックの事前学習を完了するには数十GPU時間を要し、数千エポックのシナリオでは数千ドルのコストに達するため、この分野の研究は主に大規模な研究機関に限定されてきた。
VideoMSNの効率向上により、コンシューマー向けGPU1枚で1日以内に動画自己教師あり事前学習を完了することが理論上可能となる。この結果がより広いシナリオで検証されれば、産業界のカスタム動画モデルへの需要がより低い計算予算で満たされるようになるだろう。
現在の限界
本論文はKinetics-400、UCF101、HMDB51の3つの行動認識ベンチマークに焦点を当てている。これらのデータセットの動画クリップは通常10秒未満で、行動カテゴリが明確である。スーパー画像は短い動画・集中した行動シナリオでは時系列構造を効果的にエンコードするが、数分に及ぶ複雑なシナリオ動画における性能については実証データが欠如している。
DINO-v3の事前学習データはインターネット上の画像が主体であり、赤外線・超音波・衛星画像など非自然画像の動画ドメインへ転移した際の性能については追加検証が必要である。
結論
VideoMSNは、適切な入力表現のもとで画像ViTが最小限の専用学習により動画の時空間情報を効果的にエンコードできることを実証した。10エポック対1600エポック、83.3%対81.5%という結果は、標準ベンチマーク上で誤差の範囲内として説明することはもはや困難である。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接