Cognitionは2026年9月10日にSWE-2プログラミングモデルを発表した。月之暗面がオープンソース化したKimi K3(2.8兆パラメータMoE)をベースモデルとして採用し、強化学習によるファインチューニングを経て、FrontierCode 1.1 Mainベンチマークで50.0%を記録した。Anthropic Fable 5.1との差は1ポイント未満でありながら、実行コストは64%低い。
事実の整理
Cognitionの公式ブログによると、SWE-2はKimi K3をベースに後学習を施したモデルであり、同ベースモデルにはすでに大規模なエージェントコーディング強化学習が行われている。SWE-2はFrontierCode 1.1 Mainで50.0%、DeepSWE 1.1で73.0%、Terminal-Bench 2.1で92.8%、Terminal-Bench 4で27.3%を記録した。Kimi K3のオリジナル性能と比較して、それぞれ5.8、4.5、4.5、5.8ポイントの向上を達成している。また、複数のベンチマークでSWE-1.7およびGrok 4.6を上回り、スコアとコストの両面で後者より優れた結果を示している。
技術メカニズムの解説
学習においては線形コストペナルティ機構を導入し、単一のRLラン内で異なる努力レベルに対してペナルティを課す。ペナルティ値はベースモデルのパレートフロンティアの局所的な傾きに基づいて調整される。この手法は、コストパフォーマンスフロンティア全体を前進させながらその形状を維持することを目的としている。報酬ベースラインには長さ加重方式を採用し、学習の安定性を確保している。ロールアウトサービスはスケジューリング最適化とオンラインドラフトモデルによりデコードスループットを向上させ、NVFP4/FP8カーネルと量子化対応学習を組み合わせることで、パラメータ規模がSWE-1.7の約3倍に達するにもかかわらず、学習と推論のミスマッチをより低く抑えている。学習データ量は3倍に拡大され、過去のチェックポイントに基づく反復検証フライホイールも構築されている。
産業への影響
今回の発表は、中国のオープンソースベースモデルと米国のファインチューニングチームを組み合わせる手法の実現可能性を示している。SWE-2はフロンティアに近いスコアを維持しながらコストを大幅に削減しており、コードエージェント分野におけるコストパフォーマンスのトレードオフ空間を変えつつある。Fable 5.1やGPT-5.6 Solなど既存モデルは、同等の性能における価格優位性が薄れており、市場は兆パラメータ規模モデルの商業化における参入障壁を再評価する可能性がある。
戦略的考察
【分析であり事実ではない】RLが初めて公開の場で兆パラメータ規模へ拡張されたことは、大規模強化学習のスケーラビリティに関する業界での検証を加速させる可能性がある。類似のコストペナルティ手法が広く採用されるようになれば、コードモデルのパレートフロンティアの再編により、開発者のコストパフォーマンスへの期待が塗り替えられる可能性があるが、実際の効果については今後の多様なシナリオでの検証が引き続き必要である。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接