Specific Labsは2026年9月にReal-SWEベンチマークを公開した。Fable 5.1は実際の企業プライベートコードを用いた10タスクにおいて、解決率わずか38.8%にとどまった。
事実の整理
Real-SWEは実際の企業から提供された10件の本番コードタスクで構成され、請求、税務、データ移行のシナリオを含む。テストは640回のスコアリング全記録を使用し、各タスクを8回実行して平均を取った。Fable 5.1はClaude Codeツールを用いて38.8%を達成し、GPT-6 AstraはCodex CLIで33.8%、Gemini 3.8 FlashはGemini CLIで31.2%を記録した。GLM 5.3は28.8%、Grok 4.6とMuse Spark 1.3は同率で23.8%、Kimi K3は18.8%、GPT-5.6 SolCodex CLIが16.2%で最下位となった。6つのタスクでは全モデルの通過率が15%を下回った。
タスクのコードは使用許諾を得たプライベート本番リポジトリから提供されており、企業固有のルールと複数サービス間のインタラクションを含む。エージェントはAWSシミュレーター、Docker、Kubernetes、PostgreSQL、MongoDBといった環境のほか、SlackやEmailなどのビジネスツールも扱う必要がある。プロンプトは比較的簡潔であり、モデルが自ら実装の詳細を発見することが求められる。
仕組みの分析
公開ベンチマークの多くは専門家が生成または合成したタスクを採用しており、指示が明確でコードも公開されている。一方Real-SWEでは、エージェントが独自アーキテクチャを理解し、ユーザーの依存動作を保持しながら、実際の運用制約の下でコードを修正することが求められる。請求タスクの例では、税率計算、目的地別価格設定、免除顧客の処理、税務機関のサンドボックスまたは本番環境との連携を同時に処理し、複数のサービスファイルを変更することが必要となる。
テストでは統一インターフェースではなくネイティブのツールチェーンを使用し、モデルと実際の開発環境の組み合わせ効果を直接評価する。これによりエンジニアの日常ワークフローにより近い結果が得られる一方、企業固有のコンテキストに対するモデルの理解難度も増幅される。
産業への影響
このベンチマークは、プライベートデータを用いて公開ランキングのスコア過大評価を初めて定量化したものである。モデルは公開評価では優れたパフォーマンスを示す一方、実際の企業タスクでは通過率が全般的に低く、現在の最先端モデルが本番レベルのコード修正を直接担うにはまだ困難があることを示している。コストパフォーマンスの観点では、最も高価なモデルのタスク単位コストはGemini 3.8 Flashの2.50ドルを上回る。
評価業界にとって、方法論の見直し圧力が高まっている。今後のベンチマークは実際の生産性との乖離を縮小するため、プライベートコードリポジトリによる検証へと移行する可能性がある。企業がAIプログラミングツールを採用する際は、公開ランキングよりも実際のシナリオによるテストをより重視するようになるだろう。
戦略的判断(分析であり事実ではない)
現在の結果から見ると、複雑なビジネスルールと複数サービス間インタラクションタスクにおける低通過率は、ベンダーがコンテキスト理解とツールチェーン統合能力の最適化を優先するよう促す可能性がある。長期的には、プライベートベンチマークの登場が業界を公開合成テストからハイブリッド検証モデルへと移行させる可能性があるが、具体的な展開にはさらに多くの類似データによる裏付けが必要である。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接