オリジナル SWE-Gateベンチマーク:機能テストを通過したAIコード修正の34%がコードレビュー制約に違反 2026年9月3日にarXivで公開されたSWE-Gate論文によると、機能テストを通過したAIによるソフトウェア修正の34%がコードレビュー制約に違反しており、既存のベンチマークがAIエージェントの能力を過大評価していることが示された。 AI软件工程 代码审查 基准测试 2026年9月5日 225
レビュー GPT-4o崩壊:エンジニアが最も信頼するAIの判断力が0点に転落 最新のAI評価でGPT-4oがコードのバグ検出テストで100点から0点に転落し、基本的な判断力の喪失という深刻な問題が露呈した。 GPT-4o 编程能力 代码审查 工程实践 2026年3月21日 858