Real-SWEベンチマーク公開:Fable 5.1のプライベートコード解決率はわずか38.8%
Specific Labsが2026年9月に公開したReal-SWEベンチマークでは、実際の企業プライベートコードを用いた10タスクにおいて、最高性能のFable 5.1でも解決率が38.8%にとどまり、現行の最先端モデルが本番環境レベルの
Specific Labsが2026年9月に公開したReal-SWEベンチマークでは、実際の企業プライベートコードを用いた10タスクにおいて、最高性能のFable 5.1でも解決率が38.8%にとどまり、現行の最先端モデルが本番環境レベルの
テンセント混元チームが770BパラメータのMoEモデル「Hy4 Preview」を正式に発表・オープンソース化し、Terminal Bench 2.1でDeepSeek V4 Proを超えClaude Opus 5と同等のスコアを記録した。
ERNIE Bot 4.0がPythonの基礎的な辞書内包表記で完全に失敗し、リスト形式で出力した上に謎の数字まで追加するという前代未聞のAI劣化事例が発生した。
AnthropicがClaude 3.5 Sonnetモデルの大幅アップデートを発表し、コード生成ベンチマークテストでOpenAIのGPT-4oを全面的に上回り、現在最強のコードAIアシスタントとなった。
Claude 3.5 SonnetがSWE-bench基準テストでGPT-4oを超える成果を上げ、AIコード生成分野で注目を集めています。強化学習を活用したこのモデルは、開発者にとってより信頼性の高いプログラミングアシスタントとしての地位を