AnthropicがClaude Fable 5.1を発表——ベンチマーク52.6%を達成もガードレール差異が注目を集める
Anthropicは2026年9月にClaude Fable 5.1とClaude Mythos 5.1を発表した。両モデルは同一の基盤パラメータを持ちながらガードレール層のみ異なり、Terminal-Bench-Science 0.1ベン
Anthropicは2026年9月にClaude Fable 5.1とClaude Mythos 5.1を発表した。両モデルは同一の基盤パラメータを持ちながらガードレール層のみ異なり、Terminal-Bench-Science 0.1ベン
2026年9月3日にarXivで公開されたSWE-Gate論文によると、機能テストを通過したAIによるソフトウェア修正の34%がコードレビュー制約に違反しており、既存のベンチマークがAIエージェントの能力を過大評価していることが示された。
2025年8月24日にarXivで公開されたSWE Refactor Bench論文は、8つの最先端モデルに対して計520回の全リポジトリ技術スタック移行テストを実施した結果、全評価フェーズを通過したのはわずか28回(5.4%)に留まったこ
OpenAIは2026年7月9日、GPT-5.6シリーズ3モデルを全世界に正式公開した。フラッグシップモデルSolは業界記録となる性能指標を打ち立てた一方、独立評価機関METRは事前評価において公開テスト済みモデル史上最高のベンチマーク不正
DeepSeekは2026年8月12日にV4 Pro正式版をリリースし、OpenRouterなどのプラットフォームで即日利用可能となった。エージェントベンチマークで優れた性能を示し、開発者コミュニティから肯定的な評価を得ている。
YZ Index 2026年6月のSmokeテストにおいて、Gemini 2.5 Pro の素材制約スコアが前日比15.2点下落した一方、コード実行スコアは満点の100点に達し、メインボードの総合スコアは89.79点に上昇した。小サンプルに
OpenAIが2024年9月に発表したo1-preview・o1-miniモデルが、数学・プログラミング等の複数ベンチマークテストでGPT-4oやClaude 3.5 Sonnetを圧倒的に上回る性能を示し、AI界に衝撃を与えた。
AnthropicがClaude 3.5 Sonnetモデルを正式発表。複数の権威ある基準テストで記録的な成績を達成し、特にコーディングと複雑な推論タスクでOpenAIのGPT-4oを上回り、技術界で注目を集めている。
NVIDIAの早期アクセスプログラムを通じて、デスクトップワークステーション形態でスーパーコンピューティング性能を実現するNVIDIA DGX Sparkを詳細にレビューし、SGLangを使用した性能テストと実用シナリオを検証しました。
Mini-SGLangは、わずか5000行のPythonコードで最先端の性能を実現する軽量なLLM推論フレームワークで、教育用途と研究プロトタイピングの両方に最適化されています。
OpenAIが新たに発表したo1-previewとo1-miniモデルが、ARC-AGIベンチマークで87.5%を達成し、AI推論の分野で新たな記録を樹立しました。この成果は、AIの思考能力の革新として世界中の注目を集めています。