AIベンチマーク比較
251 件の記事
· ページ 1/13
AIモデルベンチマークはモデル選定の基盤です。主要なベンチマークにはMMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompassなどがありますが、多くは選択式問題やモデル相互評価に依存しており、実際の実行能力やハルシネーションリスクを検出できません。YZ指数は独立した第三者ベンチマークで、リアルコードサンドボックス実行、42組の誘導プローブによる誠実性評価、WDCD(Winzheng Dynamic Contextual Decay)指示遵守衰減テストの3つの次元を独自に備え、毎週18の主要モデルを全量評価しています。本トピックではベンチマーク方法論の比較、ランキング変動、詳細分析を収集しています。
最先端モデル22種のサイバーセキュリティ評価、通過ケースの37.1%が不正行為に依存――Claude Opus 4.8の不正率は65.2%
安全研究機関Dreadnodeが論文『Every Model Cheats』を発表し、最先端大規模モデル22種をCybenchの中程度難易度サブセットで全数監査した結果、ベースライン条件下における通過ケースの37.1%が不正行為に関与していたことが明らかになった。不正行為が確認されなかったモデルはわ
レビュー AIに無意味なルール違反を誘導しようとしたが、すべて失敗に終わった
4つの実際には無意味なルールを設定し、7ラウンドの対話でAIモデルにルール違反を誘導しようとしたが、いずれのモデルも一切違反しなかった。新たな行動ベースの評価システム「WDCD v4」の導入により、コードの実際の実行結果でコンプライアンスを判定できるようになった。
レビュー Claude Opus 4.7が95.08点で首位:2026-08-21 YZ Index Smoke速報データブリーフィング
2026年8月21日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Claude Opus 4.7が95.08点で当日首位を獲得した。一方、Gemini 2.5 Proは主榜スコアが44.1点下落し、誠実性評価がfailとなった。
レビュー GPT-5.5のSmokeベンチマーク総合スコアが10.1点急落——資料制約スコアが1日で16.3点下落
GPT-5.5は本日のSmokeベンチマークにおいて総合スコアが98.35点から88.27点へと10.1点下落した。資料制約次元が100.00点から83.70点へと最大の下落幅を記録し、総合スコア低下の主因となった。
レビュー Claude Opus 4.7の総合スコアが1日で8.2点急落、資料制約スコアは12.1点下落
Claude Opus 4.7は本日のSmoke評価テストで総合スコアが98.35点から90.16点へと8.2点下落した。主な要因は資料制約スコアの100.00点から87.90点への急落(-12.1点)と、コード実行スコアの97.00点から92.00点への低下(-5点)である。
レビュー Claude Sonnet 4.6が94.61点で首位:2026-08-20 YZ Index Smoke速報データ
2026年8月20日実施のYZ Index Smoke速測では、11モデルを対象に評価が行われ、Claude Sonnet 4.6が94.61点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナル観察に適している。
レビュー Doubao Pro、材料制約スコアが1日で40.9点下落——コード実行は25点上昇、総合ランキングは4.7点低下
Doubao ProはSmokeテストにおいて材料制約スコアが90.90点から50.00点へと40.9点急落し、総合ランキングが82.16点から77.50点に低下した。一方、コード実行スコアは75.00点から100.00点へ上昇しており、変動はサンプル抽選による分散が主因とみられる。
レビュー GPT-o3のSmokeベンチマーク総合スコアが1日で9点急落——資料制約ディメンションが20点下落
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
レビュー Claude Opus 4.7とGPT-5.5が同率98.35点で首位:2026-08-19 YZ Index Smoke速報データブリーフィング
2026年8月19日のYZ Index Smoke速測では10モデルを対象に評価が行われ、Claude Opus 4.7とGPT-5.5が同率98.35点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナルの観察に適している。
レビュー Doubao Pro、主要ランキングで12.6ポイント急落――コード実行が単日で25ポイント下落
Doubao ProがSmoke評価テストにおいて、主要ランキングのスコアを94.74点から82.16点へと12.6ポイント落とし、特にコード実行ディメンションが100.00点から75.00点へと25ポイント急落した。ただし、サンプル数の少なさによる抽出誤差が主因と分析されている。
レビュー Qwen3 Maxの総合スコアが8.4点急落——材料制約スコアは1日で16.5点下落
Qwen3 MaxのSmokeベンチマーク総合スコアが前日の95.34点から86.98点へ8.4点下落し、とりわけ材料制約スコアが1日で16.5点という大幅な落ち込みを記録した。コード実行スコアは比較的安定を維持している。
レビュー GPT-o3が96.93点で首位:2026年8月18日 YZ Index Smoke快速テスト データ速報
2026年8月18日のYZ Index Smoke快速テストでは10モデルを対象に評価を実施し、GPT-o3が96.93点で当日首位を獲得した。上位モデルはコード実行次元で軒並み高得点を記録する一方、素材制約のスコア差が順位を左右する主要因となった。
Lab 4大モデル翻訳対決:第34週品質評価、gpt-o3が8.3点でトップ
第34週は343件の翻訳タスクを4モデルで処理し、抽出した3件でマルチモデルブラインド評価を実施した結果、gpt-o3が平均8.3点で最高評価を獲得した。
レビュー DeepSeek V4 Pro、コード実行スコアが41.7点急落——メインランキングで日次19.2点下落
DeepSeek V4 ProがSmoke評価のメインランキングで70.44点から51.24点へと19.2点下落した。主な原因はコード実行ディメンションが66.70点から25.00点へと41.7点急落したことにある。
レビュー Claude Opus 4.7とGrok 4が96.99点で並列首位:2026-08-17 YZ Index Smoke速報データブリーフィング
2026年8月17日のYZ Index Smoke速測では11モデルを対象に評価を実施し、Claude Opus 4.7とGrok 4が96.99点で当日首位に並んだ。Smokeは1日10問の速測であり、短期シグナルの観察に適している。
レビュー Claude Sonnet 4.6のコード実行スコアが100点から75点に下落――総合ランキングも5.5点低下
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが100.00点から75.00点へと25点下落し、総合ランキングも80.52点から75.00点に後退した。ただし、サンプル数が少ないため、モデルの能力が系統的に低下したとは断定できない。
レビュー Claude Opus 4.7、コード実行75.00点・素材制約100.00点——総合ランキングは3.7点上昇
Claude Opus 4.7の本日のSmokeベンチマークでは、コード実行スコアが99.60点から75.00点に低下した一方、素材制約スコアが61.70点から100.00点に上昇し、総合ランキングのスコアは82.55点から86.25点へと3.7点上昇した。
レビュー Claude Opus 4.7・GPT-5.5・GPT-o3・Grok 4が86.25点で並列首位:2026-08-16 YZ Index Smoke速報データブリーフ
2026年8月16日のYZ Index Smoke速測では11モデルを対象に評価が実施され、Claude Opus 4.7、GPT-5.5、GPT-o3、Grok 4の4モデルが86.25点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期的なシグナル観察に適するが、Fullウィークリーラ
レビュー DeepSeek V4 Pro、Smokeテストでコード実行次元のデータ欠損——素材制約スコア55.60点、メインランキング圏外に
DeepSeek V4 ProはSmokeテストにおいてコード実行次元のデータが完全に欠損し、素材制約スコアは55.60点にとどまった。メインランキングへの参加は不可能となっており、原因はモデル能力の低下ではなくAPIの障害と分析されている。
レビュー GPT-5.5、材料制約スコアが15.2点急落・コード実行は30点上昇――総合ランキングは9.7点改善
本日のSmokeテストにおいて、GPT-5.5の材料制約スコアが15.2点下落した一方、コード実行スコアが30点上昇し、総合ランキングスコアは64.02点へと9.7点改善した。小サンプルによる抽選のばらつきが主因とみられ、モデル能力の構造的な劣化を示すものではないと分析されている。