AIベンチマーク比較

218 件の記事 · ページ 1/11
AIモデルベンチマークはモデル選定の基盤です。主要なベンチマークにはMMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompassなどがありますが、多くは選択式問題やモデル相互評価に依存しており、実際の実行能力やハルシネーションリスクを検出できません。YZ指数は独立した第三者ベンチマークで、リアルコードサンドボックス実行、42組の誘導プローブによる誠実性評価、WDCD(Winzheng Dynamic Contextual Decay)指示遵守衰減テストの3つの次元を独自に備え、毎週18の主要モデルを全量評価しています。本トピックではベンチマーク方法論の比較、ランキング変動、詳細分析を収集しています。
レビュー Claude Sonnet 4.6、コード実行スコアが19.5点急落——メインランキングは逆に13.8点上昇
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが94.50点から75.00点へと19.5点下落した一方、資料制約スコアは43.30点から97.80点へと急上昇し、メインランキング総合スコアは71.46点から85.26点へと13.8点上昇した。
2026/08/08
レビュー Claude Opus 4.7とGPT-o3が97.66点で並列首位:2026-08-08 YZ Index Smoke速報データ
2026年8月8日実施のYZ Index Smokeテストで、Claude Opus 4.7とGPT-o3が97.66点で並列首位となった。9モデルを対象とした当日の速報データを報告する。
2026/08/08
レビュー Grok 4、マテリアル制約スコアが17.6点急落――総合ランキングは1.8点減にとどまる
本日のSmoke評価において、Grok 4のマテリアル制約スコアが82.60点から65.00点へと17.6点急落した一方、総合ランキングは82.99点から81.23点へと1.8点の小幅な低下にとどまった。
2026/08/07
レビュー Gemini 2.5 Pro が87.21点で首位:2026年8月7日 YZ Index Smoke クイックテスト データブリーフ
2026年8月7日実施のYZ Index Smokeクイックテストでは、9モデルを対象にGemini 2.5 Proが87.21点で当日首位を獲得した。本テストは1日10問の小規模サンプルによる監視シグナルであり、週次フルランキングの結論とは同一視できない。
2026/08/07
レビュー GLM-4.6のSmokeテスト:資料制約71.90点、コード実行と誠実性の2次元が完全欠損
GLM-4.6の本日のSmokeテストでは、資料制約71.90点・エンジニアリング判断63.90点・タスク表現50.00点を記録したが、APIの障害またはタイムアウトによりコード実行と誠実性の2次元のデータが完全に欠損し、メインランキングへの参加は行われなかった。
2026/08/06
レビュー Claude Sonnet 4.6とDeepSeek V4 Proが92.17点で並列首位:2026-08-06 YZ Index Smoke速報データ
2026年8月6日のYZ Index Smoke速測では9モデルを対象に評価が行われ、Claude Sonnet 4.6とDeepSeek V4 Proが92.17点で当日首位に並んだ。Smokeは1日10問の速測であり、短期的なシグナル観察に適しており、週次Full評価の結論とは同一視できない。
2026/08/06
レビュー WDCD三ラウンド減衰分析:R3誠実率はわずか54.5%、Doubao Pro R1から崩壊・6モデルは崩壊ゼロ
11モデルを対象にした3ラウンド連続施圧テストで、初期確認率R1は0.91だったものの、R3誠実率は54.5%まで低下し、約束遵守能力の系統的な減衰が明らかになった。Doubao ProはR1から崩壊した一方、DeepSeek V4 ProはR3で満点を記録した。
2026/08/05
レビュー DeepSeek V4 Pro・GPT-5.5・GPT-o3が80.52点で並列首位:2026年8月5日 YZ Index Smoke速報データ
2026年8月5日のYZ Index Smoke速測では9モデルを対象に評価が行われ、DeepSeek V4 Pro、GPT-5.5、GPT-o3が80.52点で当日首位に並んだ。Smokeは毎日10問の速測であり、短期シグナルの観察に適しており、Full週間ランキングの結論とは同一ではない。
2026/08/05
レビュー GLM-4.6 Smokeテスト評価:材料制約51.80点・タスク表現50.00点、API障害により2次元のデータ欠損
GLM-4.6は本日のSmokeテスト評価においてAPI障害・タイムアウトにより「実行(execution)」と「判断(judgment)」の2次元データが欠損し、自動再実行待ちのため今回のメインランキングには参加しない。材料制約次元は51.80点、タスク表現次元は50.00点を記録した。
2026/08/04
レビュー Doubao Pro のSmoke評価で5次元全スコアゼロの異常——APIタイムアウトが主因
Doubao ProがSmoke評価においてexecution・grounding・judgment・integrity・communicationの5次元すべてでスコアが欠落し、メインランキングから除外された。原因はモデル能力の低下ではなく、APIタイムアウトによるインターフェース障害と判断されて
2026/08/04
レビュー Gemini 2.5 Proが89.56点で首位:2026年8月4日 YZ Index Smoke速報データブリーフィング
2026年8月4日実施のYZ Index Smokeクイックテストでは9モデルを対象に評価が行われ、Gemini 2.5 Proが89.56点で当日首位を獲得した。本テストはコード実行と資料制約の2次元を対象とした毎日10問形式のクイックテストで、短期的なシグナル観測に適している。
2026/08/04
Lab 3大モデル翻訳対決:第32週品質評価、deepseek-v4-proが9点でトップ
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
2026/08/03
レビュー Claude Opus 4.7が95.19点で首位:2026-08-03 Smokeクイックテストデータ速報
2026年8月3日のYZ Index Smokeクイックテストでは、11モデルを対象に評価が行われ、Claude Opus 4.7が95.19点で当日首位を獲得した。本速報はあくまで短期シグナルの観測を目的としており、週次Full評価の結論とは同等ではない。
2026/08/03
レビュー GLM-4.6、Smoke評価メインランキング74点——コード実行82.3点、素材制約95点、API障害で一部ディメンション欠損
GLM-4.6が本日のSmoke評価でメインランキング74.00点を記録。コード実行82.30点・素材制約95.00点を獲得したものの、API障害・タイムアウトにより2つのディメンションのデータが欠損し、今回のランキングには参加しない。
2026/08/02
レビュー Doubao Proが96.7点で首位:2026-08-02 YZ Index Smoke速報データブリーフィング
2026年8月2日実施のYZ Index Smoke速測(10モデル対象)において、Doubao Proが96.7点を獲得し当日首位となった。Smokeは毎日10問の速測であり、短期シグナルの観察に適している。
2026/08/02
レビュー GLM-4.6、材料制約スコアが27.3点急落——メインランキングは逆に30.2点上昇
本日のSmokeベンチマークにおいて、GLM-4.6の材料制約スコアが75.00点から47.70点へ下落した一方、コード実行スコアが100点満点を記録し、メインランキングは46.29点から76.47点へと上昇した。誠実性評価はpassからwarnに変化した。
2026/08/01
レビュー GPT-o3、本日のSmokeベンチマーク主要ランキングで13.9ポイント急落――コード実行と資料制約の両次元で低下
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
2026/08/01
レビュー Claude Opus 4.7とQwen3 Maxが同点93.39点で首位:2026-08-01 YZ Index Smoke速報データ
2026年8月1日のYZ Index Smoke速測では11モデルを対象に評価が行われ、Claude Opus 4.7とQwen3 Maxが93.39点で同点首位となった。GLM-4.6は誠実性評価がwarnに転落するなど、複数モデルで大幅な変動が観測された。
2026/08/01
レビュー Qwen3 Max、材料制約スコアが20点急落し47.70点に——コード実行は37.8点急騰、メインランキングは11.8点上昇
Qwen3 MaxはSmoke評価において、材料制約スコアが前日の67.70点から47.70点へ20点急落した一方、コード実行スコアは54.70点から92.50点へ37.8点急騰し、メインランキング総合スコアは60.55点から72.34点へ上昇した。
2026/07/31
レビュー Grok 4、コード実行スコアが19.5点急落――資料制約は23.2点上昇、総合ランキングは0.3点減にとどまる
本日のSmokeテストにおいて、Grok 4のコード実行スコアが92.00点から72.50点へ19.5点急落した一方、資料制約スコアは60.90点から84.10点へ23.2点上昇し、総合ランキングスコアは78.01点から77.72点へわずか0.3点の微減にとどまった。
2026/07/31