AIベンチマーク比較
376 件の記事
· ページ 1/19
AIモデルベンチマークはモデル選定の基盤です。主要なベンチマークにはMMLU、HumanEval、Chatbot Arena(LMSYS)、SuperCLUE、OpenCompassなどがありますが、多くは選択式問題やモデル相互評価に依存しており、実際の実行能力やハルシネーションリスクを検出できません。YZ指数は独立した第三者ベンチマークで、リアルコードサンドボックス実行、42組の誘導プローブによる誠実性評価、WDCD(Winzheng Dynamic Contextual Decay)指示遵守衰減テストの3つの次元を独自に備え、毎週18の主要モデルを全量評価しています。本トピックではベンチマーク方法論の比較、ランキング変動、詳細分析を収集しています。
Lab 5大モデル翻訳対決:第41週品質評価、deepseek-v4-proが8.7点でトップ
第41週は5つのモデルが476件の翻訳タスクを処理し、抽出した3件のサンプルをマルチモデルブラインド評価した結果、deepseek-v4-proが平均8.7点で最優秀モデルに選ばれた。
レビュー Claude Sonnet 4.6、コード実行スコアが27.4点急落——素材制約は37.7点急騰
本日のSmoke評価テストにおいて、Claude Sonnet 4.6のコード実行スコアが71.90点から44.50点へ27.4点急落した一方、素材制約スコアは50.60点から88.30点へ37.7点急騰した。メインスコアは62.32点から64.21点へわずか1.9点の上昇にとどまった。
レビュー Grok 4のコード実行スコアが31.3点急落、資料制約スコアは34.7点上昇
本日のSmoke評価テストにおいて、Grok 4のコード実行スコアが95.30点から64.00点へ31.3点下落した一方、資料制約スコアは48.40点から83.10点へ34.7点上昇し、総合スコアは74.20点から72.60点へ小幅に低下した。
レビュー Claude Opus 4.7が95.63点で首位:2026-10-05 YZ Index Smoke速報データブリーフィング
2026年10月5日のYZ Index Smoke速測では14モデルを対象に評価が行われ、Claude Opus 4.7が95.63点で当日首位を獲得した。本レポートはコード実行と資料制約の2次元のみを対象とした小サンプルの日次シグナルである。
レビュー 3ラウンドの圧力後に誠実率48.5%:Grok 4は崩壊ゼロ、GPT-o3の崩壊率は20.7%
v2アンカー問題8問のみを対象としたサンプリングにおいて、15モデルの第3ラウンド平均誠実率はわずか48.5%にとどまり、制約の遵守が3回目の圧力後にシステム的に崩れることが明らかになった。Grok 4が崩壊ゼロという優れた結果を示す一方、GPT-o3の崩壊率は20.7%に達した。
レビュー Claude Opus 4.7が81.57点で首位:2026-10-04 YZ Index Smoke簡易テスト日次レポート
2026年10月4日実施のYZ Index Smokeテスト(15モデル対象)において、Claude Opus 4.7が81.57点で当日首位を獲得。Smokeテストは毎日10問の簡易テストであり、短期的なシグナル観察に適しているが、Full週次ランキングの結論とは同一視できない。
レビュー GPT-6.1 Solのメインランキングが9.2点急落、コード実行スコアが1日で16.7点下降
本日のSmoke評価テストにおいて、GPT-6.1 Solのメインランキングスコアが86.25点から77.07点に下落し、コード実行次元では75.00点から58.30点へと16.7点の大幅な低下を記録した。
レビュー Gemini 2.5 Pro、素材制約スコアが28点急落——コード実行は満点100点に
本日のSmokeベンチマークにおいて、Gemini 2.5 Proの素材制約スコアが昨日の100点から72点へ28点下落した一方、コード実行スコアは71.90点から100点へ上昇し、総合スコアは84.55点から87.40点に改善した。
レビュー Claude Opus 4.7が98.65点で首位:2026-10-03 YZ Index Smoke速報データブリーフィング
2026年10月3日のYZ Index Smoke速測では、15モデルを対象にClaude Opus 4.7が98.65点で当日首位を獲得した。Smokeは毎日10問の速測であり、短期的なシグナル観察に適している。
GPT-6.1 Sol「Astraに近い」:公式声明の独立検証
OpenAIが2026年9月29日にDevDayで発表したGPT-6.1 Solについて、「GPT-6 Astraに近い」という公式声明をYZ Indexの18問テストと公開ベンチマークデータから検証した。両モデルの差異はAstra自体の2回実行間のばらつきと同程度であり、現時点では「否定できない」
レビュー Claude Opus 4.7・GPT-5.5・GPT-6 Astra・GPT-6.1 Solが86.25点で並列首位:2026-10-02 YZ Index Smoke速報データブリーフィング
2026年10月2日のYZ Index Smokeテストでは15モデルを対象に評価が行われ、Claude Opus 4.7・GPT-5.5・GPT-6 Astra・GPT-6.1 Solが86.25点で並列首位となった。Smokeテストは日次10問の速報評価であり、短期シグナルの観測に適している。
GPT-6.1 Sol 初回テスト結果の読み方:18問口径の正しい解釈
OpenAIがDevDayで発表したGPT-6.1 Solについて、YZ Indexが18問口径の定向評価(Run #348)を実施し総合スコア95.91を記録した。本稿では、この結果の正しい読み方と統計的限界を解説する。
GPT-6.1 Sol 補足テスト:GPT-6ファミリー4モデルと単回スコアのノイズ
YZ IndexがGPT-6ファミリー4モデル(GPT-6.1 Sol、GPT-6 Astra、GPT-6 Sol、GPT-6 Luna)を同一の18問で比較テストし、単回スコアに含まれるランダム誤差の大きさと、価格差を踏まえたモデル選定の考え方を検証した。
GPT-6.1 Sol 選定ガイド:今すぐ切り替えるべきユーザーと、もう少し待つべきユーザー
GPT-6.1 Sol の利用可能プランとAPIの互換性上の注意点を整理し、個人・チーム・企業・開発者の4カテゴリ別に切り替えの判断基準を提示する。YZ Index Run #348の評価データをもとに、現時点での強みと判断を保留すべき領域を明確にした実践的な選定ガイド。
レビュー GPT-5.5のコード実行スコアが22点急落、素材制約は25.9点急上昇
本日のSmoke評価テストにおいて、GPT-5.5のコード実行スコアが72.00から50.00へと22点下落した一方、素材制約スコアは69.10から95.00へと25.9点上昇した。総合スコアへの影響は限定的で、主要ランキングは70.70から70.25へのわずか0.5点の低下にとどまった。
レビュー Qwen3 Max、コード実行スコアが24点急落——メインランキングも7.4点下落
本日のSmoke評価テストにおいて、Qwen3 Maxのコード実行スコアが94.00点から70.00点へと24点急落し、メインランキングスコアも84.51点から77.16点に低下した。ただし、問題の抽選による変動が主因とみられ、モデル能力の系統的な劣化とは判断しにくい状況だ。
レビュー Doubao Pro が95.52点で首位:2026年10月1日 YZ Index Smoke クイックテストデータ速報
2026年10月1日実施のYZ Index Smokeクイックテストでは、15モデルを対象に評価が行われ、Doubao Proが95.52点で当日首位を獲得した。Smokeは毎日10問のクイックテストであり、短期シグナルの観察に適している。
GPT-6.1 Sol 初回テスト:18問総合95.91、誠実性レイヤーの2問はそれぞれ60点
OpenAIが2026年9月29日のDevDayで発表したGPT-6.1 Solについて、YZ Indexがリリース당日(Run #348)に18問の定向テストを実施し、総合スコア95.91を記録した。実行力・判断力は満点の一方、誠実性圧力レイヤーでは2問が各60点にとどまった。
レビュー WDCD 5シナリオ横断評価:エンジニアリング規範が最低2.45点、DoubaoとClaudeの得意・不得意の差は1.45点
WDCD v3.1の5大制約シナリオ横断評価において、エンジニアリング規範シナリオで全モデルの得点が最低となり、Doubao-proは11モデル中最低の2.45/4を記録した。安全コンプライアンスシナリオでは最大1.2点の差が生じ、モデルごとの得意・不得意の偏りが明確に浮かび上がった。
レビュー GPT-o3のコード実行スコアが21.8点急落、資料制約スコアは33.5点上昇、総合ランキングは小幅上昇
本日のSmokeベンチマークにおいて、GPT-o3のコード実行スコアが93.80点から72.00点へと21.8点下落した一方、資料制約スコアは49.30点から82.80点へと33.5点上昇し、総合スコアは73.78点から76.86点へと小幅に上昇した。