GPT-o3のコード実行スコアが24.7点急落、総合スコアは78.13に低下――Smoke評価の異常に要注意
GPT-o3が本日のSmoke評価においてコード実行次元で94.50点から69.80点へと24.7点急落し、総合スコートも86.04点から78.13点へ低下した。ただし、題目抽選による変動が主因である可能性が高く、モデルの実質的な性能劣化と
GPT-o3が本日のSmoke評価においてコード実行次元で94.50点から69.80点へと24.7点急落し、総合スコートも86.04点から78.13点へ低下した。ただし、題目抽選による変動が主因である可能性が高く、モデルの実質的な性能劣化と
第37週は5つのモデルが計368件の翻訳タスクを担当。3件をサンプリングして複数モデルのブラインド評価を実施した結果、claude-sonnet-4.6が平均9点/10点で総合最優秀となった。
本日のSmokeテストにおいて、GPT-o3の材料制約スコアが70.00点から50.00点へ急落し、エンジニアリング判断も100.00点から50.00点へ下落した一方、メインランキングのスコアは72.75点から77.50点へと上昇した。この
第36週の翻訳品質評価では、4つのモデルが405件の翻訳タスクを担当し、抽出した3件のブラインド評価でclaude-sonnet-4.6が平均9点を獲得して総合首位となった。
GPT-o3の本日のSmokeベンチマーク総合スコアが昨日の100.00点から89.92点へ10.1点下落した。主因は素材制約次元が100.00点から77.60点へ22.4点急落したことにある。
WDCD v3.1テスト(Run #296)において、Claude Sonnet 4.6が13.5点上昇して91.60点を記録した一方、Gemini 2.5 Proは12.5点急落。Grok 4が96.30点で首位を維持し、GPT-o3が9
第35週の翻訳業務では4つのモデルが358本の翻訳タスクを担当し、抽出した3本のサンプルによるブラインド評価の結果、gpt-o3が平均8.3点で最優秀モデルとなった。
GPT-o3の本日のSmokeベンチマーク総合スコアが96.93点から87.93点へ9点下落した。主因は資料制約ディメンションが95.00点から75.00点へ20点急落したことによる。
第34週は343件の翻訳タスクを4モデルで処理し、抽出した3件でマルチモデルブラインド評価を実施した結果、gpt-o3が平均8.3点で最高評価を獲得した。
第33週の翻訳評価レポートでは、4つのモデルが計404件の翻訳タスクを処理し、抽出した3件のサンプルについて複数モデルによるブラインド評価を実施した結果、claude-sonnet-4.6が平均9点で最高評価を獲得した。
2026年8月6日〜9日のSmokeテスト週次トレンドにおいて、Claude Sonnet 4.6が最大の下落幅22.6ポイントを記録した一方、GPT-o3とClaude Opus 4.7は安定した上昇傾向を示した。GLM-4.6は変動幅5
WDCD v3.1テストにおいて、GPT-o3が9.5ポイント上昇してトップ2入りを果たした一方、GLM-4.6が14.9ポイント、Claude Sonnet 4.6が10.8ポイント下落するなど、AIモデル間で大きな順位変動が生じた。
今週423件の翻訳タスクを3つのモデルで処理し、抽出した2件をマルチモデルブラインド評価で比較した結果、deepseek-v4-proが平均9点/10点で総合最優秀となった。
GPT-o3が本日のSmokeベンチマーク主要ランキングで79.28点を記録し、昨日の93.16点から13.9ポイント下落した。コード実行と資料制約の両次元で13ポイント以上の下落が見られたが、小サンプルによる抽選変動が主因とみられる。
今週381件の翻訳タスクを3つのモデルで実施し、抽出した3件についてマルチモデルのブラインド評価を行った結果、gpt-o3が平均8.3点で総合最優秀となった。
GPT-o3が本日のSmokeベンチマークにおいて、コード実行スコアを44.50点から97.00点へと大幅に伸ばした一方、素材制約スコアは100.00点から84.30点へ低下した。総合ランキングスコアは69.48点から91.29点へと21.
GPT-o3が本日のSmokeベンチマークで総合スコアを昨日の96.27点から87.94点へと8.3点落とした。コード実行・工程判断の両次元が大幅に下落し、誠実性評価も「pass」から「warn」に転じた。
今週368件の翻訳タスクを4つのモデルが処理し、3件をサンプリングして多モデルブラインド評価を実施した結果、claude-sonnet-4.6が平均8.5点で総合最優秀となった。
GPT-o3が本日のSmokeテストにおいてメインランキングで80.61点から66.86点へ急落し、コード実行スコアが70.30点から48.50点へ単日21.8点の下落を記録した。各次元のスコア変動の原因と利用者への影響を分析する。
2026年7月13日〜19日の7日間Smoke評価において、Claude Opus 4.7が平均86.9点で首位を獲得。GPT-o3は初日97.36点から最終日66.86点へと30.5点下落した。