7モデルのWDCD守約スコアが集団下落、Claude Sonnet 4.6のみ8.6点逆上昇
WDCD v3.1テストにおいて、Claude Sonnet 4.6が前回比8.6点上昇した一方、7モデルが一斉に下落し、GLM-4.6は27点、Gemini 2.5 Proは23.8点の大幅下落を記録した。
WDCD v3.1テストにおいて、Claude Sonnet 4.6が前回比8.6点上昇した一方、7モデルが一斉に下落し、GLM-4.6は27点、Gemini 2.5 Proは23.8点の大幅下落を記録した。
11のAIモデルを対象にWDCD(Will Do, Can Do)評価の8問v2アンカー問題でサンプリングを実施した結果、R1確認率は全モデル100%だったが、R3誠実率は平均49.5%にとどまり、29/319回の完全崩壊が確認された。二ラ
8問のv2アンカー問題を対象としたテストにおいて、11の評価対象モデル全てでR1確認率・R2抵抗率・R3誠実率がすべて0%となり、3段階の漸進的プレッシャー下で約束を守れたモデルは皆無だった。
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
8問のv2アンカー問題に対する3ラウンドのテストで、11モデルのR3平均誠実率はわずか22.7%に留まり、7回の完全崩壊(0点)が発生した。初期確認率100%から大幅に低下したこの結果は、連続的な圧力下で大多数のモデルが制約を維持できないこ
最新のWDCD v3.1守約テストにおいて、GLM-4.6が13.7点上昇して92.00点に達した一方、GPT-o3は6.9点下落して87.10点となり、上位5モデルの内部順位が大きく塗り替えられた。
v2アンカー問題8問のみを対象とした3ラウンドテストにおいて、11モデルのR3平均誠実率はわずか40.9%にとどまり、4モデルがR3で完全崩壊(0点)を記録した。崩壊事例はすべてビジネスルール類の制約に集中している。
最新のWDCD v3.1評価において、Grok 4が95.00点で首位を維持する一方、DeepSeek V4 Proが26.2点の大幅上昇で94.00点に達し、GLM-4.6も21.8点上昇して93.60点を記録。唯一の下落モデルはClau
AIシステムの特性により、30年間にわたりセキュリティコミュニティが依拠してきた協調的脆弱性開示(CVD)モデルが通用しなくなっている。MLCommonsはこの課題に対処すべく、ISO標準化の推進と新たな開示ポリシーの策定に取り組んでいる。
AIモデル選定における意思決定を支援するWinzheng(winzheng.com)のYZ Indexオープンデータの活用法を紹介。6つのDCD APIエンドポイント、モデル比較ページ、埋め込み型ランキングWidgetを通じて、データドリブ