AIベンチマークテストの信頼性を見極める方法
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
AIシステムの特性により、30年間にわたりセキュリティコミュニティが依拠してきた協調的脆弱性開示(CVD)モデルが通用しなくなっている。MLCommonsはこの課題に対処すべく、ISO標準化の推進と新たな開示ポリシーの策定に取り組んでいる。