AI评估 に関するニュース

オリジナル

Google DeepMindがダブルブラインド評価パイロットを公開――暗号技術によるブラックボックスでモデルと問題集を隔離

Google DeepMindは2026年8月27日、世界初のフロンティアAIモデル向けダブルブラインド評価パイロットレポートを発表した。暗号技術に基づく信頼実行環境を用いてモデルと評価問題を相互に隔離し、ベンチマーク汚染を防ぐ仕組みを実証

AI评估 双盲测试 基准污染
556
レビュー

AIベンダーの真偽を見極めるのは困難:WDCD遵守テストで11大モデルのスコアが明らかに、データ漏洩の地雷を回避

WDCD(Won't Do, Can't Do Guardrail Test)遵守テストは、高圧シナリオ下でのAIモデルのデータ隔離・プライバシー保護能力を検証します。本記事では11大主流モデルのテストスコアを公開し、金融・医療業界向けの選

AI评估 WDCD测试 エンタープライズAI 数据安全
1,024