ダブルブラインド設計:信頼できるAI評価を構築するための核心的保障
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
今期WDCD守約能力ランキングでGPT-5.5が71.67点で首位を再確立し、Gemini 2.5 Proは14.2点の大幅上昇を記録した一方、ERNIE Bot 4.5は7.5点下落と明暗が分かれた。
WDCD(Won't Do, Can't Do Guardrail Test)遵守テストは、高圧シナリオ下でのAIモデルのデータ隔離・プライバシー保護能力を検証します。本記事では11大主流モデルのテストスコアを公開し、金融・医療業界向けの選