ダブルブラインド設計:信頼できるAI評価を構築するための核心的保障
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
MLCommonsがAILuminate全球保障計画を発表し、AI システムの信頼性を検証するための構造化されたデータ駆動型評価メカニズムを確立。
MLCommonsがAiluminate French Datasetsを公開し、フランス語LLM評価の標準化ツールを提供。GPT-4oが翻訳精度92%でトップ、Llama 3.1 405Bが推論タスクで勝率78%を達成。
MLCommonsとLMSYS Orgが共同開発したAILuminate Jailbreak V05ベンチマークが発表され、大規模言語モデルの脱獄耐性評価で新たな基準を確立した。Claude 3.5 Sonnetが1485 Eloで首位を獲