MLPerf Storage v3.0ベンチマークテスト結果が公開
MLCommonsが業界標準のMLPerf Storage v3.0ベンチマークスイートの結果を発表した。機械学習ワークロードにおけるストレージシステムの性能を、アーキテクチャ中立かつ再現可能な方法で評価するものである。
MLCommonsが業界標準のMLPerf Storage v3.0ベンチマークスイートの結果を発表した。機械学習ワークロードにおけるストレージシステムの性能を、アーキテクチャ中立かつ再現可能な方法で評価するものである。
MLCommonsのMLPerf Inferenceワーキンググループが、初のエンドツーエンド検索拡張生成(RAG)推論ベンチマークを公開した。複数コンポーネントで構成されるRAGパイプライン全体を計測対象とし、2つのワークロードを含む。
MLCommonsはGoogle DeepMind、OpenMined、AVERIと協力し、暗号技術を用いた初の閉源モデルダブルブラインド評価の概念実証を実施した。この手法により、モデル権重と評価データの双方を保護しながら、信頼性の高いAI
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
MLCommonsがPC向けAI性能ベンチマークの最新版「MLPerf Client v2.0」をリリースした。画像生成カテゴリとエージェントAIカテゴリが新たに追加され、AIハードウェアおよびソフトウェアの急速な発展に対応している。
MLCommonsは、企業向けAI推論サービスの性能評価を目的とした新ベンチマーク「MLPerf Endpoints v0.7」を公開した。Coreweave、Google、Intel、KRAI、NVIDIAの初期結果が掲載され、今後のv1
MLPerf Tinyは、マイクロコントローラーなどの超低消費電力デバイス上での機械学習性能を公平に比較するためのベンチマークスイートであり、精度・レイテンシ・推論あたりエネルギー消費量を統一された条件で評価する。TinyMLの普及に伴い、
MLPerf Inferenceベンチマークスイートが、LLMの実運用における最も急成長する利用形態であるマルチターンAgentic Inferenceに対応するため、新たなベンチマークを追加した。コーディングエージェントとワークフローエー
MLCommonsのEdge LLM Taskforceは、MLPerf Inference v6.1においてEdge Agentic Inferenceベンチマークを新たに導入すると発表した。提出締め切りは2026年7月31日で、ハードウ
MLCommonsのMedPerfがGoogle Cloud Confidential Computingと統合し、患者データとモデルの知的財産を保護しながら脳腫瘍分割AIの評価を安全に実施できる仕組みを実証した。この統合により、データを移
AIシステムの特性により、30年間にわたりセキュリティコミュニティが依拠してきた協調的脆弱性開示(CVD)モデルが通用しなくなっている。MLCommonsはこの課題に対処すべく、ISO標準化の推進と新たな開示ポリシーの策定に取り組んでいる。
MLCommonsのChakraワーキンググループがMLSys 2026産業フォーラムで画期的な論文を発表し、AI システムのベンチマークテストを標準化するオープンな実行トレースエコシステムの構築に向けた取り組みを示した。40社以上のメンバ
MLCommonsは本日、MLPerf Mobile v6.0を発表した。Androidデバイス上で大規模言語モデル(LLM)を実行するための生成AIベンチマークテストが新たに追加されている。
MLCommonsがMLPerf Training v6.0ベンチマークの最新結果を発表した。今回はMixture-of-Expertsアーキテクチャを採用した2つの新ベンチマークが追加され、AIエコシステムの急速な変革を示している。
MLCommonsは第4回Rising Starsとして175名超の応募者の中から39名の若手研究者を選出した。本選出はLLM、ML系統効率、ハードウェア・ソフトウェア協調設計など幅広い研究領域をカバーし、機械学習システム分野の次世代人材を
MLPerf Training Working Group は、MoE アーキテクチャを評価する新たな事前学習ベンチマーク GPT-OSS 20B を導入。単一の 8-GPU ノードでも実行可能で、統計分散を抑える工夫により公平性と再現性を
MLPerf Training v6.0に新たに追加されたDeepSeek-V3ベースの大規模事前学習ベンチマークについて解説。MoEアーキテクチャ、MLA、無補助損失の負荷分散など、現代のLLM学習における主要な技術革新を捕捉する標準化さ
AIシステムの信頼性を高めることは、市場成長と社会保護において重要です。MLCommons AIリスクと信頼性ワーキンググループは、AI信頼性マップを作成し、これを基に信頼性の向上を目指しています。
AI業界は技術の進化とともに新しいリスク評価基準を必要としています。AILuminateは、持続可能な基準管理を目指し、Prompt Stewardship Systemによって基準の新鮮さを維持し、正確なリスク評価を続けています。
MLCommonsは、個人用コンピュータのAI性能を評価するための最新バージョンであるMLPerf Client v1.6を発表しました。このバージョンでは、基準テストの体験を最適化し、重要なソフトウェアコンポーネントを更新し、利用性と性能