AIベンチマークテストの信頼性を見極める方法
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
AIベンチマークのスコアが重要な意思決定に使われる際、そのスコアが本当に信頼できるかどうかを判断するための7つの核心的な問いを解説する。データ汚染や不正行為、評価の陳腐化など、ベンチマークに潜む落とし穴を具体的な事例とともに示す。
MLCommonsがPC向けAI性能ベンチマークの最新版「MLPerf Client v2.0」をリリースした。画像生成カテゴリとエージェントAIカテゴリが新たに追加され、AIハードウェアおよびソフトウェアの急速な発展に対応している。
MLCommonsは、企業向けAI推論サービスの性能評価を目的とした新ベンチマーク「MLPerf Endpoints v0.7」を公開した。Coreweave、Google、Intel、KRAI、NVIDIAの初期結果が掲載され、今後のv1
MLPerf Tinyは、マイクロコントローラーなどの超低消費電力デバイス上での機械学習性能を公平に比較するためのベンチマークスイートであり、精度・レイテンシ・推論あたりエネルギー消費量を統一された条件で評価する。TinyMLの普及に伴い、
MLCommonsのChakraワーキンググループがMLSys 2026産業フォーラムで画期的な論文を発表し、AI システムのベンチマークテストを標準化するオープンな実行トレースエコシステムの構築に向けた取り組みを示した。40社以上のメンバ
MLPerf Training Working Group は、MoE アーキテクチャを評価する新たな事前学習ベンチマーク GPT-OSS 20B を導入。単一の 8-GPU ノードでも実行可能で、統計分散を抑える工夫により公平性と再現性を
MLCommonsは、個人用コンピュータのAI性能を評価するための最新バージョンであるMLPerf Client v1.6を発表しました。このバージョンでは、基準テストの体験を最適化し、重要なソフトウェアコンポーネントを更新し、利用性と性能
MLCommons®が業界標準のMLPerf® Inference v6.0ベンチマークテスト結果を発表し、現在のAI展開の実際のシナリオをカバーする複数の重要なアップデートを導入しました。
MLCommonsがMLPerf Client v1.0ベンチマークテストの初回結果を発表。これはクライアントおよびエッジデバイス向けに設計された初のAI推論性能ベンチマークで、モバイルデバイス上の生成AIと従来型AIタスクの性能を評価する