評価のギャップ:企業AIエージェントの現実整合問題、多くの企業が強引なデプロイを継続
VentureBeatが157社の企業を対象に実施した調査によると、50%の企業が内部評価をパスしながら実際の顧客環境で失敗するAIエージェントの障害を経験しており、自動評価への信頼は5%にとどまるにもかかわらず、67%の企業がエージェント
VentureBeatが157社の企業を対象に実施した調査によると、50%の企業が内部評価をパスしながら実際の顧客環境で失敗するAIエージェントの障害を経験しており、自動評価への信頼は5%にとどまるにもかかわらず、67%の企業がエージェント
2023年に登場したAIモデル評価プラットフォーム「Arena」は、クラウドソーシング型のブラインドテスト方式で業界標準の地位を確立し、年間売上高1億ドルの商業エンティティへと成長した。その成功はAI評価インフラという新たなビジネス領域の可
AIモデルの事実上の公的ランキングとなったArenaが、実はランキング対象企業から資金提供を受けていることが判明し、その公正性に疑問が投げかけられている。
MIT Technology Reviewの「ダウンロード」ニュースレターが、AI能力追跡の困難さと原子力技術の革新という2つの重要な科学技術トピックスに焦点を当てる。
AI評価機関METRの「計算フロンティアプロット」は業界の進歩を示す重要な指標となっているが、単純な性能対計算量のグラフではなく、AIの人間レベル能力への接近を測る複雑な指標であることが理解されていない。
『MITテクノロジーレビュー』のニュースレター『ダウンロード』最新号では、AI分野における評価の難しさと、AI時代のエネルギー需要に応える次世代原子力技術の進展を取り上げている。