レビュー GPT-o3 蓄水池サンプリング問題で100点から0点に急落、コード実行の真相は細部に隠れている GPT-o3は今回のv6評価で総合スコアが向上したものの、厳格問題「蓄水池サンプリング」で100点から0点に急落し、コード実行の信頼性に課題が露呈した。エンジニアリング判断は急上昇したが、正確なアルゴリズム実装能力には依然として系統的なリス GPT-o3 代码执行 蓄水池采样 得分波动 12時間前 47