GPT-6.1 Sol 初回テスト結果の読み方:18問口径の正しい解釈

2026年9月29日(米国時間)、OpenAIはDevDayにてGPT-6.1 Solを発表した。TechCrunchおよびDataCampの報道によると、同モデルはPlus/Pro/Business/Enterprise/Eduユーザー向けにChatGPT Work、CodexおよびAPIで提供される。Artificial AnalysisとDataCampの価格データによれば、API料金は入力$2・出力$10(100万トークンあたり)。OpenAI公式はその能力がGPT-6 Astraに近いとしており、TechCrunchの報道ではGPT-6 Astraの約5分の1の価格とされている。YZ Indexは北京時間9月30日に初回定向評価(Run #348、18問口径)を完了し、総合スコア95.91を記録した。

この数字を示す前に、まず明確にしておくべきことがある。この18問は日常的なSmokeテストの2倍の問題数であり、定向暗号化評価の口径に属する。完全な週次ランキング口径とは異なる。18問の総合スコアと主要ランキングの参照値(Run #342、完全口径)は分母が異なるため、両者を跨いで直接ランキング比較することはできない。本稿の目的は、この結果の正しい読み方を示すことであり、GPT-6.1 Solの順位を確定させることではない。

満点層が意味すること、意味しないこと

実行力層(7問)は全問満点(層スコア100)、判断力層(3問)も全問満点(層スコア100)であった。これらの数値の価値は、採点方式にある。今回の18問はすべてルールベースまたはサンドボックス採点を採用しており、ユニットテスト合格・厳密な文字列照合・構造化JSONフィールド検証・数値許容誤差比較が含まれ、AI審査員は一切介在していない。つまりこれらのスコアは非常に「堅い」ものである――あるLLM審査員が「良い回答だ」と判断したのではなく、コードがテストケースを通過し、出力が期待するフォーマットに正確に一致したということだ。

ただし満点には明確な限界がある。18問はサンプリングであり、該当能力領域の全量カバレッジではない。今回抽出された7問の実行力問題がたまたま全問通過したからといって、「実行力に死角なし」を意味するわけではない。サンプルが小さいほど、「全通過」はサンプリングの運に左右される。統計的に、小サンプルでの満点の信頼区間は直感よりもはるかに広い。

失点箇所:満点に達しなかった4層のプロフィール

今回の評価では4問が満点に届かず、3つの層に分布していた。

  • 堅実性層:4問中1問が63.6点、層スコア90.9。問題データベースは非公開のため、この問題が何を問うていたかは開示しない。したがって失点の原因を推測することはできないし、すべきでもない。
  • 誠実性ストレス層:3問中2問がそれぞれ60点、層スコア73.3、誠実性評価はpass。この層でルール採点のもと部分点を得たということは、この2問において得点ポイントをすべて獲得できなかったことを意味する。全体評価は依然passである。具体的な原因についても問題内容を開示しないため、帰因は行わない。
  • コミュニケーション層:1問のみで50点。サンプルが1問と極めて少ないため、解釈は行わない。

強調すべき点として、ここでは「なぜ失点したのか」の帰因は行っていない――帰因には問題内容の開示が必要だが、問題データベースは非公開だからだ。確認できるのはスコア分布のみである。実行力層と判断力層は全問満点、堅実性層・誠実性ストレス層・コミュニケーション層では満点に達しない問題が生じた。

サンプルサイズの正直な評価:n=1とn=3の信頼度限界

コミュニケーション層は1問で50点。n=1の状況では、この数字に統計的意味はない――50点がそのモデルのコミュニケーション能力を真に反映しているのか、この問題がたまたまモデルに不利だったのか、区別する方法がない。n=1の50点を「コミュニケーション能力が中程度」と解釈するのは誤読であり、Full評価でより多くの問題が積み上げられるまで待つ必要がある。

誠実性ストレス層はn=3で73.3点であり、方向性はやや強いものの、信頼区間は依然として広い。この3問を別の3問に置き換えれば、スコアが高くも低くもなり得る。データが無意味だということではない――73.3点+pass評価は確かに意味のある方向性シグナルである。ただ、3問の誠実性テスト結果でGPT-6.1 Solの誠実性パフォーマンスを確定的に評価することについて、完全なFull評価が出るまでは、いかなる強い結論も時期尚早である。

応答時間の分布:中央値3.9秒とピーク値24.9秒

18問の応答時間は、中央値約3.9秒、平均値約6.2秒、最長問題約24.9秒(高難度のコード問題)であった。平均値が中央値を上回り、分布は右に偏っている。大多数の問題は数秒以内に完了し、一部の高難度コード問題は明らかに長い時間を要した。推論トークン使用量は記録していないため、ロングテール応答時間の原因を判断することはできず、現象のみを報告する。また、これは並列評価条件下での観測値であり、本番環境のレイテンシと同等ではない。

中央値3.9秒は、GPT-6.1 Solが通常問題において主流のAPI呼び出し体験と同等の応答速度を持ち、「低速思考」専用モデルではないことを示している。ピーク値24.9秒は、モデルが難易度に応じて推論深度を適応的に調整する能力を持つことを示しており、これは推論型モデルの典型的な挙動特性である。日常的には高速で、難問に直面すると深く考えるのであって、一律に低速なわけではない。実際の運用への示唆としては、中程度の難易度タスクでは中央値3.9秒のレイテンシは許容範囲内だが、高複雑度のコードタスクが集中するシナリオではP99レイテンシに十分な余裕を確保する必要がある。

来週のFull評価:検証すべき4つの観察ポイント

GPT-6.1 SolはYZ Indexの評価登録簿に登録済みであり、次回の完全週次Full評価に参加する。完全なベースラインはFullをもって基準とする。その際に重点的に観察すべき点は以下の4つである。

  • 誠実性ストレス層がpassレベルを安定して維持できるか。今回はn=3で73.3点。Full評価では問題数が増えるため、passが維持されるか、それともより大幅な下落が生じるかを確認する。
  • コミュニケーション層の50点が偶発的なものか常態かを確認する。Full評価ではコミュニケーション層の問題数が増えるため、単一問題の偶然性が希釈され、初めて意味のある層評価が可能となる。
  • より大きなサンプルでの総合スコア95.91の安定性。小サンプルでの高スコアがFull評価で平均回帰を示すことは珍しくなく、これはすべてのLLM評価に共通する統計的規則であり、GPT-6.1 Solに対する特別な予断ではない。
  • 主要ランキングの既存モデルとの相対的位置づけ。Run #342の主要ランキング参照では、claude-opus-4.7が83.94でトップに立っているが、それは完全口径でのスコアである。GPT-6.1 Solについては、同一口径のFull評価が出るまで、両者を直接比較することはできない。

参考情報源:OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less;GPT-6.1 Sol (max) - Intelligence, Performance & Price Analysis;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;On Robustness and Reliability of Benchmark-Based Evaluation of LLMs。