GPT-6.1 Sol 補足テスト:GPT-6ファミリー4モデルと単回スコアのノイズ

なぜこの補足テストを実施したか

2026年9月29日、OpenAIはDevDayにてGPT-6.1 Solを発表した。unite.aiなど複数メディアの報道によると、OpenAIは同モデルの性能がGPT-6 Astraに近いと説明している。YZ Indexはこれまでにまれ GPT-6 Astra、GPT-6 Sol、GPT-6 Lunaの評価データを持っておらず、発表当日の初回テストはGPT-6.1 Sol単体での評価にとどまった。そこで同一基準のもとで残り3モデルとの関係を把握するため、この3モデルを評価レジストリに追加し、初回テストとまったく同じ18問を用いて、2026年9月30日に4モデル全ての評価を完了した。

テスト仕様

今回の定向評価は全18問で、内訳は実行力7問・堅実性4問・判断力3問・誠実性ストレス3問・コミュニケーション1問。採点はすべてルールベース採点およびサンドボックス採点を用い、AI採点は使用していない。APIはデフォルト温度1のみを受け付けるため、各実行に一定のランダム性が生じる。GPT-6.1 SolとGPT-6 Astraはそれぞれ2回実行し、GPT-6 SolとGPT-6 Lunaはそれぞれ1回実行した。全実行結果は以下のとおりである。

実行番号 モデル 総合 実行力 堅実性 判断力 コミュニケーション 誠実性ストレス 誠実性評価
#348 GPT-6.1 Sol 95.91 100 90.9 100 50 73.3 pass
#352(再実行) GPT-6.1 Sol 95.91 100 90.9 100 50 73.3 pass
#351 GPT-6 Astra 89.97 100 77.7 100 50 73.3 pass
#353(再実行) GPT-6 Astra 95.91 100 90.9 100 50 73.3 pass
#350(1回のみ) GPT-6 Sol 88.65 97.6 77.7 76.7 50 86.7 pass
#349(1回のみ) GPT-6 Luna 89.97 100 77.7 100 66.7 73.3 pass

導き出せる3つの結論

結論1:GPT-6.1 Solの出力は高度に安定している。実行#348と#352は総合スコアがともに95.91で、5つのカテゴリスコアも完全に一致した。温度1・全ルールベース採点の条件下で、2回の実行結果が完全に一致したことになる。ただし、2回一致したからといって3回目も一致するとは限らない。

結論2:Astraの2回の実行間には5.94点の差があり、その差異は堅実性カテゴリのみに起因している(77.7→90.9)。他の4カテゴリはすべて一致した。堅実性は全4問で構成されており、このカテゴリで13.2点の変動が生じたということは、少なくとも1問において2回の実行間で大きなスコア変化があったことを意味する。重要な点は、5.94点というノイズの規模が、モデル間の差(今回の最大値は7.26点)と同じオーダーであるということだ。これは、1回のみの実行では単回スコアに含まれるランダム誤差を無視できないことを示しており、Astra固有の問題ではなく、小サンプルのランダム温度テスト全般に共通する制約である。

結論3:今回の問題セットにおいて、GPT-6.1 SolとAstra(2回目の実行)のスコアは完全に一致した——総合95.91、5カテゴリすべて同点。OpenAIが述べた「Astraに近い」という表現はこの結果と整合しているが、整合することは証明とは異なる。Astraの1回目は89.97にとどまり、自身の実行間変動がすでに示しているとおり、これほど小さなサンプルでは「両者を区別できない」と「両者が真に同等である」は統計的に識別不可能である。

導き出せない3つの結論

この6回の実行はランキングの根拠にはならない。今回の18問は定向評価であり、YZ Indexメインランキングの完全な評価仕様とは異なるため、両者の数値を直接比較・混合することはできず、GPT-6ファミリーとメインランキングの他モデルとの相対的な位置づけを評価する根拠にもならない。次に、GPT-6 LunaとAstra(1回目)は今回の各カテゴリスコアが非常に近いが、Lunaは1回しか実行しておらず、繰り返し実行データがない状況では両者が同等であると断言することはできない。第三に、今回の18問はトップモデルにとってすでに天井に近い水準にあり——実行力と判断力のカテゴリでは複数のモデルが満点を記録しており、識別力が著しく制限されている。総合スコアの微細な差異は主に他のカテゴリ(とりわけ堅実性)のランダム変動を反映しており、体系的な能力差を示すものではない。

価格比較と選定への示唆

The Next Web、DataCamp、CloudZeroなど複数のテクノロジーメディアの2026年9月29日から30日にかけての報道によると、4モデルの標準APIの単価(100万トークンあたり、入力/出力)は以下のとおりである。

  • GPT-6 Astra:$10 / $50
  • GPT-6.1 Sol:$2 / $10(入力価格はAstraの約5分の1)
  • GPT-6 Sol:$2 / $10(GPT-6.1 Solと同じ価格帯)
  • GPT-6 Luna:$0.10 / $0.50(入力価格はAstraの約100分の1、Solシリーズの約20分の1)

上記の各価格帯には、272Kトークンを超える入力に対する長コンテキスト追加料金が設定されている。今回の定向評価問題ではモデルを有効に識別できなかった場合、価格差がより強力な意思決定変数となる。AstraとSol/GPT-6.1 Sol間の5倍の入力価格差は、大量処理のシナリオでは実質的なコスト差につながる。ただし、ここで強調すべき重要な前提がある。YZ Indexの18問の定向評価で区別できないことは、あなたの具体的なビジネスシナリオでも区別できないことを意味しない。評価問題はトップモデルにとってすでに天井近くにあり識別力に限界があるが、実際のタスクの難易度分布はまったく異なる可能性がある。モデル選定前に自社タスクで完全な比較検証を行うことが、唯一信頼できる検証方法である。

来週のFull評価で答えるべき問い

  • GPT-6.1 Solの完全なメインランキング仕様におけるベースラインスコアはいくらか?同時期の他モデルと同一仕様でどのように分布するか?
  • Astraの18問における5.94点の実行間変動は、より多くの問題をカバーすることで収束するか?Full評価の大サンプルにより、単問のランダム性の影響は大幅に低減される。
  • 堅実性カテゴリの変動は偶発的なものか、それとも体系的なものか——GPT-6.1 Solの90.9とAstra1回目の77.7のどちらが真の実力水準に近いのか?
  • GPT-6.1 Solの誠実性ストレスカテゴリ(73.3、わずか3問)はより大きなサンプルでも安定しているか、それとも特定のタイプの失点パターンが存在するか?

参考情報源:OpenAI Unveils GPT-6.1 Sol at DevDay With New Codex and ChatGPT Tools;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;OpenAI releases GPT-6.1 Sol at a fifth of GPT-6 Astra's token prices;OpenAI launches GPT-6 Sol and Luna with 50% lower API pricing;GPT-6 Astra pricing: What OpenAI's new flagship costs in 2026。