GPT-6.1 Sol「Astraに近い」:公式声明の独立検証

2026年9月29日、OpenAIはDevDayにてGPT-6.1 Solを発表した。Plus・Pro・Business・Enterprise・Eduユーザーを対象に、ChatGPT Work・Codex・APIで利用可能となり、その性能はGPT-6 Astraに近いとされている。まず混同しやすい背景を整理しておく必要がある。EngadgetやGoogle関連メディアの報道によれば、OpenAIは当初10月にリリース予定だったGPT-6.1 Astra(別の未リリースモデル)をキャンセルしており、その理由として内部安全テストでの回帰が報じられている。これはすでにAPIで公開されているGPT-6 Astraとは別のモデルであり、本記事で「近い」と比較しているのは後者である。

「近い」という主張を各ベンチマークで数値化する

VellumおよびDataCampが引用した公式データによると、ソフトウェアエンジニアリング評価DeepSWE v1.1では、SolとAstraのピーク正解率(約74.8%)はほぼ同等で、タスク当たりのコストは約80%低い。コンピューター操作評価OSWorld 2.0では、Solの73.5%はAstraと2.1ポイント差で、タスク当たりのコストは約7分の1となっている。TechCrunchがOpenAIから得た情報では、全推論強度を総合した際のSolのエラー率は「Astraの1.9%以内」とされているが、この指標の算出基準については公式から個別の説明はない。

なおDataCampがまとめたデータ(単一情報源につき参考値)によれば、専門的なトラブルシューティング評価TroubleshootingBenchではSolが47.96%・Astraが63.46%と差が15.5ポイントに広がり、サイバーセキュリティ評価ExploitBench Internal PortではSolが21.5%・Astraが31.5%と10ポイント差となっている。「近い」という表現が示す差の大きさは、ベンチマークによって持平から15.5ポイント(後者は単一情報源)まで一定ではない。

18問による初回テスト:検証可能な部分

YZ Indexは2026年9月30日(発表から数時間以内)に18問の特定口径で初回評価(Run #348)を実施した。採点はすべてルールベース/サンドボックス方式(ユニットテスト・完全一致・構造化JSON検証・数値許容誤差)であり、AI採点は一切介入していない。

レイヤー問題数得点備考
実行力7100全問満点
判断力3100全問満点
堅実性490.93問満点、1問63.6点
誠実性ストレス373.31問満点、2問各60点;評価:pass
コミュニケーション150—
総合1895.91—

応答速度については、18問の中央値が約3.9秒、平均値が約6.2秒、最長は高難度コード問題の24.9秒であり、18問すべてで正常に応答が返り、APIエラーは発生しなかった。(初回実行ではAPIパラメーター互換性の問題により全問失敗したが、これは「データ欠損」として記録され0点とはせず、修正後の再実行データが本記事で使用するデータである。)

同一18問による追加テスト:GPT-6.1 Sol対Astra

初回テスト公開後、GPT-6 Astraを評価登録簿に追加し、Run #348と全く同じ18問をそれぞれ1回実行した上で、GPT-6.1 SolとAstraの各実行をさらに1回ずつ繰り返した(採点は同様にルールベース/サンドボックス)。結果:GPT-6.1 Solは2回とも95.91(Run #348・#352)。GPT-6 Astraは2回それぞれ89.97と95.91(Run #351・#353)であり、2回の差は堅実性レイヤーのみに現れ(77.7対90.9)、その他のレイヤーは完全に同一だった。つまり、Astra自体の2回実行間の差(5.94点)は、AstraとGPT-6.1 Solの1回比較における差と同等であり、この18問では両モデルを区別できない。

これは公式の「近い」という主張と矛盾しないが、証明するものでもない。各モデルの実行回数は1〜2回にとどまり、18問では上位層がほぼ天井に達しており、堅実性レイヤーの1問だけで得点が変わりうる。4モデルの完全な比較とノイズ分析については、本サイトの別記事を参照されたい。

明示すべき3つの限界

  • 「Astraに近い」については「否定できない」にとどまり、「証明された」とは言えない。同一問題での追加テストでは18問上の両者を区別できなかったが、サンプルが少なく天井効果もある。この問いに答えられるのは次回の週次Fullテストである。
  • 18問の口径は完全な週次ランキングの口径とは異なる。今回の18問は通常のスモークテストの2倍規模であり、完全な問題セットではない。GPT-6.1 Solの完全なベースラインは次回の週次Fullテスト後に確定する必要があり、その後に限り既存モデルとの並列比較が可能となる。口径を明示する必要があり、直接のランキング付けや混在比較はできない。
  • 推論強度は必ず確認すべき変数である。OpenAI開発者ドキュメントによれば、GPT-6.1 Solはlowからmaxまでの複数段階のreasoning_effort(デフォルトはmedium)に対応している。ベンダーのベンチマークは通常特定の設定に対応しており、段階によって性能とコストは大きく異なる可能性がある。本サイトの初回テストでは推論強度を明示的に指定せず、APIのデフォルト値を使用した。

ベンダーベンチマークを読む際の3つのチェックポイント

  • どのベンチマークが選ばれているか:ベンダーは通常、差が最も小さいベンチマークを前面に出す傾向があり、サードパーティのまとめでは差がより大きいものが補足される場合がある(例:DataCampがまとめたTroubleshootingBench、単一情報源)。読者は見出しの数字だけでなく、開示されているすべてのベンチマークと照らし合わせるべきである。
  • サンプルの出所が公開されているか:一部の内部または非主流ベンチマーク(上述のExploitBenchなど)は広く普及したオープンベンチマークではなく、外部研究者による再現が困難であり、方法論の詳細は一方的な開示に依存している。
  • 推論強度が総合スコアにどう組み込まれているか:ベンチマーク結果に対応する推論予算は、実際の使用状況と一致しているか?高い推論コストが許容されないタスクでは、ベンチマークの参考価値は低下する。

Fullテスト後に答えられる問い

  • 完全な問題セットの口径において、GPT-6.1 Solの総合スコアは主要参照(Run #342、2026年9月28日)と比較して統計的に有意な明確な向上を示すか?これは18問の口径では現時点で答えられない問いである。
  • 誠実性ストレスレイヤーの73.3点(pass評価)は系統的なパターンか、それとも小サンプルのノイズか?Fullテストでこのレイヤーの問題数を増やした際の安定性はどうか。
  • コミュニケーションレイヤーの1問50点はFullテストで再現されるか、それとも偶発的な失点か。

以上をまとめると、18問の実テストで言えることは次の通りである。GPT-6.1 Solは実行力と判断力が全問満点、堅実性で1問63.6点が見られ、誠実性ストレスはpassだが2問が60点、コミュニケーションレイヤーの1問が50点だった。同一問題セットにおいて、GPT-6.1 SolとGPT-6 Astraの差は、Astra自体の2回実行間のばらつきより小さかった。「GPT-6 Astraに近い」という言葉を、本サイトのデータは否定しないが、結論を出すにはFullテストが必要である。

参考情報源:OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra and costs less;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access;GPT-6.1 Sol Benchmarks Explained: Coding, Computer Use & Pricing;OpenAI cancels GPT-6.1 Astra release over deceptive behavior;OpenAI cancels GPT-6.1 Astra release over safety concerns;OpenAI's GPT-6.1 Sol delivers Astra-like performance at a dramatically lower price。