2026年9月29日、OpenAIはDevDayにてGPT-6.1 Solを発表した。TechCrunchの報道によれば、公式はその能力がGPT-6 Astraに近いと説明しており、Plus・Pro・Business・Enterprise・Eduユーザー向けに提供され、ChatGPT Work・Codex・APIを通じて利用可能で、標準APIの価格はGPT-6 Astraの約5分の1とされている。Artificial Analysisのデータによれば、標準レイヤーの料金は入力$2.00・出力$10.00(100万トークンあたり)であり、本サイト登録表のGPT-5.5の$5/$20より低い水準となっている。YZ Indexはリリース当日(Run #348)に定向初回テストを実施し、総合スコア95.91を記録した。
レイヤー別スコア
今回は定向評価基準を採用した——18問構成で、通常のSmokeサンプリングの2倍に相当し、完全週次ランキング基準ではない。全問題はルールベースまたはサンドボックス方式で採点(ユニットテスト・完全一致・構造化JSONバリデーション・数値許容誤差)し、AIによる採点は介在していない。
- 実行力(7問):100点 — 7問全問満点、失点なし。
- 判断力(3問):100点 — 3問全問満点。
- 堅実性(4問):90.9点 — 3問満点、1問は63.6点。該当問題の具体的内容は問題バンクの機密保持のため非公開。
- 誠実性圧力(3問):73.3点、評価pass — 1問満点、他の2問はそれぞれ60点。誠実性圧力の3問は全問正常に応答が返り、総合評価は通過したが、3問というサンプル数では2問の60点について過度な解釈は禁物である。
- コミュニケーション(1問):50点 — このレイヤーは1問のみで、サンプルが極めて少なく、この次元の能力判断の根拠とすべきではない。
応答速度については、18問の中央値所要時間は約3.9秒、平均値は約6.2秒、最長単問は約24.9秒(高難度のコード問題)。全18問が正常に応答を返し、APIエラーは発生しなかった。
API接続メモ:互換性の問題について
初回実行時、18問が全問失敗した。調査の結果、本サイトの評価クライアントがgpt-6.xシリーズに対して引き続きmax_tokensパラメータを送信していたことが判明した。OpenAI APIは「Unsupported parameter: 'max_tokens' is not supported with this model. Use 'max_completion_tokens' instead.」というエラーを返した——本サイトの従来の判定ロジックはgpt-5/oシリーズのみパラメータ名を切り替える設定であり、gpt-6.xには対応していなかった。識別プレフィックスをgpt-5からgpt-9まで拡張して再実行したところ、全問成功した。初回の全問失敗はシステムにより「データ欠損(incomplete)」としてマークされ、0点としてランキングに計上されることはなく、データの完全性への汚染はない。また、実際のAPIキーによる呼び出しで確認したところ、OpenAIの/v1/modelsリストにおいてgpt-6.1-solはgpt-6-sol・gpt-6-luna・gpt-6-astraと並んで表示されている。
基準の相違点:メインランキング上位との直接比較は不可
18問の定向基準と完全週次ランキング基準には本質的な差異があり、直接比較や混在ランキングは行ってはならない。直近の完全週次評価(Run #342、2026-09-28)を参照として示す:
| モデル | 完全週次ランキングスコア(Run #342) |
|---|---|
| claude-opus-4.7 | 83.94 |
| grok-4 | 83.30 |
| doubao-pro | 80.49 |
| gpt-5.5 | 78.20 |
| gpt-o3 | 77.70 |
上記モデルはいずれも完全問題バンクでのスコアリングによりベースラインを確立しており、今回のGPT-6.1 Solの18問基準とは比較できない。また補足として、本記事の初出時点では、GPT-6 Astra・GPT-6 Sol・GPT-6 LunaはまだYZ Indexの評価対象に組み込まれていなかった。その後、同じ18問セットでこれら3モデルの補足テストを実施し(GPT-6.1 SolとAstraについてはそれぞれ1回ずつ再実行も行った)、その結果と「1回のスコアをどの程度信頼できるか」に関する分析は本サイトの後続記事に掲載する。GPT-6.1 Solの完全ベースラインは次回の週次Fullテストをもって確定する。
参考情報源:OpenAI Unveils GPT-6.1 Sol at DevDay;OpenAI launches GPT-6.1 Sol, says it nearly matches GPT-6 Astra;OpenAI releases GPT-6.1 Sol at a fifth of GPT-6 Astra's token prices;GPT-6.1 Sol (max) — Intelligence, Performance & Price Analysis;GPT-6.1 Sol: Features, Benchmarks, Pricing, and Access。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接