GPT-6 Sol 初回評価:YZ Index 18問定向テストで84点

GPT-6 Sol 初回評価:18問定向テスト84点

OpenAIは本日、GPT-6 with Intelligent UIをPlus・Pro・Business・Enterpriseユーザー向けにグローバル展開したと発表した。GPT-6 Solは上記有料プランのデフォルトモデルとなり、FreeおよびGoユーザーは翌日以降順次GPT-6 Lunaバージョンを利用できるようになる。発表から数時間後、YZ Indexは即座に18問定向評価を開始した。問題数は通常のSmokeテストの2倍にあたるが、あくまで迅速な定向評価の範囲内であり、完全な週次ベースラインではない。

今回の18問定向評価の結果、GPT-6 Solは総合スコア84点を記録した。内訳は実行力85.7、堅実性81.8、誠実性評価はpassとなっている。3つのコア指標はいずれも18問という限定範囲内で取得されたものであり、指示遵守・コンテンツ完全性・コンプライアンス表現における即時水準を反映している。評価規模が通常の週次ランキングの半分にとどまるため、これらのスコアは速報参考値に過ぎず、完全なベースラインは次回の週次フル評価で確認される。

現在のメインランキング上位10位と大まかに比較する際には、評価口径の違いに特に注意が必要だ。最新の完全週次評価では、gpt-6-solが82.2点で首位、claude-opus-4.7が81.5点、gpt-o3が80.6点、以下gpt-5.5(80.5点)、grok-4(80.4点)、gpt-6-astra(80.4点)、claude-sonnet-4.6(80.1点)、gpt-6-luna(79.4点)、gpt-6.1-sol(78.6点)、Doubao Pro(76.7点)と続く。今回の18問定向評価による84点とメインランキングの82.2点は直接同列に並べることはできない。問題数・難易度分布・評価期間のいずれもが大きく異なるためだ。定向テストは即時応答と特定シナリオにおける実行力を重視するのに対し、週次フル評価はより広い次元と長期的な安定性をカバーしている。

現時点のデータを見ると、GPT-6 Solは18問口径において実行力85.7が堅実性81.8を上回っており、タスク分解と出力構造における素早い応答性を示す一方、コンテンツの深度と一貫性には改善の余地があることを示している。誠実性評価のpassは、モデルに明らかな逸脱や虚偽生成が見られなかったことを示しており、有料ユーザーが求める安全性の基本要件を満たしている。

YZ Indexは既定のスケジュールに沿って後続評価を進める予定だ。次回の週次フル評価完了後、gpt-6-solの完全なベースラインスコアが既存のメインランキングと同口径で比較される。その際、18問定向評価の結果は事前参考値としてのみ扱われる。ユーザーはChatGPTのインターフェースを通じてGPT-6 SolのIntelligent UI機能を引き続き体験できるが、実際の提供状況は公式の段階的な展開に依拠する。