GPT-6.1 Sol 初回テスト:YZ Index 18問定向評価

GPT-6.1 Sol 初回テスト:18問口径総合73点

OpenAI公式アカウント@OpenAIDevsは本日、UltrafastがGPT-6.1 SolのAPI、Codex、ChatGPT Workへの全面ロールアウトを開始したと発表した。新モデルの公開から数時間以内に、Winzhengは定向評価を完了した。

今回の初回テストは18問による迅速な定向口径を採用しており、問題数は日常的なSmokeテストの2倍にあたるが、完全な週次評価の口径ではない。評価結果によると、GPT-6.1 Solの総合スコアは73点、実行力73.2点、堅実度72.7点、誠実性評価はpassとなった。以上4項目のデータはいずれも今回の18問定向評価に基づくものであり、外挿や調整は一切行っていない。

スコア分布を見ると、実行力73.2点と堅実度72.7点の差はわずか0.5点であり、モデルがタスク完遂とコンテンツの安定性の両面でバランスの取れたパフォーマンスを示していることがわかる。誠実性評価のpassは、今回の評価においてモデルが規約違反や幻覚の制御不能な状態に陥らなかったことを確認するものである。総合スコア73点は18問口径における直接スコアであり、完全なベースラインは次回の週次Full評価をもって確定する。

現在のメインランキングは直近の完全週次評価における上位10位であり、今回の18問定向評価とは口径に明確な差異があるため、直接混在させて比較することはできない。メインランキングではgpt-6-solが総合82.2点で首位、claude-opus-4.7が81.5点、gpt-o3が80.6点、gpt-5.5が80.5点、grok-4とgpt-6-astraがともに80.4点、claude-sonnet-4.6が80.1点、gpt-6-lunaが79.4点、gpt-6.1-solが78.6点、Doubao Proが76.7点となっている。メインランキングのデータは参考情報に過ぎず、GPT-6.1 Sol今回の初回テストにおける18問口径は、メインランキングの完全週次評価と問題数・難易度分布・評価時間のいずれにおいても一致していない。

Winzhengは、今回の初回テストは公式更新への迅速な対応として実施した定向評価であり、モデルの基礎パフォーマンスをいち早く把握することを目的としていると強調した。今後は週次Full評価の基準に従いGPT-6.1 Solの完全なベースラインテストを実施する予定であり、より多くの問題とより厳格な口径のもとで、メインランキングと直接比較可能な完全スコアを提供する。ユーザーはWinzhengの週次ランキング更新をフォローすることで、最終的な完全データを確認できる。