GPT-6.1 Sol 初回テスト:18問88点、実行力98.7
OpenAIの公式アカウント @OpenAIDevs が本日、GPT-6.1 Sol はコーディングエージェントに対してより大きな作業領域を提供し、コーディング・コンピューター操作・クロスアプリワークフローの各シナリオで高いパフォーマンスを発揮し、GPT-6 Astraよりもコストが低いと発表した。同モデルの公式アップデート完了直後、Winzhengは18問の定向評価を実施した。この問題数は通常のスモークテストの2倍にあたる。
今回の評価は迅速な定向口径によるものであり、総合スコアは88点。実行力スコアは98.7を記録し、タスク完了の安定性が極めて高いことを示した。堅実度は74.8であり、細部処理と長距離一貫性における性能を反映している。誠実性評価はパス(pass)。上記データはすべて18問の定向テストに基づくものであり、外挿や補完は一切行っていない。
明確にしておくべきこととして、今回の18問評価は完全な週次評価口径ではなく、サンプル規模および難易度分布は完全ベースラインと差異がある。現在のメインランキングトップ10(直近の完全週次評価結果)では、claude-opus-4.7が83.9、grok-4が83.3、Doubao-proが80.5、以降はgpt-5.5(78.2)、gpt-o3(77.7)、claude-sonnet-4.6(76.4)、gemini-3.1-pro(75.5)、deepseek-v4-pro(75.2)、gemini-2.5-pro(74)、Qwen3-max(68.7)の順となっている。これらのスコアはいずれも完全週次評価に基づくものであり、今回の18問定向結果とは直接並べて比較できるものではなく、あくまで大まかな参考にとどまる。
公式発表が強調するコーディングおよびコンピューター操作能力は、今回の定向テストでもある程度確認されたが、18問というサンプル数では週次評価の全シナリオをカバーするには不十分である。また、堅実度74.8と実行力98.7のスコア差は、モデルが異なる評価軸において依然として最適化の余地を持つことを示唆している。
Winzhengは今後の予定通り、来週に完全な週次フル評価を開始する。より多くの問題数と包括的な評価軸をカバーし、メインランキングと同一口径の最終的な位置づけを示す予定だ。その際、詳細なサブ項目の内訳とクロスモデル比較も同時に公開される。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接