xAIは2026年9月21日、Grok 4.7を正式にリリースした。公式発表によると、同モデルはDeepSWE v1.1ベンチマークの高強度(xHigh)設定において71.0%を達成し、前世代のGrok 4.6の65.2%から約6ポイント向上した。CursorBench 4.0のスコアも40.4%から46.3%に上昇した一方、100万トークンあたりの価格は入力$2・出力$6のまま据え置かれた。これはxAIがGrok 4をリリースして以来、連続する2番目のマイナーバージョンアップであり、トレーニングの方向性は汎用対話能力から数時間規模のエンジニアリングタスクへと明確にシフトしている。
強化学習への賭け:難問をモデルに与える
xAIの公式ブログによると、Grok 4.7は「数時間規模のタスクに重み付けされた、より難易度の高い問題セットに対して、より長い強化学習トレーニングラウンドを実施した」という。このエンジニアリング上の意味は、xAIがトレーニング段階において、一問一答の短いタスクではなく、長時間の推論と多段階の検証を必要とする実際のエンジニアリングシナリオをモデルに意図的に学習させたということだ。これは現在の主要な大規模ラボのトレンドとも一致している――OpenAIやAnthropicも同時期に、RLの計算リソースの重点をRLHFによる選好アライメントから、検証可能なタスクのプロセス報酬へと移行させている。
DeepSWE v1.1ベンチマークは、コードベースの理解、バグの特定、修正パッチの生成、テストスイートによる検証を含む、ソフトウェアエンジニアリング全工程における自律的な完遂能力を測定する。71.0%という数値は、Grok 4.7がこの種のタスク10件のうち約7件を独立して完了できることを意味する。比較対象として、同時期にClaude Fable 5.1がこのベンチマークの高強度設定で報告したスコアは約70.0%、GPT-5.6 Solは約72.7%であり、三者は同一グループに位置する。
「価格は競合の半額」――数字は嘘をついていないが、結論は嘘をついている
リリース後の議論で最も広まった主張は、Grok 4.7の価格が同種モデルの約半額というものだ。100万トークンあたりの表示価格を見れば、この比較はおおむね成立する――$2/$6は、市場の一部フラッグシップモデルの$6〜$15という価格帯と比較したものだ。しかしAI分析機関Artificial Analysisの実測データによると、Grok 4.7は同社の「インテリジェンス指数」タスクにおいて平均約81,000出力トークンを消費するのに対し、Grok 4.6は36,000トークンであり、タスクあたりのトークン消費量は125%増加している。
これが意味するのは、同等のエンジニアリングタスクにおいて、実際に支払うコストは0.5倍ではなく、ほぼ1.0倍、場合によってはそれ以上になるということだ。Artificial Analysisの試算では、Grok 4.7 xHighがCursorBenchタスクを完了する1回あたりのコストは約$6.01であるのに対し、Claude Fable 5.1 Mediumの同等完了コストは約$7.05であり、差は約15%に縮小し、宣伝されている「半額」とはほど遠い。
このパラドックスはxAI固有のものではないが、Grok 4.7において特に顕著に表れている。強化学習によってモデルは「スロー思考」経路を取りやすくなり、大量の中間推論ステップが可視トークンとして展開されるため、ベンチマークスコアは上がる一方で、請求額もひっそりと増加する。毎月数十億トークンを処理する本番環境のチームにとって、この差異は移行判断に影響を与えるに十分だ。
2つのベンチマーク、2つの顔
開発者コミュニティでは対立する2つの意見が浮上しているが、その根源はGrok 4.7が異なるベンチマークで示す極めて顕著なパフォーマンスの差異にある。
CursorBench 4.0は、コード補完・リファクタリング・デバッグなど人が関与するインタラクティブなシナリオにおけるAIコーディングアシスタントの完了品質を測定する――Grok 4.7はここで46.3%を獲得しており、Fable 5.1と同等水準にある。
一方、Terminal-Bench 4.0は、純粋なコマンドライン環境におけるモデルの自律的な実行能力を測定する――Grok 4.7は37.6%にとどまり、Claude Fable 5.1の同時期スコアである約57.9%との差は20ポイントを超える。ある開発者はこの結果を直接「horrendous(ひどすぎる)」と表現した。
この2組のデータから読み取れるパターンは一貫している。Grok 4.7は、フィードバックループと人による確認が存在する長期的な協調タスクでは合格水準のパフォーマンスを発揮するが、モデルが自律的に判断・実行・検証する無人監視のシナリオでは、現時点では及ばない。これは、Grok 4.7をCI/CDパイプラインや夜間の自動化タスクに組み込むかどうかを評価しているチームにとって、無視できない実際的な制約だ。
Harveyリーガルベンチマーク:控えめに扱われた強み
公式発表にはもう一つ、主流の報道では見落とされたデータがある。Grok 4.7はHarveyリーガルエージェントベンチマークで19.6%を獲得しており、同時期の比較対象フラッグシップモデルを数倍上回ると報告されている。Harveyベンチマークは、法的文書の分析・契約書レビュー・多段階の法的推論タスクにおけるAIのパフォーマンスを測定するもので、高度な専門知識を要する知識労働シナリオに該当する。
これはDeepSWEにおける強みと合わせて、明確な輪郭を形成している。Grok 4.7のRLトレーニングが重点を置く「数時間規模のタスク」とは本質的に、ソフトウェアテストの合否であれ法的条項の正確な引用であれ、明確な正解が存在しプログラム的に検証可能な専門的問題だ。この種のタスクに共通する特徴は強い報酬シグナルが得られることであり、RLによる精錬に適している。
競争環境における位置づけ
現在比較可能なベンチマークを見ると、DeepSWEにおけるGrok 4.7とFable 5.1、GPT-5.6 Solの差は2ポイント以内であり、統計的ノイズの範囲に入っている。ただしCursorBenchとTerminal-Benchでは三者の分化がより明確で、それぞれのRLトレーニングデータ配分の重点の違いを反映している。
価格面では、xAIの$2/$6はAnthropicやOpenAIの同等能力帯モデルの公開価格を依然として下回っており、トークン消費量増加後の実際コストを加味しても、Grok 4.7は長期的なコーディングタスクにおいて約10〜20%のコスト優位性を維持している。この優位性は圧倒的な選択理由とはならないが、コストに敏感な中規模チームにとっては十分な意味を持つ。
結論
Grok 4.7は特定のシナリオにおいて完成度の高いエンジニアリングツールだが、そのマーケティング上の語りと実際のパフォーマンスの間にはいくつかの明確なずれがある。DeepSWE 71%は本物のスコアだが、高強度の推論モードに依存している。「価格は競合の半額」は表示価格を見れば合理的だが、高いトークン消費量が実際のタスクにおいてその優位性をかなり相殺している。Terminal-Benchでの弱点は、完全自動エージェントシナリオが現時点での主戦場ではないことを示している。
長期的なコード協業のニーズを持ち、エンジニアリングタスクにおけるより高い推論レイテンシを受け入れられるチームにとって、Grok 4.7はテストに値する選択肢を提供している。高速な無人自動化を必要とするチームにとっては、現時点のデータは移行判断を支持するには不十分だ。xAIは「難しい問題を正確に解く」道に賭けており、「簡単なタスクを速くこなす」方向性は取っていない。その方向性自体は明確だ――ただし、完全な実用性に達するまでには、Terminal-Benchであと数バージョンの改善が必要だ。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接