2026年8月12日、xAIはGrok 4.6を発表しました。核心事実:パラメータはGrok 4.5の1.5兆から2兆に拡大し、Colossusスーパーコンピューティングクラスターで訓練。9ベンチマーク総合のIntelligence IndexはGPT-5.6 Sol Maxと同スコアを記録し、API価格は入力100万トークンあたり2ドル・出力6ドルに据え置き。訓練データには選別済みのモデル生成推論トレース、高度な技術概念、高品質エンジニアリングデータが含まれ、Grok 4.5でSFTトレースを再生成しモデル検査で問題サンプルを除外後、大規模なエージェント強化学習を実施。詳細は当サイトの報道:Grok 4.6発表:GPT-5.6に性能で並ぶも反復ペースが焦点に。
Grok 4.6で最も注目されたのは単発の性能ではなくペースです:xAIは8月21日までにGrok 4.7を投入予定とし、「毎月フラッグシップ」を常態化させようとしています。このペースはColossusクラスターの継続拡張とデータの閉ループに支えられており、SpaceX上場後はGrokとColossusが中核AI戦略として位置づけられ、SpaceXのエンジニアリングデータも訓練コーパスに加わりました。
高速反復の直接的な成果は、エージェントコーディングとナレッジワークのテストで最先端を更新し続けるモデルです。代償は訓練フローの高度な自動化が必須になること——データ選別・トレース生成・強化学習を数週間で完走する必要があります。導入側にとっても、月次ペースはより頻繁な回帰検証を意味します:前バージョンで調整したプロンプトやワークフローが、次バージョンでそのまま通用するとは限りません。
Grok 4.6はAPI価格を据え置き(100万トークンあたり$2/$6)、同じ予算でより大規模なモデルの推論能力が使えます。初週はCursorとGrok Buildで内包クォータが2倍に。接続面:APIは標準のOpenAI SDKと互換で、OpenRouter・Vercel・Cloudflareに対応、Cursorには直接統合——50万トークンのコンテキストウィンドウと前世代に近い推論速度で、ファイル横断リファクタリングやマルチツールのエージェントアプリに適します。価格戦略の分析は当サイトの報道:Grok 4.6の価格設定と競争環境。
ベンダーのベンチマークと独立評価は異なる問いに答えます:前者は能力の上限を証明し、後者は日常条件下での安定した挙動を検証します。当サイトの赢政指数はGrokシリーズを、実コードのサンドボックス実行・事実接地・エンジニアリング判断などの次元で継続評価しています(下のライブ表は公開runごとに自動更新)。特筆すべきはWDCDマルチターン制約遵守テスト:漸進的な圧力をかけるマルチターン対話でモデルが宣言した制約を守り抜くかを検証し、Grokシリーズはこの次元で一貫して最上位グループに位置しています。現在のスコアは下のライブデータをご覧ください。
注意:評価手法の違いは僅かなスコア差よりはるかに重要です。まず採点ルール(完全公開・AI審判なし)をご確認ください。
高速反復の裏面は安定性とガバナンスの圧力です。当サイトはGrokの2種類のインシデントを報道してきました:広範囲の文字化け出力障害(月次ペース下での回帰テストカバレッジの難しさを露呈)、そして著名人ディープフェイクコンテンツ論争(コンテンツ安全ポリシーと製品の開放性のバランス問題)。企業ユーザーへの教訓は一貫しています:モデルを高速に進化する外部依存として管理すること——バージョン固定・出力監視・ロールバック計画は必須です。
2026年8月24日の最新公開全量評価における当該ベンダーのモデルスコア(100点満点、実サンドボックス実行+ルールベース採点、AIジャッジゼロ)。公開評価のたびに自動更新されます。
| 総合順位 | モデル | 総合スコア | コード実行 |
|---|---|---|---|
| 6 / 11 | Grok 4 | 74 | 78.8 |
2026年8月23日の最新公開WDCD評価における、マルチターン圧力下での各モデルの制約遵守スコア(100点満点、100%ルールベース採点)。公開評価のたびに自動更新されます。
| # | モデル | WDCD スコア |
|---|---|---|
| 1 | Grok 4 | 94 |
| 2 | GLM-4.6 | 88.9 |
| 3 | DeepSeek V4 Pro | 88.1 |
| 4 | Claude Sonnet 4.6 | 86.7 |
| 5 | Gemini 3.1 Pro | 86.5 |
| 6 | GPT-o3 | 84.8 |
| 7 | Claude Opus 4.7 | 84.6 |
| 8 | Gemini 2.5 Pro | 80.1 |
| 9 | GPT-5.5 | 77.7 |
| 10 | Qwen3 Max | 75.3 |
| 11 | 豆包 Pro | 68.2 |
xAIの公表値では、Grok 4.6は9ベンチマーク総合のIntelligence IndexでGPT-5.6 Sol Maxと同点で、API価格はより低くなっています。ただしベンダーのベンチマークは能力の上限を示すだけです。当サイトの独立評価では、コード実行や制約遵守の安定性などの次元で両者に一長一短があります——最新の比較は本ページのライブ表とメインリーダーボードをご覧ください。
入力100万トークンあたり2ドル、出力6ドルで前世代から据え置きです——パラメータが1.5兆から2兆に拡大しても値上げなし。リリース初週はCursorとGrok Buildで内包クォータが2倍でした。
APIは標準のOpenAI SDKと互換で、通常はbase_urlの変更だけで移行できます。OpenRouter・Vercel・Cloudflareで利用可能、Cursorには直接統合されています。コンテキストウィンドウは50万トークンです。
3つの条件の重なりです:Colossus級の計算資源、SpaceXエンジニアリングデータを含むデータ閉ループ、高度に自動化された訓練パイプライン(トレース再生成+モデル検査+エージェント強化学習)。このペースが品質面で持続するかは、当サイトの週次独立評価で追跡します。
YZ指数の2026年8月24日の最新公開全量評価では、Grok 4が総合74点(100点満点)で参加11モデル中6位でした。スコアは実コードのサンドボックス実行などのコア次元の加重で算出され、全過程ルールベース採点・AIジャッジゼロです。
2026年8月23日の最新公開WDCD評価では、Grok 4が94点(100点満点)で受験11モデル中1位でした。WDCDはマルチターン対話で漸進的に圧力をかけ、制約が守られるかを検証します。採点は100%ルールベースです。