Grok 4.6 徹底解説:xAIの月次フラッグシップ・価格戦略・独立評価データ

最終更新: 2026-08-23 · 本ページは常設リファレンスとして、事象の進展と最新の公開評価データに合わせて更新されます
xAIは2026年8月12日にGrok 4.6を発表:パラメータは1.5兆から2兆に拡大、9ベンチマークのIntelligence IndexはGPT-5.6 Sol Maxに並び、API価格は据え置きです。本ガイドはリリースの事実、月次フラッグシップの反復ロジック、接続方法、そして当サイトの独立評価(マルチターン制約遵守テストを含む)でのGrokシリーズの実測を整理します。

Grok 4.6とは:リリースの事実

2026年8月12日、xAIはGrok 4.6を発表しました。核心事実:パラメータはGrok 4.5の1.5兆から2兆に拡大し、Colossusスーパーコンピューティングクラスターで訓練。9ベンチマーク総合のIntelligence IndexはGPT-5.6 Sol Maxと同スコアを記録し、API価格は入力100万トークンあたり2ドル・出力6ドルに据え置き。訓練データには選別済みのモデル生成推論トレース、高度な技術概念、高品質エンジニアリングデータが含まれ、Grok 4.5でSFTトレースを再生成しモデル検査で問題サンプルを除外後、大規模なエージェント強化学習を実施。詳細は当サイトの報道:Grok 4.6発表:GPT-5.6に性能で並ぶも反復ペースが焦点に

「毎月フラッグシップ」:反復ペースの論理と代償

Grok 4.6で最も注目されたのは単発の性能ではなくペースです:xAIは8月21日までにGrok 4.7を投入予定とし、「毎月フラッグシップ」を常態化させようとしています。このペースはColossusクラスターの継続拡張とデータの閉ループに支えられており、SpaceX上場後はGrokとColossusが中核AI戦略として位置づけられ、SpaceXのエンジニアリングデータも訓練コーパスに加わりました。

高速反復の直接的な成果は、エージェントコーディングとナレッジワークのテストで最先端を更新し続けるモデルです。代償は訓練フローの高度な自動化が必須になること——データ選別・トレース生成・強化学習を数週間で完走する必要があります。導入側にとっても、月次ペースはより頻繁な回帰検証を意味します:前バージョンで調整したプロンプトやワークフローが、次バージョンでそのまま通用するとは限りません。

価格と接続:据え置き価格でより大きなモデルへ

Grok 4.6はAPI価格を据え置き(100万トークンあたり$2/$6)、同じ予算でより大規模なモデルの推論能力が使えます。初週はCursorとGrok Buildで内包クォータが2倍に。接続面:APIは標準のOpenAI SDKと互換で、OpenRouter・Vercel・Cloudflareに対応、Cursorには直接統合——50万トークンのコンテキストウィンドウと前世代に近い推論速度で、ファイル横断リファクタリングやマルチツールのエージェントアプリに適します。価格戦略の分析は当サイトの報道:Grok 4.6の価格設定と競争環境

独立評価から見たGrok

ベンダーのベンチマークと独立評価は異なる問いに答えます:前者は能力の上限を証明し、後者は日常条件下での安定した挙動を検証します。当サイトの赢政指数はGrokシリーズを、実コードのサンドボックス実行・事実接地・エンジニアリング判断などの次元で継続評価しています(下のライブ表は公開runごとに自動更新)。特筆すべきはWDCDマルチターン制約遵守テスト:漸進的な圧力をかけるマルチターン対話でモデルが宣言した制約を守り抜くかを検証し、Grokシリーズはこの次元で一貫して最上位グループに位置しています。現在のスコアは下のライブデータをご覧ください。

注意:評価手法の違いは僅かなスコア差よりはるかに重要です。まず採点ルール(完全公開・AI審判なし)をご確認ください。

リスクとガバナンス

高速反復の裏面は安定性とガバナンスの圧力です。当サイトはGrokの2種類のインシデントを報道してきました:広範囲の文字化け出力障害(月次ペース下での回帰テストカバレッジの難しさを露呈)、そして著名人ディープフェイクコンテンツ論争(コンテンツ安全ポリシーと製品の開放性のバランス問題)。企業ユーザーへの教訓は一貫しています:モデルを高速に進化する外部依存として管理すること——バージョン固定・出力監視・ロールバック計画は必須です。

YZ指数の現在スコア(ライブデータ)

2026年8月24日の最新公開全量評価における当該ベンダーのモデルスコア(100点満点、実サンドボックス実行+ルールベース採点、AIジャッジゼロ)。公開評価のたびに自動更新されます。

総合順位モデル総合スコアコード実行
6 / 11 Grok 4 74 78.8
完全なランキングと方法論を見る →

WDCD マルチターン制約遵守テスト(ライブデータ)

2026年8月23日の最新公開WDCD評価における、マルチターン圧力下での各モデルの制約遵守スコア(100点満点、100%ルールベース採点)。公開評価のたびに自動更新されます。

#モデルWDCD スコア
1 Grok 4 94
2 GLM-4.6 88.9
3 DeepSeek V4 Pro 88.1
4 Claude Sonnet 4.6 86.7
5 Gemini 3.1 Pro 86.5
6 GPT-o3 84.8
7 Claude Opus 4.7 84.6
8 Gemini 2.5 Pro 80.1
9 GPT-5.5 77.7
10 Qwen3 Max 75.3
11 豆包 Pro 68.2
WDCD の完全なランキングと方法論を見る →

よくある質問

Grok 4.6とGPT-5.6はどちらが強い?

xAIの公表値では、Grok 4.6は9ベンチマーク総合のIntelligence IndexでGPT-5.6 Sol Maxと同点で、API価格はより低くなっています。ただしベンダーのベンチマークは能力の上限を示すだけです。当サイトの独立評価では、コード実行や制約遵守の安定性などの次元で両者に一長一短があります——最新の比較は本ページのライブ表とメインリーダーボードをご覧ください。

Grok 4.6のAPI価格は?

入力100万トークンあたり2ドル、出力6ドルで前世代から据え置きです——パラメータが1.5兆から2兆に拡大しても値上げなし。リリース初週はCursorとGrok Buildで内包クォータが2倍でした。

Grok 4.6への接続方法とコンテキストサイズは?

APIは標準のOpenAI SDKと互換で、通常はbase_urlの変更だけで移行できます。OpenRouter・Vercel・Cloudflareで利用可能、Cursorには直接統合されています。コンテキストウィンドウは50万トークンです。

xAIはなぜ毎月フラッグシップを出せるのか?

3つの条件の重なりです:Colossus級の計算資源、SpaceXエンジニアリングデータを含むデータ閉ループ、高度に自動化された訓練パイプライン(トレース再生成+モデル検査+エージェント強化学習)。このペースが品質面で持続するかは、当サイトの週次独立評価で追跡します。

Grok 4は現在、独立ベンチマークでどんな成績ですか?

YZ指数の2026年8月24日の最新公開全量評価では、Grok 4が総合74点(100点満点)で参加11モデル中6位でした。スコアは実コードのサンドボックス実行などのコア次元の加重で算出され、全過程ルールベース採点・AIジャッジゼロです。

現在、マルチターンの圧力下で最も制約を守るモデルは?

2026年8月23日の最新公開WDCD評価では、Grok 4が94点(100点満点)で受験11モデル中1位でした。WDCDはマルチターン対話で漸進的に圧力をかけ、制約が守られるかを検証します。採点は100%ルールベースです。