アリババは2026年8月にQwen3.8-Maxモデルを発表した。総パラメータ数は2.4兆、アクティベーションパラメータは約950億に達する。同モデルは最大100万トークンのコンテキストウィンドウをサポートし、QwenCloud APIを通じて既に公開されている。オープンウェイトは8月10日の週にHugging FaceおよびModelScopeを通じて公開される予定だ。
モデルの主要仕様と利用可能性
Qwen3.8-MaxはQwen3.5アーキテクチャをベースに構築されており、テキスト・画像・動画の入力をサポートし、出力はテキストとなる。最大入力長は99.1万トークン(思考モード時はやや低下)、最大出力は13.1万トークン、推論予算の上限は26.2万トークンだ。APIの価格は入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで、キャッシュ読み取りはより低コストとなる。同モデルはOpenAIおよびDashScopeのインターフェースと互換性があり、ベースURLとモデルIDを変更するだけで統合できる。
ベンチマーク結果と実際の実行能力
Terminal-Bench 2.1テストでは86.6点を記録し、Claude Opus 4.8およびFable 5の84.6点を上回り、GPT-5.6 Solの88.8点に次ぐ成績となった。SWE-bench Proは67.7点、FrontierSWEは73.5点で、いずれもFable 5の対応スコアを下回る。一方、PaperBenchでは93.0点、IFBenchでは82.8点、GPQA Diamondでは92.6点を達成した。ビジョン関連ベンチマークでも、OSWorld-Verified 86.1点、Parametric CAD Bench 91.5点、OmniDocBench 1.5点と上位に位置している。
社内テストでは、同モデルが長期タスクを自律的に完了できることが示された。自律コーディングのデモでは、空のリポジトリから開始し、16日以上連続して動作し、265回のコミット、127件のプルリクエスト、151件のイシューを生成した。また、自動ビルド・ユニットテスト・リカバリ機構も含まれていた。別の研究論文の実験を再現するタスクでは、125時間連続で稼働し、7,600行のコードを記述、1,100回以上の操作と33ラウンドのGPUトレーニングを完了した結果、最終的な手法によりAIME24ベンチマークが2.7ポイント向上した。
オープンウェイトがもたらす産業変化
これまでQwenシリーズのMaxレベルモデルはウェイトが公開されていなかったが、今回は2.4兆パラメータ版および27Bの小型モデルの公開が予定されており、ユーザーはローカルへの展開やファインチューニングが可能となる。27B版は一般的なGPUハードウェアで動作するが、2.4兆パラメータ版には依然としてマルチノードのデータセンター環境が必要だ。公開後は、ソフトウェアエンジニアリング、法律文書審査、メディア運営、デザインなどの分野でリポジトリ規模のコーディングエージェントや長尺動画インデックスツールを直接活用できるようになる。
市場の即時反応として、アリババの株価は香港市場で一日に7.3%上昇した。アナリストは、中国の開発者が半導体規制の下でもAnthropicやOpenAIとの差を急速に縮めていることを示す事例として今回の発表を指摘している。
背景にある駆動要因
モデルのアクティベーションパラメータはわずか950億であり、推論時には一部のパラメータのみが関与するため、計算コストとレイテンシが低減される。これは、総パラメータ規模の追求だけでなく、Mixture of Expertsアーキテクチャによる効率上の実質的な最適化を反映している。長期自律実行能力は、フィードバックループ・タスク分配・異常リカバリの組み込みサポートに由来しており、ユーザー入力を単発の回答ではなく実行可能なプロジェクトへと変換できる。
一部のベンチマークでFable 5に迫るか上回る結果は、中国チームがマルチモーダルエージェントと長文書処理に注力してきた成果が定量的に示されたことを意味する。オープンウェイトの公開はエコシステム構築への考慮から決定された可能性が高く、サードパーティによるカスタマイズを許可することで応用の普及を加速させるとともに、輸出規制の環境下での影響力拡大を図るものと見られる。
独自の評価
Qwen3.8-Maxの発表は、パラメータ規模と実際の展開効率が両立可能であることを示している。オープンウェイトの公開は中国AI応用の普及を加速させるだろうが、2.4兆パラメータモデルのローカル実行には依然として高いハードルがあり、短期的にはAPIが主な利用形態であり続ける。自律コーディングおよび研究再現における性能は単純な問答の域を超えており、その将来的な価値は開発者が実際のプロジェクトで社内テストの結果を安定して再現できるかどうかにかかっている。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接