2026年9月27日、北京のNaiveAIは309B MoEオープンソースモデル「Naive-N0.5-Flash」を発表した。有効パラメータは15.5B、1Mコンテキストをサポートし、MITライセンスで完全オープンソース化されており、推論速度は最大2000トークン/秒に達する。
事実の整理
本モデルは北京のNaiveAIが2026年9月27日にリリースした。総パラメータは309B、有効パラメータは15.5Bで、1Mコンテキストをネイティブサポートする。アーキテクチャにはグローバルアテンション層を持たず、スライディングウィンドウアテンションとDeepSeekスパースアテンションを組み合わせたハイブリッド設計を採用。小米(Xiaomi)のMiMo-V2.5をベースに改造し、3.25Tトークンで追加学習を実施した。重みと推論コードはMITライセンスでオープンソース化されており、コーディングおよびAI研究開発タスクを主な用途として位置付けている。
メカニズムの解説
モデルの学習プロセスには、AIが研究開発の最適化に参加する手法が採用されている。AIモデルがハイブリッドアテンションアーキテクチャの探索と、学習・推論・デプロイシステムの最適化を担い、人間の研究者が方向性の指針と重要な意思決定を提供する。推論システム「NaiveRT」はmega-kernelフュージョン、Programmatic Dependent Launch、およびSpeculative Decodingを組み合わせており、Standardモードではユーザーあたり50トークン/秒、Ultrafastモードでは最大2000トークン/秒を実現する。
APIの料金は入力100万トークンあたり0.10ドル、出力0.40ドル、キャッシュ読み取り0.01ドルに設定されている。また、開発者向けにオープンウェイトも提供される。
産業への影響
開発者にとっては、MITライセンスにより重みの直接ダウンロードとコード改変が可能となり、1Mコンテキストと最大2000トークン/秒の速度が長文テキスト処理と高速イテレーションのハードルを下げる。企業ユーザーに対しては、APIの料金体系が定量化可能なAPI呼び出しコストの選択肢を提供する。
競合状況においては、本モデルのハイブリッドアテンション設計が既存の全アテンションモデルと差別化を図るものであり、開発者はコーディングタスクにおけるローカル計算やスパース計算の実際のパフォーマンスを検証できる。上下流のツールチェーンに対しては、NaiveRTの最適化手法が今後の推論フレームワークにおけるカーネルフュージョンおよびスケジューリング戦略に影響を与える可能性がある。
比較と先例
本モデルの追加学習データ量は3.25Tトークンであり、アーキテクチャは小米のMiMo-V2.5から改造されている。評価において比較対象として挙げられたモデルにはGLM-5.3、Kimi-K3、Qwen-3.8-Maxなどが含まれるが、具体的なスコアは各モデルの公式ブログを参照する必要がある。
戦略的見解
現時点の事実に基づけば、今後最も起こりうる展開は、開発者コミュニティがMITライセンスの重みを活用してファインチューニングやツール統合を進めることであり、観察すべき指標としてはGitHubのコミット数、実際の推論レイテンシに関する報告、およびAPI呼び出し量の変化が挙げられる。
開発者がモデルを選定する際は、まずローカル環境に重みをデプロイして1Mコンテキスト下でのコーディングタスクをテストし、その後APIコストと自前の推論環境構築のコストパフォーマンスを比較することが推奨される。企業ユーザーは小規模なAPI呼び出しでUltrafastモードの本番負荷下での安定性を検証してから、利用拡大の判断を行うとよい。
モデルが標榜する再帰的自己改善の手法はまだ初期段階にある。一方、完全オープンソース化された重みとコード、およびAI研究開発タスクに特化した学習設計は明確な優位点となっている。
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接