Thinking Machines、Inkling-Small 276Bパラメータモデルを発表——Inklingに迫る性能を実現

Thinking Machinesは2026年7月31日にInkling-Smallを発表した。これは総パラメータ数2,760億、1トークンあたり活性化パラメータ120億のMoEモデルであり、より大規模なInklingと同等の性能を持ちながら、サイズと速度が大幅に最適化されている。全モデルウェイトはHugging FaceとTinker Playgroundで公開されており、テキスト・画像・音声のマルチモーダルファインチューニングに対応している。

事実の整理

同社の公式ブログによると、Inkling-SmallはMixture-of-Experts(MoE)アーキテクチャを採用し、総パラメータ数は2,760億、1トークンあたりの活性化パラメータは120億にとどまる。Terminal-Bench 2.1、HLEテキスト推論、IFBench命令遵守などのベンチマークにおいて、可変思考努力(variable thinking effort)機構を通じてInklingに近い性能を達成しつつ、計算コストを大幅に削減している。なお、Inklingは総パラメータ数9,750億・活性化パラメータ410億で、2026年7月15日に発表されている。

仕組みの解説

Inkling-SmallはMoE設計により、入力処理時に一部のエキスパートネットワークのみを起動する。これにより、総パラメータ数2,760億のモデルが推論時に消費する計算量は、実質的に120億パラメータ相当にとどまる。同社はNVIDIA GB300 NVL72システム上でトレーニングを完了しており、オリジナル版とNVFP4量子化版の両方を提供することで、Blackwellハードウェアへの展開を容易にしている。可変思考努力機能により、ユーザーはminimalからxhighの範囲で出力品質とコストのバランスを調整でき、これは出力TFLOPsの消費量に直接対応する。

産業への影響

開発者にとっては、全モデルウェイトの公開により、直接ダウンロードしてTinkerプラットフォーム上でドメイン特化のファインチューニングが可能となり、API呼び出しへの依存が不要になる。企業ユーザーにとっては、総パラメータ数2,760億でありながら活性化パラメータが120億にとどまる設計により、特にローカル推論が必要なシナリオでの導入障壁が大きく下がる。競争環境においては、Thinking MachinesのこのリリースはQwenなどの中国語オープンソースモデルと並ぶ米国発のオープンソース選択肢を提供するものであり、組織がクローズドシステムに依存せず自らモデルを構築できることを強調している。

公式ブログは、Inkling-Smallがエージェント的なツール使用・推論・命令遵守のベンチマークにおいて、Inklingよりも高い効率性を示し、同規模のオープンソースモデルと比較しても競争力があると指摘している。

比較と先例

Inklingとの比較では、Inkling-Smallは総パラメータ数が9,750億から2,760億に、活性化パラメータが410億から120億に削減されながら、マルチモーダルのネイティブサポートと最大100万トークンのコンテキスト長を維持している。両モデルは同一ベンチマーク上で性能対計算コストのカーブを示しており、Inkling-Smallのカーブはより左に位置し、同等の性能をより低コストで実現できることを示している。Bridgewater Associatesが類似のオープンモデルを金融タスク向けにファインチューニングし、コストをクローズドモデルの14分の1に抑えた事例は、オープンウェイトの実際的な価値を裏付けている。

戦略的評価

現在の状況を踏まえると、より多くの組織がTinkerプラットフォーム上でInkling-Smallを特定のワークフロー向けにファインチューニングし、低努力設定と高努力設定における実際のコスト対効果を検証していくと考えられる。

開発者がモデルを選定する際、タスクがレイテンシに敏感でマルチモーダル入力を必要とする場合、Inkling-Smallの120億活性化パラメータは明確な効率上の優位性を提供する。独自データを持つ企業は、オープンウェイトを活用してローカル環境でファインチューニングを完結させることで、クローズドモデルへの繰り返しの支払いを回避できる。