Miles v0.1:プロダクションレベルのフロンティア後学習システム

Miles v0.1:プロダクションレベルのフロンティア後学習システム

Miles RLループ

Miles v0.1は、フロンティア後学習(post-training)専用に構築されたフルスタックのプロダクションレベルシステムである。slimeのシンプルな設計思想を継承し、「検証可能・クリーン・カスタマイズ可能」というコア原則に従い、RLトレーニングループの各フェーズを全面的に最適化している。精度・効率・信頼性・拡張性を最優先目標とし、フロンティア規模のRLトレーニングを研究者と開発者にとって身近なものにする。

The Miles fully async RL loop

Milesにおける典型的なRLトレーニングタスクは、以下のフェーズを循環実行する。Rolloutフェーズでは、SGLangエンジンがトラジェクトリを生成する。Trainingフェーズでは、NVIDIA Megatron-LMまたはFSDPトレーナーがトラジェクトリグループを消費してポリシーを更新する。Weight updateフェーズでは、新しい重みをRolloutクラスターに同期させる。

Rollout

すべてのRolloutはSGLangによって生成される。MilesはSGLangをネイティブ統合しており、マルチターン会話・ツール実行・サンドボックス環境・トークン忠実なトラジェクトリキャプチャをサポートし、長文脈およびエージェンティックなワークロードに特に適している。

完全非同期RL

ロングテールトラジェクトリ問題に対処するため、Milesは完全非同期RL設計を採用し、同期スケジューリングによる相互ブロッキングを回避する。Rolloutエンジンはトラジェクトリを継続的に生成し、トレーナーは完了済みグループを独立して消費してモデルを更新する。

How fully async handles long-tail trajectories

スケジューリングはサンプル粒度で行われ、完了したトラジェクトリは即座にスロットを解放する。データバッファがRolloutスループットとトレーニングペースを分離し、ユーザーはここで保持・リトライ・破棄のポリシーをカスタマイズできる。

Evaluation modes on the timeline

エージェンティック環境とTITO

MilesはプラグインポイントによってHarborやHUDなどの環境を統合し、複数のサンドボックスバックエンドをサポートする。TITOセッションサーバーは、モデルが生成した正確なトークンIDをトレーナーに渡すことを保証し、トークナイゼーションのズレを防ぐ。

The TITO session server

高効率R3とトレーニング最適化

Rollout Routing Replay(R3)はMoEルーティング結果を記録・再生し、数値的一致性を保証する。MilesはNVFP4・MXFP8などの低精度トレーニングおよびINT4 QATをサポートし、Blackwellアーキテクチャにおける高スループットを確保する。

On-policy distillation in MilesMetrics in the GLM-5.2 agentic RL training example