Miles RLループ
Miles v0.1は、フロンティア後学習(post-training)専用に構築されたフルスタックのプロダクションレベルシステムである。slimeのシンプルな設計思想を継承し、「検証可能・クリーン・カスタマイズ可能」というコア原則に従い、RLトレーニングループの各フェーズを全面的に最適化している。精度・効率・信頼性・拡張性を最優先目標とし、フロンティア規模のRLトレーニングを研究者と開発者にとって身近なものにする。

Milesにおける典型的なRLトレーニングタスクは、以下のフェーズを循環実行する。Rolloutフェーズでは、SGLangエンジンがトラジェクトリを生成する。Trainingフェーズでは、NVIDIA Megatron-LMまたはFSDPトレーナーがトラジェクトリグループを消費してポリシーを更新する。Weight updateフェーズでは、新しい重みをRolloutクラスターに同期させる。
Rollout
すべてのRolloutはSGLangによって生成される。MilesはSGLangをネイティブ統合しており、マルチターン会話・ツール実行・サンドボックス環境・トークン忠実なトラジェクトリキャプチャをサポートし、長文脈およびエージェンティックなワークロードに特に適している。
完全非同期RL
ロングテールトラジェクトリ問題に対処するため、Milesは完全非同期RL設計を採用し、同期スケジューリングによる相互ブロッキングを回避する。Rolloutエンジンはトラジェクトリを継続的に生成し、トレーナーは完了済みグループを独立して消費してモデルを更新する。

スケジューリングはサンプル粒度で行われ、完了したトラジェクトリは即座にスロットを解放する。データバッファがRolloutスループットとトレーニングペースを分離し、ユーザーはここで保持・リトライ・破棄のポリシーをカスタマイズできる。

エージェンティック環境とTITO
MilesはプラグインポイントによってHarborやHUDなどの環境を統合し、複数のサンドボックスバックエンドをサポートする。TITOセッションサーバーは、モデルが生成した正確なトークンIDをトレーナーに渡すことを保証し、トークナイゼーションのズレを防ぐ。

高効率R3とトレーニング最適化
Rollout Routing Replay(R3)はMoEルーティング結果を記録・再生し、数値的一致性を保証する。MilesはNVFP4・MXFP8などの低精度トレーニングおよびINT4 QATをサポートし、Blackwellアーキテクチャにおける高スループットを確保する。

© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接