MilesがOPDを導入:蒸留をポストトレーニングのプリミティブへ
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
智能体強化学習(Agentic RL)におけるトレーニングと推論の不一致を解消するコア設計原則「Token-In-Token-Out(TITO)」を解説し、MilesフレームワークにおけるTITO実装の仕組みを詳述する。
MilesはオープンソースのRL(強化学習)フレームワークで、AMD GPUのROCm環境での大規模な言語・マルチモーダルモデルの後学習を可能にします。