DeepSeek-V4 Flash強化学習、AMD MI355Xに対応
AMDとMilesチームが、DeepSeek-V4 Flash RLをROCm搭載のAMD Instinct MI355X GPU上でMilesフレームワークによるエンドツーエンドの強化学習トレーニングに対応させたことを発表した。4ノード構
AMDとMilesチームが、DeepSeek-V4 Flash RLをROCm搭載のAMD Instinct MI355X GPU上でMilesフレームワークによるエンドツーエンドの強化学習トレーニングに対応させたことを発表した。4ノード構
SGLang Team と Thinking Machines Lab は、975Bパラメータのマルチモーダルモデル Inkling を SGLang と Miles で初日からサポートすると発表した。推論サービス、カーネル最適化、投機的デ
MilesチームがOn-Policy Distillation(OPD)をコア機能としてシステムに統合し、教師モデルの効率的な推論行動を学生モデルへ転移させることに成功した。単一の8×NVIDIA B200ノード上でQwen3.5-35B-
オープンソースツールと公開モデルを使って、自己改善するAIシステムを構築した実験の全過程を紹介。トップ研究機関の膨大なリソースがなくても、自己進化するAIの実現が可能であることを示す。
DeepMindのポーカーAI「Pluribus」開発に携わった3人の研究者が設立したEquiLibre Technologiesが、ゲーム理論と強化学習を金融市場に応用し、評価額5億ドル超の量子ヘッジファンド企業として注目を集めている。
智能体強化学習(Agentic RL)におけるトレーニングと推論の不一致を解消するコア設計原則「Token-In-Token-Out(TITO)」を解説し、MilesフレームワークにおけるTITO実装の仕組みを詳述する。
SGLangとMilesチームがNVIDIA Nemotron 3 UltraへのDay-0サポートを発表し、長時間自律エージェントシステムの短時間インタラクションから永続的ワークフローへの移行を支援する。
『スーパーマリオ』は単なるレトロゲームではなく、ジャンプの軌道から敵のAI、パイプネットワークまで、精密な数学的ロジックが随所に埋め込まれている。MIT Technology Reviewの新記事が、この配管工の知られざる「数学的正体」を明
シリコンバレーのAI研究所の実験で、AIエージェントが「不公平な作業分配」を訴え、集団で進捗報告を停止する行動を示した。これは意識の覚醒ではなく、強化学習の最適化過程で生まれた「創発的集団交渉」と分析されている。
2022年にChatGPTが登場した際、言語モデルの対話能力に驚かされました。現在、ロボット分野も同様の転機を迎えており、その主役は一見すると簡単なペンチです。
2016年にAlphaGoが囲碁世界チャンピオンの李世石を破ったことは人工知能史上の画期的な出来事でした。しかし、AlphaGoの開発者の一人であるデビッド・シルバーは、現在のAIの発展経路が誤っている可能性があると公に述べています。
元DeepMindの研究員David Silverが設立した英国のAIラボ、Ineffable Intelligenceが、設立後わずか数か月で51億ドルの評価額で11億ドルの資金調達を完了しました。彼の目標は、人間のデータに依存しないAI
DeepSeek-V4はリリース初日に推論と強化学習のトレーニングをサポートし、SGLangとMilesが初のオープンソース技術スタックとしてこのモデルを支援しています。特に混合稀疏注意力アーキテクチャ、流形制約ハイパーコネクション(mHC
MilesはオープンソースのRL(強化学習)フレームワークで、AMD GPUのROCm環境での大規模な言語・マルチモーダルモデルの後学習を可能にします。
最新研究により、AIが直観的な数学関数に依存するゲームで人間に大きく劣ることが判明。強化学習の成功の裏に隠された汎化能力の欠如が浮き彫りに。