ロボット企業であるUnitree(宇樹科技)は先日、ロボットのトレーニング用ソースコードを全面的にオープンソース化すると発表し、業界で大きな注目を集めています。今回オープンソース化されるのは、強化学習(RL)のトレーニングコードと、シミュレーションからシミュレーション(Sim-to-Sim)、シミュレーションから現実(Sim-to-Real)までの完全なコードです。
Unitree、ロボットトレーニング用コードを全面オープンソース化:業界のイノベーションを加速


ロボット企業であるUnitree(宇樹科技)は先日、ロボットのトレーニング用ソースコードを全面的にオープンソース化すると発表し、業界で大きな注目を集めています。今回オープンソース化されるのは、強化学習(RL)のトレーニングコードと、シミュレーションからシミュレーション(Sim-to-Sim)、シミュレーションから現実(Sim-to-Real)までの完全なコードです。
7月2日、オープンソース強化学習インフラAReaLが2.0版を発表。基盤モデル訓練とエージェント応用の連携を強化し、実業務向け継続学習を実現。エージェントの対話を記録・整理し訓練に活用、持続的進化を可能に。....
元DeepMind研究者が設立したEquiLibre Technologiesが強化学習を金融取引に応用。Aラウンドで評価額5億ドル、Creandum主導で同社最大の投資に。Tower Research Capitalと協業し、1日数十億ドルを取引。2025年には暗号通貨市場に参入予定。....
NVIDIAがPolar強化学習トレーニングフレームワークをオープンソース化。主な革新点は、CodexやClaude Codeなどの主要コードエージェントがネイティブコードを変更せずにGRPOトレーニングに接続できること。このフレームワークは、コードエージェントが単一ステップタスクから複雑な長フロータスク(リポジトリレベルの変更やOSインタラクションなど)へ進化する際の業界課題を解決し、エージェント強化学習の「壁」を打破する。....
テンセントの混元は、UCLAや香港中文大学などと協力し、マルチモーダル大規模言語モデル(MLLMs)の「受動的理解」から「能動的推論」への進化を促進するため、マルチモーダル検索エージェントをオープンソース化しました。これまで、高品質データ、自動軌跡合成パス、訓練レシピの欠如により、トップエージェントの再現が困難でした。今回のオープンソース化は、この停滞を打破し、コミュニティの発展を目指します。....
アリババの通義ラボがFIPOアルゴリズムを発表。Future-KLメカニズムにより、複雑な論理推論における従来の強化学習の課題を解決し、数学問題などの推論精度と効率を大幅に向上させた。....