RecodeX 重构消息,星尘智能(Astribot)基座模型团队近日发布在线强化学习框架SmoothRL,该框架支持异步执行,适配大模型异步推理成为常态后的部署场景。SmoothRL首次将异步在线强化学习应用于真实高动态投掷任务验证,证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放等动态操作。

订阅 RecodeX 创投情报 每日融资动态与原创深度报道,直达邮箱