关于ZAKER Skills 合作
新浪财经 16小时前

星尘发布在线强化学习框架 SmoothRL,实现与大模型的异步推理

来源:新浪科技

新浪科技讯 9 月 4 日上午消息,近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的 online RL 到底该从哪些动作里学。

SmoothRL 首次将这类异步 online RL 放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。

过去几年,机器人基础模型主要解决的是 " 会不会 ":用更多数据、更强模型,把能力做宽。但机器人真正进入真实环境以后,新的问题往往不是完全不会,而是差几毫米、差半拍,或者换一个物体位置就不够稳定。

SmoothRL 关注的是这之后的一层:一个已经具备基础能力的 pretrained policy,进入真实世界以后,能不能继续根据真实执行结果修正自己。SmoothRL 指向的是一个正在变得越来越具体的问题:预训练让机器人学会怎么做,真实世界里的后训练,再把这些能力练得更准、更稳、更可靠。

在模型全面发展时,星尘 "AI 模型 - 具身 OS- 绳驱本体 " 的全栈系统也在持续迭代,推动 Physical AI 的应用与规模化部署。

下一步,团队计划进一步探索更大范围的策略更新、更广泛的任务分布,以及异步执行与生成式策略端到端优化之间的结合。

相关阅读

最新评论

没有更多评论了
新浪财经

新浪财经

新浪财经提供7*24小时财经资讯及全球金融市场报价;覆盖股票、债券、基金、期货、信托、理财、管理等多种面向个人和企业的服务。

订阅

觉得文章不错,微信扫描分享好友

扫码分享

热门推荐

查看更多内容

企业资讯

查看更多内容