第一步
第二步
第三步
第四步
第五步

星尘发布在线强化学习框架SmoothRL,实现与大模型的异步推理

2026-09-04 10:04    来源: 云财经    影响力评估指数:17.72  
云财经讯,近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL到底该从哪些动作里学。 SmoothRL 首次将这类异步online RL放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。(新浪科技)
云财经智能匹配相关概念