星尘发布在线强化学习框架SmoothRL,实现与大模型的异步推理
2026-09-04 10:04   
来源: 云财经   
影响力评估指数:17.72  
云财经讯,近日,星尘智能(Astribot) 基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。解决的是大模型异步推理成为真实部署常态后,与之适配的online RL到底该从哪些动作里学。
SmoothRL 首次将这类异步online RL放到真实高动态投掷任务中验证,进一步证明在线学习不仅能用于高精度修正,也能适配连续加速、精确释放、不能停顿的动态操作。(新浪科技)
云财经智能匹配相关概念
| 新闻标题 | 时间 | 消息来源 | 新闻热度 |
|---|---|---|---|
| 支持举措密集落地 “六张网”建设按下快速键 | 今天 07:20 | 云财经 |
|
| 光大证券:维持中国民航信息网络“增持”评级 机场数字化&航旅智能收入快速增长 | 今天 07:07 | 云财经 |
|
| 康鹏科技:拟斥3000万-5000万元回购股份 | 09-03 17:03 | 云财经 |
|
| 武汉天源等在山西和顺成立环保能源公司 | 09-03 16:26 | 云财经 |
|
| 福鼎遭遇暴雨“中国白茶第一街”被淹,数家茶叶门店遭受损失 | 09-03 11:52 | 云财经 |
|
| 巴基斯坦外交部:希望美伊重返谈判桌 | 09-03 10:47 | 云财经 |
|