第一步
第二步
第三步
第四步
第五步
//弹窗容器

阿里通义实验室智能计算团队推出新算法FIPO

2026-04-07 22:32    来源: 云财经    影响力评估指数:17.09  
云财经讯,4月7日,阿里通义实验室智能计算团队宣布推出新算法FIPO(Future-KL Influenced Policy Optimization),引入Future-KL机制,奖励关键Token,解决纯强化学习(Pure RL)训练中“推理长度停滞”难题。据该团队介绍,在32B规模的纯RL设定下,率先实现对o1-mini与同规模DeepSeek-Zero-MATH的性能反超。
云财经智能匹配相关概念