AgentOPSD:面向智能体强化学习的递归自蒸馏方法

HuggingFace Daily Papers(社区热门论文)2026-08-06 16:00

AgentOPSD 提出一种免评论家的递归回合级信用分配方法,将 token 级师生对数概率差聚合为回合级证据,并在 log-odds 空间递归更新贝叶斯信念状态,将稀疏结果监督转化为回合级信用信号。

ai