多轮智能体任务只有一个终点奖励,但在一条包含搜索、工具调用和多轮决策的轨迹里,决定成败的往往是一个不起眼的查询词、动作或对象选择。
这正是多轮语言智能体强化学习中的时间信用分配难题:终点奖励告诉模型 " 这条轨迹最后对不对 ",却没有告诉它 " 中间哪一步值得被强化 "。
当前的主流方案是让同一个模型在训练时阅读任务相关的程序性技能,再回头给无技能轨迹中的 token 打分。但教师的高置信度并不等于这一步真的对任务有帮助:它可能只是更偏好某种句式、格式或语言表达。
针对这个问题,来自中国科学技术大学与阿里巴巴集团的研究团队提出ADRS(Agentic Reinforcement Learning with Self-Distilled Reward Shaping),把训练期的特权技能转化为与回报相关的 token 级信用,并直接接入原生的 reward-to-advantage-to-policy 路径。
问题:终点奖励为什么不够
在ALFWorld中,智能体要先找到正确房间,再拿起物体、改变状态并完成放置;在WebShop中,它要搜索商品、检查属性、保留用户约束并完成购买。只看最后的成功标签,无法区分一条轨迹里的关键动作和无关的语言填充。
ADRS 把挑战拆成三点:教师分数不能直接跨交互步骤比较,不同步骤的上下文长度和模型不确定性使原始 log 概率的偏移与尺度都在变化;教师置信度不一定是有用的置信度,一个 token 被高度偏好可能只是因为语言上常见;独立的蒸馏损失可能绕开 GRPO/GiGPO 正在构造的组相对 advantage。
ADRS 如何工作:三层信用构造
ADRS 是位于轨迹采样和 actor 更新之间的信用构造层,不改变底层 RL 算法,也不把技能文本带到推理阶段。每轮训练分三步:无技能采样——行为策略在不读取技能的情况下生成多轮轨迹;训练期重评分——固定同一策略快照,对已生成 token 分别用普通上下文和带任务匹配技能的上下文重评分,技能只在训练期出现,rollout 与推理都保持 skill-free;构造并注入信用——教师信号经校准和可靠性门控后加到基础 token reward 上,交给原有的 advantage 算子更新策略。
具体分三层:
第一层在每个交互步骤内对教师分数做中心化和尺度归一化,保留 " 当前步骤里哪些 token 相对更受教师支持 " 的相对证据,而不是相信跨步骤的原始绝对值。
第二层是 TVA(Teacher Value Advantage)门控,根据同一比较组内 " 教师置信度—实际回报 " 的关联调节信号强度:教师更偏好的 token 确实出现在更高回报的轨迹中,指导才会被放行;关联弱时,教师信号不会默认成为任务信用。
第三层不再另开一条独立的蒸馏反向传播支路,而是把门控后的 token 信号在 advantage 构造之前注入,与环境奖励共同进入策略更新。

论文在 ALFWorld、WebShop 和搜索式 QA 三类环境上评估,覆盖 Qwen2.5-3B/7B 和 Qwen3-1.7B。150-step 共同预算下,3B 模型的 ALFWorld 成功率达到94.5%,较最强基线提升10.1个百分点;WebShop 的 Score/Success 为87.5/76.6;7B 上 ALFWorld 达到96.1%。重要的是,rollout 和推理都不读取技能,提升全部来自训练期对 token 信用的重新构造。

消融上,GiGPO82.8% → ADRS(无 TVA)87.5%→ ADRS+TVA89.8%,TVA 在 token 级特权信用之外再带来2.3个百分点,说明 " 教师偏好 " 与 " 教师偏好是否和回报相关 " 并不是同一个问题。token 诊断显示,训练到 150 步时 action 与 style token 的更新幅度比达到95.3—— ADRS 不是平均地强化整段回答,而是把更新对准真正决定执行结果的动作和对象。数据效率上,使用 60% 训练数据即超过全量 GRPO;在未见任务上平均高出11.9个百分点;最大交互步数增至 50 时,成功率为94.5%对84.4%,交互链路越长优势越明显。

方法的边界同样清楚:TVA 使用的是 batch 内的统计关联而非因果归因;效果依赖底层 advantage 算子是否保留 token 级差异;重评分也带来训练期的额外前向计算。但方向已经清晰:当多轮智能体面对的不是一步到位的答案,而是一连串会产生延迟后果的决策时,真正重要的不是 " 这条轨迹最后成功了 ",而是——成功之前,究竟是哪一个 token 做对了关键选择。
论文标题:Agentic Reinforcement Learning with Self-Distilled Reward Shaping
作者:Ranxu Zhang、Guinan Chen、Shaodong Chen、Jinghao Lin、Xiaozhou Xu、Zhe Sun、Yanyong Zhang、Chao Wang 等
论文链接:https://arxiv.org/abs/2608.03223
一键三连「点赞」「转发」「小心心」
欢迎在评论区留下你的想法!
— 完 —
【学术投稿】请在工作日发送邮件至:ai@qbitai.com,标题注明【投稿】,并告诉我们:你是谁,从哪来,投稿内容附上项目 / 主页链接,以及联系方式。
我们会 ( 尽量 ) 及时回复你 : )
点亮星标
科技前沿进展每日见