ALLE RESEARCH / AGENTIC REINFORCEMENT LEARNING
← 返回 Agentic RL 研究目录
AGENTIC RL / POST-TRAINING

PiCA让每一步探索,
都有学习的方向。

Under Review

Agent 如何知道,哪一次搜索真正推动了答案?

我们研究长程任务中的信用分配。PiCA 识别多轮搜索中的关键步骤,以依赖历史轨迹的过程奖励,指导 Agent 的强化学习后训练。

Pivot-Based Credit Assignment for Search Agentic Reinforcement LearningDongyi Liu* · Yifan Niu* · Qinwen Wang · Han Xiao · Jia LiHKUST (Guangzhou) · HKUST   /   * Equal contribution
7 benchmarks

知识密集型问答 · 域内与域外评测

39.6% EM

Qwen2.5-3B · 七项基准平均

42.6% EM

Qwen2.5-7B · 七项基准平均

数据来源:论文 Table 1;EM 为答案精确匹配率,结果为三次独立运行的平均。

01 / THE IDEA

奖励真正带来进展的步骤。

把搜索轨迹视为累积信息、逐渐接近正确答案的过程。

01 / PIVOT STEPS

找到关键进展

利用目标子问题与子答案,识别轨迹中推动任务求解的关键步骤,为奖励模型提供监督。

02 / TRAJECTORY AWARE

结合完整历史

根据此前的搜索与推理估计成功概率,用相邻步骤的概率变化衡量进展,建模步骤之间的依赖。

03 / POLICY OPTIMIZATION

转化为训练信号

结合过程奖励、搜索轮次惩罚与最终答案奖励,通过 PPO 优化 Agent 的多轮搜索策略。

PiCA 两阶段流程:先利用关键步骤和最终结果训练奖励模型,再冻结奖励模型,以过程奖励、轮次惩罚和任务奖励训练搜索策略。
FIGURE 1 / 方法总览第一阶段训练 PiCA 奖励模型;第二阶段通过 PPO 优化搜索 Agent。图截取自论文第 4 页,点击可放大。
02 / EVIDENCE

在真实问答任务中验证。

覆盖 NQ、HotpotQA、TriviaQA、PopQA、2WikiMultiHopQA、MuSiQue 与 Bamboogle。

七项基准平均成绩 · PiCA 与 TIPS
模型方法EM ↑F1 ↑
Qwen2.5-3B InstructTIPS33.6%41.1%
PiCA39.6%48.1%
Qwen2.5-7B InstructTIPS41.7%51.0%
PiCA42.6%51.2%

来源:论文 Table 1(EM)与 Table 2(F1)。原表 0–1 分数换算为百分数;TIPS 为主表中七项平均成绩最高的对比方法。上述结果限于论文中的搜索问答设置。

TRAINING DYNAMICS

兼顾答案质量
与探索过程。

在论文的消融实验中,仅在答案奖励上增加轮次惩罚,会出现回答变短、后期性能下降的现象。加入 PiCA 后,训练保持较稳定的回答长度,答案 F1 持续提升。

PiCA 消融实验:左图为训练答案 F1,右图为回答长度;完整 PiCA 奖励组合与仅 F1、F1 加惩罚两种设置对比。
FIGURE 3 / 消融实验不同奖励组合下的答案 F1 与回答长度。截取自论文第 8 页,点击可放大。
FROM RESEARCH TO CAPABILITY

从任务与环境,
走向 Agent 后训练。

围绕可验证任务、过程奖励与训练评测,探索 Agent 能力提升。

START A CONVERSATION

与 ALLE 研究团队交流

数据、环境、评测与合作。

hello@alleai.cloud ↗