
文章主要内容总结本文聚焦大型推理模型(LRMs)在多轮问题解决中的局限性,指出当前单轮强化学习(RL)训练虽能提升模型单轮推理能力,但会导致模型在多轮交互中重复答案、难以根据反馈修正推理,进而提出作为观测的单值反馈(Unary Feedback as Observation, UFO)框架,以解决这一问题。研究发现,通过多轮RL训练引入简单的单值反馈(如“再试一次”),可在保持单轮性能的同时,显著提升模型的多轮推理能力。具体而言,UFO将静态单轮数据集转化为多轮交互场景,通过马尔可夫决策过程(MDP)建模问题解决过程,仅用“错误时需重试”的单值反馈作为环境观测。此外,为鼓励模型以更少轮次得出正确答案并在失败时尝试多样化推理,设计了包含轮次奖励衰减(鼓励高效性)和答案重复惩罚(鼓励多样性)的奖励机制。实验结果显示,UFO框架使多轮推理准确率提升达14%,且该能力可迁移至跨领域任务。创新点揭示单轮RL训练的局限性:发现单轮RL训练会削弱模型的多轮交互推理能力,导致重复输出相同答案(70%的失败案例中,模型在5轮交互中答案完全一致)。提出UFO框架:利用简单的单值反馈(如“再试一次”),将静态单轮数据集转化为多轮训练场景,无需额外标注或复杂环境,即可实现多轮RL训练。设计针对性奖励机制:通过轮次奖励衰减(鼓励用更少轮次解决问题)和答案重复惩罚(减少重复推理),