Copy Less, Ground More: Overcoming/ˈoʊvərˌkəmɪŋ/ Repetitive/rɪˈpɛtɪtɪv/ Copying in Long-Context/longcontext*/ Reasoning/ˈrizənɪŋ/ via Evidence-Aware/evidenceaware*/ Reinforcement/ˌriɪnˈfɔrsmənt/ Learning/ˈlərnɪŋ/
Large language models that generate step-by-step reasoning traces have achieved strong performance on complex tasks, and extending them to long-context settings has emerged as an important frontier. However, we identify a critical failure mode in this regime: \emph{repetitive copying}, where models ...
查看中文翻译
生成逐步推理轨迹的大型语言模型在复杂任务上取得了强大的性能,并将其扩展到长上下文设置已成为一个重要的前沿领域。然而,我们在这种情况下发现了一个关键的失败模式:\emph{重复复制},其中模型广泛地将文本从输入复制到其推理轨迹中,而不是有效地解决问题。我们表明,这种行为在前沿长上下文法学硕士中普遍存在,并且随着上下文长度的增加而加剧。通过将每个提示分为与任务相关的关键证据和不相关的干扰上下文,我们进一步表明根本原因是基础不足:模型不加区别地复制提示,而那些未能关注关键证据的模型更有可能回答错误。受这一诊断的启发,我们提出了 GEAR(接地证据感知奖励),这是一种奖励塑造方法,通过对与关键证据重叠的接地奖励和与不相关上下文重叠的干扰惩罚来增强准确性信号。为了在自然语言数据上启用 GEAR,我们开发了一个自动化管道,可以从任意文档构建带证据注释的训练数据。我们在多个模型规模和基准上验证了 GEAR,结果显示,在基于准确性的奖励下,GEAR 比标准 RL 平均提高了 4.6 分,在较长的上下文中获得更大的收益,同时还减少了重复复制和思考长度。我们的研究结果表明,即使长上下文评估从简单的检索转向复杂的推理,相关证据的准确基础仍然是不可或缺的能力,并且还有很大的改进空间。