📄 Deep Tech

ArXiv 最新

Copy Less, Ground More: Overcoming/ˈoʊvərˌkəmɪŋ/ Repetitive/rɪˈpɛtɪtɪv/ Copying in Long-Context/longcontext*/ Reasoning/ˈrizənɪŋ/ via Evidence-Aware/evidenceaware*/ Reinforcement/ˌriɪnˈfɔrsmənt/ Learning/ˈlərnɪŋ/

Lizhe Fang, Weizhou Shen, Tianyi Tang 2026-07-21 cs.CL | cs.AI

Large language models that generate step-by-step reasoning traces have achieved strong performance on complex tasks, and extending them to long-context settings has emerged as an important frontier. However, we identify a critical failure mode in this regime: \emph{repetitive copying}, where models ...

查看中文翻译

生成逐步推理轨迹的大型语言模型在复杂任务上取得了强大的性能,并将其扩展到长上下文设置已成为一个重要的前沿领域。然而,我们在这种情况下发现了一个关键的失败模式:\emph{重复复制},其中模型广泛地将文本从输入复制到其推理轨迹中,而不是有效地解决问题。我们表明,这种行为在前沿长上下文法学硕士中普遍存在,并且随着上下文长度的增加而加剧。通过将每个提示分为与任务相关的关键证据和不相关的干扰上下文,我们进一步表明根本原因是基础不足:模型不加区别地复制提示,而那些未能关注关键证据的模型更有可能回答错误。受这一诊断的启发,我们提出了 GEAR(接地证据感知奖励),这是一种奖励塑造方法,通过对与关键证据重叠的接地奖励和与不相关上下文重叠的干扰惩罚来增强准确性信号。为了在自然语言数据上启用 GEAR,我们开发了一个自动化管道,可以从任意文档构建带证据注释的训练数据。我们在多个模型规模和基准上验证了 GEAR,结果显示,在基于准确性的奖励下,GEAR 比标准 RL 平均提高了 4.6 分,在较长的上下文中获得更大的收益,同时还减少了重复复制和思考长度。我们的研究结果表明,即使长上下文评估从简单的检索转向复杂的推理,相关证据的准确基础仍然是不可或缺的能力,并且还有很大的改进空间。

阅读原文 →

Appearance/əˈpɪrəns/ Pointers/ˈpɔɪntərz/ -- Multimodal/multimodal*/ Region Control of Diffusion/dɪfˈjuʒən/ Transformers/trænsˈfɔrmərz/

Rahul Sajnani, Yulia Gryaditskaya, Radomír Měch 2026-07-21 cs.CV | cs.AI

Controllable image generation remains challenging for creative professionals, who often require precise regional control over materials, object identities, and spatial arrangements that cannot be reliably achieved through text prompting alone. Diffusion Transformers (DiTs) can natively ingest hetero...

查看中文翻译

可控的图像生成对于创意专业人士来说仍然具有挑战性,他们通常需要对材料、对象身份和空间安排进行精确的区域控制,而仅通过文本提示无法可靠地实现这些控制。扩散变压器(DiT)本身可以摄取来自文本和图像的异构令牌,但它们缺乏确定这些令牌应在何处以及如何影响输出的机制。我们引入了外观指针,即紧凑的标记,通过将文本或图像输入与用户指定的掩码对齐,引导 DiT 在正确的空间位置找到正确的外观线索。外观指针由区域对应网络生成,并通过空间聚合机制进行细化,使模型能够处理多个区域描述,而不会显着增加令牌负载。我们的方法引入了第一个与模态无关的接口,用于 DiT 中的本地化多模态控制,而无需从头开始重新训练基本模型。在一系列指标中,我们的单一模型达到或超越了特定模态的最先进方法的性能,为生成图像合成中的精确、区域感知、多模态指导提供了一条简单且可扩展的路径。

阅读原文 →

CodeRescue:/coderescue*/ Budget-Calibrated/budgetcalibrated*/ Recovery/rɪˈkəvəri/ Routing for Coding Agents

Qijia He, Jiayi Cheng, Chenqian Le 2026-07-21 cs.AI

Coding agents increasingly operate in executable environments where a failed attempt produces actionable feedback rather than merely an incorrect answer. Existing cost-aware systems typically treat such failures as cascade decisions: try a cheap model first, then escalate hard cases to a stronger an...

查看中文翻译

编码代理越来越多地在可执行环境中运行,其中失败的尝试会产生可操作的反馈,而不仅仅是错误的答案。现有的成本感知系统通常将此类失败视为级联决策:首先尝试一个便宜的模型,然后将困难案例升级为更强大和更昂贵的模型。然而,在编码中,执行反馈也可以使进一步的廉价模型恢复变得有价值,从而提出预算部署问题:代理何时应该花费更多廉价计算,何时应该升级?我们将这种故障后决策制定为异构操作上的恢复路由,并通过执行部署来训练受监督的路由器。为了使同一路由器在不断变化的预算下可用,我们添加了一个保形风险控制(CRC)层,该层无需重新训练即可选择部署时间成本损失,并在可交换性下提供边际预期成本控制。在五个编码基准测试中出现的失败中,廉价的恢复和升级表现出了互补的成功模式。校准边界改进了固定操作、仅提示路由器和二进制级联基线;在主要的 GPT-5.4-nano/GPT-5.4 设置中,一个 CRC 校准的边界点超过了始终升级的解决率,同时使用了其平均恢复成本的 35%。代码可在 https://github.com/Qijia-He/agent-budget-control 获取。

阅读原文 →