Paper Digest: 2026-08-12
今天最值得看的 paper,我会选 Persistent Recursive Worlds Enable Autonomous Software Evolution。 它研究的是 coding agents 最难绕开的系统问题:一个软件项目可能持续几天、几个月,甚至几十年,任何单个 agent 的 session、context 和 memory 都活不了这么久。作者提出的 EvoX Ge...
今天最值得看的 paper,我会选 Persistent Recursive Worlds Enable Autonomous Software Evolution。 它研究的是 coding agents 最难绕开的系统问题:一个软件项目可能持续几天、几个月,甚至几十年,任何单个 agent 的 session、context 和 memory 都活不了这么久。作者提出的 EvoX Ge...
今天最值得看的 paper,我会选 SWE-Bench ProMax: Benchmarking Agents on Large-Scale Multilingual Code Refactoring。 它选了一个 code agents 还远没有解决、同时非常接近真实工程的能力:large-scale refactoring。模型需要在多个文件之间协调修改,保持外部行为一致,并让完整 t...
今天最值得看的 paper,我会选 DCAS: Decoupling CLI Agent Scaffolding to Internalize Planning across Scaffolds。 它指出 code-agent training 里一个容易被忽略的 confound:模型学到的内容同时包含解决软件问题的能力,以及生成 trajectory 的 agent scaffold ...
今天最值得看的 paper,我会选 AgentOPSD: Recursive Self-Distillation for Agentic Reinforcement Learning。 它处理 long-horizon agentic RL 里一个很具体的问题:trajectory 结束后只有一个 success reward,训练系统怎样知道中间哪些 turn 真正改变了结果? GRP...
今天最值得看的 paper,我会选 ABSeeker: Training Long-Horizon Search Agents via Answer-Backtracked Credit Assignment。 它研究 long-horizon agent training 里最难处理的问题之一:一条搜索 trajectory 最终成功或失败,训练系统该怎样判断中间两百步里哪些动作真正有价...
今天最值得看的 paper,我会选 TurnSight: Turn-Level Hindsight Self-Distillation for Tool-Integrated Reasoning。 它研究的是 agentic RL 里一个很具体的难题:一条十轮 tool-use trajectory 最后拿到成功或失败的 reward,模型怎么知道是哪一轮工具选择、参数构造或中间推理真正决...
今天最值得看的 paper,我会选 LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks。 它抓住了 long-horizon agent 的一个核心故障源:任务越长,execution history 越像一份混杂了事实、猜测、计划和自我评价的数据库。模型需要从不断增长的 context 里判断哪些...
今天最值得看的 paper,我会选 From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards for Open-Ended LLM Self-Improvement。 它问了一个很实际的问题:RLVR 在数学和代码上很好用,因为答案、单元测试或编译器可以给出确定的 reward。到了 summarizat...
今天最值得看的 paper,我会选 Qwen-UI-Agent Technical Report: Toward Next-Generation Real-World Centric Foundation GUI Agents。 它最有价值的部分是完整系统设计。模型、环境、online RL、action space、data flywheel 和 harness 被放在同一个闭环里讨论。...
今天最值得看的 paper,我会选 CoRT: Counterfactual Replay for Token-Level Rubric-Guided Policy Optimization。 Rubric-based RL 有一个容易被忽略的信息损失。 Verifier 原本可以逐条判断 response 是否满足 correctness、formatting、safety、style...