Paper Digest: 2026-06-22
今天最值得看的 paper,我会选 Probe-and-Refine Tuning of Repository Guidance for Coding Agents。 这篇论文处理的问题非常贴近现在的 coding agent 使用现场:一个 repo 里的关键操作知识,往往不在代码里。 比如: 哪些文件负责哪些 subsystem 测试应该怎么跑 哪些 workflow...
今天最值得看的 paper,我会选 Probe-and-Refine Tuning of Repository Guidance for Coding Agents。 这篇论文处理的问题非常贴近现在的 coding agent 使用现场:一个 repo 里的关键操作知识,往往不在代码里。 比如: 哪些文件负责哪些 subsystem 测试应该怎么跑 哪些 workflow...
今天最值得看的 paper,我会选 RODS: Reward-Driven Online Data Synthesis for Multi-Turn Tool-Use Agents。 这篇论文处理的是 multi-turn tool-use agent 训练里一个很现实的问题:静态数据很快会失效。 在 GRPO 这类 rollout-based RL 里,一个样本真正有价值,往往发生在模...
今天最值得看的 paper,我会选 LoopCoder-v2: Only Loop Once for Efficient Test-Time Computation Scaling。 这篇论文关心一个很现实的问题:code model 能不能通过 test-time computation scaling 继续变强,而且代价要可控。 过去我们常见的 scaling 思路,是把模型做大、数...
今天最值得看的 paper,我会选 Open-SWE-Traces: Open-SWE-Traces: Advancing Dual-Mode Multilingual Distillation for Software Engineering Agents。 这篇论文抓住了 open coding agent 最现实的瓶颈:不是缺一个更漂亮的 demo,而是缺足够大的、足够真实的、lic...
今天最值得看的 paper,我会选 APPO: APPO: Agentic Procedural Policy Optimization。 它研究的是 agentic RL 里一个很硬的问题:多轮 tool-use agent 到底该在哪里探索,又该把 credit 分给哪一个中间决策? 很多 agent RL 方法会把 tool call boundary、固定 workflow st...
今天最值得看的 paper,我会给 EvoArena: EvoArena: Tracking Memory Evolution for Robust LLM Agents in Dynamic Environments。 这篇研究的是一个很具体、也很容易被低估的问题:如果环境一直在变,agent 的 memory 该怎么活下去? 很多 agent eval 默认世界是静态的。任务条件固定...
今天最值得看的 paper,我会给 Arbor: Toward Generalist Autonomous Research via Hypothesis-Tree Refinement。 这篇研究的是一个很实际的问题:如果让 AI agent 长时间做 research,它怎样避免每次都像重新开始? Arbor 的设计有三块。 第一块是 long-lived coordinator。...
今天最值得看的 paper,我会给 SWE-Explore: Benchmarking How Coding Agents Explore Repositories。 这篇关心一个很容易被最终分数掩盖的问题:coding agent 在修 bug 之前,到底有没有找到该看的代码。 很多 repository-level benchmark 会把 agent 的全部能力压成一个 binar...
今天最值得看的 paper,我会给 Socratic-SWE: Self-Evolving Coding Agents via Trace-Derived Agent Skills。 这篇关心一个很核心的 coding agent 问题:agent 做过很多题,留下很多成功和失败轨迹,这些轨迹要怎么变成下一轮能力提升的燃料。 现在很多 synthetic SWE data 方法会通过固定...
今天最值得看的 paper,我会给 Combinatorial Synthesis: Scaling Code RLVR via Atomic Decomposition and Recombination。 这篇 paper 关心一个很硬的 code model 问题:RLVR 要怎么继续扩大。 RLVR 的吸引力很清楚。代码任务天然适合 verifiable rewards,只要 t...