Paper Digest: 2026-05-18
今天最值得看的 paper,我会给 RoadmapBench。 这篇 paper 的价值很直接,它终于把“coding agent 看起来会修 bug”和“coding agent 真的能做版本级开发”分开测了。 RoadmapBench 做的是 version upgrade 任务。agent 拿到的是旧版本代码快照,目标不是修一个孤立 issue,而是根据 roadmap instr...
今天最值得看的 paper,我会给 RoadmapBench。 这篇 paper 的价值很直接,它终于把“coding agent 看起来会修 bug”和“coding agent 真的能做版本级开发”分开测了。 RoadmapBench 做的是 version upgrade 任务。agent 拿到的是旧版本代码快照,目标不是修一个孤立 issue,而是根据 roadmap instr...
今天最值得看的 paper,我会给 Self-Distilled Agentic Reinforcement Learning。 这篇 paper 打中的问题很实在。大家都知道 RL 已经成了 agent post-training 的主轴,但一旦任务变成多轮交互,reward 往往太粗,反馈来得太晚,错误还会一路滚雪球。很多时候,agent 不是完全不会做,而是学不到足够细的修正信号。 ...
今天最值得看的 paper,我会给 MinT: Managed Infrastructure for Training and Serving Millions of LLMs。 这篇 paper 的价值很直接,它讨论的已经不是“怎么再训出一个更强的 LoRA policy”,而是当你真的开始大规模做 post-training 之后,policy 生命周期本身会不会成为系统瓶颈。 作者...
今天最值得看的 paper,我会给 StepCodeReasoner: Aligning Code Reasoning with Stepwise Execution Traces via Reinforcement Learning。 这篇 paper 有意思的地方,不在于它又把某个 benchmark 提高了几点,而在于它抓得很准,代码推理不该只在最终答案上被奖励,还应该在中间执行状态...
今天最值得看的 paper,我会给 Shepherd: A Runtime Substrate Empowering Meta-Agents with a Formalized Execution Trace。 这篇 paper 打动我的地方很直接,它讨论的不是 agent 会不会做题,而是 agent 的运行过程能不能被当成真正的系统对象来管理。 现在很多 agent 工作流都有一个共...
今天最值得看的 paper,我会给 Constraint Decay: The Fragility of LLM Agents in Backend Code Generation。 这篇 paper 很值得看,因为它把 coding agent 讨论里最容易被掩盖的一层,直接量化出来了:模型能把功能写出来,不代表它能把后端系统写稳。 作者设计得很克制。他们固定统一的 API contr...
今天最值得看的 paper,我会给 Constraint Decay: The Fragility of LLM Agents in Backend Code Generation。 这篇 paper 刺中的,是 coding agent 讨论里最容易被 demo 掩盖的一层:模型能把功能写出来,不等于它能把后端系统写对。 作者专门盯着这个问题做了一组很干净的实验。他们固定统一的 API...
今天最值得看的 paper,我会给 SWE-WebDevBench: Evaluating Coding Agent Application Platforms as Virtual Software Agencies。 这篇 paper 的价值很直接,它终于开始认真回答一个被 demo 视频冲淡了的问题:那些一句话生成应用的 coding agent,离真正能交付的软件团队还有多远? ...
今天最值得看的 paper,我会给 ProgramBench: Can Language Models Rebuild Programs From Scratch?。 这篇 paper 很直接,它问的就是一句很多人嘴上已经在默认、但证据其实并不够的话:LLM agent 到底能不能从零搭起一个像样的软件项目? 作者做法很硬。他们没有继续考单点 bug fix、局部 feature com...
今天最值得看的 paper,我会给 AI-Generated Smells: An Analysis of Code and Architecture in LLM and Agent-Driven Development。 这篇 paper 很扎人,因为它讨论的不是 AI 写的代码能不能过样例,而是另一层更难回避的问题:这些代码以后还能不能维护。 作者做了一次很系统的技术债审计,既看单...