Paper Digest: 2026-04-20
今天最值得看的 paper,不是又一个更高分的 benchmark 结果,而是一篇把一个越来越现实的问题捅破的工作。Where does output diversity collapse in post-training? 关心的不是模型会不会答对第一条,而是模型在后训练之后,为什么越来越容易给出“整齐划一”的答案。 这件事乍看像个审美问题,其实很技术,也很现实。很多人默认,只要 top...
今天最值得看的 paper,不是又一个更高分的 benchmark 结果,而是一篇把一个越来越现实的问题捅破的工作。Where does output diversity collapse in post-training? 关心的不是模型会不会答对第一条,而是模型在后训练之后,为什么越来越容易给出“整齐划一”的答案。 这件事乍看像个审美问题,其实很技术,也很现实。很多人默认,只要 top...
今天最值得看的 paper,是一篇把 SWE agent 为什么总在长任务里失速 说得很透的工作。SWE-TRACE: Optimizing Long-Horizon SWE Agents Through Rubric Process Reward Models and Heuristic Test-Time Scaling 关心的不是某个 flashy demo,也不是再堆一点 bench...
今天最值得看的 paper,不是又一个更大模型,也不是一个花哨 demo,而是一篇很具体地讨论 AI coding agent 到底怎样才能少走弯路 的工作。Formal Architecture Descriptors as Navigation Primitives for AI Coding Agents 讨论的是一个常被低估的问题,coding agent 在真实代码库里,究竟有多少...
今天最值得看的 paper,是一篇把 post-training 里一个常被使用、却少有人真正讲透的方法拆开来看的工作。Rethinking On-Policy Distillation of Large Language Models: Phenomenology, Mechanism, and Recipe 讨论的是 OPD,on-policy distillation。这个方向这半年越...
今天最值得看的 paper,不是又一个更大的 benchmark,而是一篇把 RL for LLMs 里一个很烦、但大家都见过的毛病讲清楚的工作。The Past Is Not Past: Memory-Enhanced Dynamic Reward Shaping 这篇 paper 盯住的是 rollout diversity 崩掉之后的那种熟悉场面,模型并不是不会探索,它只是会反复绕回同...
今天最值得看的 paper,不在 Hugging Face 热榜里,而在 arXiv 的 cs.SE 角落。原因很简单,这篇 paper 碰到的是 code LLM 真正在生产里会撞上的墙,模型知道的 API,和今天真实存在的 API,经常已经不是同一个东西。When LLMs Lag Behind: Knowledge Conflicts from Evolving APIs in Cod...
今天最值得看的 paper,挑战的不是一个小结论,而是最近 post-training 圈里一个被说得过于顺口的判断,SFT 负责记忆,RL 负责泛化。这个说法太整齐了,所以也太可疑。Rethinking Generalization in Reasoning SFT 这篇 paper 做的事情很扎实,它把 reasoning SFT 的泛化问题拆开来看,最后给出的答案不是 yes 或 no...
今天最值得看的 paper,不在于它又给 agent 加了什么新能力,而在于它终于认真去量 agent 到底做对了什么、做错了什么。过去很多 autonomous agent benchmark 最大的问题,是只看终点,不看过程。最后按钮点对了、文件改对了、答案交对了,分就给了。但真实世界里的 agent,往往恰恰死在过程里,绕远路、碰安全红线、靠运气撞对结果。Claw-Eval 这篇 pa...
今天最值得看的论文,落点非常明确,coding model 真正缺的,也许不是再多一点“会说”的 reasoning,而是更像程序员那样,先在脑子里跑一遍代码,再决定自己写得对不对。今天几篇强 paper 放在一起看,会发现一个共同方向,大家都在试图把模型从只会产出答案,往会模拟过程、会修正错误、会更新信念那边推。 今日 3 篇精选 1) Self-Execution Simulatio...
今天最值得看的论文,不在 benchmark 花活,而在一个更根本的问题,post-training 到底该从哪里拿到足够密、但又不失真的学习信号。稀疏 outcome reward 太粗,纯 privileged distillation 又容易把目标带偏。今天最强的几篇 paper,基本都围着这条线打转,只是切入点不同,有的在讲 reasoning RL 的信号设计,有的在讲 code ...