Paper Digest: 2026-07-14
今天最值得看的 paper,我会选 Weak-to-Strong Generalization via Direct On-Policy Distillation。 它讨论的是一个很现实的 post-training 问题:RLVR 很有用,但在强模型上反复跑 RL 太贵。 现在很多 reasoning model 的提升来自 reinforcement learning with ve...
今天最值得看的 paper,我会选 Weak-to-Strong Generalization via Direct On-Policy Distillation。 它讨论的是一个很现实的 post-training 问题:RLVR 很有用,但在强模型上反复跑 RL 太贵。 现在很多 reasoning model 的提升来自 reinforcement learning with ve...
今天最值得看的 paper,我会选 Long-Horizon-Terminal-Bench: Testing the Limits of Agents on Long-Horizon Terminal Tasks with Dense Reward-Based Grading。 这篇 paper 很直接地戳中了当前 agent 的薄弱处:短任务看起来越来越能做,长任务还是很难。 很多 t...
今天最值得看的 paper,我会选 Single-Rollout Asynchronous Optimization for Agentic Reinforcement Learning。 这篇 paper 讨论的是一个很现实的 post-training 问题:当 RL 训练对象变成 coding agent、tool-use agent、long-horizon reasoning a...
今天最值得看的 paper,我会选 Latent Programming Horizons in Coding Agents。 这篇 paper 问了一个很有意思的问题:当 coding agent 一步步读代码、改文件、跑测试时,底层 language model 的 hidden state 里,到底有没有形成对程序状态的内部判断? 作者没有只看最终 patch 是否通过测试。他们把...
今天最值得看的 paper,我会选 AutoTrainess: Teaching Language Models to Improve Language Models Autonomously。 这篇 paper 问了一个很实在的问题:如果 coding agent 已经能改代码、跑命令、看日志,它能不能进一步接管一部分 post-training 工作,帮我们持续改进另一个 langua...
今天最值得看的新 paper,我会选 Evolution Fine-Tuning: Learning to Discover Across 371 Optimization Tasks。 如果只按 HuggingFace 热度看,Dockerless 仍然是今天最贴近 coding agent 的强信号。但这篇昨天已经写过了,所以今天换一条同样重要的线:LLM 能不能把”反复改进一个解”学...
今天最值得看的 paper,我会选 Dockerless: Environment-Free Program Verifier for Coding Agents。 它切中的问题非常实际:coding agent 的 post-training,很多时候卡在 verifier 上。 如果要训练一个能修 repo issue 的 agent,你需要知道一条 trajectory 或一个 p...
今天最值得看的 paper,我会选 Unlocking Model Potentials Through Adaptive Multi-Agent Scaffolding for Efficient Issue Resolution。 这篇论文的核心问题很直接:同一个 base model,为什么换一个 agent scaffold,解题能力会差这么多? 在真实的软件 issue res...
今天最值得看的 paper,我会选 Qwen-AgentWorld: Language World Models for General Agents。 这篇论文把 agent training 里一个关键对象摆到了台前:环境。 如果一个 agent 要在网页、代码仓库、GUI、工具系统里规划和执行,它面对的是一连串 state transition: 当前观察是什么 下一步...
今天最值得看的 paper,我会选 Tmax: A simple recipe for terminal agents。 这篇论文处理的是一个很现实的问题:terminal agent 已经变成 LLM 最重要的下游形态之一,但公开的训练 recipe 还不够清楚。 我们现在说 coding agent,很多时候说的其实就是 terminal agent: 它要读文件 它要跑...