Paper Digest: 2026-05-04
今天最值得看的 paper,我会给 Can Coding Agents Reproduce Findings in Computational Materials Science?。 这篇 paper 的价值,不在于又做了一个“agent benchmark”,而在于它故意把 coding agent 从熟悉的 SWE 题库里拎出来,丢进一个更麻烦、也更真实的场景:你能不能根据论文里并不完...
今天最值得看的 paper,我会给 Can Coding Agents Reproduce Findings in Computational Materials Science?。 这篇 paper 的价值,不在于又做了一个“agent benchmark”,而在于它故意把 coding agent 从熟悉的 SWE 题库里拎出来,丢进一个更麻烦、也更真实的场景:你能不能根据论文里并不完...
今天最值得看的 paper,我会给 Claw-Eval-Live: A Live Agent Benchmark for Evolving Real-World Workflows。 这篇 paper 戳中的问题很硬。很多 agent benchmark 一发布就开始老化,任务集合是静态的,评分又偏向 final answer,于是你能看到一个分数,却不太知道 agent 到底有没有真的完...
今天最值得看的 paper,我会给 ClawGym: A Scalable Framework for Building Effective Claw Agents。 原因很简单,这篇 paper 抓住了很多 agent 工作里最难、也最容易被跳过的那一段:怎么系统化地制造训练任务,怎么做可验证的 workspace,怎么把 agent 的训练、评测、诊断连成一个闭环。 现在很多 age...
今天最值得看的 paper,我会给 Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses。原因很直接,它抓住了 coding agent 这波里最容易被低估、但又最有杠杆的那一层,真正决定 agent 上限的,常常不只是 model,本质上还是 harne...
今天最值得看的 paper,我会给 From Skills to Talent: Organising Heterogeneous Agents as a Real-World Company。它有一种很少见的野心,关心的已经不是单个 agent 会不会多调用几个 tool,也不是 prompt 怎么再雕得更漂亮,而是更上面一层的问题,如果我们真把一群 agent 当作一个组织来设计,会发生...
今天最值得看的 paper,是一篇把 agentic coding 里一个很少被认真量化、却已经非常现实的问题直接摆上桌面的工作。How Do AI Agents Spend Your Money? 关心的,不是 agent 能不能再多解几道题,也不是哪个模型 demo 更炫,而是一个所有真正开始部署 coding agent 的团队都会撞上的问题,这些 agent 到底把 token 花在...
今天最值得看的 paper,是一篇把 LLM 蒸馏为什么总像很多零散经验拼起来的黑箱工艺 这件事,重新整理成一套更清楚 recipe 的工作。Hybrid Policy Distillation for LLMs 关心的,不是再换一个新名字去包装蒸馏,也不是只在某个窄 benchmark 上多拿几个点,而是一个更实在的问题,如果你真想把强模型的能力更稳地迁到小模型上,目标函数、优化方式和数据...
今天最值得看的 paper,是一篇把后训练里一个经常被默认、却很少被讲清楚的问题直接拎出来的工作。Near-Future Policy Optimization 关心的核心,不是再堆一个更复杂的 RL 框架,也不是去找一个更强的外部 teacher,而是一个非常实际的问题,当 RLVR 或 GRPO 开始进入平台期,模型到底该向谁学。 这篇 paper 最妙的地方,在于它把这个问题回答得既...
今天最值得看的 paper,是一篇把 code generation 里一个经常被掩盖的问题直接摊开来的工作。PlayCoder: Making LLM-Generated GUI Code Playable 关心的重点,不是模型会不会把函数补全出来,也不是 repo benchmark 上多拿几个点,而是一个更接近真实软件的问题,你让模型写出来的 GUI 程序,用户真的能一路点下去、用下去...
今天最值得看的 paper,是一篇把 agent 为什么总像在 demo 里很聪明,落到真实工具世界里却不够稳 这件事讲得很透的工作。Agent-World: Scaling Real-World Environment Synthesis for Evolving General Agent Intelligence 关心的核心,不是再给 agent 多加一点 prompting tric...