Paper Digest: 2026-08-27
今天最值得看的 paper,我会选 JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution。 同一个 foundation model,放进不同的 agent runtime,表现可能差很多。Memory 怎么裁剪,任务怎么拆,tool 在什么时候暴露,失败之后如何恢复,这些选择共同构成 harn...
今天最值得看的 paper,我会选 JIT-Agent: Scaling Harness Intelligence via Just-in-Time Harness Evolution。 同一个 foundation model,放进不同的 agent runtime,表现可能差很多。Memory 怎么裁剪,任务怎么拆,tool 在什么时候暴露,失败之后如何恢复,这些选择共同构成 harn...
今天最值得看的 paper,我会选 AutoSaddler: Automatic Harness Optimization with Durable Updates from Agent Execution Traces。 长任务里的 agent failure 往往很琐碎。一次工具参数选错,一条 prompt rule 过于宽泛,一个 hook 在错误时机触发,几十步之后才表现成整个任务...
今天最值得看的 paper,我会选 Apodex 1.1: Scaling Agentic Intelligence for Complex Work。 很多 agent benchmark 测的是一次任务能否完成:模型拿到 instruction,调用若干 tools,最后给出答案。真实工作多了几个麻烦。任务会持续很久,文件和外部信息不断变化,中间步骤会失败,多条支线需要并行推进,最终结...
今天最值得看的 paper,我会选 AI with Authority, from Application to Silicon。 论文报告了一个相当激进的工程实验。一个研究者使用消费级 AI subscriptions,指挥一支小型 agent fleet,在五周内完成应用代码、verified compiler、executive 和 RISC-V processor,并把芯片送入 c...
今天最值得看的 paper,我会选 EnvHarness: Awakening Static Worlds for Agent Learning。 Agent RL 有一个很朴素的矛盾。Policy 在持续更新,environment 却常常保持原样。训练初期有价值的任务,在模型掌握主要模式后会迅速失去区分度。Environment 也看不到 policy 当前卡在哪里,只能重复提供既定分...
今天最值得看的 paper,我会选 SPADE: Self-Play in Adaptive Synthetic Executable Environments。 Agent RL 有一个很现实的上限:模型可以持续训练,环境池却常常停在原地。人工任务、静态合成任务和固定 verifier 都会逐渐被学会。继续增加 rollout,只是在重复已经缺少学习信号的分布。 SPADE 把 env...
今天最值得看的 paper,我会选 ClawGym II: Exploring Black-Box RL on Agent Harness。 训练一个能在真实环境中工作的 agent,最麻烦的部分往往发生在 model 之外。OpenClaw、Claude Code 这类 harness 会管理工具、状态、重试、上下文压缩、并发任务和长时间执行。对用户来说,这些能力组成了完整产品。对 RL...
今天最值得看的 paper,我会选 Beyond Final Scores: A Systematic Evaluation of Agents for Long-Horizon AI Research and Development。 研究型 agent 的演示越来越像真正的 R&D:读代码和论文、提出方案、运行实验、观察结果,再继续修改模型或系统。评价这类 agent 时,最终...
今天最值得看的 paper,我会选 DarwinX: Evolving Agent Harnesses Through Natural Selection。 一个 LLM agent 的能力同时存在于两处:模型 weights,以及包围模型的 harness。Prompt、tools、skills、memory 和 control flow 都会决定它怎样行动。模型冻结之后,agent 仍...
今天最值得看的 paper,我会选 The Devil Is in the Interface: Evaluating How Tool Architecture Shapes Coding Agent Behavior。 Coding agent 的工具越来越多。Shell、文件读写、代码搜索、patch、Python execution、scratchpad、subagent,几乎每个...