Paper Digest: 2026-09-24
今天最值得看的 paper 是 PACT: From Credit Assignment to Critic Alignment。 LLM agent 的一条 trajectory 可能有几万 tokens、几十次 tool calls,训练时却常常只在最后拿到一个 verifier reward。这个结果该怎样分给前面每个 token,一直是 agent RL 里最难处理的问题之一。 ...
今天最值得看的 paper 是 PACT: From Credit Assignment to Critic Alignment。 LLM agent 的一条 trajectory 可能有几万 tokens、几十次 tool calls,训练时却常常只在最后拿到一个 verifier reward。这个结果该怎样分给前面每个 token,一直是 agent RL 里最难处理的问题之一。 ...
今天最值得看的 paper 是 The Tasteful Agent: Measuring and Improving Taste in Long-Horizon Tasks。 一个 coding agent 可以在前几步做出完全合理的选择,跑了很久才发现方向错了。最终 success rate 会记录失败,却很难告诉我们真正关键的错误发生在哪里。论文把这种能力称为 agent 的 tas...
今天最值得看的 paper 是 Harness-Zero: Harness Distillation via Agent-as-Harness。 Agent 的能力经常来自模型外部:system prompt、tool schema、control flow、memory、context management,以及各种为特定任务手工打磨的 scaffold。一个强 harness 可以显著...
今天最值得看的 paper 是 CodeMidas: Scaling Agentic Coding RL Environments from Code Itself。 训练 coding agent 的 RL 数据有一个很现实的瓶颈:任务必须足够多、足够多样,还要有可靠 verifier。Issue、pull request 和 commit 可以提供天然任务,但只有留下完整开发痕迹的功能...
今天最值得看的 paper,我会选 Don’t Mask the Environment: Observation Supervision Changes How Agents Explore Under RL。 Agent trajectory 里交替出现两类 token:模型给出的 command 和 tool call,以及环境返回的 stdout、error、test result...
今天最值得看的 paper,我会选 ScienceIDE: Turning World’s Scientific Codebase into Agent Learnable Environments。 科学计算软件里沉淀了几十年的知识。天体物理、海洋气候、等离子体、材料、量子和粒子探测器的代码,包含可运行的模型、数值方法与领域约束。直接把这些 repository 交给 agent,通常得...
今天最值得看的 paper,我会选 ExecuCritic: Calibrated Critic Shaping for Code Generation with Verifiable Rewards。 代码模型做 RLVR 时,unit tests 可以给出客观的 pass/fail verdict,但整个程序经常只得到一个 bit 的奖励。程序究竟错在 API、类型、边界条件、复杂度还...
今天最值得看的 paper,我会选 ZGCM-1: A Fully Open and Extremely Efficient Foundation Model for Math and Agentic Search。 这是一份少见的全链路 7B foundation model 技术报告。作者开放了 pre-training、mid-training、SFT 和 post-training...
今天最值得看的 paper,我会选 DataFlex-RL: An Evaluation Platform for RLVR Data Policies。 它得到的结论很朴素,也很容易让人不舒服:在一套受控的 GRPO recipe 里,uniform sampling 已经带来了很大的提升;给 rollouts 加上更聪明的 selection、reweighting 或 adaptiv...
今天最值得看的 paper,我会选 NCP-ArchPreview Technical Report: Moving towards Latent Space Language Models through Next Concept Prediction。 语言模型一直在做一件极其局部的事:根据前面的 token,预测下一个 token。这个目标简单、稳定、容易扩展,也把模型牢牢绑定在词表...