Paper Digest: 2026-06-03
今天最值得看的 paper,我会给 Trust Region On-Policy Distillation。 这篇 paper 处理的是一个很实际的 post-training 问题:我们想用更强的 teacher model 带一个 student model,让 student 在自己的 generation trajectory 上学习。这个方向叫 On-Policy Distill...
今天最值得看的 paper,我会给 Trust Region On-Policy Distillation。 这篇 paper 处理的是一个很实际的 post-training 问题:我们想用更强的 teacher model 带一个 student model,让 student 在自己的 generation trajectory 上学习。这个方向叫 On-Policy Distill...
今天最值得看的 paper,我会给 Harness-1: Reinforcement Learning for Search Agents with State-Externalizing Harnesses。 这篇 paper 讲 search agent,但真正有价值的地方是它重新画了一条边界:哪些事情应该交给模型学,哪些事情应该交给 agent harness 维护。 很多 sea...
今天最值得看的 paper,我会给 GrepSeek: Training Search Agents for Direct Corpus Interaction。 这篇 paper 讲 search agent,但它抓住了一个更大的问题:如果 agent 可以直接操作环境,检索就不一定要被压缩成一次向量查询。 GrepSeek 的选择很大胆:让 search agent 把语料库当成一个...
今天最值得看的 paper,我会给 LiteCoder-Terminal: Scaling Long-Horizon Terminal Environments for Learning Language Agents。 这篇的核心问题很实际:terminal agent 要学会多步规划、根据命令反馈修正动作、在动态环境里更新状态。但现在训练这类 agent 很依赖抓取来的外部代码仓库,d...
今天最值得看的 paper,我会给 Agent Explorative Policy Optimization for Multimodal Agentic Reasoning。 这篇来自 NVIDIA,核心问题很清楚:agentic reasoning 里有两种动作,一种是在模型内部继续思考,另一种是调用外部工具。后者更接近真实 agent 能力,但训练起来也更不稳定。 作者把这个问题...
今天最值得看的 paper,我会给 MiniMax-M2。 这篇是 foundation model 技术报告。表面上最醒目的数字是 MoE: 旗舰模型 M2 有 229.9B total parameters,每个 token 只激活 9.8B。这个 sparse activation 设计让模型在推理成本和能力之间取得更好的平衡。 但这篇真正值得读的地方,是 MiniMax 把模型能...
今天最值得看的 paper,我会给 ECHO。 这篇 paper 讲 terminal agents,但它真正抓住的是 agent RL 里一个经常被浪费掉的信号:环境返回。 CLI agent 每一步都在和一个小世界互动。模型输出命令,terminal 执行命令,然后返回 stdout、stderr、文件变化、日志、trace 和错误信息。标准 GRPO 类训练通常只把 action ...
今天最值得看的 paper,我会给 SkillOpt。 这篇 paper 讲的是 agent skills,但它真正有意思的地方,是把 skill 当成一种可以被训练的外部状态来处理。 很多 agent 系统里的 skill,本质上还是一份手写文档:告诉模型怎么做事、注意什么、调用哪些工具。它可以被人修改,也可以被模型总结,但常见流程都偏松散。写得好不好,往往靠经验和事后感觉判断。Ski...
今天最值得看的 paper,我会给 OpenComputer。 这篇 paper 处理的是 computer-use agent 里一个很基础、也很麻烦的问题:我们到底怎么判断 agent 真的完成了任务。 很多现有 benchmark 看的是最终截图、最终文本,或者干脆让 LLM 当裁判。但真实软件操作里,成功常常藏在细粒度状态里。一个 spreadsheet 公式有没有填对,一个 I...
今天最值得看的 paper,我会给 SkillsVote。 这篇 paper 戳中的问题很关键。大家现在谈 agent,很容易把注意力放在 model 本身,或者放在单次 task 的成功率上。但一旦系统开始积累 reusable skills,真正麻烦的事情就来了:哪些经验值得保留,哪些 skill 值得暴露给 runtime,哪些更新会让系统越来越强,哪些更新其实是在把未来上下文慢慢污...