Paper Digest: 2026-07-29
今天最值得看的 paper,我会选 Reinforcement Learning for Code Optimization。 Code RL 已经有一条相对清晰的路径:模型生成程序,sandbox 执行 hidden tests,通过就得到 reward。 当目标加入 execution time,训练问题立刻复杂很多。Runtime 会受到 test size、机器负载、进程调度、缓...
今天最值得看的 paper,我会选 Reinforcement Learning for Code Optimization。 Code RL 已经有一条相对清晰的路径:模型生成程序,sandbox 执行 hidden tests,通过就得到 reward。 当目标加入 execution time,训练问题立刻复杂很多。Runtime 会受到 test size、机器负载、进程调度、缓...
今天最值得看的 paper,我会选 Kimi K3: Open Frontier Intelligence。 这是 Moonshot AI 对 Kimi K3 的完整技术报告。模型总参数 2.8T,每个 token 激活 104B 参数,原生支持 vision,并提供 1M-token context window。模型权重已经开放。 这些数字足够醒目,但真正值得读的是报告里几条互相咬合...
今天最值得看的 paper,我会选 Molt: A Scalable PyTorch-Native Training Framework for Agentic Reinforcement Learning。 Agentic RL 的研究节奏,常常快过训练框架的演化速度。 研究者可能想换一个 advantage estimator,增加新的 rollout scheme,调整 polic...
今天最值得看的 paper,我会选 AREX: Towards a Recursively Self-Improving Agent for Deep Research。 Deep Research agent 最难的部分,往往发生在搜索进行很久以后。 Agent 已经打开过许多页面,收集了相互矛盾的证据,也写出了一版看似完整的答案。此时继续增加搜索轮数,常常只会让 context 更拥...
今天最值得看的 paper,我会选 SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD。 这是一份少见的全栈技术报告。它从 1.6T 参数 DeepSeek-V4-Pro 的 full-parameter post-training 出发,一路写到 Ascend Supe...
今天最值得看的 paper,我会选 ISO: An RLVR-Native Optimization Stack。 RLVR 的 data、reward、objective 和 rollout system 已经被反复重做,optimizer 这一层却大多沿用 pretraining 的默认答案。AdamW 负责把 reward feedback 变成 weight update,模型仍然...
今天最值得看的 paper,我会选 Distilled Reinforcement Learning for LLM Post-training。 它处理的是 reasoning model post-training 里一个很实际的冲突。 RL 依赖 outcome reward,优化目标清楚,但 long response 上的 token-level credit assignme...
今天最值得看的 paper,我会选 Understanding Reasoning from Pretraining to Post-Training。 它抓住了 reasoning model 研究里一个长期被切开的接口:pretraining 把模型带到哪里,会怎样决定后面的 RL 能走多远、走多快。 常见的 post-training 实验会固定一个 pretrained mode...
今天最值得看的 paper,我会选 LongStraw: Long-Context RL Beyond 2M Tokens under a Fixed GPU Budget。 这篇 paper 解决了一个越来越明显的落差:模型推理已经接近 million-token context,RL post-training 仍经常停在 256K 或更短。 这个差距对 agent 特别麻烦。一次长...
今天最值得看的 paper,我会选 Know Before Fix: QA-Driven Repository Knowledge Acquisition for Software Issue Resolution。 这篇 paper 讲的是 coding agent 里一个非常真实的问题:agent 写 patch 之前,经常没有建立可靠的 repo understanding。 在 ...