Welcome to EveryAI
Welcome to EveryAI — a curated collection of AI research digests, X timeline highlights, and original writing. What You’ll Find Here 📚 Paper Digest Daily curated picks from the latest AI/ML resea...
Welcome to EveryAI — a curated collection of AI research digests, X timeline highlights, and original writing. What You’ll Find Here 📚 Paper Digest Daily curated picks from the latest AI/ML resea...
今天最值得看的 paper 是 Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability。 它研究一个越来越常见的 post-training 场景:teacher 和 student 使用不同 tokenizer 时,怎样做 on-policy...
今天最值得看的 paper 是 Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents。 现在的 coding-agent benchmark 通常问一个问题:patch 能不能通过测试? SWE-CC 加入了另一个现实问题:这份贡献符合...
今天最值得看的 paper 是 Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite。 它抓住了 code-agent training 里一个很现实的问题:强 harness 能让模型完成更多任务,但成功轨迹里混入了 controller intervention、workflow convention...
今天最值得看的 paper 是 Cross-Benchmark Transfer from RL on Agentic Coding Tasks。 它问了一个 code-agent post-training 里很关键的问题:在一小批高质量 coding tasks 上做 RL,学到的能力能不能跨 repository、benchmark、agent harness 和任务时长继续生效? ...
今天最值得看的 paper 是 The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation。 On-policy distillation 通常让 student 在自己的 trajectories 上匹配...
今天最值得看的 paper 是 ROSS: Relearning from Self-Generated Rollouts through Selective Supervision。 LLM post-training 会消耗大量算力生成 rollouts。Policy 更新以后,这些历史轨迹通常被视为 stale data:它们来自旧模型,分布已经落后,整条模仿还可能把错误、无效尝试和...
今天最值得看的 paper 是 Groupwise Agentic Grading and Advantage Redistribution for Code Agent RL,简称 GAGAR。 代码智能体做 RL 时,最方便的 reward 来自测试:通过为 1,失败为 0。这个信号客观、便宜、容易扩展,却把所有成功轨迹压成了同一种结果。 同一个 issue,可以有两份都能通过测试的...
今天最值得看的 paper 是 RayOrch: Programming and Executing Lineage-Controlled Multi-Grain Dataflows for Foundation-Model Data Preparation。 基础模型的数据准备,经常同时面对两个方向相反的需求。 PDF、网页和视频会动态展开成 page、region、clip 等子任务...
今天最值得看的 paper 是 Rufus-Air: An Open LLM Post-Training Recipe。 很多模型报告会公开最终 benchmark,却把真正决定复现成败的部分压缩成几句话:SFT 数据怎样混,RL prompt 怎样筛,rollout 被截断后怎样处理,推理和训练精度不一致怎么办,sandbox 挂掉算谁的错,每个 stage 又该接在哪个 checkpo...