<feed xmlns="http://www.w3.org/2005/Atom"> <id>https://nemo9cby.github.io/everyai/</id><title>EveryAI</title><subtitle>AI research digests, X timeline highlights, and original writing by Boyuan Chen.</subtitle> <updated>2026-10-07T16:04:43-04:00</updated> <author> <name>Boyuan Chen</name> <uri>https://nemo9cby.github.io/everyai/</uri> </author><link rel="self" type="application/atom+xml" href="https://nemo9cby.github.io/everyai/feed.xml"/><link rel="alternate" type="text/html" hreflang="en" href="https://nemo9cby.github.io/everyai/"/> <generator uri="https://jekyllrb.com/" version="4.4.1">Jekyll</generator> <rights> © 2026 Boyuan Chen </rights> <icon>/everyai/assets/img/favicons/favicon.ico</icon> <logo>/everyai/assets/img/favicons/favicon-96x96.png</logo> <entry><title>Paper Digest: 2026-10-07</title><link href="https://nemo9cby.github.io/everyai/posts/paper-digest/" rel="alternate" type="text/html" title="Paper Digest: 2026-10-07" /><published>2026-10-07T00:00:00-04:00</published> <updated>2026-10-07T00:00:00-04:00</updated> <id>https://nemo9cby.github.io/everyai/posts/paper-digest/</id> <content type="text/html" src="https://nemo9cby.github.io/everyai/posts/paper-digest/" /> <author> <name>Boyuan Chen</name> </author> <category term="Paper Digest" /> <summary>今天最值得看的 paper 是 Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability。 它研究一个越来越常见的 post-training 场景：teacher 和 student 使用不同 tokenizer 时，怎样做 on-policy distillation？ 直觉上，token 对不齐就应该设计更复杂的 span alignment，把更多位置纳入监督。论文给出的实验结果很克制：严格的 1:1 对齐已经覆盖了大部分 student-generated tokens。把近似匹配的 span 也塞进 loss，监督覆盖率虽然达到 100%，模型准确率反而下降。 跨 tokenizer 蒸馏的两层对齐 On-Policy ...</summary> </entry> <entry><title>Paper Digest: 2026-10-06</title><link href="https://nemo9cby.github.io/everyai/posts/paper-digest/" rel="alternate" type="text/html" title="Paper Digest: 2026-10-06" /><published>2026-10-06T00:00:00-04:00</published> <updated>2026-10-06T00:00:00-04:00</updated> <id>https://nemo9cby.github.io/everyai/posts/paper-digest/</id> <content type="text/html" src="https://nemo9cby.github.io/everyai/posts/paper-digest/" /> <author> <name>Boyuan Chen</name> </author> <category term="Paper Digest" /> <summary>今天最值得看的 paper 是 Correct Code, Broken Contributions? SWE-CC: Benchmarking Repository Policy Compliance for Coding Agents。 现在的 coding-agent benchmark 通常问一个问题：patch 能不能通过测试？ SWE-CC 加入了另一个现实问题：这份贡献符合 repository 自己的开发规则吗？ 一个 agent 可以正确修复 issue，同时违反格式规范、git 流程、测试要求、生成文件约定或其他项目政策。测试给出绿色结果，maintainer 仍然无法放心 merge。 把 repository policy 变成可执行检查 作者从 12 个成熟开源项目的贡献文档中提取规则，整理成 823 条 machine-checkable ato...</summary> </entry> <entry><title>Paper Digest: 2026-10-05</title><link href="https://nemo9cby.github.io/everyai/posts/paper-digest/" rel="alternate" type="text/html" title="Paper Digest: 2026-10-05" /><published>2026-10-05T00:00:00-04:00</published> <updated>2026-10-05T00:00:00-04:00</updated> <id>https://nemo9cby.github.io/everyai/posts/paper-digest/</id> <content type="text/html" src="https://nemo9cby.github.io/everyai/posts/paper-digest/" /> <author> <name>Boyuan Chen</name> </author> <category term="Paper Digest" /> <summary>今天最值得看的 paper 是 Scaling Trajectories for Complex Tasks through Recursive Self-Rewrite。 它抓住了 code-agent training 里一个很现实的问题：强 harness 能让模型完成更多任务，但成功轨迹里混入了 controller intervention、workflow convention、stopping rule 等外部能力。把这些轨迹直接拿去 SFT，模型可能学会依赖训练时的脚手架，部署到普通 harness 后就失效。 作者提出 Recursive Self-Rewrite，简称 RSR。核心流程可以压缩成一句话：让 specialized harness 帮模型发现解法，再让模型在 deployment harness 里重新练会一次。 三个 harness 扩大经验...</summary> </entry> <entry><title>Paper Digest: 2026-10-02</title><link href="https://nemo9cby.github.io/everyai/posts/paper-digest/" rel="alternate" type="text/html" title="Paper Digest: 2026-10-02" /><published>2026-10-02T00:00:00-04:00</published> <updated>2026-10-02T00:00:00-04:00</updated> <id>https://nemo9cby.github.io/everyai/posts/paper-digest/</id> <content type="text/html" src="https://nemo9cby.github.io/everyai/posts/paper-digest/" /> <author> <name>Boyuan Chen</name> </author> <category term="Paper Digest" /> <summary>今天最值得看的 paper 是 Cross-Benchmark Transfer from RL on Agentic Coding Tasks。 它问了一个 code-agent post-training 里很关键的问题：在一小批高质量 coding tasks 上做 RL，学到的能力能不能跨 repository、benchmark、agent harness 和任务时长继续生效？ 作者选择 Kimi K2.7 Code，一个 1T parameters、32B active parameters 的 MoE 模型。训练数据只有 1,700 个 expert-built tasks，其中 1,000 个是 repository tasks，700 个是 terminal tasks。训练也很克制，只做一轮 GSPO，并用 rank-32 LoRA 更新模型。 结果覆盖六个...</summary> </entry> <entry><title>Paper Digest: 2026-10-01</title><link href="https://nemo9cby.github.io/everyai/posts/paper-digest/" rel="alternate" type="text/html" title="Paper Digest: 2026-10-01" /><published>2026-10-01T00:00:00-04:00</published> <updated>2026-10-01T00:00:00-04:00</updated> <id>https://nemo9cby.github.io/everyai/posts/paper-digest/</id> <content type="text/html" src="https://nemo9cby.github.io/everyai/posts/paper-digest/" /> <author> <name>Boyuan Chen</name> </author> <category term="Paper Digest" /> <summary>今天最值得看的 paper 是 The Teacher Is a Direction, Not a Destination: Extrapolating RL-Induced Representation Residuals in On-Policy Distillation。 On-policy distillation 通常让 student 在自己的 trajectories 上匹配 teacher 的 next-token distribution。更激进的方法会进一步外推 teacher 隐含的 reward，希望 student 超过 teacher。 RIDE 提醒我们，真正有用的 RL change 未必能在 logits 中被完整观察。Language-model head 会对 hidden-state change 做各向异性的压缩，而 sampled-to...</summary> </entry> </feed>
