Paper Digest: 2026-10-07
今天最值得看的 paper 是 Rethinking Cross-Tokenizer On-Policy Distillation: From Alignment Coverage to Supervision Reliability。
它研究一个越来越常见的 post-training 场景:teacher 和 student 使用不同 tokenizer 时,怎样做 on-policy distillation?
直觉上,token 对不齐就应该设计更复杂的 span alignment,把更多位置纳入监督。论文给出的实验结果很克制:严格的 1:1 对齐已经覆盖了大部分 student-generated tokens。把近似匹配的 span 也塞进 loss,监督覆盖率虽然达到 100%,模型准确率反而下降。
跨 tokenizer 蒸馏的两层对齐
On-Policy Distillation 让 student 在自己的生成轨迹上接受 teacher 的分布监督。Teacher 和 student tokenizer 不同时,需要解决两层问题:
- sequence alignment:两个 tokenizer 切出的 token 边界能否对应
- vocabulary alignment:对应位置上,两边能够比较哪些 token probability
论文测试了三个异构 teacher-student pair,任务覆盖数学推理和代码生成。尽管 vocabularies 差异明显,严格 1:1 alignment groups 仍然覆盖了多数 student tokens。
作者进一步检查这些严格对齐位置上的 probability mass。结果显示,共享 vocabulary 平均保留了 teacher 和 student 几乎全部的概率质量。换句话说,tokenizer 不同看起来制造了很大的 vocabulary gap,真正落到 student 自己生成的轨迹上,可用的监督比预想中完整得多。
Top-16 reverse KL 已经足够
有了 strict positions,最直接的方法是在全部 shared vocabulary 上计算 reverse KL。论文发现,还可以进一步压缩监督:每个位置只保留 student 选出的 shared-vocabulary top 16 tokens。
这个 compact loss 的准确率与 full shared-vocabulary OPD 相当,并超过论文评估的 cross-tokenizer baselines。
这对训练系统很有现实意义。跨模型蒸馏通常需要传输或保存 teacher logits。若每个 strict position 只需要一个很小的候选集合,通信量、存储量和 KL 计算都会下降。Student 负责选择局部 support,也让监督集中在当前 policy 真正可能采取的 token 上。
100% supervision coverage 为什么更差
为了覆盖 tokenizer mismatch groups,作者加入 span log-probability 的 MSE supervision。它让每个位置都获得训练信号,却降低了最终准确率。
论文没有停在 outcome comparison。作者取只使用 strict loss 训练得到的 checkpoints,分别计算 strict objective 与 span objective 的 gradients:
- 两组 gradient 的方向一致性很弱,有时为负
- span gradient 相对 strict gradient 的规模随训练增长
- 较大的 mismatch-span update 会逐渐盖过更可靠的 strict signal
这是一种很实用的 post-training 诊断方式。新 loss 带来更多 labelled positions,并不等于带来更多有效学习。先看 gradient cosine、relative norm 和 downstream accuracy,才能判断辅助目标是在补充监督,还是在持续拉偏主目标。
对 post-training pipeline 的启发
一套务实的 cross-tokenizer OPD pipeline 可以从最小方案开始:
- 找出严格 sequence alignments
- 测量 shared vocabulary 保留的 probability mass
- 用 student-selected top-k support 计算 reverse KL
- 监控不同 supervision channels 的 gradient cosine 与 norm ratio
- 只有在下游指标稳定改善时,才加入 span-level approximate alignment
这里真正值得带走的原则是 supervision reliability。训练目标的覆盖率只是一个描述统计,更新方向是否可信才决定模型最终学到什么。
今天另外两篇相关论文
TRACE 处理大规模 MoE RL 中的 FP4 rollout。它让 rollout-side quantization outcome 指导 training-side rounding,直接缩小两个 execution path 的数值差异。论文报告 joint FP4 weight/activation 与 FP4 KV-cache rollout 可以维持接近 BF16 的 RL 表现,同时把 rollout 加速到最高 5.4x。对于 rollout 占据大部分集群时间的系统,这是一条很硬的工程线索。
HERMES 把 repository artifacts 封装成带 resident LLM 的 executable Dev-Primitives,再通过 dependency-aware activation 和 bug diagnosis 选择需要参与的组件。它在四个 software-engineering benchmarks 上平均超过 matched harnesses 12.4%,并展示了小模型 component agents 配合强 routing 后的成本优势。最值得关注的是它对 context ownership 的处理:程序知识留在组件附近,runtime evidence 决定哪些局部状态需要被激活和修改。
论文:https://arxiv.org/abs/2610.08448
另外两篇:https://arxiv.org/abs/2610.07767、https://arxiv.org/abs/2610.07832