EveryAI

Paper Digest: 2026-04-24

今天最值得看的 paper,是一篇把 LLM 蒸馏为什么总像很多零散经验拼起来的黑箱工艺 这件事,重新整理成一套更清楚 recipe 的工作。Hybrid Policy Distillation for LLMs 关心的,不是再换一个新名字去包装蒸馏,也不是只在某个窄 benchmark 上多拿几个点,而是一个更实在的问题,如果你真想把强模型的能力更稳地迁到小模型上,目标函数、优化方式和数据...

Paper Digest: 2026-04-23

今天最值得看的 paper,是一篇把后训练里一个经常被默认、却很少被讲清楚的问题直接拎出来的工作。Near-Future Policy Optimization 关心的核心,不是再堆一个更复杂的 RL 框架,也不是去找一个更强的外部 teacher,而是一个非常实际的问题,当 RLVR 或 GRPO 开始进入平台期,模型到底该向谁学。 这篇 paper 最妙的地方,在于它把这个问题回答得既...