EveryAI

Paper Digest: 2026-04-08

今天最值得看的 paper,不在于它又给 agent 加了什么新能力,而在于它终于认真去量 agent 到底做对了什么、做错了什么。过去很多 autonomous agent benchmark 最大的问题,是只看终点,不看过程。最后按钮点对了、文件改对了、答案交对了,分就给了。但真实世界里的 agent,往往恰恰死在过程里,绕远路、碰安全红线、靠运气撞对结果。Claw-Eval 这篇 pa...

Paper Digest: 2026-04-07

今天最值得看的论文,落点非常明确,coding model 真正缺的,也许不是再多一点“会说”的 reasoning,而是更像程序员那样,先在脑子里跑一遍代码,再决定自己写得对不对。今天几篇强 paper 放在一起看,会发现一个共同方向,大家都在试图把模型从只会产出答案,往会模拟过程、会修正错误、会更新信念那边推。 今日 3 篇精选 1) Self-Execution Simulatio...