模型给自己当teacher,拆细人群问更准

今日概览

  • SEED的teacher不是更大的模型,而是同一个模型的后见之明——它读完自己刚跑完的轨迹,总结成自然语言技能,再拿「带技能/不带技能」两种上下文的概率差,去填结果奖励在中间几十步留下的监督空白。
  • 检索agent原地打转烧光预算,缺的不是更强的模型:SearchOS把任务进度从对话历史里搬出来,做成一张能直接查覆盖率的关系表,再让中间件而不是模型本身去判定「该打断了」。
  • 语言和视觉想象被塞进同一条计划序列,每步计划天然锚在物理状态上,省掉VLM和世界模型之间的对接工程;代价是误差串联,想象错一步,后面的语言推理就建在错误前提上。
  • 把人群拆细分别问再加权聚合,比直接问总体更贴近真实调查数据。这条恒等式不需要标准答案就能验,任何拿LLM估分布的pipeline当天都能自查一遍。

重点关注

01 训练优化 这个teacher不比student强,它只是知道结局

结果奖励只在轨迹末尾给一次分,中间几十步决策全靠这一个标量往回摊,token级的策略更新基本等于在猜——SEED补的就是这段监督空白,做法是在RL循环里挂一路稠密的token级蒸馏信号。真正值得追问的是这个teacher从哪来:它不是另一个更大的模型,而是同一个策略模型读完自己刚跑完的轨迹后,用自然语言写出来的「技能」——可复用的流程、起决定作用的那个观察、该避开的失败模式。SEED把这些技能回填进上下文,让同一批动作在「带技能」和「不带技能」两种上下文下各被打一次分,两者的概率差就成了逐token的监督信号,与结果奖励联合优化;而所谓self-evolving,是指收集轨迹和分析轨迹用的是同一个模型,策略变强,它总结技能的能力也跟着变强。所以teacher的优势不在能力,在信息:它有后见之明,知道这条轨迹最后成没成、栽在哪一步。这也就划出了收益边界——如果失败是「当时没意识到该这么做」,一句自然语言技能确实能纠回来;如果失败是模型压根不具备那个能力,后见之明再准也变不出来,这跟几天前那篇拆解on-policy蒸馏的文章结论一致:蒸馏搬运的是已有能力,不是新增能力。摘要给的是「稳定提升」和样本效率改善这类定性说法,没有放具体数字,文本和视觉两类agent任务都做了实验,代码已开源,想判断值不值得上自己的任务,跑一遍基线比看摘要靠谱。

SEED把后见之明变成了监督信号——同一个模型读完自己的轨迹总结成技能,再用「带技能/不带技能」的概率差去填结果奖励留下的空白,全程不需要外部更大的teacher判断这类方法能不能帮到你,先分清你的失败是「没想到」还是「不会」,后见之明只能纠正前者代码已开源、文本和视觉agent任务都覆盖了,但摘要只给定性结论,要落地得自己跑基线对比。

02 Agent 检索agent原地打转烧光预算,缺的不是更强的模型

检索agent的失败有个固定形状:一次搜索没捞到有用证据,模型判断不出该换什么方向,于是换个近义词再搜一遍——交互历史越滚越长,任务进度反而越跟越丢,预算烧完了答案还是残的。SearchOS把病因归在「进度只存在于对话历史里」:隐式、易丢、还没法在多个agent之间共享。它的解法是把进度搬到模型外面——任务被建模成一张要填满的关系表,发现实体、补齐字段、每个值挂上来源证据,「还差哪些格子」于是变成可以直接查询的覆盖率,而不是靠模型自己回忆;另一半是把已经试过并失败的搜索方式记下来,再用一层拦在模型和工具之间的中间件盯住停滞和预算耗尽,让「该打断了」成为外部判定,而不是等模型自己醒悟。WideSearch和GISA上它在所有对比指标上领先单agent和多agent基线,但摘要里分不出这些收益有多少来自显式状态、多少来自同时上的并行调度——吞吐上去本身就意味着更多次搜索,要看消融才好下结论。不过那条设计原则是可以直接搬的:把「已覆盖什么、什么已经失败过」从上下文里拎出来变成外部可查的状态,在自己的harness层就能做,不用等更强的模型。

打转的根因是进度只存在于对话历史里,把「已覆盖/已失败」外置成可查状态,是harness层就能落地的改动停滞判定该交给拦在模型和工具之间的中间件去做,别指望模型自己发现在原地转榜单领先里混着并行调度带来的更多搜索次数,显式状态本身贡献多少要等消融数据

03 机器人 RxBrain把语言和视觉想象塞进了同一条计划序列

具身模型做计划一直分两条路走:视觉语言模型(VLM)用文字拆任务、做决策,世界模型预测未来画面,两边各管一段,中间靠工程手段对接。腾讯这条具身线的上一篇算的是效率账,RxBrain动的则是更上游的问题——计划本身该怎么表示:它干脆取消了那个接口,让语言和视觉想象交替出现在同一条计划序列里,语言负责任务拆解、约束、时序和决策逻辑,视觉想象负责把每一步锚到具体的物理状态上。好处很直接:计划的每一步天然带着「执行完世界会变成什么样」,不需要再多一层去校验语言决策和物理状态对不对得上。代价同样直接:单条序列意味着误差会串联,中间状态想象错了,后面的语言推理就在一个错误前提上继续往下推,而摘要没有交代这种误差怎么被约束。摘要还提到不做大规模动作数据预训练也能在真机上跑出结果,但用词是「promising」,得看全文的实验规模才好判断——对做具身的团队来说,真正该盯的是单序列这条路线扛不扛得住误差累积,而不是自建benchmark上的数字。

语言和视觉想象共用一条计划序列,每步计划天然对齐物理状态,省掉VLM和世界模型之间的对接工程代价是误差串联——视觉想象画错中间状态会直接污染后续的语言推理,这是评估这条路线时该优先追问的点「不用大规模动作数据预训练就有真机表现」是最值得验证的一条,摘要用的是promising,别当成已验证结论

04 可解释性 把人群拆开问再加起来,比直接问更准

直觉上,把一个总体问题拆成十几个子群分别去问、再加权拼回来,误差只会越滚越大。这篇用二叉树把人群递归切成越来越细的子群,逐个喂给模型再按先验权重聚合,结果反过来了:拆得越细,聚合出的估计反而越贴近真实的人类调查数据,作者管这叫「宏观谬误」。逻辑起点其实很朴素——如果prompt真是在指定条件、输出真是那个条件分布的估计,那么按任意合法方式切分人群再加权聚合,都该还原出同一个总体分布;实测下来主流前沿模型在多个领域普遍违背这条恒等式,说明子群层面的知识模型是有的,只是直接问总体时传不上去。这个自检最实用的地方在于不需要标准答案:同一个问题按年龄切一次、按地域切一次,两组聚合值应该对得上,对不上就说明你拿到的不是条件分布,而是模型对「某类人该怎么答」的笼统印象。做合成用户调研和persona模拟的团队,值得先跑一遍这个测试再决定信不信自己手里的数。

用LLM估人群分布前先做一致性自检——换几种切分方式各自聚合,数对不上就别拿去做决策需要总体比例时优先走细粒度路径,分子群问再加总比直接问总体更接近真实数据这个检验不依赖标准答案,任何pipeline当天就能跑,也说明前沿模型在这一维度远未饱和
模型给自己当teacher,拆细人群问更准

也值得关注

05
从法规描述生成自动驾驶测试脚本,真正的指标是编译通过率 代码智能—把它当成可机械验证的DSL代码生成,迭代式RAG的作用就是把编译错误一轮轮修回来;这个评测思路比场景生成本身更通用。链接
06
冻结小模型不改权重,把验证过的知识存成KV状态再graft回新上下文 推理加速注意bit-exact(SHA-256相等、零KL)说的是恢复过程的确定性,不等于跨上下文拼接后语义还成立,读这类主张时先把这条边界划清楚。链接
07
连续空间的扩散语言模型,每个token有自己的时间步 模型架构从高斯噪声一次确定性映射到token画布,不再反复采样。可以接上几天前那张非自回归路线图,看作其中一条具体押注。链接

今日观察

今天三篇论文修的是同一个毛病,只是各自修在了不同的地方:模型自己那条主信号,撑不住变长的任务。SEED面对的是结果奖励——一条轨迹跑完只回来一个标量,中间几十步没人管,于是它在旁边补了一路teacher的token级信号;SearchOS面对的是越滚越长的交互历史——进度隐在对话里,越查越丢,于是它在旁边补了一张外部可查的覆盖率表;RxBrain面对的是纯语言的计划——每一步决策都悬空,不知道执行完世界会变成什么样,于是它在旁边补了一路视觉想象。三者都没有去把那条主信号本身做得更强,而是各自加了第二路信号,把长程任务重新锚住。

这给出的排查顺序,比「再换个更强的模型」实在得多。你的agent跑长了走偏、原地打转、越推越离谱,多半不是模型不够聪明,而是它手上只有一路信号,而这路信号在长程上会被稀释掉。第二信号可以补在三个位置,成本差着量级:系统层最便宜——在harness里加一份外部进度状态、加一条停滞判定,改的是你自己的代码,当天就能试;表示层次之——改计划或中间结果的表示形式,让它自带可核对的锚点,动的是模型的输入输出约定;训练层最贵——要teacher、要轨迹、要重跑RL,SEED那套的门槛就在这里。

所以顺序应该倒过来走,先在系统层试。挑你手上跑得最长的那个agent,别动模型,先把「已经完成了什么、什么已经试过并失败了」从对话历史里拎出来,写成一份每一步都能查的显式状态,再加一条「连续N步没有新进展就打断」的硬规则。跑一周看走偏率降了多少——如果这一步就把问题按住了,后面两层的钱你就不用花了。