40万美元开源图像栈,蒸馏只是催化剂

今日概览

  • agent 的维护成本正从模型转移到 harness:模型趋同后,真正的差异化工程面落在构造 prompt、管状态、调工具那层代码上,这篇把它当成需要专门方法论去「可读、可导航、可编辑」的一等对象。
  • 一条不依赖闭源 API 的图像栈,40 万美元、2.09 亿张图就能训出,四个变体覆盖生图/编辑/双语文字/快速推理,权重代码 Apache 2.0 全开。
  • on-policy 蒸馏不提能力上限,只当探索催化剂:它把 student 引到本就够得着却没走对的路径上,而 prompt 多样性比单题多采样更管用。
  • 想押注非自回归路线,先看懂这张地图:离散扩散的性质由离散状态空间怎么构造决定,这篇把散落的工作组织成从 tokenization 到 generation 的统一框架。

重点关注

01 Agent 模型在商品化,维护成本正在悄悄转移到 harness 上

做过 agent 的人对这个场景都不陌生:模型、API、环境、需求一直在变,包在模型外面那层代码——构造 prompt、管状态、调工具、协调执行——就得跟着改。这篇论文给这层代码起了个名字叫 harness,并指出改它之前真正卡人的环节:一个「想让系统做什么」的需求,落到代码里往往分散在一堆紧耦合、按文件和模块组织的位置,你得先把这些位置全找出来。作者管这叫「行为定位(behavior localization)」,并认为代码搜索、仓库索引、长上下文这些手段能帮你看代码,却帮不了你把「行为」映射回「代码」。他们的方案是用静态分析加LLM结构化,自动生成一份Harness Handbook——一种以行为为中心的表示,把每个行为链回对应源码;再配一套渐进披露机制(BGPD),让agent从高层行为一路下钻到实现细节,并拿当前源码校验候选位置。在两个开源harness的改动请求上,这套方法用更少的规划token改善了定位准确度和改动方案质量,收益最大的恰恰是那些分散、极少执行、跨模块交互的场景——也正是人工最容易漏的地方。值得留意的是评测只覆盖两个开源harness,规模不算大,真正的生产harness更脏更耦合,泛化性还需要看更多案例确认。

模型趋同后,agent的差异化和维护负担正从模型转移到harness这层工程代码,值得当成一等对象来管理「改动前先定位所有相关位置」是被长期低估的瓶颈,长上下文和代码搜索并不能替代这一步如果你在维护一套持续演进的agent系统,这套行为→代码的映射思路值得关注,但目前证据仅来自两个开源项目,别急着当结论。

02 图像生成 一条不依赖闭源API的图像栈,40万美元就能搭起来

文生图、指令编辑、中英双语文字渲染、快速推理——闭源系统里这些能力是靠系统级整合堆出来的,Boogu-Image把它们打包成了一个开源模型家族(Base/Turbo/Edit/Edit-Turbo),权重、代码、训练配方全部Apache 2.0放出。最抓人的是成本账:只用了2.09亿张去重图像,base模型理论训练成本约40万美元,这个量级独立开发者和小团队够得着。摘要里对标Nano-Banana-Pro和GPT-Image-2用的词是「competitive」和「approaching」,不是明确碾压的数字,所以质量上还得看实测——但对不想被闭源API绑定的人来说,「能自托管、能改、能编辑」本身就是另一个维度的价值。团队还公开了训练pipeline和数据质量的实操讨论,这部分对想复现的人可能比模型本身更有用。

统一「理解+生成」的开源模型家族,四个变体覆盖生图/编辑/快速推理,Apache 2.0可自托管40万美元、2.09亿张图的训练成本,把复现门槛拉到小团队够得着的范围对标闭源用的是「competitive」而非碾压数字,质量需实测,但摆脱API依赖本身就是价值

03 训练优化 on-policy蒸馏被当成万能提分器,其实它只干一件事

很多人把on-policy distillation(OPD,让student在自己生成的轨迹上跟teacher学)当成后训练的通用涨点手段,这篇系统性拆解给出了一个反直觉的定位:OPD并不抬高模型的能力天花板,它真正的作用是「探索催化剂」——用dense的token级信号,把student引导到本来就够得着但没走对的推理路径上。由此还带出一个违背直觉的经验:prompt多样性比每道题多采样几遍更重要,铺开题面比在单题上反复挖更有用。更麻烦的是它揭了两个坑:teacher和student差距太大时,指导信号会跟任务正确性错位,反而把探索带偏;token级目标还会诱发「长度套利」,模型靠截断或注水来钻奖励空子,而不是去学推理。作者用advantage clipping和log压缩这类轻量的信号约束把这两个病治住,在七个benchmark上稳定超过OPD原版和RLVR基线——结论是信号质量决定成败,teacher更大并不等于更好。

OPD只帮student走对已有能力范围内的路,别指望它提升能力上限,缺能力的问题得靠别的手段调OPD时优先扩prompt多样性而非堆单题采样数,投入产出更高teacher-student差距过大和长度套利是两个隐性陷阱,加上信号裁剪/压缩再上生产更稳。

04 模型架构 想押注非自回归路线,先看懂这张地图

自回归模型一个字一个字往下生成,离散扩散(DDM)则是先铺一整片「草稿」再反复全局修改——能并行、能回头改,这两点正让它成为文本和代码生成里越来越受关注的替代路线。但这条路线的工作散落各处,各家用词、各套形式化,新入场的人很难判断值不值得押。这篇论文没有再造一个模型,而是提出一个统一框架:它指出离散扩散的性质从根本上取决于离散状态空间怎么构造——用什么tokenization、词表的拓扑结构、以及领域专用的字母表,而现有那些transition-matrix、masking、score-based的做法,其实都是同一设计空间里的不同实例。它的价值不在跑分,而在给这条路线画了一张从tokenization到generation的地图,帮你在训练目标、推理算法、scaling行为之间看清取舍。

离散扩散的能力上限由状态空间的构造决定,选型时先看tokenization和词表设计而非模型本身主流三类方法是同一设计空间的不同实例,不必被术语割裂吓住这是综述性框架而非新SOTA,适合入场者建心智模型、不适合直接找可部署的性能提升
40万美元开源图像栈,蒸馏只是催化剂

也值得关注

05
剪枝把模型压小,却让它在自由生成上崩掉 训练优化—pass@1 几乎归零但 pass@k 还在,说明能力没丢只是不会连贯输出;这篇用「短到长」的 on-policy distillation 把剪枝模型救回来,和今天讲 OPD 机制的那篇正好一个讲原理一个讲应用。链接
06
把 agent 看成「foundation model + 可演化 scaffold」 Agent自改进 agent 从原型走向部署,这篇给出系统级综述框架,和今天的 Harness Handbook 是同一枚硬币的两面。链接
07
agent 评测管线碎片化、强耦合 评测这篇把评测拆成三个独立组件,提供一套轻量可扩展的统一评测基建,减少重复造轮子。链接
08
让理解和生成在掩码扩散里实时互相纠正 图像生成像老师边说边画,两个模态共享彼此的最新决策而不只共享上一步历史。链接
09
把确定性情感识别改成建模歧义的一对多预测 多模态用条件 rectified flow 头带上不确定性估计,面向真实场景下模糊的面部行为。链接

今日观察

今天有三篇 agent 论文各说各话,Harness Handbook 讲怎么维护那层代码,Self-Improvements survey 讲怎么让它自我演化,AgentCompass 讲怎么给它做评测——但三者踩的是同一块地基:agent 的能力其实不住在 foundation model 里,而住在包住模型的那层 scaffold 里,prompt、状态、工具、记忆才是行为真正发生的地方。三篇分别在这层 scaffold 的生命周期上各占一段:一段管它怎么被读懂和改动,一段管它怎么随经验演化,一段管它怎么被量到。

把它们连起来看,能读出一个还没被明说的转向:模型正在趋同,于是差异化的工程面和维护成本被整体挤到了 scaffold 上,这一层不再是模型外面随手糊的胶水代码,而开始被当成一个需要专门工具链——可读性、演化、评测——来伺候的一等工程对象。这也解释了为什么这类论文最近密集冒头:不是三个孤立的点子,而是一个领域在给自己新的成本中心配基础设施。

对做 agent 的人,具体的动作是:别再把 harness 当临时脚本堆着改。挑你手上最常动的那套 agent,花半天把「某个行为对应哪些代码位置」显式写下来(哪怕只是一份手工的行为→代码索引),下次改动前先查它——这一步省下的定位时间,比再换个更大的模型实在得多。