这周开放权重的推理模型把及格线拉高了一截,但更值得琢磨的是它随附的那套响应格式:每个角色被拆成几条 channel——最终输出一条、思考过程一条、工具调用一条。以后的 agent 就是表面说一套、心里想一套、手上用一套。
这是八月一号的一份研究,方向是用编码 agent 来做机器学习。这条线上此前已经有几个前作:一个是不断迭代代码、跑评估器比效果;另一个更直接——编码 agent 自己的代码也应该被迭代,如果它能重写自己的代码,你就得到一个持续进化的 agent。
这次瞄的是三个很具体的痛点:
一、模型倾向于用自己最熟的老工具。数据多、准确率也许不低,但它选的库和方法往往偏老,新技术用得很少,就没法在最新的 SOTA 基础上继续往上做。
二、以前的 agent 习惯整体大改,而不是在现有代码上逐步迭代。
三、缺乏深度。机器学习的链路环节很多——数据处理、特征工程、实验迭代、消融——一上来就大规模「装修」,结果每个点都没做深。
它的解法很朴素也很有效:直接让 agent 上网去搜最新的模型和算法,把新东西用上。
这次发布的第一句话就说得很明确:推动开放权重推理模型的前沿边界——说白了就是把这个领域的及格线拉高,你们都基于这条线往后走。
许可证选的是 Apache 2.0。它和 MIT 最大的差别在专利授权上说得明确得多:如果你用了它的软件,回过头来起诉它专利侵权,理论上你会立刻失去专利使用权——起诉了就不配用了。此外还管商标使用权。MIT 则基本什么都不管。
但真正的关键句是「为消费级硬件运行做了大量效率优化」。
两个尺寸:大的那个用低位量化后只占七十多 G 显存,一块 80G 的卡就能跑,对标的是对家的小推理模型;小的那个占 16G,实测下来还更少,大概 13G 出头。
于是选择题变了:要一个推理模型,是上一台八卡机跑那个大开源旗舰,还是单卡跑这个。
当然 80G 的消费级卡本身还很少见——不过已经有厂商的产品能给到模型九十多 G 的可用空间。
随附的响应格式值得单独看。随着 agent 越来越复杂,客户对 API 的需求不会停在「兼容一个响应接口」上。
它加了新的角色:工具和函数的定义可以放进一个专门的开发者角色里,而不是一股脑塞进系统提示词;工具本身也能作为一个角色出现。
更重要的是 channel 这个概念——每一个角色都有不同的 channel:一条是最终输出,一条是分析过程也就是思维链,还有一条一般用来放工具相关的内容。
所以以后的 agent 就是:表面说一套、心里想一套、手上用一套,三条通道并行,加上不同角色各自完成自己的工作。
这套格式很可能会变成事实标准。
发布之后几乎所有能想到的推理引擎都迅速支持了——连最偏底层的那个 C++ 实现都很快跟上,这一点挺震惊的。
但接下来就是分水岭:大家都能推理,谁推理得牛,差异非常大。
从实测图上看,这个模型的速度极快,仅次于某家的轻量档;而专用推理硬件那一家的速度更是快得离谱。
同一个开放权重,在不同引擎和硬件上跑出来的体验完全不是一回事——这正在变成一个独立的竞争维度。
顺带试了一批端侧模型:让它倒着背字母表、问一张图里最大的房间有多大、认一认照片里是谁。
这类任务才是端侧该走的方向。
端侧还去追 SOTA 分数,很没意思。