这期有个评价模型的角度值得留下来:不要只比性能,要比性能除以参数量。按这个尺子看,当时几个百亿级模型都在合理区间,反倒是 405B 那个显得不划算。另外还拆了 Outlines 是怎么在解码那一层把输出格式约束住的。
Outlines 这个库的功能和 OpenAI 那时刚发的格式化输出 API 类似:给它一个 JSON 或正则的 schema,它引导模型按这个格式输出。
原理在解码层:每一次 decoder pass 之后,它去更新 token 的 probability(softmax logits),从而约束下一步能生成什么。不是生成完再校验,而是压根不让它生成不合法的 token。
底层是基于正则做约束的。为了支持 JSON,它先做了一层比较工程化的处理:把 JSON schema 解析、转换成正则表达式,再交给受约束的生成器。
微软的 Copilot Copyright Commitment 覆盖面很全:M365 的 Copilot、Bing Chat(含企业版)、Windows Copilot、Dynamics 的 ERP Copilot、GitHub Copilot——这些产品生成的内容如果引发诉讼,微软兜。
当然有限制,比如你自己改过的内容就不管了。但能做这个承诺本身说明问题:得对自己产品有足够强的信心,才敢给客户这种 commitment。
评论区有两类声音值得记。一类指出:条款和法律一样,最终用户其实很难按你承诺的方式去理解——什么叫「合理使用」,解释权在法律手里,不在条款里。
Mistral 这批模型里,有个 7B 的被直接拿去和 22B、34B 比,HumanEval 之类的成绩能到 65 上下——研究上做得确实不错。
更值得记的是他们提出的评价角度:performance / parameter ratio,性能参数比。
不能只说你够强,还得说你多大才这么强。按这个维度看,当时百亿级的那几个(Mistral Large 2、Llama 3.1 70B)都落在挺不错的区间;而 Llama 3.1 405B 虽然性能确实更高一点,但参数量实在太大,这个比值就不好看了。
OntoGPT 是个挺早的项目,一直没抽出时间试。它做的事是从大量文本里抽结构化数据。
和 GraphRAG 那类「图 + 模型」的路子相比,它的差别在 ontology(本体论):抽取过程是基于本体论做 grounding 的,所以结果更准确、更适合严肃场景。
LangGraph 发得早,所以配一个可视化的编辑 IDE 是很自然的事——LangGraph Studio 就是这个。当时看下来做得挺不错。
这也接上了前几期的判断:agent 这一层最缺的就是像样的调试工具,谁先把 IDE 做出来谁就占住了开发者的入口。
结尾有个观点:做这一行还是需要有一定的 coding 能力。
但这里说的不是记住多少种语法或语言特性,而是知道怎么用一种很规范化、很形式化的语言去把事情说清楚,怎么按工程化的方式去思考问题。