EP.13 · 2024-08-09
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2024 年 8 月当时的判断,未按后来的发展修改。
2024-08-09 · 49 分钟 · 逐话题

别只看性能,要看性能除以参数量

这期有个评价模型的角度值得留下来:不要只比性能,要比性能除以参数量。按这个尺子看,当时几个百亿级模型都在合理区间,反倒是 405B 那个显得不划算。另外还拆了 Outlines 是怎么在解码那一层把输出格式约束住的。

本期话题
  1. Outlines:在解码层把输出格式焊死
  2. 微软给 Copilot 生成的内容兜版权诉讼
  3. 性能参数比:一个更公平的尺子
  4. OntoGPT:靠本体论把抽取做严肃
  5. LangGraph Studio:顺理成章的那个 IDE
  6. 为什么还是要会一点 coding
01

Outlines:在解码层把输出格式焊死

Outlines 这个库的功能和 OpenAI 那时刚发的格式化输出 API 类似:给它一个 JSON 或正则的 schema,它引导模型按这个格式输出。

原理在解码层:每一次 decoder pass 之后,它去更新 token 的 probability(softmax logits),从而约束下一步能生成什么。不是生成完再校验,而是压根不让它生成不合法的 token。

底层是基于正则做约束的。为了支持 JSON,它先做了一层比较工程化的处理:把 JSON schema 解析、转换成正则表达式,再交给受约束的生成器。

02

微软给 Copilot 生成的内容兜版权诉讼

微软的 Copilot Copyright Commitment 覆盖面很全:M365 的 Copilot、Bing Chat(含企业版)、Windows Copilot、Dynamics 的 ERP Copilot、GitHub Copilot——这些产品生成的内容如果引发诉讼,微软兜。

当然有限制,比如你自己改过的内容就不管了。但能做这个承诺本身说明问题:得对自己产品有足够强的信心,才敢给客户这种 commitment。

评论区有两类声音值得记。一类指出:条款和法律一样,最终用户其实很难按你承诺的方式去理解——什么叫「合理使用」,解释权在法律手里,不在条款里。

相关信源
03

性能参数比:一个更公平的尺子

Mistral 这批模型里,有个 7B 的被直接拿去和 22B、34B 比,HumanEval 之类的成绩能到 65 上下——研究上做得确实不错。

更值得记的是他们提出的评价角度:performance / parameter ratio,性能参数比。

不能只说你够强,还得说你多大才这么强。按这个维度看,当时百亿级的那几个(Mistral Large 2、Llama 3.1 70B)都落在挺不错的区间;而 Llama 3.1 405B 虽然性能确实更高一点,但参数量实在太大,这个比值就不好看了。

相关信源
04

OntoGPT:靠本体论把抽取做严肃

OntoGPT 是个挺早的项目,一直没抽出时间试。它做的事是从大量文本里抽结构化数据

和 GraphRAG 那类「图 + 模型」的路子相比,它的差别在 ontology(本体论)抽取过程是基于本体论做 grounding 的,所以结果更准确、更适合严肃场景。

05

LangGraph Studio:顺理成章的那个 IDE

LangGraph 发得早,所以配一个可视化的编辑 IDE 是很自然的事——LangGraph Studio 就是这个。当时看下来做得挺不错。

这也接上了前几期的判断:agent 这一层最缺的就是像样的调试工具,谁先把 IDE 做出来谁就占住了开发者的入口。

06

为什么还是要会一点 coding

结尾有个观点:做这一行还是需要有一定的 coding 能力。

但这里说的不是记住多少种语法或语言特性,而是知道怎么用一种很规范化、很形式化的语言去把事情说清楚,怎么按工程化的方式去思考问题。

每周 AI 情报 · AI Buzzwords · EP.13 · 2024-08-09 · 49 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾