EP.7 · 2024-05-11
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2024 年 5 月当时的判断,未按后来的发展修改。
2024-05-11 · 66 分钟 · 逐话题

260 个项目里,agent 秒掉了所有别的方向

这期先看了一批新孵化项目的分布——两百多个项目,技术栈高度一致:agent 一家独大,指数上秒掉所有别的方向。前两年那波区块链,全废了。

本期话题
  1. 两百多个项目,技术栈高度一致
  2. 让模型自己反问自己,来查它有没有幻觉
  3. 把数据变成「模型能直接用」的那一层
  4. 把分享材料做成组件,而不是一份大 PPT
01

两百多个项目,技术栈高度一致

看一批孵化项目最有价值的地方,是它跟趋势高度相关——他们看中什么,本身就是信号。

这一批 260 个项目里:技术栈特别一致,agent 处于绝对主导地位,指数上秒掉其他所有方向。多模态有一点,但不多;前两年很火的区块链全都废了。

基础设施是个有意思的例外:做投资的人非常多,但真实的创业项目很少——因为这基本上是大厂的生意。

按领域分:最大的一块是软件开发——这帮程序员在拿 agent 把自己干掉。第二大是金融,这个挺出乎意料,金融领域确实有巨大量的创业公司。

02

让模型自己反问自己,来查它有没有幻觉

这个方法很巧:不用外部知识库去核对,而是用模型自身对概念的理解来判断。

做法是对同一个问题做多个维度的采样,拿采样出来的片段回过头去问模型:这个片段支持刚才那句话吗?

举的例子是一句人物介绍:某人是意大利的职业球手、生于米兰、卒于某地。采样出几段之后,逐段去问「这段支持那句话吗」。

本质是 self-query——让它自己问自己,换多个维度反思一遍,看会不会出现冲突。有冲突,大概率就是幻觉。

这套方法后来被拿去做成了一个基准,用来评价别的方案。

03

把数据变成「模型能直接用」的那一层

有一条被反复提到的赛道:数据管道——原始数据怎么解析、怎么转化,变成大模型好用的数据。

老选手还是那几家做工作流调度和数据平台的;新出来的这一代直接把定位写成「让你的数据 RAG-ready」。

它开源了一个核心项目:预处理工具——把 PDF、HTML、Word 这些东西解析转换成优质的、模型能用的语料。

让人意外的是,这理论上应该算企业最核心的能力,他们却把它开源了。

商业模式看起来不是 SaaS,是纯 ToB、项目制的服务:你企业有多少数据,我帮你把它做成可用的形态。

04

把分享材料做成组件,而不是一份大 PPT

这是一段方法论:不可能用一份 PPT 打天下——内容分属各个领域,客户想听的主题每次都不一样。

所以把长期整理的材料组件化agent 与多 agent、评测、各类架构图、landscape 类的概览,每个领域画在对应的组件里。

要讲什么主题,就从组件库里挑几块拼成一份 PPT。

面向企业的那套内容也是按角色分层的:高管和管理者看的是一层,专业岗位看的是另一层,再加上模型与应用的安全合规;此外还有给人力、产研、用户体验这些部门的通用部分。

每周 AI 情报 · AI Buzzwords · EP.7 · 2024-05-11 · 1 小时 6 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾