EP.31 · 2025-03-07
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 3 月当时的判断,未按后来的发展修改。
2025-03-07 · 52 分钟 · 逐话题

模型卷到下一阶段之后,凸显出来的是数据源

这期两个观察。一是 Manus——产品设计确实做得好,但更值得看的是它的用例库:第一次有 agent 产品把生活、教育、效率这些场景摆出来,而不是清一色的编码和研究。二是一个更结构性的判断:模型能力还在往前,但现在真正拉开差距的,已经是搜索背后那个数据源了。

本期话题
  1. Manus 的产品设计确实好
  2. 最该抄的是它的用例库
  3. GAIA 这种榜,卷起来是好事
  4. 真正拉开差距的是数据源
01

Manus 的产品设计确实好

还没拿到邀请码,只能看演示。但产品做得确实好——至少在工程和产品设计上,是当时用到过的最好的一个。

最值得看的是它的 Replay:任务完成之后能完整回放推进过程。左边是它干了什么、执行了什么,本质上是一份 action log(台账),路数和 computer use 是一样的;右边是工作台。把过程摊开给人看,这件事本身就是产品力。

02

最该抄的是它的用例库

如果只能推荐一样东西,那就是 Manus 的 use case gallery

以前 computer use 那类产品的用例,往往都偏编码、偏研究。Manus 是第一个把生活类、教育类、效率类这些场景大大方方摆出来的。

做 agent 类产品的人都该去翻一遍这个用例库——它回答的是那个最难的问题:这东西到底给谁、在什么时候用。

03

GAIA 这种榜,卷起来是好事

榜单一出来就会被刷,这很正常。但要分清卷什么:

以前卷 MMLU 那类,真的没什么意思;现在卷 GAIA 这种——考的是在现实世界里能不能真帮人把活干完——就是好事。

顺着它的题目还能做一件挺可怕也挺有意思的事:拿这些题去估算,到底哪些工作可能会被彻底干掉。

04

真正拉开差距的是数据源

做同一个研究型问题,接了高质量文献库的产品结果明显更好。结构上大家差不多——正面、负面、条件因素、干预建议,但差异在引用:它给出的 reference 是一篇篇具体的 PDF、具体的网页、库里的具体文献,内容和引用都比通用的研究流程靠谱得多。

这指向一个结构性判断:尤其是 DeepSeek 出来之后大家用得更多了,才发现模型能力当然重要,但更重要的是搜索这个按钮背后——你的数据源是不是足够高质量,至少在目标用户那个领域里足够高质量。

有个产品在这件事上很有前瞻性:很早就设计了自己的「书架」功能。别的 AI 产品基本没把知识管理当回事,顶多在 To B 端做个 workspace 之类的工作台,没人对书架、对知识沉淀做深设计。

结论很清楚:模型卷到下一个阶段之后,凸显出来的就是这一层。

每周 AI 情报 · AI Buzzwords · EP.31 · 2025-03-07 · 52 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾