这期两个观察。一是 Manus——产品设计确实做得好,但更值得看的是它的用例库:第一次有 agent 产品把生活、教育、效率这些场景摆出来,而不是清一色的编码和研究。二是一个更结构性的判断:模型能力还在往前,但现在真正拉开差距的,已经是搜索背后那个数据源了。
还没拿到邀请码,只能看演示。但产品做得确实好——至少在工程和产品设计上,是当时用到过的最好的一个。
最值得看的是它的 Replay:任务完成之后能完整回放推进过程。左边是它干了什么、执行了什么,本质上是一份 action log(台账),路数和 computer use 是一样的;右边是工作台。把过程摊开给人看,这件事本身就是产品力。
如果只能推荐一样东西,那就是 Manus 的 use case gallery。
以前 computer use 那类产品的用例,往往都偏编码、偏研究。Manus 是第一个把生活类、教育类、效率类这些场景大大方方摆出来的。
做 agent 类产品的人都该去翻一遍这个用例库——它回答的是那个最难的问题:这东西到底给谁、在什么时候用。
榜单一出来就会被刷,这很正常。但要分清卷什么:
以前卷 MMLU 那类,真的没什么意思;现在卷 GAIA 这种——考的是在现实世界里能不能真帮人把活干完——就是好事。
顺着它的题目还能做一件挺可怕也挺有意思的事:拿这些题去估算,到底哪些工作可能会被彻底干掉。
做同一个研究型问题,接了高质量文献库的产品结果明显更好。结构上大家差不多——正面、负面、条件因素、干预建议,但差异在引用:它给出的 reference 是一篇篇具体的 PDF、具体的网页、库里的具体文献,内容和引用都比通用的研究流程靠谱得多。
这指向一个结构性判断:尤其是 DeepSeek 出来之后大家用得更多了,才发现模型能力当然重要,但更重要的是搜索这个按钮背后——你的数据源是不是足够高质量,至少在目标用户那个领域里足够高质量。
有个产品在这件事上很有前瞻性:很早就设计了自己的「书架」功能。别的 AI 产品基本没把知识管理当回事,顶多在 To B 端做个 workspace 之类的工作台,没人对书架、对知识沉淀做深设计。
结论很清楚:模型卷到下一个阶段之后,凸显出来的就是这一层。