这期后半场是斯坦福那份 500 页的 AI Index 报告,里面最值得记的不是某个数字,是措辞的变化——以前说 AI 只在特定领域强,今年改成了「超过人类,但还不是全部任务」。前半场聊了个当时挺好玩的方向:把向量数据库塞进浏览器,让每个 Tab 变成一个 agent。
找向量数据库的时候撞见一个挺自然的方向:能不能把向量库直接跑在浏览器里。确实有不少实现,IndexedDB 之类都能承载。
单看这个能力想象空间不大——无非是一个纯本地的网页版 RAG,用的全是浏览器自己的资源。但再往前推一步就有意思了:浏览器的 Tab 之间是有跨 Tab API 的,可以互相通信。
如果每个 Tab 都接了一个模型,那每个 Tab 就可以当成一个 agent,靠 cross-tab API 做一套完全跑在本地的多 agent。
这期看了两个硬件。一个是带履带的桌面小机器人——用手机当大脑,有自己的时间线和世界观,能识别手势和语气、会抓拍周围空间,走情感陪伴路线。众筹超额完成,当时准备量产。
评价挺客观:这类产品七八年前就有过,还做得挺集成——会跑到桌子边缘被吓退、能识别猫脸人脸。只是随着这一代模型出现,多模态能力真的能给它赋能了。
另一个是 Rewind 的 Pendant,改了外形。本质是个一直在录音的吊坠,戴在身上把你说的所有话记下来,之后可以回溯检索。
一份文档把大模型的来路一以贯之地串了一遍:最早是个分类问题 → 简单线性回归 → 复杂一点的分类和回归 → 分类的不只是文字,图片怎么办 → 复杂度撑不住了,得上神经网络 → 大量训练数据。绕了一圈,回到最初的梦想其实差不太多。
另一个是 3Blue1Brown 的频道(B 站也有),大量可视化课程讲神经网络怎么工作,动画质量很高。
第一份是 Galileo 的:把 RAG 拆成一个个 component,逐个说清关注点和要做的事。里面引用的提示词技巧当时相当新——已经没人只讲 CoT 了,ToT 是起步,后面还往上叠。
第二份分了九章(第十章没写完),最值得看的是数据准备那部分:一个数据源进来之后怎么 chunking,列了一大堆策略——固定大小的、context aware 的;chunk 完怎么 organization;各种 tokenize 方式。每一步都举了例子,有些还带可直接参考的代码。
这两份的实际用处是对客户:「你们召回怎么不准」这种问题,可以拿这些材料一起 debug——出问题基本就集中在那几个点上。
斯坦福这份报告 500 页,数据极多。第一条 takeaway 是 AI beats humans on some tasks, but not on all。
图像分类、visual reasoning、English understanding 这几项已经超过人类基线。真正的信号在措辞:以前的说法是「AI 只在某些特定领域很强,但人整体更强」,今年改成了「超过人类,但还不是全部任务」——主客位置反过来了。
投资部分的数字对比很直接:美国约 170 亿美元,第二名约 70 亿美元。新成立的 AI 公司数量,2023 年美国是 290 家,中国 100 多家——两边差距和投资额是对应的。
但最扎眼的是分领域那张图。把 2022 和 2023 两条线叠在一起看,绝大多数领域变化都不大,只有一个例外:Infra 领域涨了 18 倍。
当时据此下的判断是:要说哪一类 AI 公司会起来,肯定是 Infra 那一层。另外报告里说 50% 多的公司称自己已经用上了 AI。