这期最值得记的是 Karpathy 那个「吞食」的比喻:软件 1.0、2.0、3.0 之间不是一代替一代,而是新的把旧的一口口吃掉。他在特斯拉做 FSD 时就是这么干的——一边把固定业务逻辑的代码删掉,一边把那部分功能迁进神经网络。
常规蒸馏是 teacher 模型把答案喂给 student 模型。这项研究换了个做法:答案由标准答案给定,而 teacher 模型负责生成「解释」——解题路径已经确定,但每一步到底什么意思、为什么这么走,交给模型来讲。
结果是:解释比答案对 student 更有用——一个几 B 的小模型,能训出比自己大好几倍的模型。
这家公司的研究一向有意思,而且出得很快,有时候跟都跟不上。
有产品基于推理模型做了个随身录音设备,主打转写、总结、思维导图生成,能连续录 20 个小时——等于可以戴一整天。
拆开看,和市面上已有的同类产品差别不大。但恰恰是这种「看不出差异化」的密集涌现,说明这个领域的需求已经被验证了——大家都在找合适的硬件形态,找不到新的就先抄一个。
切玻璃的声音之后,这个方向越来越卷:切开一个奶瓶是什么声音、切开果汁瓶是什么声音;折一架纸飞机、一只纸蜂鸟、一朵纸花,各是什么声音;沙滩上的沙堡呢。
视频模型能生成声音之后,大家对声音本身的探索一下就放飞了。ASMR 只是一个大家偏好刺激的形式,真正的信号是「声音」这一维度刚刚被打开。
Karpathy 那套框架里最重要的一点:1.0、2.0、3.0 并不是一个演进迭代、单纯替代的过程,而是一个吞食的过程。
他举自己在特斯拉做 FSD 的经历:在把功能逐渐迁进神经网络的过程中,1.0 时代那些写死的业务逻辑代码不断被删掉——边删 1.0 的软件,边训 2.0 的模型,最后 2.0 把 1.0 干的事全吞掉了。
还有一句被引用最多的:现在最酷的编程语言是英语,或者说自然语言。
生态上也有对应现象:围绕几个「核项目」(比如语音识别、视觉编码器)会长出一大批衍生项目——2.0 时代的软件可以这样看,3.0 时代大概率也一样。