2025 年的最后一次分享。最值得留下的是一段解释:模型的能力为什么这么参差——因为人脑是在「任何一维出错就活不下来」的压力下多元优化的,而模型的优化目标是模仿文本、解数学题、在竞技场里得分。
「有些题它做得比博士还好,有些题它连小孩都不如」——这种参差不是缺陷清单,是优化目标不同的必然结果。
人类的神经网络,是为一个部落的生存而进化的。而部落的生存是一个多维度的多元优化问题——但凡有一件事错了,就很可能整个挂掉。所以这条路上活下来的大脑,每一维都不能太差。
模型的神经网络优化的是什么?模仿人类的文本、数学谜题的奖励信号、以及在竞技场里的名次。这三样都不包含「哪一维塌了会死」这个约束。
所以模型的能力剖面必然是尖峰加深谷,而不是人类那种被生存压平过的曲线。说它「不行」和说它「超过博士」,往往说的是同一个模型的不同维度。
现在所有人都在讲 vibe coding,火到得给原来那种写代码的方式起个新名字来区分——于是有了 core coding。
一个词流行到逼出它的反义词,本身就是采纳程度的读数。
而模型这边给 vibe coding 加的东西,说白了就一句话:更漂亮、更简洁、界面更有审美。——不是能力维度,是成品观感维度。
工具调用这条线上,已经形成的做法是思考和调用交错进行:你调一次模型,它内部自己调了好几次工具——先思考,再调工具,拿到结果继续思考,再调下一个。
在「交错思维」之外,又出现了一个叫「保留思维」的概念。
差别在于:交错是每一轮都重新想,保留是把上一轮的思考带到下一轮去。多轮工具调用里,这两种处理方式的成本和效果差得不小。
算力侧:电力被反复提起——power、power、power。同期还能看到通过卫星影像去追踪数据中心建设进度的做法。
并购侧:芯片端出现了针对推理芯片公司的收购动作。
具身侧:有一条路子是用 AI 生成的视频来教机器人——不采集真实演示数据,直接生成。