这期有个判断挺值得记:新一代推理模型的瓶颈已经不在「够不够聪明」,而在于它极度吃上下文。顺着这个往下想,公司里最该有的那个岗位就变了。
新版语音合成值得看一眼,原因很朴素:中文终于正常了。
上一版说中文非常奇怪,基本听不了。新版拿一段技术说明来念——手势识别、单帧动作、两根手指放大这类内容——已经流畅准确。
英文那一侧也继续往上提了不少。
这条线的定位很明确:第一个基于视频训练、并达到 SOTA 级别视觉理解与预测能力的世界模型,用途是机器人的零样本控制。
理解那一半:跳水动作的识别——前向还是后向、翻腾几周、有没有转体。传统上要靠专门的动作分类基准来做,纯多模态模型达不到这个精度。
预测那一半更有意思:打开冰箱门 → 预期你要去拿瓶子 → 预测你会按压瓶子把东西挤出来 → 再预测你把它放回去、关上门。它预测的是「这个场景下接下来会发生的动作」。
怎么用?给它一个起始帧和一个目标帧,让它预测中间的全过程来做规划,在隐空间里得到一条最可能成功的序列,然后驱动机器人去执行。
有人用「让模型画一张鹈鹕骑自行车的 SVG」跟了半年,这期做了回顾:
早期的开源旗舰基本没法看;到某一版之后逐渐像样,满血版能画出一只带颜色的鸟骑车;推理模型出来之后正常多了,连车架的横梁都出来了;小尺寸的推理版反而差些(它本来就是为理工科任务做的);再往后几家的旗舰都已经不错——鸟嘴对了、车也对了。
评测方法本身也挺好玩:写个程序把手头三十个结果两两配对拼成图,左边一个右边一个,随机排列,让另一个模型来判断哪边更好,最后跑一个 ELO。
而这周的开发者大会上直接出现了动态的鹈鹕骑车视频——到这一步,这个比赛基本可以结束了。作者自己也说要换下一道题。
前段时间某个版本特别会谄媚,被吐槽到官方回退,并专门写文章解释原因。
其中一条挺关键:他们有一个团队在做「风格检查」——衡量 AI 的回答是不是跟人类的风格更一致。
想一想:如果这个信号被用来影响模型自己的生成风格,那它确实很可能演化成一个更会拍马屁的模型。
所以这不是一个 bug,是一个优化目标选错了导致的必然结果。
关于新一代推理模型,这期的判断是:关键点已经不在模型本身够不够聪明,而在于它非常吃上下文——因为它能感知到自己的上下文够不够。
用它就像在喂一只极其贪吃的东西:给多少上下文它都要。同时系统提示词会极大地塑造它的行为,指令遵循也做得很好。
顺着往下推,公司里最重要的事就变了:不再是「简单地把提示词写好」,而是提前把上下文和任务指令准备好。
具体是三问:我们公司大概有哪些任务?这些任务依赖的上下文可能来自哪里?我怎么把这些东西——上下文本身,或者获取上下文的渠道——先备好?
一旦这些备齐了,等到有一个足够便宜的强推理模型可用,就能直接用起来。
所以可能会出现一个提示词工程之外的新职业:信息架构师。把对应任务的上下文找到、整理好、整理成对的结构,再交给用户和模型——这是一个很重要的决策,不只是提示词那些标准技巧。
开发者大会上有一堆奇怪的小更新,最显眼的是所有版本号直接跳到 26。
为什么不是 25?想想看:到了 2026 年 1 月,你手上还装着一个「25」,是不是会觉得有点过时。
传得最多的是那套新的界面材质语言。这对应到一篇叫《战略性撤退》的文章,它的判断是:这家公司的核心能力从来就不是 AI,而是「为终局而设计」。
所以它拿出来的是下一代统一的设计材料语言,而不是去正面拼模型。在自己不占优的赛道上后撤,把资源押回自己真正定义得了的东西——这是撤退,也是选择。