这期主要围着 Simon Willison 那篇年度总结展开。他有两个判断当时很刺耳:一是随着 o1 这类模型出现,免费用上最强模型的日子大概率回不来了;二是现在做 agent 的人,很多是在利用这个词本身的欺骗性——他为此在推特上收集了 211 个不同的 agent 定义。
CES 上关注度最高的是 NVIDIA 的 RTX 50 系列,用了新架构,结合 DLSS 和推理技术。游戏侧的卖点是 AI 补帧和改进的抗锯齿,很多游戏因此拿到更高帧数;此外还主打用 AI 生成高精度 3D 模型,以及模型训练和自动驾驶。
另一条线是 AI 眼镜,一口气出了六款,各自面向不同人群。但官网普遍不提电池续航——能连续运行多久,没人给数字。
Simon Willison 的年度总结里有个当时听着挺刺耳的判断。此前各家都在越来越多地把 SOTA 模型免费给用户用,OpenAI 也是。
但随着 o1 这类模型出现,免费使用 SOTA 级别模型的日子很可能回不来了——成本实在太高。标志就是 o1 Pro 那种只有 ChatGPT Pro 订阅才能访问的形态。
同一篇文章里,他对 agent 的看法相当沮丧:认为大家都在做一些挺扯的 agent,没什么真东西。
论证方式非常 geek:他在推特上收集了 211 个不同的 agent 定义,然后让大模型帮他归纳——结论是归纳不出什么有用的东西。
他的核心指控是这个词具有很强的欺骗性,所以特别容易被套在各种事情上——就像 AGI 一样,什么东西加上它都能先骗一波。
提到 ARC-AGI 时给的理由很朴素:一个聪明人即使完全没受过训练,也能拿到 95 分以上。
正因为它对人类如此简单、对模型却很难,它才是个好基准——而这也正是 o3 这一代推理模型下一步要正面解决的问题。
Meta 的大概念模型(LCM)核心主张是:把大模型的推理过程和语言表述彻底解耦。
灵感来自人怎么思考——人想事情并不是一个 token 一个 token 地想,而是按一个个概念、按更高维度的顺序在推进。所以现在这种 token by token 的方式本身是有缺陷的。
它设想的链路是:词先经过一个 concept encoder 变成一堆概念,推理在概念这一层进行,最后再解码回语言。