这期有个很具体的观察:过去做玩游戏的 agent,手上只有「结果打成什么样」,缺的是「人当时手指是怎么动的」。缺了这层,模型学到的东西就是断的。
这条线去年有非常多进展,但模型层面其实没多少——大量工作都发生在 agent 上,而且做得挺优秀。
上周还有一笔投资落地:一家大厂投了做 AI scientist 的团队,签的是战略合作。金额没披露。
这类合作最实在的部分不是钱,是拿到对方的基础设施和模型资源。
延伸阅读 · 本刊深潜《从 $15 一篇论文到 Nature 发表:AI Scientist 的科研自动化之路》——这条线的完整脉络与成本量级。
有一个把成本和能耗换算成日常单位的指标,可以理解成「一个汉堡等于多少 token」。
这不是纯噱头概念。背后是一篇很专业的分析文章,评估过程是认真的,不是拍脑袋吹出来的。
把抽象的算力开销落到一个人人有直觉的单位上,这件事本身就有传播价值。
延伸阅读 · 本刊深潜《Token 经济学:定价、悖论与下一代商业模式》——把 token 换算成日常单位之后,账该怎么算。
一篇很长的文章梳理了这段合作史:最开始是台积电孤注一掷投了一百多亿,帮苹果把芯片做起来。那之后很多年,大家默认高端制程的驱动力就是苹果。
这几年的大变化是:英伟达也成了同等量级的驱动力,变成了双驱动。
三边都因此要重新想事情:对台积电来说,需要重新定义自己的战略;对苹果和英伟达来说,各自要去找自己的「下一个台积电」。
有一篇研究直接冲着一个默认假设去:大家总觉得 token 数决定一切——scaling law 嘛,token 越多越好。
这个假设正在被认真检验。
如果它只在某个区间成立,那所有基于「继续堆数据」的路线规划都要重算。
有个项目名字取自赛车游戏里的氮气加速。它盯的是一个被长期忽略的缺口:以往所有玩游戏的 agent,拿到的都只是「玩的结果」,缺的是用户当时怎么操作手柄的数据。
只有效果、没有动作序列,这本身是有问题的。
所以这个项目专门收集了大量的手柄操作数据来训模型——左右怎么动、什么时候按哪个键,全都在里面。
这是个通用的提醒:很多任务上真正稀缺的不是「更多样本」,而是「中间过程的样本」。
Excel 类产品:某家新出的只能说凑合,还是更推荐之前提过的那个 Ramp 的表格产品,注册就能用。
安全:现在是做安全生意的好时机。当 agent 开始大规模接管真实操作,攻击面是同步扩张的。
本地部署:跑编码 agent 这类东西,硬件门槛比想象中低——最低配的小主机就够,根本没有模型算力需求。