这期最值得记的是一个范式判断:第一波是模拟的时代,巅峰是自我对弈;第二波是人类数据的时代,代表是聊天模型;第三波应该是经验的时代——放 agent 自由,让它在环境里自己交互,奖励由环境给,而不是由人的预判给。
有个团队做了一个类似 AI 小镇的东西,算是那一代的巨大升级版。整体体验从游戏感到背后的编排都做得不错——如果它背后真的是大量模型在跑,那这套编排确实挺讲究。
玩法有游戏模式和数据模式:你可以看着它自己做各种事,也可以给它下指令——先让它去卖木头,再让它去赚钱,再放它自己去找地方玩。
还有一类强指令的道具。比如给它一条「多去户外玩玩,别整天看书」——它居然还会犟嘴:「理论阅读不可缺」。得把强制那一项勾上,它才比较听话。
此外可以升级房子,但材料要它自己去砍树挖矿;还能翻它的日记,看它每天都干了什么。
顺带一个观察:最早那篇 AI 小镇论文的几位作者,后来在这个方向上似乎都没有太多新进展,不知道为什么。
有一篇文章反复在讲同一件事:要打破「以人类为中心的 AI 系统」的局限。
它指的是现在这套做法——拿大量人工产生的数据去训练,希望 agent 越来越像人那样思考、那样行动。直觉上就能感到问题:这样训出来的模型不具备很强的自我探索能力,天花板是人给的。就像当年的 AlphaGo 和 AlphaZero 的差别。
它提的几条是连着的:动作和观察要成对;奖励函数应该由环境给,而不是来自人的预先判断;agent 应该依据自己的经历去规划和推理,而不是套用人类的推理视角。
三波浪潮的划分很清楚:第一波是模拟的时代,巅峰是自我对弈的棋类系统;第二波是人类数据的时代,代表是聊天模型;第三波应该是经验的时代。
起点被认为是那个拿下数学奥赛金牌的项目,由此衍生出电脑操作、手机操作这类真的像人一样跟现实世界打交道的 agent。
新范式就一句话:放 agent 自由,让它自己在环境中交互。
接着上一条推:如果 agent 需要不断了解你的「体验流」,那它最适配的设备和交互界面是什么?
答案大概率是大量的 AI 硬件——以及以前那一波「量化自我」。
那件事当年没做成,是因为采集回来的数据没人会解读;现在解读的那一环有了。
所以对 AI 设备和量化自我这两个方向,值得给出比之前更高的权重。
上期讲过某家的图像编辑模型,确实很不错。紧接着另一家就发了它的轻量图像模型,效果也很好。
给的示例明显比前一个做得好——而且它结合了自家开发平台的应用构建能力。
也就是说:出图不再是终点,出完直接就能落进一个能跑的应用里。
这份榜单里有四条值得记的观察:
一、某家大厂一口气有四个应用上榜——邮箱、笔记、开发平台,还有实验室(能上榜是因为视频模型和虚拟试衣的 agent 都挂在里面)。其中笔记那个涨得非常猛,最近的视频概览功能做得相当不错。
二、几家新玩家进来了,量也不小;但对比之下,另一条线从二月攒下来的月活一路延续到现在,依然比它们都高。(这张图是去掉头部那家画的,不然没得看。)
三、中国找到了自己的一批赢家,而且全是出海产品。前五十里有二十几个是中国应用——一家做图像的公司独占五个,另一家大厂三四个。另外,大量尝试性的 AI 应用都被塞进了同一个浏览器壳里。
四、vibe coding 真的产生了实打实的用户。以前大家总觉得这是个尝鲜的事,但从支付平台的数据看,头部产品的收入留存率高达 100%——虽然有新用户进来也有老用户流失,但总收入还在涨。
「玩具」和「生意」的分界线,就在这个留存数字上。