这期最有意思的一条:世界不是提前建好的模型,而是每一帧现渲染出来的;然后把一个会玩游戏的 agent 扔进这个现生成的世界里,让它自己去完成任务。两头一接,就成了一条自我进化的路子。
有人做了一套判断手机游戏好坏的方法论,不看画面不看销量,看它用了多少种暗黑模式:时间上的(逼你天天上线)、金钱上的(怎么一步步掏你钱)、社交上的(必须组工会、必须拉人)、心理上的(沉没成本、徽章、勋章)。
按这几个维度排出来之后,左边一堆看着像独立游戏,右边一堆看着像最赚钱的游戏。
同一段里还提到另一篇文章:讲小孩本该在没有大人盯着的情况下、和同龄人自己组小群体到处玩,而美国这几年的孩子几乎没有过这种独立玩耍的经历。对做 AI 游戏的人来说,这两篇放在一起看比单看任何一篇都有用。
有个想法在这期被提出来:心理学里那些测同理心、测换位思考的题目,能不能直接拿来给大模型打分?
实际试下来,现在的模型在很多这类题目上能打到八九十分。
反过来的推论更有意思:如果模型确实具备这种迁移能力,那把它用在心理学问题本身上,理论上也是成立的。
以往的发布节奏是有规律的:1.5,然后 2 的 Flash-Lite 和 Flash,再到 Pro,再到多模态的 image,然后又回到 Flash-Lite——小、小、中、大、中、小,中间穿插 Deep Think、Computer Use 这类特化版本。
这次一上来直接就是 Pro。而且 Pro Image 的 model card 隔天早上就跟着更新了,节奏很快。
但 model card 本身没什么内容:核心只说了 3 Pro 的架构基于此前一系列研究(列的都是 2.5 Pro 那批 paper),仍然是 Transformer,是 MoE。该说的技术细节基本没说。
实时 3D 世界生成这条线,关键差别在于:它不是像高斯泼溅那样先建好一个模型再去看,而是每一帧都是当场渲染出来的,清晰度和帧率都不低(二十几帧)。因为是现渲染,环境才能保持一致。
把它和一个会在游戏里完成任务的通用 agent 接起来,就出现了这期最值得记的画面:现场生成一个场景,让 agent 在这个刚生成出来的世界里自己玩。演示是一个蝴蝶角色去找一朵红花——世界是生成的,行动是 agent 自己的,而且世界记忆会延续到它的动作里。
两头一接就是左脚踩右脚:世界可以无限生成,agent 就可以无限练。这条路如果真跑通,训练数据的瓶颈就换了一种形态。