EP.62 · 2025-11-21
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 11 月当时的判断,未按后来的发展修改。
2025-11-21 · 60 分钟 · 逐话题

先生成一个世界,再把 agent 扔进去自己玩

这期最有意思的一条:世界不是提前建好的模型,而是每一帧现渲染出来的;然后把一个会玩游戏的 agent 扔进这个现生成的世界里,让它自己去完成任务。两头一接,就成了一条自我进化的路子。

本期话题
  1. 用四个维度给手机游戏打「坑人分」
  2. 心理学量表反过来给模型打分
  3. Gemini 3 Pro:反常的发布顺序,很薄的 model card
  4. 现渲染的世界 + 在里面自己玩的 agent
01

用四个维度给手机游戏打「坑人分」

有人做了一套判断手机游戏好坏的方法论,不看画面不看销量,看它用了多少种暗黑模式:时间上的(逼你天天上线)、金钱上的(怎么一步步掏你钱)、社交上的(必须组工会、必须拉人)、心理上的(沉没成本、徽章、勋章)。

按这几个维度排出来之后,左边一堆看着像独立游戏,右边一堆看着像最赚钱的游戏。

同一段里还提到另一篇文章:讲小孩本该在没有大人盯着的情况下、和同龄人自己组小群体到处玩,而美国这几年的孩子几乎没有过这种独立玩耍的经历。对做 AI 游戏的人来说,这两篇放在一起看比单看任何一篇都有用。

02

心理学量表反过来给模型打分

有个想法在这期被提出来:心理学里那些测同理心、测换位思考的题目,能不能直接拿来给大模型打分?

实际试下来,现在的模型在很多这类题目上能打到八九十分。

反过来的推论更有意思:如果模型确实具备这种迁移能力,那把它用在心理学问题本身上,理论上也是成立的。

03

Gemini 3 Pro:反常的发布顺序,很薄的 model card

以往的发布节奏是有规律的:1.5,然后 2 的 Flash-Lite 和 Flash,再到 Pro,再到多模态的 image,然后又回到 Flash-Lite——小、小、中、大、中、小,中间穿插 Deep Think、Computer Use 这类特化版本。

这次一上来直接就是 Pro。而且 Pro Image 的 model card 隔天早上就跟着更新了,节奏很快。

但 model card 本身没什么内容:核心只说了 3 Pro 的架构基于此前一系列研究(列的都是 2.5 Pro 那批 paper),仍然是 Transformer,是 MoE。该说的技术细节基本没说。

04

现渲染的世界 + 在里面自己玩的 agent

实时 3D 世界生成这条线,关键差别在于:它不是像高斯泼溅那样先建好一个模型再去看,而是每一帧都是当场渲染出来的,清晰度和帧率都不低(二十几帧)。因为是现渲染,环境才能保持一致。

把它和一个会在游戏里完成任务的通用 agent 接起来,就出现了这期最值得记的画面:现场生成一个场景,让 agent 在这个刚生成出来的世界里自己玩。演示是一个蝴蝶角色去找一朵红花——世界是生成的,行动是 agent 自己的,而且世界记忆会延续到它的动作里。

两头一接就是左脚踩右脚:世界可以无限生成,agent 就可以无限练。这条路如果真跑通,训练数据的瓶颈就换了一种形态。

每周 AI 情报 · AI Buzzwords · EP.62 · 2025-11-21 · 1 小时
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾