§ 01 起点:一场没人写脚本的情人节派对

2023 年,斯坦福博士生 Joon Sung Park 做了个实验:给 25 个装了记忆、反思、规划能力的 AI 智能体一个虚拟小镇,取名 Smallville,只给其中一个智能体下了一句指令——办一场情人节派对。没有人再插手。到了那天,智能体们自己张罗了邀请、自己布置了咖啡馆、自己决定了要不要赴约、要不要带伴。

这篇论文叫《Generative Agents: Interactive Simulacra of Human Behavior》,拿了 UIST 2023 最佳论文奖,后来在 Google Scholar 上被引用超过 1.8 万次——比很多研究者一辈子的引用总量还多。它也成了一个流派的起点:用大模型模拟"像一个人一样行动的东西",不只是回答问题。

三年后,这条路线分叉成了三个完全不同的项目,赌注一个比一个大。

§ 02 StudentSim:给一个学生,训一个数字分身

微软研究院和伊利诺伊大学香槟分校 2026 年 9 月 1 日放出的这篇论文,瞄准的是一个很具体的痛点:AI 家教要做到因材施教,得知道"什么指导对什么学生有效",但这个信号从真实学生身上收集极慢、极贵、极稀疏——一个学生一学期可能就写五篇作文、下几十盘棋。

研究者的判断是,一个够格的学生模拟器要同时过两道关:行为保真度(F)——答题的样子要像这个学生本人,特有的错误、特有的强项都要在;指导响应性(R)——给它一段老师的讲解之后,它要能像这个学生一样调整答案。这两个维度是正交的:一个答得比真实学生还好的模拟器,没有真实学生的那些"坑",练不出对付真人错误的辅导技巧;一个流畅地"从错误走向正确"却不管起点对不对的模拟器,也测不出指导到底有没有用。

在这之前,学生模拟分两条路,各占一半。知识追踪这类状态追踪模型是在真实数据上训出来的,保真度还行,但结构上没给"老师的文字讲解"留输入口。直接拿大模型角色扮演——比如把学生水平写成一段 prompt 喂给 GPT-5.4——响应性不差,但即便描述写得再精确,模型也不会可靠地表现出与那个描述相符的能力水平,更像一个演技不错但对角色一知半解的演员。

StudentSim 的解法是两阶段训练:第一阶段把某个领域所有学生的记录池化,训一个学该领域"共性"的基础模型;第二阶段只用某个学生自己的稀疏记录,在这个基座上做个性化微调。底层模型是 Qwen3-4B-Instruct,加 LoRA 适配器——4B 参数,不算大。

评测集 StudentSimEval 覆盖三个领域共 60 名学生。数字很直白:

领域 / 指标基线模型GPT-4oGPT-5.4StudentSim
棋类 F(Maia2 基线)0.4540.2160.2320.515
棋类 R0.2720.7660.7190.907
二语写作 F0.5130.4720.5140.562
二语写作 R0.0200.3880.5950.642
数学 F0.4920.5120.6120.638
数学 R0.6130.6940.7100.918
FIG · 棋类指导响应性 R(0–1,越高越能按老师讲解调整答案) 0 0.25 0.5 0.75 1.0 基线模型 0.272 GPT-4o 0.766 GPT-5.4 0.719 StudentSim 0.907
图 1 · 棋类指导响应性 R:StudentSim 以 4B 参数 + 单个 LoRA 适配器碾压远大于它的闭源模型
数据来源:StudentSim: Training LLM-based Student Simulators(arXiv:2609.01591)

一个案例很说明问题:同一个棋局局面,三名真实棋手分别走了三步不同的棋——推中兵、走保守兵型、用象将军抓马。专门训练来模仿人类走法的 Maia2,因为只按 ELO 分段建模,三个人全部塌缩成同一步"大多数中等水平棋手会走的棋";GPT-5.4 拿到每人的对局历史文字描述,三步全部猜错,还猜的是三步不同的错棋;StudentSim 训出来的三个个性化模型,各自还原了对应棋手的真实走法。另一个案例更极端:一名棋手走了严重误招,教练给出苏格拉底式提问——全程不点出具体格子。Maia2 没有文字输入通道,原样重复了误招;GPT-5.4 读懂了"要走皇后将军",但答错了具体格子;StudentSim——一个只有 4B 参数、外挂单个 LoRA 适配器的模型——顺着这串引导性问题推理出了正确格子。一个 4B 模型在这里打赢了体量大得多的闭源模型,说明差距不是参数堆出来的。

论文最后做了个概念验证,把模拟器从评测工具往前推一步,变成强化学习的奖励模型:用 StudentSim 当奖励,训一个真的 AI 棋类教练(Qwen3-VL-8B,GRPO 算法),跟没有强化学习的基线、以及用 GPT-5.4 扮演学生当奖励的版本做对比。8 名有竞技水平的棋手盲评 74 条标注:

条件准确率讲解质量(1–5)个性化(1–5)
无强化学习75.7%2.992.80
GPT-5.4 作为奖励71.6%3.082.42
StudentSim 作为奖励90.5%3.313.93
FIG · AI 棋类教练人工评测准确率(8 名棋手盲评 74 条标注) 0% 20% 40% 60% 80% 100% 基线 75.7% 无强化学习 75.7% GPT-5.4 作为奖励 71.6% ↓ StudentSim 作为奖励 90.5% 用保真度不够的模拟器做 RL 奖励,效果比完全不做强化学习还差
图 2 · 反直觉点:GPT-5.4 扮演学生当奖励,训出的教练比不做强化学习的基线还差(71.6% < 75.7%)
数据来源:StudentSim: Training LLM-based Student Simulators(arXiv:2609.01591)

StudentSim 全面领先不意外,意外的是中间那一行:用 GPT-5.4 扮演学生当奖励训出来的教练,准确率和个性化程度反而比完全不做强化学习还差。一个"响应性够但保真度不够"的模拟器拿去做奖励模型,不是帮助有限,而是会把策略往错的方向训——它教会了教练去迎合一个不真实的学生画像,代价是教练自己的事实错误率上升。

代码和数据已经在 GitHub 上开源,MIT 协议。论文自己也在结论里承认局限:现在这套框架抓住的是学生某一时刻的状态、以及这个状态在一次指导后的单步变化,一个学生真正的学习过程——跨越很多次互动的知识习得、保持、遗忘——完全没建模,这是明确留给未来的方向,不是藏着掖着的短板。

§ 03 MatrAIx:一次性模拟 83 亿人

如果说 StudentSim 是把模拟做窄做深,2026 年 8 月 4 日挂上 arXiv 的 MatrAIx 走的是完全相反的路子——不追求对单个人的高精度还原,而是尽可能覆盖人类多样性的全貌。

这篇论文的作者列表本身就很能说明规模:Xiaomin Li 领衔,加上 92 位共同作者,能看到 Dawn Song(加州伯克利)、James Zou(斯坦福)、Marinka Zitnik(哈佛)、Yilun Du(哈佛)这些学界名字;多家媒体报道称团队里还有 40 余名来自 OpenAI、Anthropic、Google DeepMind、xAI 的参与者,累计超过 200 名科学家参与——这部分跨机构参与规模论文本身没有逐一列出所属机构,但近百人的作者名单足以说明这是一次罕见的产学界联合项目。

MatrAIx 的核心是三部分。第一是 Persona 8B:83 亿条人格记录,每条用 1290 个类别维度描述,一部分从保留了属性相关性的依赖图里采样生成,一部分直接来自真人撰写的档案。团队公开了一个经过质量筛选的核心子集,约 100 万条人格,其中 599,847 条有真人数据背书、40 万条是合成的。数据来源包括联合国人口统计、General Social Survey、维基百科人物传记、亚马逊认证购买评论、Stack Overflow 开发者调查等。第二是 MatrAIx Playground,四种测试环境——问卷、AI 聊天机器人、网页、App,人格智能体可以在这些环境里搜索、比价、看评论、做购买决策,也可以直接操作 Linux、macOS、iOS 桌面,通过虚拟鼠标键盘触屏完成真实的软件操作。第三是覆盖电商、软件、金融、医疗等 25 个以上领域的 1010 个应用任务,团队在 8 个代表性任务上跑了 18189 次评测,人格智能体由 Claude Opus 4.8、GPT-5.5、Claude Haiku 4.5 三个模型驱动。

团队做了两组验证。一组是 400 次受控实验,考察十个行为属性在四种环境下能否被正确表达或正确压制,结果 366 次成立,91.5%。另一组请真人评审和 LLM 评审共同评估"真人背书"人格的信息提取质量。

FIG · MatrAIx 核心子集构成 + 400 次受控实验通过率 核心子集 · 约 100 万条人格 60% 40% █ 599,847 条 · 真人数据背书 █ 400,000 条 · 依赖图采样合成 400 次受控实验 · 十个行为属性 × 四种环境 91.5% 366 / 400 次成立 █ 通过 366 次 █ 未成立 34 次 团队自述:"仅用于测试",非"替代真人"
图 3 · 83 亿条人格记录里,真正拿去做受控验证的只有 400 次实验
数据来源:MatrAIx: Simulating the World with 8.3 Billion Persona Agents(arXiv:2608.04205)

这套系统想解决的问题跟 StudentSim 不是一回事——它不追求还原某一个具体的人,而是给一款产品或一个 AI 系统提供一整个"虚拟用户群",在真人测试之前先把涨价后的犹豫、AI 助手出错后要不要继续用、不同延迟下的容忍度这类分布规律跑出来。研究者自己在论文里划了一条边界:虚拟用户永远替代不了真实的人,涉及社会命运的重大决策和重要科学结论,真实用户的直接参与不可或缺。这条免责声明不是客套话——下一节会看到,恰恰是这条边界,Simile 打算跨过去。

§ 04 Simile:把 Smallville 变成一家公司

三条线里,Simile 走得最快,也赌得最大。公司是 Joon Sung Park 联合他 Smallville 论文的两位合著者——斯坦福教授 Michael Bernstein(现任首席数据官)和 Percy Liang(现任首席科学家)——一起创办的,另有一位前波士顿咨询集团高管 Lainie Yallen 出任 COO。

2026 年 2 月,公司完成由 Index Ventures 领投的 1 亿美元 A 轮,投资人名单里还有 Fei-Fei Li 和 Andrej Karpathy 这样的研究者背书;仅仅五个月后的 7 月 30 日,公司又拿下由 Greenoaks 和 Index Ventures 联合领投的 2 亿美元 B 轮,估值 20 亿美元——五个月涨了大约 20 倍,两轮合计融资 3 亿美元。客户名单里已经出现 CVS Health、Wealthfront、Deloitte、Gallup。

FIG · Simile 两轮融资时间线(2026) 2026-02 · A 轮 $1 亿 · Index Ventures 领投 Fei-Fei Li / Karpathy 背书 2026-07-30 · B 轮 $2 亿 · Greenoaks + Index Ventures 领投 估值 $20 亿 5 个月 · ≈ 20 倍 两轮合计融资 $3 亿 · 客户:CVS Health / Wealthfront / Deloitte / Gallup
图 4 · Simile 五个月内估值从隐含的约 1 亿美元量级跳到 20 亿美元
数据来源:Synthetic-user startup Simile raises $200M at $2B valuation 5 months after $100M Series A(TechCrunch)
FOUNDER'S PITCH · 创始人原话
"今天的前沿大模型是智能的 CPU——擅长有唯一正确答案的理性问题;Simile 要做的是智能的 GPU——专门编码人的价值观、偏好和品味。更大的野心,是做一个"人类社会的 CERN",有朝一日能模拟银行挤兑、气候合作博弈,或者一个民主制度开始崩坏的早期信号。"
— Joon Sung Park,Simile 创始人 & CEO · Sequoia Capital《Training Data》播客,2026

这套说法听着像愿景演讲,但公司拿出的验证数据是具体的:在一次模拟约一千人、结构上对齐美国人口分布的实验里,Simile 的架构和模型预测个体行为的准确率,达到了真人自己重复回答同一问题时"自我一致率"的 85%——也就是说,不是跟某个抽象的"标准答案"比,而是跟真人本身的复现稳定性比。为了拿到这类校准数据,公司和 Gallup 建立了战略合作,通过对方的调查网络接触真实人群,用真实行为数据给模拟结果打锚点,而不是单纯靠 prompt 里一段人物描述让模型自由发挥。这也是这三个项目的共同点:谁都没敢只靠"prompt 一个角色"就交差,StudentSim 靠真实学生记录微调,MatrAIx 靠近百万条真人背书的人格档案,Simile 靠和 Gallup 这样的调查机构合作拿真实数据锚定。

客户最初是想在这套系统上跑随机对照实验的社会科学家,后来是造访斯坦福见过演示的世界 500 强董事会成员和 CEO——他们的第一反应通常是"我们有几千万客户数据,能不能拿这些数据做更好的模拟"。这也是 Park 自己在采访里坦承的紧张点:越来越多真实客户数据被喂进这套系统,"负责任、合乎伦理"这几个字要怎么落地,目前还是在对话过程中,没有定论。

§ 05 三条线放在一起看,分歧在哪

三个项目都从同一个观察出发——大模型加上恰当的架构,能让智能体的行为在一段时间内"看起来像一个人"。但往下走,它们在同一个问题上给出了三个不同的答案:模拟到什么程度才算够用?

StudentSim 选的是最保守的答案:只在有客观裁判的窄领域里做精确匹配——棋有引擎评分,作文有老师改过的版本,数学题有标准答案,F 和 R 两个指标都能被严格量化,4B 模型加单个 LoRA 适配器就够用,因为它要证明的只是"这一次强化学习的奖励信号可信"。MatrAIx 选的是覆盖优先:83 亿人格、1290 个维度,换来的不是对单一个体的高精度还原,而是在真人测试之前把产品在不同群体上的摩擦点、边界情况尽量扫一遍,团队自己也把话说在前面——高风险的社会性决策,模拟结果不能替代真人参与。Simile 选的是最激进的答案:直接把"预测个体真实决策"的能力当成可以卖给世界 500 强、指导十亿美元级商业决策的产品,用一次约一千人的对齐实验和 85% 的相对准确率作为立论基础。

这三个选择里,可验证性是递减的。StudentSim 的每一个数字都能对着棋局引擎复算;MatrAIx 拿出了 91.5% 这样的受控实验结果,但样本量是 400 次、八个代表性任务,团队自己的措辞是"用于测试",不是"用于替代";Simile 现在要卖的,恰恰是 MatrAIx 论文划出的那条红线另一边的东西——用模拟结果指导真实的、高风险的商业乃至社会决策。一个 85% 的相对准确率数字,从"帮企业提前发现产品的价格敏感人群"这种低风险场景,跳到"预判银行挤兑""捕捉民主制度崩坏的早期信号"这种论文里想都没想去碰的高风险场景,中间的验证空白目前没有人填上。Park 自己在采访里也承认,"负责任地使用客户真实数据"这件事,公司现在还在摸索,没有答案。

FIG · 三条线可验证性对照(定性示意,非统一量尺) StudentSim · 绿 棋局引擎可逐项复算 · 完全可验证 MatrAIx · 黄 91.5% · 400 次受控实验 · 团队自称"仅用于测试" Simile · 红 85% 相对准确率 · 约 1000 人样本 · 已用于真实高风险商业决策
图 5 · 条形长度为定性示意(三条线没有统一量尺的可比数值),用于可视化"可验证性"沿 StudentSim → MatrAIx → Simile 递减的相对关系;Simile:85% 相对准确率 · 约 1000 人样本 · 已用于真实高风险商业决策
基于本文 § 02–§ 05 综合判断(非单一数据源)

参考来源 · Sources

作者:冯小平,[email protected]