MIT Computational Cognitive Science Lab 用贝叶斯概率程序和数十年儿童认知实验数据,质疑"参数越大、智能越强"的行业共识——这是目前对大语言模型最有实证支撑的一支异见学派,由 MacArthur Fellow Joshua Tenenbaum 主持。
在 AI 领域,Josh Tenenbaum 是一个特殊的存在:他对大语言模型最系统性的批评,是目前所有批评声音中最有实验数据支撑的一种。他的核心主张——用贝叶斯概率程序解释人类智能,而不是靠 scaling 堆参数——不是理论推测,而是建立在数十年儿童认知实验数据之上的判断。
CoCoSci 的研究核心问题是:人类为什么能从极少样本中学习概念?一个两岁的孩子看到三只不同的"狗",就能识别第四只从未见过的品种;而主流大语言模型需要互联网规模的数据才能近似这个能力。CoCoSci 认为,这个差距不是参数量的问题,而是学习机制的问题——人类在用概率推断生成认知程序,而不是做统计模式匹配。
2015 年,Tenenbaum 团队在 Science 发表封面论文,首次用计算模型复现了人类的概念学习行为:系统通过概率程序归纳,仅从少量样本就能生成新的、可泛化的概念,被引用超过 3000 次,成为"少样本学习"研究的基石之一。2023 年,团队发表框架论文《From Word Models to World Models》(arXiv:2306.12672),质疑一个更根本的问题:语言模型真的等于智能吗?他们的答案是:语言是理解世界的入口,但世界模型本身必须包含物理、因果、心理等结构性知识,这些不是语言统计能够涌现出来的。
CoCoSci 不是反对 AI 的——实验室 2025-2026 年的最新工作,恰恰在把大语言模型和概率程序合成结合:用 LLM 生成候选程序,用贝叶斯方法筛选最优假设。这是一种利用而非对抗的姿态:语言模型作为直觉,概率推断作为理性。
概率程序归纳——2015 年 Science 封面论文展示:概率程序归纳模型在手写字符识别任务上仅需 1 个样本就能达到接近人类水平的识别率,而同期深度学习方法需要数千个样本。这个 gap 在 2015 年令人震惊,在 2026 年依然没有被完全解决。
直觉物理——CoCoSci 把物理引擎当作内嵌的"世界模型",用贝叶斯推断在可能的物理场景中搜索最优解释,并构建了 ThreeDWorld 高保真三维物理仿真平台测试 AI 的直觉物理推理能力。一个在物理仿真环境中用结构化先验训练的模型,在真实物理推理任务上系统性超越了纯数据驱动的 CNN 模型。
直觉心理学(Theory of Mind)——2025 年,Tenenbaum 团队是 NeurIPS Theory of Mind 研讨会的核心组织者。CoCoSci 的测试方法能区分"真正的 ToM 能力"和"对 ToM 题目的语言统计记忆"——大型语言模型能"说出"正确答案,但用的机制不是人类的推理机制,这是大多数 LLM 评估基准无法区分的差异。
CBMM——Center for Brains, Minds and Machines 是 NSF 资助的 Science & Technology Center,为认知科学家和 AI 研究者提供长期合作的制度化基础,是商业 AI 公司不会自己建设的基础设施。
LeCun 和 Hinton 对 LLM 的批评主要基于理论直觉,Tenenbaum 的批评建立在数十年儿童认知实验数据上——这让 CoCoSci 在 AI 异见学派中占据了一个特殊位置:它的批评是实验性的,不是哲学性的,因此更难被忽略。
《From Word to World》不是技术突破,而是框架质疑:在 GPT-4 刚刚震惊世界的 2023 年,这篇论文问的是——我们真的在走向智能吗,还是只在走向越来越大的语言统计机器?这个问题当时被很多人忽略,但在 scaling 遇到瓶颈的年代,它的回声会越来越响。
CoCoSci 路线的风险是清晰的:如果 LLM scaling 持续有效、持续产生能力涌现,认知科学路线的紧迫性就会降低。但这个风险同时也是它的价值所在——当 scaling 遇到真正的天花板时,理解人类学习机制的研究将成为突破口。CoCoSci 不是在押注 scaling 会失败,而是在保存一种不同的思路。
Josh Tenenbaum 和 CoCoSci 的价值,不在于他们是否会在短期内"打败"大型语言模型,而在于他们提出了一套完整的、有实验支撑的替代性问题——当 AI 领域因为 scaling 遇到瓶颈而需要重新思考方向时,CoCoSci 的积累将是最重要的知识储备之一。他们在做的事情,是为下一次范式转移准备好思想工具。
首次发布 2026-08-17