Center for Research on Foundation Models 没有训练过最大的模型,但它定义了所有人都在训练的那类模型该叫什么——这个命名决策,成了 GPT-4、Claude、Gemini 能被放进同一个叙事里讨论的前提。
2021 年,Percy Liang 带领斯坦福团队发表了一篇改变 AI 领域叙事的论文(Bommasani et al., "On the Opportunities and Risks of Foundation Models")。这篇由 100 多位作者合著的 200 页报告,不是因为训练了什么新模型而重要,而是因为它命名了一个范式:Foundation Models(基础模型)——首次系统论证"先训练通用大模型、再针对任务微调"这一范式的机遇与风险。
CRFM(Center for Research on Foundation Models)的核心主张可以用一句话概括:如果我们不能系统性地评估 AI 系统,我们就不知道自己在构建什么。这个主张催生了 HELM(Holistic Evaluation of Language Models)——一个覆盖准确率、公平性、鲁棒性、毒性等多维度的评估框架,选择一次性报告所有指标,而不是让实验室挑选对自己最有利的那一个。
透明度是 CRFM 的另一条主线。Foundation Model Transparency Index(FMTI)每年给主要 AI 开发者打分——训练数据是否披露、架构文档是否完整、安全评估是否公开——这张百分制评分表被欧盟 AI Act 实施团队和美国 AI 行政命令起草者参考引用。CRFM 没有制造法规,但它制造了法规所需的技术语言。
2024 年,Marin 项目启动:CRFM 开始自己训练并完全开放一个基础模型,权重、数据、代码、训练日志全部公开。这回答了一个潜在的公信力问题——如果一个机构只评估别人而从不自己实践,它的评估标准有多少说服力?
HELM 覆盖 42 个以上评估场景、7 个核心指标维度,包括准确率、效率、鲁棒性、公平性、偏见、毒性和幻觉率,被全球学术界和监管机构广泛引用。2026 年 6 月,HELM 正式进入维护模式——CRFM 的公告措辞是"任务阶段性完成",但更真实的解读是:AI 能力进化速度已经超过了固定评估框架的更新频率。
FMTI 每年用 100 个问题评估 OpenAI、Anthropic、Meta、Google、Mistral 等机构的透明度,涵盖训练数据来源、架构文档、安全评估方法、使用政策和影响评估。第 1 版(2023)到第 3 版(2025,2026.02 更新),评分结果以百分制呈现。欧盟 AI Act 实施团队在起草"通用目的 AI 模型"监管附件时参考了这一框架。
Marin 是 CRFM 对自己最严格标准的回答:完全开放的基础模型训练项目,基于 JAX/Levanter 框架(针对 Google TPU 优化),权重、数据集、训练代码、实验日志全部公开——比商业 AI 公司常见的"只开放权重、不开放数据"的开源标准更严格。
CRFM 的评估方法论也开始向垂直领域渗透:法律方向的 LLM 幻觉检测研究(Journal of Empirical Legal Studies, 2025)发现,即使表现最好的模型,在引用案例法时幻觉率仍不可忽视;医疗方向对生物医学专门基础模型进行系统评估;Arabica(2026.01)是首个阿拉伯语 LLM 全面评估基准,发现现有主流评估体系严重低估了阿拉伯语模型在方言处理上的真实能力差异。
命名即权力。CRFM 2021 年的命名决策创造的不只是一个术语,而是一个思维框架,让 AI 投资者、监管者、媒体有了共同语言——命名本身就是一种影响力,通常比发表一篇技术论文的影响力更持久。FMTI 则把"AI 公司应该透明"这个模糊的政策主张,翻译成了 100 个可操作的是/否问题,这是比游说立法更聪明的政策影响方式。
但 HELM 进入维护模式这件事说明的不只是某个项目结束了:AI 能力进化速度已经超过了学术界建立固定评估框架的速度。CRFM 需要持续定义新的评估问题,否则会被速度更快的后来者超越——这是学术机构在快速技术变革时代面对的结构性挑战。Marin 项目解决了"评估者的公信力"问题:一个只评估别人而不自己实践的机构,说服力是有限的,而 Marin 的标准比任何它评估过的商业模型都更严格。
CRFM 的核心价值不在于训练出了什么模型——它没有训练 GPT-4,也没有 Claude。它的价值在于:它命名了范式,它建立了评估标准,它翻译了监管语言,它实践了自己宣扬的开放原则。在一个每周都有新模型发布的领域,CRFM 做的是让整个行业有共同尺度的基础设施建设——这比任何单一的技术突破都更难被复制,但也更容易被技术变化的速度甩在身后。
首次发布 2026-08-17