Goodfire 把"理解神经网络内部在想什么"这件事,从纯学术的可解释性研究,变成了一门可以被出售的工程能力——Silico 是迄今为止最接近"神经网络调试器"的产品形态。
Goodfire 的核心比喻是:今天的 AI 工程处于蒸汽机时代的热力学诞生之前——工程师靠试错构建系统,却没有底层科学解释系统为什么运作。Goodfire 的赌注是先把可解释性做成一门科学,再让 AI 从经验主义过渡到精确工程。这个赌注分两层:科学层要搞清楚神经网络内部的"特征"对应什么概念,工程层要用这份理解去精确控制模型行为。
公司由 CEO Eric Ho、CSO Tom McGrath(前 DeepMind 可解释性团队创始人)和 CTO Daniel Balsam 领导,注册为 PBC(公益公司)——法律形态上就把"可解释性优先"写进了公司使命。团队在 Series B 后约 50 人。
技术路线是稀疏自动编码器(SAE):把神经网络内部纠缠在一起的"多义"神经元(polysemantic)分解成单一含义的"特征"(monosemantic),这些特征据称可以对应到颜色、情绪、编程语言乃至生物学概念等人类可理解的语义。
2024 年 8 月,Goodfire 用 $7M 种子轮发布了 Ember——首个把 SAE 变成托管 API 的产品。2025 年 4 月,Series A 融到 $50M,投资方包括 Menlo Ventures,其中 Anthropic 首次以直投方式下注 mech interp 商业化。2026 年 2 月,B Capital 领投 $150M Series B,估值 $1.25B,公司正式从研究实验室进入商业 AI 公司行列。
产品层面,Silico——一个基于 agent 的自动化 interp IDE——被 MIT Technology Review 评为 2026 年十大突破技术之一,被视为第一个真正可用的"神经网络调试器"。技术验证方面,Goodfire 与 Arc Institute 合作在基因组基础模型 Evo 2 内部解码出对应已知生物学概念的特征,成果发表于 *Nature*。
在医疗场景,Goodfire 与 Prima Mente 合作,在医疗模型中用 mech interp 技术发现了阿尔茨海默病的新生物标记物,并将模型幻觉率降低了 58%——这被 Goodfire 视为可解释性从"理解 AI"走向"用理解去改进 AI"的关键证据。
Goodfire 最大的方法论风险来自它最引以为豪的成果本身。斯坦福的 James Zou 公开警告:在 Evo 2 这样的基础模型中找到"表示某个生物学概念"的特征,不代表模型在做预测时真的使用了这个特征——发现一个相关的表征,和证明它是因果结构,是两件事。
阿姆斯特丹大学研究者 Leonard Bereska 的批评更尖锐:他称 Goodfire 的工作是"给炼金术加精度,而不是真正的工程",直指 SAE 分解出的特征究竟是模型内部真实的因果机制,还是仅仅是统计相关性——这也是整个 mech interp 领域尚未解决的核心问题。
与此同时,商业信号却相当明确:Bridgewater Associates(通过 Transluce)、Prima Mente 等高监管行业客户率先为可解释性付费,说明市场激励已经足够强,不需要等监管强制介入。这构成了 Goodfire 的核心张力——商业验证的速度,正在跑赢科学验证的速度。
Goodfire 的估值曲线和它的科学争议是同时上升的:$1.25B 估值与 Anthropic 的直接投资证明市场愿意为"可解释性即将变成基础设施"下注,但 James Zou 和 Leonard Bereska 的批评指向同一个未解问题——SAE 特征到底是模型的因果机制还是精巧的相关性。58% 的幻觉削减、新发现的阿尔茨海默病标记物,这些是可复现的工程成果,还不等于"理解 AI"这件事本身已经被解决。Goodfire 现在更像是在用商业成功给一门尚未成熟的科学买时间。
首次发布 2026-08-07