2023 年的 GCG 论文用自动化梯度搜索证伪了"对齐训练已经足够安全"这个学界共识,掀起了整个 LLM 安全赛道的军备竞赛。写下这篇论文的 CMU 团队,一年后成立了 Gray Swan AI——一家同时握有最强攻击方法(GCG 家族)和最强防御技术(Circuit Breakers)的公司,这种攻防闭环在行业里极为罕见。
Gray Swan AI 由 Matt Fredrikson(CEO,CMU 教授)、Zico Kolter(首席科学家,CMU 教授)和 Andy Zou(CTO,CMU 博士生,师承 Kolter 与 Fredrikson,本硕来自 UC Berkeley,师承 Dawn Song 与 Jacob Steinhardt)在 2024 年初成立。非典型之处在于,创始人中包含两位终身教授——这保证了公司既能持续产出学术声誉,又能承接商业合同。
公司的谱系可以追溯到 2023 年 7 月的 GCG 论文(《Universal and Transferable Adversarial Attacks on Aligned Language Models》):首个全自动 LLM 越狱方法,可绕过 ChatGPT、Bard、Claude 的对齐防护,被纽约时报头版报道,引爆了整个 adversarial robustness 研究热潮。三个月后的 Representation Engineering(RepE)论文,从认知神经科学取得灵感,提出可以读取和控制 AI 系统的内部表征。
Gray Swan 选择不公开融资,Crunchbase 显示"unfunded",但公司直接为 OpenAI、Anthropic、Meta 等前沿实验室提供安全评估服务,收入来自真实企业合同而非投资人资金——这是一种罕见的、客户驱动而非风投驱动的商业模式。
2024 年 6 月发布的 Circuit Breakers 是第一个对抗鲁棒对齐技术:在神经激活层(第 10 到 20 层)监控语义、而不是像传统 RLHF 那样在词语层面识别关键词,能截断有害思维的生成过程,Forbes 报道称 OpenAI 等公司正在采用这项技术。同年 9 月首届 Ultimate Jailbreaking Championship 上,25 个匿名模型接受 600 多名全球黑客的攻击:22 个非 Cygnet 模型(包括 Alibaba、Microsoft、Mistral、Cohere 的模型)在开赛 45 分钟内全部被攻破,而用 Circuit Breakers 强化的 Cygnet-knox 在整整一个月的竞赛期间无人完全攻破。
2025 年 4 月的 Safety Pretraining 论文把安全防护前移到预训练阶段,将攻击成功率从 38.8% 降至 8.4%,被 NeurIPS 收录。2025 年 3 到 4 月的 Agent Red-Teaming Challenge 测试了 22 个 AI Agent,1.8 百万次攻击尝试中有 6.2 万次攻破,赏金池达 $171,000。
2026 年 3 月的 Indirect Prompt Injection Arena 论文是目前最新的重要成果:13 个前沿模型面对 464 名红队员、超过 27.2 万次攻击,在工具调用、代码生成、计算机操作三种场景下无一模型幸免。同月完成博士答辩的 Andy Zou,其论文题为《From Representation Engineering to Circuit Breaking》,是否会继续全职推动公司的研究节奏尚不明确。
"Unfunded"背后的真相值得追问:与多个前沿实验室的合作规模,让人怀疑这是否真的是完全 bootstrapped 的公司,是否有战略投资者隐藏在合作协议条款里,目前没有公开信息可以确认。Circuit Breakers 本身也有代价——竞赛实录显示 Cygnet 模型存在过度拒绝问题,误拒率从 2% 一度升至 39%,这个安全性与可用性之间的 tradeoff 如何在实际产品部署中管理,是悬而未决的问题。
Gray Swan 的研究重心已经从聊天机器人越狱自然延伸到 Agentic 系统安全,2025 到 2026 年的 Agent Red-Teaming、Indirect Prompt Injection Arena 是其最前沿的贡献——AI agent 从邮件、文档、网页等外部数据源读取内容的场景,制造了新的攻击面,用户往往看不到中间过程,"隐蔽攻击"因此格外危险:攻击者将恶意指令嵌入 agent 处理的外部文档,agent 执行有害操作后,呈现给用户的最终响应中不留任何痕迹。
Gray Swan 与 CMU/斯坦福合作的一项研究还发现,为企业网络设计的 AI 渗透测试 agent 可以超越 90% 的专业人类渗透测试人员,成本仅为人类的一小部分——这是学术产出直接转化为商业信号的又一例证,但也意味着攻防两端的自动化竞赛正在加速。
Gray Swan 是目前唯一在竞赛平台(Arena)、开源工具(nanoGCG)、学术论文(GCG 系列)和商业产品(Cygnal/Shade)四个维度同时运营的 AI 安全公司,攻防两端的技术闭环是它区别于 Haize Labs、Apollo Research 等同类玩家的真正壁垒。但"未披露融资"的商业结构和 Circuit Breakers 误拒率的可用性代价,都还是需要在下一阶段验证的开放变量——尤其是当研究重心从聊天机器人转向 Agentic 系统之后,谁来为"隐蔽攻击"这类新型威胁买单,会是决定它下一步定位的关键问题。
首次发布 2026-08-07