三个哈佛本科同学在 2023 年底创立了 Haize Labs,把红队测试从人工手艺变成算法。他们的 Cascade 多轮攻击系统在标准化基准上打赢了 Scale AI 的人工红队团队,而他们最新的野心是 RiskRubric.ai——一套面向整个行业的模型风险公开评分,客户包括委托评估的 Anthropic、OpenAI、AI21 等模型厂商自身。
Haize Labs 由 Leonard Tang(CEO,哈佛本科、Stanford CS 博士肄业)、Richard Liu 和 Steve Li 三位哈佛本科同学在 2023 年 12 月创立。公司的核心判断很直接:业界普遍认为"人工红队 = 更有创意 = 更难防御",但 Haize 用数据反驳了这一点——他们的自动化攻击系统 Cascade,在标准化 benchmark 上的攻击成功率高于 Scale AI 的人工红队团队。
公司的定位是AI 安全评估的第三方评级机构——对标金融行业的 Moody's。这个类比不是营销修辞:2025 年 9 月上线的 RiskRubric.ai 提供跨模型可比较的公开安全评分,而委托方本身就包括 Anthropic、OpenAI、AI21 这些模型厂商。护城河不是单一技术突破,而是中立性和标准化方法论。
2025 年 11 月,团队搬进了曼哈顿下城 5000 平方英尺的新办公室,同月完成 $12.5M 种子轮融资(更早期由 General Catalyst 领投的一轮把估值定在 $100M)。
2024 年 2 月,Haize 与 Hugging Face 合作发布 Red-Teaming Resistance Leaderboard,系统评估前沿模型在极端红队攻击下的鲁棒性。同年,ACG 算法把 CMU 提出的 GCG 对抗攻击速度提升 38 倍、GPU 显存需求降低 4 倍,攻击成功率达到 44%,是基线的 4 倍。
2024 年 10 月发布的 Cascade 是关键节点:用 attacker LLM 替代人工红队,通过树搜索和提示优化在多轮对话中逐步升级攻击,在 Gray Swan RR 和 Llama 3 LAT 这类专门抗对抗训练的模型上,攻击成功率显著超过 Scale AI 的人工红队。Haize 的判断是:单轮越狱是伪问题,多轮渐进式攻击才是真正威胁——大多数安全产品仍只聚焦单次 prompt 防御。
2025 年 9 月,RiskRubric.ai 正式上线,成为首个 AI Model Risk 公开排行榜。同时,Haize 在出柜前(2024 年 6 月)已经向 Anthropic、OpenAI、Cohere 等披露了数千个漏洞;在企业应用层客户(Deloitte、MongoDB)的集成场景中,他们发现的 prompt injection 和上下文污染问题密度,远高于模型本身的漏洞。
Haize 想成为"AI 界的 Moody's",但这个类比本身带着历史包袱:Moody's 也曾因为评级方法论不透明、被评级对象付费评级的利益冲突结构而陷入信任危机。RiskRubric.ai 的方法论是否公开可审计,直接决定这个定位能否站得住。
Cascade 的攻击成功率数据目前来自 Haize 自测,尚缺乏独立第三方复现——这对一个以"中立评级"为卖点的公司而言,是一个需要尽快补上的缺口。同样悬而未决的是商业模式的可持续性:数百万美元的合同是项目制还是订阅制,决定了这门生意是一次性评审还是持续性收入。
另一个明显的空白是多模态和 AI Agent 评估。Leonard Tang 自己在 2025 年 5 月的播客访谈中承认多模态是"emerging risk",但 Haize 迄今公开的全部方法论——ACG、Cascade、DSPy——都只针对文本模型。
Haize Labs 的差异化很清楚:是市面上唯一同时做学术级方法论(ACG、Cascade、RiskRubric)、又对模型厂商和应用层企业双向卖服务的红队机构,这构成了真正稀缺的"第三方"定位。但这个定位的可信度完全建立在方法论透明性和数据可复现性之上——一旦 RiskRubric 的评分标准或 Cascade 的攻击数据被质疑存在自证倾向,"中立评级机构"的叙事就会立刻松动。多模态和 Agent 评估能力的缺口,是它在下一轮竞争中最直接的短板。
首次发布 2026-08-07