跳到正文
← DeepDive 实验室与建设者 ·
← DeepDiveNEOLAB · №13 · 2026 · AUG 17
DEEPDIVE / [NEOLAB] · CARTESIA AI
v1 · 2026 · AUG 17
CASE FILE STATE SPACE MODELS SAN FRANCISCO

CARTESIA AI
押注后 Transformer 时代

Cartesia AI 在押注一件事:Transformer 不会永远统治 AI——状态空间模型(SSM)在推理延迟和边缘部署上有结构性优势,而 Mamba 系列证明了这条路是真实的。

类型 / TYPE
营利公司 · 学术衍生实验室
领域 / FOCUS
SSM/Mamba 架构
总部 / HQ
San Francisco
成立 / FOUNDED
2023/2024
规模 / TEAM
~40–60 人
融资 / FUNDING
$86M 累计(Series A $27M)
状态 / STATUS
活跃 · 产品化阶段
最后核实 / VERIFIED
2026-08-17
§ 01 / 是什么

用状态代替注意力

Transformer 的注意力机制有一个结构性弱点:计算复杂度是 O(n²),序列越长越慢,推理时的 KV Cache 还要占用大量内存,这让实时应用(语音、视频流处理)的延迟居高不下。状态空间模型(SSM)的思路不同:推理时只维护一个固定大小的"状态"(类似 RNN 的隐状态),计算复杂度降到 O(n),与序列长度线性相关,延迟极低,还比 Transformer 的滑动注意力窗口更能保留远程依赖。

Cartesia 由 Stanford Hazy Research 实验室(Chris Ré)衍生而来,Chief Scientist Albert Gu 正是 Mamba 论文的作者之一(与 Tri Dao 合著),被 *Time* 评为 100 位最具影响力 AI 人物之一。核心团队还包括 Karan Goel、Arjun Desai、Brandon Yang。产品定位是 Realtime AI API:文字转语音(TTS)、实时音频处理和边缘推理。

§ 02 / 关键事实

从 Mamba 论文到 Mamba-3

2022–23 年,Albert Gu 与 Tri Dao 发表 Mamba 论文,这是 SSM 在语言模型上应用的奠基之作,首次在标准 benchmark 上匹配 Transformer 的表现。2023 年末,团队从 Stanford 衍生出 Cartesia,2024 年中发布 Sonic TTS API——市场上延迟最低的 TTS 服务之一,验证了 SSM 在实时语音场景的优势。同年 12 月,Index Ventures 与 Kleiner Perkins 领投 $27M Series A,公司累计融资达到 $86M。

2025 年,Cartesia 扩展了多语言 TTS 和语音克隆等产品线。2026 年初,团队与 Princeton PLI 合作发布 Mamba-3——一个以推理效率为优先目标的 SSM 架构,引入 MIMO 变体,性能超越 Mamba-2。

§ 03 / 张力与判断

最大资产也是最大风险

SSM 在延迟敏感场景的优势有实测数据支撑:Sonic TTS 的实际延迟低于 OpenAI TTS、ElevenLabs 等 Transformer 方案,Mamba-3 在 1.5B 参数规模下,跨序列长度的延迟持续低于同类 Transformer——这不是营销说辞。但 2022 年 Mamba 论文发布后,社区测试也发现在更大规模(70B+)时,Mamba 和 Transformer 的差距会缩小,SSM 在中小规模优势显著,大规模结论仍待验证。

真正的护城河在"不能连云"的场景——车载 AI、医疗设备、工厂机器人,因为 Transformer 在云端推理已经有 Flash Attention 等优化压缩了差距。这是一个时机问题:边缘 AI 硬件的普及速度决定 Cartesia 的成长曲线。而公司最重要的资产 Albert Gu 同时也是最大的风险——Mamba 论文让 SSM 从学术玩具变成真实选项,但如果 Transformer 出现新的效率突破(MoE、Flash Attention 3 等),SSM 的窗口就会收窄。反直觉的是,这家公司的成功某种程度上依赖于"Transformer 不能被充分优化",而优化 Transformer 的人比优化 SSM 的人多得多。

Cartesia 已经用 Sonic TTS 和 Mamba-3 证明了 SSM 不是纸面理论——延迟数据是真实的,Time 100 级别的学术信誉也是真实的。但公司的长期命运系于一场它无法单独控制的架构竞赛:SSM 的胜负手不在于它自己进步多快,而在于 Transformer 阵营的优化速度是否会持续压缩它的优势窗口。$86M 的融资规模和边缘 AI 硬件的普及节奏,决定了 Cartesia 究竟是在为一个必然到来的后 Transformer 时代打前站,还是在为一个可能永远不会大规模到来的利基场景做准备。

来源 / SOURCES
← 全部实验室索引 · DeepDive 首页

更新记录

首次发布 2026-08-07