前 Meta FAIR 巴黎团队集体离开,用 Xavier Niel 的 €300M 捐赠建立了非营利、完全开源的语音 AI 实验室。2024 年 7 月发布 Moshi——世界上第一个真正端到端全双工语音 AI 系统,比 GPT-4o 语音模式早整整一个月。
2023 年 11 月,一批来自 Meta FAIR 巴黎实验室的顶尖研究者同时离开了这家全球规模最大的 AI 研究部门,目标是建立一个非营利、完全开源、专注语音 AI 的欧洲实验室。资金来自 Xavier Niel——法国 iliad/Free 集团创始人,欧洲科技独立性最坚定的倡导者之一。他以捐赠而非投资的方式,向一家名为 Kyutai 的法国非营利机构(Association loi 1901)注入了 €300M。
核心成员几乎是 Meta FAIR 巴黎音频/语音研究组的整体迁移:Patrick Pérez(前 FAIR 巴黎首席科学家)、Alexandre Défossez(EnCodec 音频编解码器作者)、Neil Zeghidour(前 Google DeepMind,SoundStream 论文作者)、Laurent Mazaré、Gabriel Synnaeve 等。团队规模 20–30 人,完全研究导向,产出全部开源——这与 METR、Redwood Research 等非营利研究机构属于同一类型,而不是有融资退出压力的创业公司。
2024 年 7 月,距 GPT-4o 语音模式发布整整一个月前,团队发布 Moshi——全球第一个真正意义上的端到端全双工语音 AI 系统,配套论文发布于 arXiv,模型权重以 CC BY 4.0 完全开放。
Moshi 绕过传统的 ASR → LLM → TTS 管道,直接在语音 token 层面做端到端建模,理论延迟 160ms,低于人类感知阈值约 200ms,能在"听"的同时"说"——可打断对方,有自然的填充词和节奏。双流架构让模型同时处理输入和输出语音流,实现真正的双工对话,而不是管道式系统的轮流应答。
Helium-1 是 2B 参数、专为法语优化的轻量模块化 LLM,可本地部署,是 Kyutai"语言主权"立场的直接技术体现。MoshiVis 在 Moshi 基础上增加视觉理解能力,模型可以"看到"摄像头画面或屏幕截图,同时进行实时语音对话——视觉与语音的联合端到端建模比管道式拼接难得多,这也是其他语音 AI 公司尚未做到的一步。
Xavier Niel 同时是 Mistral AI 最大股东之一,又资助了 Kyutai——这构成欧洲 AI 主权战略的双轨布局:商业轨(Mistral)加研究轨(Kyutai)。语音数据是所有 AI 模态中最敏感的一类,非营利加开源的定位让 Kyutai 能获得欧洲大学和公共机构的数据授权,这是闭源商业公司难以合法复制的数据优势。
Moshi 是端到端语音 AI 的学术里程碑——在 GPT-4o 之前率先验证了端到端全双工的可行性,而且用 CC BY 4.0 完全开源,让整个研究社区都能在此基础上延伸研究,这是闭源管道式系统无法提供的。
非营利模式很可能是语音 AI 这个数据敏感领域的正确选择:GDPR 对语音数据处理有极严格限制,非营利研究机构有特殊豁免路径,能与法国国家图书馆、大学、公共机构合作获取数据,这是 ElevenLabs 或 Hume 这类商业公司无法复制的优势。
但最大的风险恰恰来自同一枚硬币的另一面:€300M、十年以上资金保障、零商业化压力,既是护城河也可能滑向研究惰性——没有 deadline 和 ARR 压力的研究团队,历史上多次证明可能失去应用导向,滑向"发表即可、不需要 deploy"的状态。Xavier Niel 是否有机制保证 Kyutai 保持外部影响力,是关键未知数。
Kyutai 的命题是:开源的、端到端的、欧洲的语音 AI 基础研究,比商业的、管道式的、美国的更能推动真正的技术进步。Moshi 是这个命题的第一个实验性证明——它在 GPT-4o 之前率先验证了端到端全双工的可行性,并把整个实验完整开放给了全世界的研究社区。这个实验室最好的结局,是成为语音 AI 领域的"CERN 时刻":不做商业化,但定义了所有商业化的技术基础。
首次发布 2026-08-07