Moshi
全双工语音语言模型
全球第一个端到端全双工语音 AI 系统。绕过传统 ASR → LLM → TTS 管道,直接在语音 token 层面做端到端建模。理论延迟 160ms,低于人类感知阈值约 200ms。真正实现"同时说话和听"——可以打断对方,有填充词(嗯、啊),节奏自然。
2024 年 7 月发布,比 GPT-4o 语音模式整整早一个月。模型权重在 HuggingFace 完全开放(CC BY 4.0),推理代码在 GitHub 全部公开。这让 Moshi 成为语音 AI 领域第一个可以被研究者完整复现的端到端系统。
双流架构:一个流处理用户输入语音,另一个流实时生成输出语音。两个流在同一个语音语言模型中联合建模,使模型能够在"听"的同时"说",实现真正的双工对话。