Inception Labs 押注的是:如果不按顺序生成 token,而是"并行去噪"生成整段文字,速度可以比 Transformer 自回归方式快 5–10 倍——Mercury 是迄今最有力的概念验证。
Transformer 自回归生成有一个根本限制:必须一个 token 接一个 token 依次生成,第 n 个 token 要等第 n-1 个生成完才能开始——这是速度的天花板。Inception Labs 借鉴图像生成领域的扩散模型(Stable Diffusion、DALL-E 3 的方法论),把这套思路搬到文本上:从"噪声"开始,对整段文字并行进行多步"去噪",最终生成的不是一个接一个的 token,而是整块文字同时成形。速度提升是 5–10 倍,相较同质量水平的 Transformer。
旗舰产品 Mercury 是全球第一个商业可用的扩散式 LLM(dLLM),支持 128K token 上下文窗口,并有专门面向代码生成的 Mercury Coder 版本。公司知名天使投资人包括 Andrew Ng 和 Andrej Karpathy。
2025 年 11 月,Inception Labs 同日公布 $50M 融资和 Mercury 正式发布——由 Menlo Ventures 领投,参投方阵容罕见地跨越了云计算和算力供应链的多个关键节点:Mayfield、Innovation Endeavors、NVentures(NVIDIA VC)、M12(Microsoft VC)、Snowflake Ventures、Databricks Investment。同期发布的还有 Mercury Coder,直接对标 GitHub Copilot 的速度痛点。
2026 年,团队持续迭代 Mercury 的模型质量,并计划在 arXiv 2506.17298 发布完整技术报告,公开去噪步数、采样策略等训练细节。
NVIDIA、Microsoft、Databricks 同时投资是一个强烈的基础设施信号:NVentures 下注说明 NVIDIA 认为 dLLM 会改变 GPU 的利用模式,M12 的参与指向 Azure 与代码生成场景的战略布局,Databricks 则连接了数据处理与 AI 推理。这不只是一家创业公司在融资,更像是 AI 基础设施供应链里一个关键缺口正在被填补。
但早期扩散式语言模型研究(如 MDLM、PLAID)显示过一个问题:并行生成的不同部分缺乏严格的"因果"约束,容易出现"局部连贯、整体矛盾"的现象。Inception 的应对是多步去噪加混合采样策略,具体效果要等完整论文数据验证。另一个悬而未决的问题是范式兼容性——OpenAI o1/o3 证明"更多推理时间计算"能大幅提升质量,但 dLLM 的"去噪步数"能否同样支持推理时间 scaling,目前研究还不充分。产品策略上,Mercury Coder 比通用版 Mercury 定位更精准并非巧合:代码补全、文本续写这类"局部一致性"要求较低的任务,正是 dLLM 优势最大的场景;数学推理、多步规划这类需要严格前后依赖的任务,则是并行去噪局限性最明显的地方。
Inception Labs 用 Mercury 证明了扩散式文本生成可以做到商业规模,NVIDIA、Microsoft、Databricks 的联合下注说明产业界相信这是一个真实的架构选项,而不只是学术趣味。但公司的产品策略本身已经暴露了这条路的边界——Mercury Coder 比通用版 Mercury 更受重视,恰恰因为代码补全这类"局部一致性"要求低的任务,才是并行去噪最擅长的领域。dLLM 能否兼容推理时间 scaling、能否在数学推理等强因果依赖任务上追平 Transformer,仍是悬而未决的问题。Inception 现在的位置,是在一个被验证"能跑通"但尚未被验证"能通吃"的架构上,抢先建立了商业化先发优势。
首次发布 2026-08-07