2026 年 5 月 11 日,Thinking Machines Lab 发布 TML-Interaction-Small——Mira Murati 离开 OpenAI 一年多以来交出的第一个真正意义上的模型。它不是另一个 GPT-5,赌注押在了交互本身:276B MoE 原生实时音视频模型,turn-taking 延迟压到 0.40 秒,第一次让「视觉主动性」成为可被评测的能力。
如果你用过 ChatGPT 的语音模式,一定体会过那种微妙的不适感——说完一句话,等了大约一秒,对面才「反应」过来。这种延迟不算「慢」,但它就是不像人。
原因在于今天几乎所有「实时语音」AI 底层结构都是回合制的:要么在听,要么在说,永远不会同时。模型听完一整轮再说一整轮,中间靠一个叫 VAD(Voice Activity Detection,语音活动检测)的外挂模块去猜——「用户是不是说完了?」这个判断远比模型本身的智力水平低得多。
Thinking Machines 的核心观点很尖锐:今天所有大厂的「实时模型」,都是把回合制模型套上一层硬编码脚手架,再叫它「实时」。这违背了 Rich Sutton 的「苦涩教训」——任何手工脚手架,最终都会被端到端学习的大模型取代。带着这个判断,TML-Interaction-Small 没有把 VAD、ASR、TTS、对话管理器各做一个模块拼起来,而是从零训练了一个原生消费连续音视频流的模型。Thinking Machines Lab 官方博客
模型名为 TML-Interaction-Small("Small" 暗示后面还有更大的),架构是 Mixture-of-Experts,总参数 276B,单 token 激活 12B,原生处理音频、视频、文本三流,所有组件(音频前端、视频前端、Transformer 主干、音频解码 flow head)从零联合训练。目前是研究预览,有限内测已开放。
论文里被低估但实际最关键的设计是双模型协作架构:Interaction Model 始终在线,处理对话节奏、即时回应、视觉感知;Background Model 异步运行,承担深度推理、网页浏览、复杂工具调用。二者共享完整上下文——当 Interaction Model 判断当前任务「想得过来」,自己回;判断「想不过来」,把上下文打包发给 Background Model,自己继续陪用户聊,Background 出结果后再自然地把答案织入对话。这种「快慢分层」的范式,Anthropic 用 Claude 做过类似的 reasoning + agent 拆分,但 Thinking Machines 把它做成了显式的双模型实时协作。
这些全新维度今天的 OpenAI / Google 实时 API 全部做不了——不是因为他们模型不够强,而是这些任务在「回合制 + VAD 脚手架」的架构下根本不可能存在。
理解这次发布的第一个关键概念是 time-aligned micro-turn。传统模型把输入输出「压扁」成一条 token 序列,视野里没有时间——只有 token 的先后,用户停顿、沉默、打断这些「用时间承载的语义」全都感知不到。Interaction Model 看到的世界是每 200 毫秒处理一片输入、生成一片输出:这片 200ms 里用户在说,模型就吐「沉默」;该插话,就吐音频 tokens。沉默被显式建模为模型的一种输出——这是关键,让主动插话、同时说话(live translation)、视觉主动开口这些能力自然涌现。
大多数「全模态」模型走 encoder + LLM 路线:音频经 Whisper-like encoder、图像经 ViT-like encoder 变成 token 喂给 LLM,输出再走 TTS——每个组件是预训练好的「零件」,问题是零件之间没有梯度联通。Thinking Machines 选择相反的路:音频用 dMel 表示、图像切成 40×40 patch 过 hMLP、音频输出用 flow head 解码,所有前端和 Transformer 主干一起从零训练,代价是训练成本高得多,收益是模型真正学会了「听」和「看」。
200ms 的硬性延迟约束意味着推理栈必须做大量底层优化:Streaming Sessions(已开源到 SGLang)在 GPU 显存里维护持久会话序列,每次只 append 新的 200ms 块;MoE 小 batch 场景下用 gather+gemv 而非 grouped gemm;用确定性内核(延续此前 Defeating Nondeterminism in LLM Inference 的工作)实现 trainer-sampler 对齐,端到端开销 <5%;用 NVIDIA Blackwell 的 NVLS 做 all-reduce 通信优化。这些工程细节解释了为什么之前没人能把一个 276B 模型做成全双工实时。
FD-bench V1.5 上 77.8 vs 第二名 54.3,不是 10% 的提升,是接近 50% 的提升——在 AI 基准被卷到 1-2 个点的今天,这种差距说明评估的是一个被现有架构系统性忽视的维度。但工程师 Sean Goedecke 提出了值得严肃看待的批评:带不带 Background Model 出分差异巨大——BigBench Audio 上 Interaction Model 自己 75.7%,加上 Background Model 跳到 96.5%;FD-bench V3 的 Pass@1 68% 也是带 Background Model 测的。这不是作弊,但确实让「Interaction Model 本身有多智能」变得模糊。Sean Goedecke
Thinking Machines 自己在博客里也承认:全双工对话不是他们发明的,Moshi(Kyutai Labs,2024)和 PersonaPlex(NVIDIA)已经把 micro-turn、interrupted streams 这套技术验证过了。Goedecke 算了一笔账:TML-Interaction-Small 大约是 Moshi 激活参数的 2 倍、总参数的 40 倍——Interaction Models 的真正技术突破在于规模 + 视频 + 工业级部署,而不是 micro-turn 本身的发明权。
Murati 离开 OpenAI 时拿到 20 亿美元种子,最近又在谈 50 亿美元新一轮,估值据传逼近 500 亿。Bloomberg 市场原本期待另一个 GPT-5 量级的前沿模型,Interaction Models 给出的答案是:不打这一仗。前沿模型这条赛道上 OpenAI 有最大算力、Anthropic 有最锋利的训练方法学、Google 有最完整的数据栈——一个 2025 年成立的实验室正面打前沿模型几乎必败,尤其当最大优势是人才(John Schulman、Barret Zoph 等 30 多位前 OpenAI 研究员)而非算力。所以 Murati 找到了一个别人没发力的维度:把「AI 怎么和人协作」当作一阶问题来研究。
博客里引用了 Anthropic 自己的模型卡:「当我们的模型被用在'手放在键盘上'的同步交互模式下,价值会大打折扣……放进自主长任务 agent 里,反而更能激发编程能力」;以及 Hayek 1945 年论文 The Use of Knowledge in Society——分散的、关于特定时间地点的知识,是任何中央调度系统无法捕获的。两句话连起来看:Thinking Machines 在说,当前 AI 实验室追求「自主性」的方向,是在主动放弃人类拥有的那部分独特知识。
把 AI 推向「autonomous agent」的方向,本质上是在重复计划经济的错误——中央规划者永远无法获取分布在每个人手中的局部知识。
Thinking Machines 引用 Hayek 隐喻的解读研究预览的 demo 看起来都很顺,但全双工系统在真实场景里有一堆魔鬼细节:200ms 的硬约束意味着对网络抖动极度敏感;餐厅、车内等环境噪音场景下,端到端模型有没有比 VAD 做得更好,博客没正面回答;Thinking Machines 自己也承认连续音视频流让上下文堆积极快,长会话还需要「小心的上下文管理」。
Goedecke 的疑问也值得重复:当 Background Model 慢慢吐结果时,Interaction Model 会不会出现「刚才那句话当我没说」式的自我修正?让快模型在合适时机派任务给慢模型,是 AI 系统设计里的经典难题,OpenAI 和 Anthropic 都还没把这事做利索。另外,「模型在你写代码时主动指出 bug」听上去很酷,但同样的能力用在别处可能令人不安——主动开口的边界在哪里,仍是一个开放问题。
语音 AI 创业公司的格局重洗——大量「AI 客服/AI 销售」公司技术栈是 STT + LLM + TTS + VAD 拼装,若 Thinking Machines API 开放,Vapi、Retell、Bland 这些 voice infra 公司压力陡增。AI 硬件的设计哲学——Humane AI Pin 失败、Rabbit R1 折戟之后,双模型架构(端侧跑 Interaction、云端跑 Background)为下一代 AI 眼镜/耳机提供了技术基础。「Agent」叙事的反思——2024-2025 是 agent 自主叙事的高峰,Thinking Machines 用 Anthropic 自己的模型卡论证人在回路时模型反而表现更好,行业重新拥抱「协作式 AI」并非不可能。评估科学的更新——今天的 benchmark 几乎全是回合制范式,FD-bench、TimeSpeak、CueSpeak 只是开始。
Interaction Models 不是 GPT-5 量级的「智能跃迁」,它是交互范式的跃迁——前者改变模型能做什么,后者改变人和模型怎么一起做事。Thinking Machines 押注的逻辑是:当前沿模型智能边际收益开始递减,「怎么用」会比「多聪明」更重要。这个判断对不对,2026 年下半年到 2027 年市场会给答案。