支付宝和瑞幸合作做了个说话就能买咖啡的智能体,跑通的路径其实不复杂:瑞幸自己的 API 完善,接 MCP 就行;付款那句话本身带声纹,可以直接当支付授权。但顺着想一层就会发现问题——没人会愿意为海底捞、瑞幸、星巴克各装一个 AI。
有机构做了个可视化,把虚拟经济相关技术分成三类:
Access(触达层)——实时流媒体 API、边缘数据中心、6G 网络这些;
Immersion(沉浸层)——AR、AI Avatar,一直到意识上传;
Transaction(交易层)——数字钱包那一类。
好用的地方在于它把技术之间的依赖关系也画出来了:点开任一项能看到它依赖什么、当前进展到哪。
有个游戏不给任何说明——你玩它的目的就是发现规则和目标本身。能操作的只有上下左右。
过程是这样的:先乱走,发现每动一步顶上的点数就少一个(那是体力)。玩几轮之后注意到左下角有个图案,每次经过它就会变成另一个图案;当它和某个目标图案一致时,这关就算过了。
然后就卡住了:要走六步才能到,而生命只剩四步。
玩的时候会明显感到「脑子在被训练」——而这正是 ARC-AGI 的设计原则:做一个对人相对容易、对 AI 很难的基准。
支付宝和瑞幸的智能体演示很简单:说「我要一杯什么样的咖啡」,它提示你可以去哪家店买哪一款,你说「好,下单」,它就确认下单。
拆开看两处:一是瑞幸自身 API 很完善,所以大概率直接接 MCP 就行——不需要 GUI agent 那套去操作界面。二是「下单」这句话是人说的,声纹会一起过去——如果平台能基于用户历史语音做声纹识别,那这句话本身就可以充当支付授权,整个链路就闭合了。
顺着往下想一层:虽然这次是瑞幸出面,但用户会愿意为海底捞、瑞幸、星巴克各装一个 AI 吗?
显然不会。所以这件事背后想做的,一定是一个统一入口。
同期的另一条消息正好印证:美团也发布了自己的模型。这场竞争的标的从来不是单家门店的智能体,而是「用户说话时,那句话先落到谁家」。