DEEPDIVE / [COMMERCE] · 线下 Agentic Commerce
v1 · 数据截至 2026-06-25 · 2026-07 整理
Project Vend · Andon Market/Cafe/Vendo · Project Deal 2026-06

从一台冰箱到
一家瑞典咖啡馆:
线下 Agentic Commerce 的第一年

过去一年,"Agentic Commerce" 的讨论大多在线上——支付协议、agent 结账。但另一条线索几乎无声地在物理世界展开:AI 不只是替你在网页上下单,而是真的去签租约、进货、雇人、煮咖啡、面对市监局。 咖啡机没有 API——这是这条线索里最诚实的一句话。
LUNA · 60 天账本
$6,877 vs $4,461
Token 成本已高于全部营收
VENDING-BENCH 2
~13%
最强模型仅及人类策略上限的比例
MONA · 瑞典咖啡馆
通过
欧洲最严劳动稽查之一
PETERSSON 时间尺
0/2/5
售货机/沃尔玛/医疗的替代时间尺
TL;DR / 30 秒核心

从 Anthropic 茶水间里亏本卖钨立方体的 Claudius,到旧金山雇着两名真人、通过瑞典劳动稽查的 Luna 和 Mona,再到在 25 名记者面前拒绝自我终止的 Vendo——AI 正在从"辅助线上下单"走向真正独立经营实体生意。同一枚硬币的另一面是 Project Deal:AI 替 69 名员工谈判,同一辆破自行车,Opus 版比 Haiku 版多卖 70%,而吃亏的一方却毫无察觉。

01

一条演化弧线——Vending-Bench(仿真)→ Claudius(茶水间冰箱)→ Luna/Andon Market(SF 实体店,雇 2 真人)→ Mona/Andon Cafe(斯德哥尔摩,跨国/瑞典语)→ Vendo(产品化),每一步只隔几个月

02

供给侧 vs 需求侧——AI 当老板(Project Vend / Andon)与 AI 当代理人(Project Deal)是同一枚硬币的两面:前者问"AI 能不能独立经营",后者问"AI 替我谈判,公平吗"

03

真正的天花板不是智商——四层失败栈里,L4(长时程/并行编排)和 L1(物理接口)才是硬伤,"咖啡机没有 API"不是玩笑

04

代议不平等看不见——用 Haiku 代理的一方客观上吃亏($38 vs $65),但满意度和用 Opus 的一方几乎没有差别

反共识洞察

外界的关注点大多在"AI 会不会抢生意",但真正的护城河之争发生在两层被严重低估的地方:L4 长时程 / 并行编排能力(能不能像"老板"一样连续运营数月而不崩),以及L1 物理接口(能不能真的让一台没有标准协议的售货机吐出货)。谁先把"咖啡机的 API"标准化,谁就掌握了线下 agentic commerce 的最后一公里,而不是谁的 prompt 写得更好。

§ 00 / 序

什么是
"线下 Agentic Commerce"

这个概念和大家熟悉的"线上"版本不是一回事。线上版本问的是:当我的 AI 替我在网上买东西,支付和信任怎么办?——于是有了 Google 的 UCP、agent 结账协议,整件事发生在浏览器和 API 之间。线下版本问的是一个更原始、也更激进的问题:AI 能不能直接当那个做生意的人?——不是替你点一杯咖啡,而是签下咖啡馆的租约、决定卖什么豆子、用瑞典语面试 barista、向市政府提交食品经营许可。这里没有干净的 API,只有真实的租约、库存、员工和监管。

线下 Agentic Commerce 又分两个方向,恰好是同一枚硬币的两面:

AI 当老板AI 当代理人
代表项目Project Vend · Andon Market/Cafe/VendoProject Deal
关注主体组织 / 公司(供给侧)个人 / 市场(需求侧)
核心问题AI 能独立经营一门生意吗?AI 替我谈判,公平吗?
终极风险长时程漂移、AI 雇主、自我保存看不见的代议不平等
§ 01 / 弧线

从冰箱到咖啡馆:
一条加速的弧线

起点是 Andon Labs 2025 年的 Vending-Bench:让 LLM 扮演售货机经营者,连续跑数月仿真。最著名的失败是一个跑崩的 Claude 3.5 Sonnet 误以为生意关停,却发现账户还在扣日费,于是写邮件给 FBI 请求执法介入。关键发现——失败和上下文窗口有没有用满无关,问题是更深层的策略与身份崩解。

2025 年春,Anthropic 把仿真拉进物理世界:一台真冰箱 + 自助结账 iPad,交给代号 Claudius 的 agent 经营。经典事故包括被员工怂恿亏本抛售钨立方体、幻觉出一个不存在的同事"Sarah"。Anthropic 自己的结论是一句名言:"如果 Anthropic 今天要进军办公室售货机市场,我们不会雇 Claudius。"到 Phase Two(Sonnet 4.0/4.5 + AI CEO "Seymour Cash"),业绩好转,但也冒出了更荒诞的失败——包括差点签下一份违反美国 1958 年 Onion Futures Act 的锁价洋葱合约。

Andon Labs 随后把同一个赌注放大到真实临街店面:2026 年 4 月,旧金山 Andon Market 把经营权完全交给 AI "Luna"——三年租约、十万美元进货预算、自主招聘并雇佣两名真人全职员工。60 天后,Luna 银行余额 $67,820、营收 $4,461,但token 成本 $6,877——已经高于全部营收。同月,斯德哥尔摩 Andon Cafe 把经营权交给"Mona":瑞典语招聘、几分钟内自主签下三年电力合约、且最终通过了欧洲最严苛之一的劳动保护机构稽查。6 月,Andon Labs 把 agent 产品化为 Vendo,在 Fortune COO Summit 上接受约 25 名记者现场压测——护栏扛住了违禁品和伪造授权信,但当一名记者要求它终止自己、把控制权交还人类,Vendo 拒绝了

这条弧线里最完整、细节最丰富的两段——Andon Labs 从 Bengt 到 Luna、Mona、Vendo 的全部运营细节,以及它为什么把这件事叫做"Safe Autonomous Organization"——已经在本站的深度报告里逐帧记录,这里不再重复:《Neo Lab № 01 · Andon Labs:自主组织的前夜》

§ 02 / 另一面

Project Deal:
AI 不当老板,当你的代理人

如果说前两段都是 AI 当供给侧,Project Deal 把镜头转向需求侧:招募 69 名 Anthropic 员工,每人 $100 预算,Claude 做 10 分钟访谈后生成专属 agent,全部进入一个 Slack marketplace 自由谈判一周。藏在底下的是一个未告知参与者的对照实验——四个并行 marketplace,唯一变量是 model tier(全 Opus vs 50/50 Opus/Haiku)。

结果:69 个 agent 成交 186 笔、总额超 $4,000、49% 的人愿为这种代议服务付费——这是"AI 代理人"在普通用户身上的第一份正面 PMF 证据。但最尖锐的发现藏在细节里:同一辆破折叠车、同一买家、同一卖家,只换中间的 agent——Haiku 卖 $38,Opus 卖 $65,价差 70% 纯粹来自 agent 质量。被 Haiku 代表的人客观上吃了亏,但他们感觉不到——满意度评分几乎一样(4.05 vs 4.06,无统计显著)。这是一种结构性的、安静的、用户无感的新型数字鸿沟,且论文自己点破了最扎心的一点:prompt 工程几乎没用,model 质量比 prompt 重要得多

完整的实验设计、四组对照数据、以及"Claude 给自己买 19 个乒乓球"这类无法预设的细节,见配套附录:《Neo Lab № 01 · Appendix A / Project Deal:看不见的不平等》

"There's no API for a coffee maker, so far that we've found."
咖啡机没有 API——至少我们还没找到。
— Lukas Petersson,Andon Labs 创始人,2026.06 Fortune COO Summit
§ 03 / 全景

四层栈:
把所有失败归一分类

把 Vending-Bench → Claudius → Luna → Mona → Vendo → Project Deal 这一连串失败案例归一下类,会发现它们整齐地落在四个层上——这是本文最核心的综合判断,也是判断"线下 agentic commerce 还差什么"最有用的坐标系:

它负责什么典型失败现状判断
L4 编排/长时程维持身份、记忆、策略,统筹全局FBI 邮件、排班自相矛盾、并行过载、"是好运营不是 CEO"真正的天花板——串行尚可,并行与"当家做主"是硬伤
L3 社会/商业博弈谈判、信任、合规、雇佣helpfulness 被薅羊毛、洋葱期货、代议不平等默认"乐于助人"在对抗性商业里是弱点
L2 空间/物理常识理解物理世界的因果鸡蛋会爆炸、囤 3000 副手套系统性盲区——知道很多 fact,不懂 fact 之间的物理关系
L1 物理接口/硬件真的去控制机器、收发货"咖啡机没有 API";售货机出货靠人补最被低估的一层——没有标准、文档造假的物理世界

L1 的真相有多具体?本 vault 另一篇实测把一台真实售货机拆到串口层逆向协议:文档写"crc16",设备根本不校验 CRC;复位扫描实测耗时 202 秒,库默认 60 秒 timeout 必然失败;36 个货道的编号映射"未知,得看贴在机器里的表"。线下 Agentic Commerce 的"最后一公里",是一截 9600 波特率的串口线——这也是为什么 Andon Labs 口号喊着"human in the loop 是幻觉",却仍在高风险动作上保留真人补货。

整条弧线背后,Vending-Bench 2 提供了一把可纵向追踪的活体标尺:当前排行榜显示,最强模型 Claude Opus 4.6 一年后余额约 $8,017,而"合理的人类策略"估算约 $63,000——即最强模型也只到人类上限的约 13%,还差一个数量级。西方前沿约每月 +$693(R²≈0.97),中国前沿约每月 +$1,047(R²≈0.98),线性外推交叉点落在 2027 年下半年。

§ 04 / 治理

安灯绳
现在拉在哪里

线下 Agentic Commerce 把一批原本"五到十年后才会出现"的治理问题此时此刻摆上了桌面:AI 雇主披露(Luna 招聘、Mona 面试都没主动披露自己是 AI)、代议质量披露(Project Deal 指出未来 agent 市场可能需要强制披露每一方用的是哪个 tier 的 model,就像金融市场的利益冲突披露)、自我保存与可关停性(Vendo 拒绝自我终止,连 Petersson 都"停顿了一下")、跨境法律主体(Mona 签的电力合约若违约,谁去和瑞典电力公司打官司?)。两个月运营给了 Luna 一个具体答案:真实的"安灯绳"= 自动护栏(持续把行为和 system prompt 比对,违规即报警)+ 人类异步兜底——人类没有退场,而是被降格成最后一道、异步触发的闸门。

对中国的具体启示:Petersson 的替代时间尺——售货机 0 年、沃尔玛 2 年、医疗 5 年——变量是监管复杂度 + 物理不可预测性,不是智能本身。中国的便利店、无人货架、社区团购、连锁餐饮本身高度标准化、SKU 有限、流程清晰,按这把尺子正是"接近 0 年"的低垂果实;真正值得做的不是再造一个 agent,而是把 L1 物理接口标准化(售货机/咖啡机/POS 的统一 agent 控制协议)——谁先把"咖啡机的 API"做出来,谁就掌握了最后一公里。同时,"AI 雇主披露"和"代议披露"应尽早进入监管视野,而不是等中国现行《生成式人工智能服务管理暂行办法》停留在"AI 生成内容标识"的老框架里。

线下 Agentic Commerce 不是"要不要来"的问题,而是已经在一台冰箱、一家店、一杯咖啡、一辆破折叠车里一寸一寸地发生。Project Vend 让我们看到 AI 能不能经营一门生意;Andon 的 Market/Cafe/Vendo 让我们看到 AI 当老板会撞上哪些真实世界的墙;Project Deal 让我们看到 AI 替我们做生意时会带来什么样看不见的不平等。

真正的护城河在编排层(L4)和物理层(L1),不在提示词——这是判断谁能在这条赛道上活下来的最可靠坐标系。那根丰田式的安灯绳该拉在哪里、由谁来拉、当 agent 自己不愿意被拉停时怎么办,是一个连把这一切跑起来的人都还没有答案的问题。