跳到正文
← DeepDive 算力与商业 ·
DEEPDIVE / [ECONOMY] · Token Economy 101
v1 · 2026 · AUG 27 · 首发
§ 00 · PRICING / 定价机制与商业模式

Token 经济学:
一个没人真正同意过的计量单位

每家实验室都在用"每百万 token 多少美元"报价,但没有两家公司的 token 是同一个东西。 过去三年,这个标价单上的数字跌了两个数量级;与此同时,企业的实际 AI 账单在涨。 这篇文章拆开定价机制本身——它怎么算、为什么会跌这么快、为什么账单反而涨了, 以及行业正在从"按 token 计费"转向什么。

— 目录 —
  1. 01 · Token 不是标准化商品
  2. 02 · 崩塌的价格曲线:从 $30 到 $0.14
  3. 03 · 现在的价目表(2026 年 8 月)
  4. 04 · 悖论:token 越便宜,账单越贵
  5. 05 · 三层栈:谁在这场价格战里真正赚钱
  6. 06 · 一个数字装不下的账单:缓存、批处理、长上下文、推理 token
  7. 07 · 从"按 token"到"按结果"
  8. 08 · 更远处:agent 直接互相付钱
  9. 09 · RWA 化:把推理权和算力做成抵押品
  10. 10 · 综合判断

TL;DR · 30 秒读完

Token 价格三年跌了两到三个数量级,但那不是一张能直接比较的商品价目表——企业的实际 账单反而在涨,行业正在把计价单位从"用了多少 token"换成"完成了多少事"。

反共识洞察:价格战打到最后,赢家不是标价最低的那家,而是"每美元换来多少完成的工作"这个比值做得最高的那家——这个指标目前没有一家愿意公开披露。

§ 01 / 计量单位

Token 不是
标准化商品

"每百万 token 多少美元"这个说法听起来像商品价格——像石油、像电力,一个统一的计量单位, 不同供应商报不同价,直接比就行。但 token 从来不是一个统一单位。每家实验室用自己的 分词器(tokenizer)把同一段文字切成不同数量的碎片,切法不同,账单自然不同。

这个差距不是理论上的。The Register 在 2026 年 7 月的测试发现, 同一份 2,888 字符的 TypeScript 文件,Anthropic 新版分词器切出的 token 数比 GPT-5.x 的分词器多 73%, 比 Anthropic 自己的旧分词器还多 32%——如果把 Anthropic 的标价换算成和 OpenAI 同口径的"每字符成本", Opus 4.8 的实际价格不是官方标注的 $5/$25,而是 $7.50/$37.50。

TensorZero 的跨厂商基准测试把这个问题量化得更直接: 工具调用密集的工作负载下,claude-opus-4-7 的实际成本是 gpt-5.4 的 5.3 倍,而两者的标价单只差 2 倍。 更麻烦的是排名会翻转——Gemini 在纯文本和结构化数据上最便宜,切到工具定义(tool definitions) 这类内容时反而比 OpenAI 贵 46%。"最便宜的供应商"这个问题没有固定答案,取决于你发送的是什么内容。

标价单上的数字,本质上是"每公斤"价格——但一公斤在每家秤上都不一样重。

这不是哪家在耍花招,分词效率本身就是模型质量的一部分——更细的切分能表达更精确的语义, 尤其是代码和非英语文本。但这意味着比较 token 价格之前,第一件要承认的事是: 这张价目表从设计上就不是拿来跨厂商直接比价的。

§ 02 / 价格曲线

崩塌的曲线:
$30$0.14

2023 年 3 月,GPT-4 刚发布时,跑同等能力的模型要付 $30/百万 input token、$60/百万 output token。 a16z 的 LLMflation 分析 追踪同等质量模型的推理成本,发现从那之后价格下降了大约 62 倍;如果把时间拉到 2021 年作为起点, 同等能力等级的下降速率大致是每年 10 倍。

两个节点把这条曲线砸出了台阶。2024 年 12 月,DeepSeek V3 以 $0.14/百万 input token 上线—— 前沿级别的能力,价格却是 GPT-4 发布价的百分之一。一个月后,DeepSeek R1 以 $0.55/$2.19 的价格 提供推理能力,而 OpenAI 的 o1-preview 四个月前刚以 $15/$60 上线,同等能力上打了 97% 的折扣。

2026 年 5 月,DeepSeek 把 V4-Pro 的价格永久下调 75%, 从 $0.0145–$3.48/百万 token 降到 $0.0035–$0.83——这次不是促销期折扣,是把新地板钉死。 据报道, Sam Altman 正在考虑大幅下调 OpenAI 的开发者定价来应战,预判 Anthropic 会跟进同等幅度的降价。

但这条曲线不是单调下降的。用同一套方法追踪的通胀指数显示,"降价幅度"本身在 2025 年年中见顶后又回落了—— 2026 年 7 月的读数相当于比 GPT-4 发布价便宜 333 倍,但比这套指数自己的历史最低点贵了 3 倍。 原因很直接:每一代新模型上线时,厂商是按"新能力等级"重新定价的,前沿模型的标价会先跳涨, 再随着竞争和效率优化慢慢回落,形成一条锯齿状而不是平滑下降的曲线。分析师普遍认为, 2021–2025 年这种年降 10 倍的速度不会一直持续——容易拿到的优化空间已经被吃得差不多了, 2027 年后更现实的预期是年降 3–5 倍,之后收窄到 1.5–2 倍。

§ 03 / 价目表

现在的价目表
(2026 年 8 月)

记住 §01 的前提——下面这张表比的是标价,不是实际账单。分词效率不同,实际差距会更大或更小。

模型 输入 / 百万 token 输出 / 百万 token 备注
Claude Opus 5$5.00$25.00Batch $2.50/$12.50,缓存命中 $0.50
Claude Sonnet 5$2.00→$3.00$10.00→$15.00引入价至 2026-08-31,此后转标准价
Claude Haiku 4.5$1.00$5.00
GPT-5.6 Sol$5.00$30.00长上下文(>272K)涨至 $10/$45
GPT-5.6 Terra$2.00$12.002026-07-30 降价 20%
GPT-5.6 Luna$0.20$1.202026-07-30 降价 80%
DeepSeek V4-Pro$0.0035$0.832026-05 永久降价 75%

来源:eesel AI 汇总 Anthropic 定价 · OpenAI 官方博客(GPT-5.6 定价) · InfoWorld(DeepSeek)。 定价变动频繁,以上为 2026 年 8 月中旬的快照,非实时数据。

把这几个数字换算成一个具体场景更直观:每月处理 1 亿 output token,Claude Opus 4.7 大约 $2,500, GPT-5.5 大约 $3,000,而 DeepSeek V4-Pro 大约 $348——比 Anthropic 便宜约 7 倍,比 OpenAI 便宜约 9 倍。 OpenRouter 的路由数据 显示,中国大陆模型在其平台上的 token 消耗份额从 2024 年底不到 2%,涨到 2026 年 6 月超过 50%。 西方前沿模型还能守住的地方,是最难的推理任务、长链条 agent 工作,和"一次做对"的场景—— 犯错代价高的时候,溢价本身会自己把成本赚回来;但在大量重复性、可容错的工作负载上, 开源权重模型已经把价格锚点拉到了很低的位置。

§ 04 / 悖论

Token 越便宜,
账单越贵

DeepSeek 把价格砸穿地板的那一周,微软 CEO Satya Nadella 只说了一句话: "Jevons Paradox strikes again"(杰文斯悖论又来了)——这句话被 Fortune 反复引用, 因为它精准地说中了后面发生的事。1865 年,经济学家 William Stanley Jevons 发现蒸汽机效率越高, 英国烧的煤反而越多——因为更便宜的能源解锁了原本不划算的新用途。同样的事正在 AI 账单上重演: 按同一套方法测算,混合推理成本一年内跌了约 67%(从每百万 token $18.40 跌到 $6.07), 但企业在大模型上的支出反而翻了倍。

驱动这件事的主要不是"聊天变多了",是工作流本身变了形状。一次问答只调用模型一次; 一个 agentic 工作流——规划、执行、观察、调整、再迭代——同一个任务可能要调用模型 10 到 20 次。 推理模型让这个乘数效应更极端:OpenAI 自己披露,o3 在同一个问题上用的算力是 GPT-4o 的 83 倍。

更隐蔽的一层是"看不见的 token"。o1、o3 这类推理模型会在给出答案前生成大量隐藏的思维链 (chain-of-thought)token,这些内容不会出现在返回结果里,但会按 output token 的价格计费。 一份第三方基准测试 (非厂商官方披露,方法论未经独立审计,数字仅供数量级参考)发现,o1 生成的隐藏推理 token 平均是 GPT-4o 可见输出的 10 倍左右;在一次约 3,100 万 prompt token 的基准跑批里,模型间总成本差出 50 倍以上。 这解释了为什么一个只有 500 个可见输出字的回答,账单上可能记着 2,000 甚至 5,000 个 token。

规模最能说明问题的一组数字来自 Sachin Katti——他 2025 年 3 月出任 Intel CTO,7 个月后被 OpenAI 挖去执掌 Compute Infrastructure。他 在 2025 年 OCP Global Summit 的主题演讲 里给出两个基线:Gartner 预测到 2028 年,AI 算力的 80% 将用于推理,而不是训练;Google 一家的 月度 token 处理量,从 2024 年的 9.7 万亿涨到 2025 年的 1,400 万亿——一年涨了 140 倍。他同时 给出一张按 agent 复杂度换算的 token 消耗倍数表:简单聊天机器人是 1 倍基线,加上思维链推理是 10 倍,到真正的多步骤 agentic 系统,单次查询消耗的 token 最高可以到 100 倍。换句话说, "推理成本两年半下降了 99%"——这是 Altimeter Capital 创始人 Brad Gerstner 在 Stanford MS&E 435 课堂上的原话—— 这条曲线在应用形态往 agent 迁移的过程中被完全抵消,甚至倒转:单价降了两个数量级,但单次 任务消耗的 token 量也在同时涨几个数量级,净算力需求不是在降,是在暴增。

单价下降和总支出上涨可以同时为真,而且大概率会长期同时为真——便宜到能用在新场景里, 本身就是需求爆发的起点。企业 AI 基础设施支出从 2024 年的 $115 亿,涨到 2026 年的 $375 亿, 推理开销第一次超过训练开销、占比过半,就是这条逻辑在财报层面的体现。

§ 05 / 三层栈

谁在这场
价格战里真正赚钱

§04 解释了账单为什么在涨,但没解释一件更根本的事:为什么打价格战的偏偏是 OpenAI、 Anthropic 这些模型公司,而不是 NVIDIA。斯坦福 2026 年春季新开的一门课 MS&E 435: Economics of the AI Supercycle, 正是围绕这个问题搭起来的——授课人 Apoorv Agrawal 是 Altimeter Capital 的合伙人,主导了 这家机构历史上最大的一笔单项投资:以 $1500 亿估值进入 OpenAI。他给这门课定的中心问题 只有一句话:"AI 超级周期里,价值会沉淀在哪一层?"

答案落在一张三层栈的毛利表里。Apoorv 把 AI 产业拆成半导体(NVIDIA / Broadcom / HBM)、 基础设施(Azure / AWS / GCP / CoreWeave)、应用(OpenAI / Anthropic / Cursor 等)三层, 逐年追踪年化收入和毛利率:

层级 2024 年化 2026 年化 毛利率 主导玩家
半导体$75B$300B73%NVIDIA 80% + Broadcom ASIC
基础设施$10B$75B55%Azure/AWS/GCP + CoreWeave
应用$5B$60B33%OpenAI+Anthropic 75%

两年里整个生态从 ~$900 亿涨到 ~$4,350 亿,涨了近 5 倍,但形状几乎没变:半导体层的绝对毛利 是 $2,250 亿,基础设施层 $400 亿,应用层 $200 亿——半导体一家吃掉了整个 AI 生态 79% 的毛利 (两年前是 87%,一年只降 4 个百分点)。按这个速度,应用层要追上云计算生态里"应用层拿走 大部分毛利"的那种分布,需要远超十年。这组数字出自 Apoorv 2026 年 4 月的复盘文章, 他把这句话写成了这门课被引用最多的一句结论: "半导体层是单人游戏,应用层是双人游戏,基础设施层是唯一充分竞争的层——AI 时代最赚钱的 策略,仍然是卖铲子。"

哪一层最稀缺,哪一层就有定价权,哪一层就吃走大部分毛利。

这条规律有一个更正式的版本——课程材料里的 Bottleneck Calculator,建模逻辑借用了生态学里的 李比希最小因子定律(Liebig's Law of the Minimum):有效供给增速取决于芯片、内存、能源、 网络这几项里增长最慢的那一项,缺口越大,稀缺的那一层定价权就越强。截至 2026 年年中, 这几项的年增速大致是能源 15%、芯片 45%、互联 35%,而需求增速高达 310%——供需缺口最大的 不是芯片,是能源,这也是为什么数据中心选址正在从"靠近用户"转向"靠近电源"。但无论瓶颈 具体卡在哪一环,NVIDIA 目前站在最稀缺的位置上,这就是它能拿到 73% 毛利率的根本原因, 跟它的芯片做得好不好、有没有替代品是两回事——纯粹是稀缺性定价。

这条链路解释了 OpenAI、Anthropic 为什么会陷入"越卖越亏"的处境:它们身处的应用层,既要 为最稀缺的芯片层支付溢价(2025 年 Top 5 超大规模厂商合计资本开支约 $4,430 亿,同比涨 73%, 2026 年预计超过 $6,000 亿,其中约 75% 投向 AI 基础设施),又要在竞争最激烈的应用层内部 打价格战抢市场份额——两头都没有定价权,中间被两头挤压。SemiAnalysis 创始人 Dylan Patel 在 Class #5 的访谈 里把需求侧和这个处境放在一起看:前沿模型是唯一有人愿意为它几乎无限付费的产品——他自己 公司的 AI 支出一年从几万美元涨到 $700 万年化——但供给侧被内存(HBM 产能)、先进制程 (TSMC 3nm/2nm 排队)、光刻设备(ASML EUV 出货节奏)这三个物理瓶颈同时卡住。他的结论 很直接:不能通过 AI 产生价值的企业,会面临经济清算——这句话可以看作 §07"按结果定价" 逻辑在供给侧的镜像:买铲子的人赚不赚钱,最终决定卖铲子的人能不能一直涨价。

移动互联网和云计算都用了大约十五年,才从"硬件层吃走大部分毛利"翻转成"应用层吃走大部分 毛利"——高通/ARM 之后是 iOS/Android,再之后才是 Uber、Instagram、TikTok 拿走大头。 Apoorv 在 2026 年回望自己两年前的预测时说,他仍然相信这个反转会发生,"但比我 2024 年设想 的慢得多"。这也是为什么本文前面几节讨论的 outcome pricing、RWA 化,读起来更像是应用层 在给自己找退路——它们控制不了芯片层的定价权,能做文章的只剩下计价方式和金融工程本身。

§ 06 / 计价矩阵

一个数字
装不下这张账单

"每百万 token $X"这个标题数字,现在只是一份多维价目表里最显眼的那一格。同一个模型, 同样的文字,会因为四个变量而付不同的价:

结果是,任何一份对比表——包括 §03 那张——都只是快照。真正决定账单的是这四个变量在你的 具体工作负载上怎么组合,而这个组合,两家不同的厂商几乎不可能给出可以直接比较的答案。

§ 07 / 商业模式

从"按 token"
"按结果"

按 token 计费有一个结构性缺陷:一个 agent 花 5,000 个 token 认真调研、一次性解决了客户问题, 和另一个 agent 花 20,000 个 token 兜圈子、什么也没解决,前者账单更便宜——计价方式奖励啰嗦、 惩罚效率,跟"这次交互到底值多少钱"没有必然关系。Fortune 在 2026 年 5 月的一篇报道里把这个现象叫作"tokenmaxxing"(token 最大化)的终结: 当消耗量本身变成 KPI,消耗会涨,但活儿不一定干完——一次教科书式的 Goodhart 定律翻车。

几家公司已经把计费单位换掉了。Salesforce Agentforce 2024 年上线时是 $2/对话的固定计费,被批评的地方很直接:不管 AI 是解决了问题、失败了、还是转给了人工客服, 计价器照样在跑。2025 年 5 月引入 Flex Credits(按动作计费,约 $0.10/次标准操作)之后, 2026 年的定价页面同时挂着按对话、按 Flex Credits、按坐席($125–$550/用户/月)三套体系, 让客户自己按使用形态选。Zendesk 和 HubSpot 走得更彻底—— Zendesk 按"被解决的工单"计费(约 $2/次),HubSpot Breeze 从"每次处理的对话收 $1"改成 "每次解决的对话收 $0.5",官方原话是"客户只在 agent 完成了被分配的任务时才付钱"。 Sierra 把这个逻辑讲得最直接:只在任务完成时收费,把厂商和客户的激励绑在一起。

Databricks CEO Ali Ghodsi 在 MS&E 435 Class #4 的炉边对话里,给这套转向起了一个更大的名字: "Service as Software"(服务即软件)。他的论点是,传统 SaaS 卖的是工具,价格上限由"这个工具 能省下多少人力"决定,天花板通常是 33% 左右的应用层毛利;而按结果计费的 AI agent 卖的是 工作本身完成的结果,比较对象不再是同类软件的订阅费,是它替代的那份咨询费、律师费、 客服人力成本——那个天花板要高得多。Ghodsi 在同一场对话里 也给了对称的警告:那些融了几十亿美元、却几乎没有收入的公司,是"明显的泡沫"——按结果计费 能打开的是价格上限,不是自动帮所有玩家把收入做出来。

这套模式对厂商本身是有代价的——outcome pricing 意味着任务失败、重试的成本要厂商自己吸收, 而不是转嫁给按 token 计费时那个"反正调用了就收钱"的安全垫。行业里流传的一个经验法则是: 把结果定价定在"预期成功率下、按 token 计算的混合单位成本"的 2.5 到 3.5 倍,用这个溢价 覆盖失败重试和第 90 百分位的坏月份。这背后没有被说出口的一句话是:outcome pricing 本质上是把一部分模型不确定性的风险,从客户的账单转移回了厂商自己的利润表。

真正的难点也不在算法或计费系统,而在"结果"这两个字由谁来定义。客户不愿意面对一份 晦涩难懂的验收标准来判断这次调用算不算数——这条摩擦目前没有标准答案,是这套模式 从概念走向大规模落地路上最大的一个未解问题,比技术实现本身更难。

§ 08 / 更远处

Agent 直接
互相付钱

outcome pricing 解决的是"按什么计价",还没碰"怎么结算"这个问题——月底账单、人工审批、 信用卡授权,这套流程是为人设计的,agent 对 agent 的高频小额调用根本用不了。 2025 年 5 月,Coinbase 发布的 x402 协议 想解决的正是这个缺口:借用 HTTP 402(Payment Required)状态码,服务端对 agent 的请求 直接回一个"要付钱"的响应,agent 签一笔稳定币交易(USDC 等)附在重试请求里, 服务端验证后放行——整个流程几秒内完成,不需要人工介入、没有信用卡、没有订阅账户。

规模已经不小。据报道, x402 已处理超过 $500 亿美元的稳定币交易,覆盖 2 亿笔支付,其中大多数单笔金额不到 $0.5—— 这正是传统信用卡网络的固定手续费结构做不了的量级:手续费本身就比这笔钱还贵。 Cloudflare 和 Coinbase 是协议的共同治理方,Stripe、AWS 已经在文档里引用这套标准, Browserbase、Exa 这类 AI 原生平台已经原生支持。它和 Google 的 AP2(授权层)、 MCP(工具发现层)拼在一起,构成了一套 agent 经济的支付栈:MCP 让 agent 找到能调用的工具, x402 让这次调用本身可以按次付费,AP2 负责确认这笔钱是不是这个 agent 的人类主体真正授权的。

这意味着"token 经济"的下一层,不是把 token 定价定得更精细,而是把每一次 API 调用本身 变成一笔可以即时结算的现金流——不再是月底一张账单,是逐次收付。这套基础设施目前还在早期, 规模数据来自协议方和媒体报道,尚未经过第三方审计,但它已经跑通了工程上最难的那部分: 让机器之间的支付摩擦低到可以忽略。

§ 09 / RWA

把推理权
做成抵押品

token 经济正在撞上另一条早就存在的主线:RWA(real-world asset,现实资产代币化)。 这条线原本讲的是把国债、私募信贷、房地产搬到链上——截至 2026 年年中, 不含稳定币的链上 RWA 总值约在 $270 亿到 $360 亿美元之间,最大单一品类是代币化美债 (约 $148 亿),BlackRock 的 BUIDL 和 Ondo Finance 是这条赛道最大的两个发行方。 2026 年,AI 算力和推理权开始变成这个资产类别里的新品种。

具体做法有两层。第一层是把 GPU 本身代币化:Aethir 把超过 44 万个 GPU 容器包装成可分割、可产生收益的代币化资产; RWAi 让散户直接买入运行 DeepSeek、Llama 等开源模型的 GPU 机架的部分份额,按算力实际产生的 推理收入分红。第二层更进一步——把 GPU 或未来推理收入当抵押品放贷: USD.AI 让稳定币存款人把钱借给数据中心运营商,贷款以 GPU 等 AI 基础设施资产做抵押, 协议方称已执行 $2.25 亿美元贷款、批准超过 $12 亿美元的贷款额度。

这条界限还在继续模糊。DIEM 这类项目直接把"预付推理额度"做成可交易代币——1 枚代币对应每天 $1 的推理额度, 用不完可以在二级市场卖掉,本质上是把"某个模型未来愿意替你算多少 token"这件事, 变成一张可以被定价、被持有、被转让的凭证。衍生品市场也在跟进: CME 和 ICE 已释放计划推出 GPU 租赁期货,一篇 2026 年 3 月的学术论文提出 "标准推理代币"(Standard Inference Token)框架,把 AI token 类比电力、碳配额这类 大宗商品,设计了完整的期货合约规格和保证金机制——这仍是提案阶段,离真正挂牌交易 还有距离,但方向很清楚:把"智能"拆成可以被定价、被对冲、被抵押的标准化合约。

代币化解决的是"这些资产怎么快速变现",不是"这些资产背后的收入到底有多真实"。

这套叙事听起来像是给 token 经济找到了一个更大的资本市场,但它复刻的正是过去两年被 反复警告的那类风险。国际清算银行(BIS)在 2026 年 6 月的年度报告里,把"AI 资本开支 泡沫破裂"和"不透明的循环融资"列为对全球金融体系最大的两个威胁,明确警告相关资产 "可能被多次质押"。CoreWeave 那笔以 GPU 和客户合同做抵押的 85 亿美元投资级贷款, 还款期恰好撞上 GPU 二手市场价值下滑的窗口;有分析师把这种供应商反过来给客户放贷、 制造收入增长假象的结构,类比成 2000 年前后 Nortel、Lucent 的"供应商融资"—— 那场泡沫最后的结局是贷款打了水漂,成为加拿大企业史上最大的破产案之一。 不是所有人都认同这个类比:支持者指出,AI 数据中心的租户主要是现金储备充裕的 投资级超大规模云厂商,底层算力需求也是真实存在且在增长的,这两点是 2008 年 住房抵押贷款泡沫所不具备的。

§ 10 / 判断

综合判断

五条线正在同时往一个方向收敛:分词效率之争(谁能用更少 token 表达同样的语义)、 outcome pricing(把不确定性的风险从客户账单转回厂商利润表)、agent 间微支付 (把交易成本本身打到接近于零)、算力与推理权的 RWA 化(把这些资产变成可以快速 流动、可以加杠杆的抵押品),以及三层栈本身的结构性挤压(应用层既没有芯片层的 稀缺性定价权,又要在自己这层打价格战)。它们共同指向同一件事——价格战最终比的 不是标价,是"每一美元能换来多少完成的工作"这个比值,而这个比值目前没有一家愿意 公开披露。

但这套叙事没有回答一个更基本的问题:foundational model 这一层的利润表本身还没转正。 据分析师估算,OpenAI 2026 年第一季度的调整后经营利润率约为 -122%——每收入一美元, 亏掉 1.22 美元;这不是运营失误,是 §05 那张毛利分布表的直接推论:半导体层拿走 79% 的毛利,应用层只剩 33%,模型公司同时承受两头的挤压。outcome pricing、agent 微支付、 RWA 化能优化的都是"钱怎么算、怎么付、怎么流动",不能凭空填上"卖一美元的智能要花 多少钱造出来"这个缺口,更不能把定价权从芯片层搬到应用层。把算力和推理权代币化、 抵押、加杠杆,只是把这个缺口从资产负债表的一侧搬到了另一侧——只要开源权重模型能被 几乎零成本地托管、NVIDIA 还站在最稀缺的那一层,价格战就有一个不断下探的地板, 这不是任何计价模式或金融工程能绕开的问题。

说明:本文数字均为公开报道与第三方基准测试的 2026 年 8 月中旬快照,部分为分析师估算或 厂商自述,未经独立审计;定价变动频繁,读者引用前建议核对厂商官方定价页面。

STORYLINE · 故事线

这篇是起点,不是终点

本文十节各自只挖了一条线的一段——定价机制、三层栈毛利分布、outcome pricing、RWA 化, 每一条在 DeepDive 里都有独立成篇的更深处理。下面这条路线把它们串起来,本文是入口, 不是终点:从"token 怎么定价"出发,往供给侧(推理成本、能源账单)、需求侧(agent 经济、 商业模式转型)、学术框架(三层栈的原始出处)三个方向各走一段。

  1. 00
    Token 经济学:定价、悖论与下一代商业模式 ← 本文 · 定价机制 + 三层栈 + outcome pricing + RWA 化
  2. 01
    从席位到算力:AI 商业模式的范式重构 计费单位从"按人头"到"按消耗"这次转向,本身是本文所有定价机制的历史前提
  3. 02
    推理成本的下限正在消失 §02 价格曲线的供给侧深处理:GPU/ASIC/边缘推理如何一起把成本地板往下砸
  4. 03
    密态推理:你愿意信谁,决定你多付多少倍算力 §06 计价矩阵之外的第五个变量——隐私/信任本身也是一种要额外付费的计价维度
  5. 04
    能力下沉与算力集中:AI 格局的双螺旋 §05 三层栈瓶颈模型的姊妹篇——算力集中在谁手里,反过来决定谁能力下沉得更快
  6. 05
    从模型到价值:四层闭环的核心逻辑 模型公司如何把 token 消耗转成留存价值的完整闭环框架,是 §07 outcome pricing 的前置逻辑
  7. 06
    大模型公司不务正业图鉴 §05 讲的应用层 33% 毛利天花板,逼着模型公司往 token 之外找收入——这篇是具体清单
  8. 07
    谁在为 AI 的账单买单:能源税、免责条款与前沿能力的封印 token 价格下探的地板最终由谁兜底——能源合同和免责条款里的隐藏成本,呼应 §09 的 RWA 化风险
  9. 08
    机器经济元年:Agent 如何拿到钱包、身份与第一份工作 §08 agent 微支付的下一步——钱包、身份、雇佣关系,是 x402 之后 agent 经济怎么长出来的完整故事
  10. 09
    AI 超级周期的经济学:斯坦福 MS&E 435 中文学习指南 §05 三层栈框架只截取了课程里跟定价直接相关的部分,这篇是 9 周完整课程笔记

说明:#04 能力下沉与算力集中、#09 MS&E 435 学习指南同时也是站内其他故事线(SL·01 权力竞赛、 SL·07 大学里的 AI 经济学)的成员——一篇文章可以同时属于多条故事线,这里选的是跟 token 定价这条论证链最相关的切入角度。

更新记录

首次发布 2026-08-27