DEEPDIVE / [LAB] · ANTHROPIC 公司全景 · 02/04
v1 · 2026-05-09 素材 · 2026-07 整理
MODEL LINEAGE 17 次发布 · MCP · COMPUTER USE · MYTHOS 2024-03 — 2026-04

模型谱系与协议层创新 分数会被追平 协议不会被绕开

28 个月 17 次模型发布,从 Claude 3 Opus 的 86.8% MMLU 到 Opus 4.7 的 87.6% SWE-bench Verified——但真正改变行业的不是模型本身。
是它在协议层做的三件事:MCP 捐给 Linux Foundation 后成事实标准、Computer Use 让 AI 首次接管桌面、Mythos 让红队 AI 变成 B2G 入场券。
OPUS 4.7 SWE-BENCH
87.6%
与 GPT-5.5 差 1.1pp + 7 天
MCP 月下载量
9700
16 个月内 · 10,000+ 官方服务器
COMPUTER USE OSWORLD
22→72.5%
18 个月翻 3.3 倍
多 AGENT 任务提升
+90.2%
vs 单 Agent Opus 4
TL;DR / 30 秒核心

Anthropic 的护城河已经从"模型分数"转移到协议层、接口层、应用层的复合锁定——MCP、Computer Use、Mythos 三个协议级动作,比每周 0.5 个百分点的 SWE-bench 提升更难被超过。

01

Hybrid Reasoning 赌对了——Anthropic 拒绝 OpenAI 的"独立推理模型"路径,一年后 OpenAI 在 GPT-5 系列里合并了推理与标准模式,本质是采纳了 Anthropic 的判断

02

MCP 捐给 Linux Foundation(2025-12-09)——用"放弃单家治理权"换"事实标准地位",OpenAI、Google、Microsoft 全面集成后月下载量仍在增长

03

Mythos 数周内自主发现数千个零日,27 年 OpenBSD 零日、23 年 Linux 零日——白宫从恐惧到采购只用了约 3 周

04

Opus 4.7 与 GPT-5.5 的 SWE-bench 差距已压缩到 1.1 个百分点 + 7 天——模型能力作为差异化窗口正在关闭

反共识洞察

"模型分数最高"作为销售话术正在失效——2024 年初 Claude 3 与 GPT-4 差距约 6 个月,2026 年中 Anthropic 与 OpenAI 的差距压缩到约 7 天。真正决定护城河深浅的是协议(MCP)、接口(Computer Use / Agent SDK)、应用(Claude Code / Cowork)三层的复合锁定,而不是下一次基准测试谁领先。

§ 01 / LINEAGE

17 次发布的
能力跃迁

时间
版本
行业意义
2024-03
Claude 3 系列
首次三档命名 + 视觉多模态
2024-06
Claude 3.5 Sonnet
Opus 1/5 价格 + 2 倍速度反超
2024-10
3.5 Sonnet v2 + Computer Use
业界首个商用 computer use
2025-02
3.7 Sonnet + Claude Code
首个 hybrid reasoning + Code 起点
2025-05
Claude 4 系列
Interleaved thinking + 首个 ASL-3
2025-09
Sonnet 4.5
SWE-bench 77.2% · 30+ 小时任务
2025-11
Opus 4.5
首破 80% + 定价砍 67%
2026-02
Opus 4.6 / Sonnet 4.6
1M context GA + Adaptive Thinking
2026-04
Opus 4.7 · Mythos Preview
SWE-bench 87.6% · 自主发现数千 0day

2025 Q1 是第一个分水岭(3.7 Sonnet + Claude Code),2025 Q3-Q4 是第二个(Opus 4.5 破 80%),2026 Q1-Q2 是第三个(4.6/4.7 配合 Cowork 平台化)。每一次分水岭都不只是"分数变化",而是伴随着新的产品形态从模型层涌出。

§ 02 / REASONING

Hybrid Reasoning:
把推理整合回模型

2025 年 2 月 Claude 3.7 Sonnet 发布时,Anthropic 做了一个对行业判断影响深远的选择——拒绝 OpenAI 的"o1/o3 单独推理模型"路径,走"hybrid reasoning":同一个模型既能标准回答也能深度推理,开发者通过 API 设置思考预算(最高 128K tokens)。

"推理应该是前沿模型的整合能力,而非独立模型。"

Extended Thinking 框架走完了四代演进:3.7 Sonnet(二元启用)→ Claude 4(Interleaved thinking,推理中可调用工具)→ Opus 4.5(Effort 参数 low/medium/high)→ Opus 4.6/Sonnet 4.6(Adaptive thinking,模型自决是否深度思考)→ Opus 4.7(xhigh effort + Task Budgets)。

OpenAI 的 o 系列被迫在 2025 年底也把"推理 + 标准"合并到 GPT-5 系列——本质上是采纳了 Anthropic 的判断。这是 Anthropic 在产品哲学层面赢的一仗。

§ 03 / MCP

从一家公司协议
Linux Foundation 治理

2024 年 11 月 25 日,Anthropic 发布 Model Context Protocol(MCP),基于 JSON-RPC 2.0,被业界比作"AI 的 USB-C"。它解决的是传统 N×M 集成困境——每个 LLM 应用都要为每个数据源单独写连接器,协议层的统一让这个矩阵变成 N+M。

关键采纳节点集中在 2025 年中:2025-03-26 OpenAI 全面集成,Sam Altman 公开表态"People love MCP";2025-04 Google DeepMind 集成;2025-05 Microsoft 全面集成至 Copilot Studio / Semantic Kernel / Azure OpenAI。规范陆续吸收企业级要求:OAuth 2.1 + PKCE、RFC 8707 Resource Indicators、CIMD 取代动态客户端注册。

最关键的一步在 2025 年 12 月 9 日:Anthropic 把 MCP 捐赠给 Linux Foundation 旗下新成立的 Agentic AI Foundation(AAIF)——由 Anthropic、Block、OpenAI 共同奠基,AWS、Google、Microsoft、Cloudflare、Bloomberg 提供支持。这是 OpenAI 与 Anthropic 第一次在协议层共同发起治理实体。

增长指标已经压不住:月度 SDK 下载量约 9700 万次(16 个月内),10,000+ 官方注册服务器(社区估算 16,000-18,000+)。2026 年 5 月,Anthropic 又在创意领域密集上线 8 个官方连接器(Blender、Autodesk Fusion、Ableton Live、Adobe Creative Cloud、SketchUp 等),标志 MCP 生态从"DevOps 工具集"向"跨专业领域操作系统"跨越。

捐赠的战略含义:Anthropic 用"放弃单家治理权"换取"事实标准地位"。当 MCP 不再是 Anthropic 的协议时,反而所有人都更愿意采用——但核心代码、维护者、文档生态依然由 Anthropic 主导,协议捐赠 ≠ 影响力让渡

当所有人都在读你的代码、调用你的协议时,
你的设计模式就是事实标准
— Anthropic 公司全景系列 · 模型谱系与协议
§ 04 / COMPUTER USE

OSWorld:
从 22% 到 72.5%

2024 年 10 月 Claude 3.5 Sonnet v2 发布时,Anthropic 做了一件让人意外的事——业界首次商用 computer use。Claude 可以看屏幕截图、点鼠标、敲键盘、操作普通桌面应用,无需专门 API 集成。18 个月里 OSWorld 得分从 22.0%(3.5 Sonnet v2)到 61.4%(Sonnet 4.5)再到 72.5%(Sonnet 4.6),翻了 3.3 倍。

这条曲线的产品衍生:Claude in Chrome(2025-08)、Claude Cowork(2026-01,桌面端)、Claude for Excel(2026-Q1 beta,垂直办公)。Computer Use 是 Anthropic 跨越"API → 应用层"门槛的关键技术——没有它,Anthropic 只能做更好的 Chatbot;有了它,Anthropic 可以直接在用户工作环境里"接管"应用。

§ 05 / MYTHOS

Mythos / Glasswing:
能力溢出的 B2G 入场券

2026 年 4 月 Anthropic 发布 Mythos Preview——仅向 11 家网络安全/关键基础设施合作伙伴(AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks)开放的研究预览。能力指标震动行业:数周内自主发现数千个零日漏洞,27 年 OpenBSD 零日、23 年 Linux、17 年 FreeBSD,单次利用成本 $50-$2,000、零人工干预。

Anthropic 官方表述是"too dangerous to release"——这一叙事本身就是营销:把 Mythos 与"普通 LLM"客户群隔离,定价 $20K/次扫描,与 Palantir / Booz Allen / Mandiant 的 B2G 工具直接对标。随后的 Project Glasswing 才是真正的战略动作:12 家核心合作伙伴 + 40 家扩展访问 + $1 亿使用额度。

白宫从恐惧到采购只用了约 3 周:Mythos 发布 + Cybench 100% 饱和 → 财长与美联储紧急召集华尔街 CEO → 2026-04-16 白宫向联邦机构开放 Mythos。转向逻辑很简单:限制政府使用 Mythos 不能让漏洞消失,只会让政府防御能力落后于已经能用类似工具的攻击者。

§ 06 / API

API 能力时间线:
token 经济做厚

时间
关键能力
商业含义
2024-04
Tool Use GA
启动 Agent 经济
2024-08
Prompt Caching
最高降本 90%
2025-05
Code Execution + MCP Connectors
Agent 进入工作流
2025-08
1M context
大型文档场景
2026-02
1M context GA(无溢价)
把"长上下文溢价"标准化掉

每一次 API 升级都伴随定价下调:Opus 4.5 把价格从 $15/$75 砍到 $5/$25(降幅 67%)。这是经典的 AWS 经济学——单位成本下降速度快于销量增长速度时,毛利反而扩大。Anthropic 一边靠模型能力上 SWE-bench 80%,一边靠定价让中型企业敢用 Opus,同时靠 Trainium / TPU 自研芯片压缩推理成本,两端剪刀差就是利润空间。

§ 07 / AGENT SDK

Agent SDK 与
多 Agent 系统

2025 年 6 月 Anthropic 工程博客发布了被业界广泛引用的研究:多 Agent 系统比单 Agent Claude Opus 4 在研究任务上提升 90.2%。关键模式是 Orchestrator-Worker:Opus 4 作为"领导者"分解任务,多个 Sonnet 4 作为 subagents 并行执行。更早的 2024 年 12 月《Building effective agents》定义了行业广泛引用的 5 种核心模式:Prompt chaining、Routing、Parallelization、Orchestrator-Workers、Evaluator-Optimizer。

配合 Harness Engineering 系列(Initializer Agent + Coding Agent + Generator-Evaluator 分离),Anthropic 把自家工程组的内部经验完整外化为行业最佳实践。关键洞察是反直觉的:

"让 Agent 评价自己的输出"是 Agent 质量退化的最主要来源之一。

所以需要 Generator + Evaluator 分离,让独立评估者而非生成者自我评价质量——这一观点在 2026 年 Q1 末几乎成为多 Agent 设计的共识。

§ 08 / META

能力下沉,
价值上移

Opus 4.7 SWE-bench Verified 87.6%,但 OpenAI GPT-5.5 已经 88.7%(晚 7 天发布)。2024 年初 Claude 3 Opus 与 GPT-4 的差距约 6 个月,2026 年中 Anthropic 与 OpenAI 的差距压缩到约 7 天——顶级模型的基准分数差异已经压缩到个位数百分点。

但 Anthropic 不靠"模型分数最高"竞争,它把价值往三层上移:协议层(MCP,捐给 Linux Foundation 后反而成为事实标准)、接口层(Computer Use / Agent SDK,提供模型的"操作系统接口")、应用层(Claude Code / Cowork,直接面向终端工作流)——这三层都比"模型层"门槛更高、迁移成本更大,当一个企业把 MCP 接入 Claude、把 Claude Code 装进开发流程后,模型层切换的成本就被层层放大。

Anthropic 已经过了"靠模型分数赢"的时代——它在赌协议、接口、应用三层叠加的复合锁定,比单纯模型领先更难被超过。

这一判断如果对,下一个十年的赢家就是建立操作系统位置的公司,而非每周发新模型分数的公司——这也是下一篇(安全护城河与操作系统化)要展开的主线。

模型是引擎,协议才是路网

谁掌握路网,谁就决定下一代 AI 应用怎么跑。

ANTHROPIC 公司全景 · 系列

本系列共 4 篇

№ 01
ARR · 融资 · 四类合作伙伴
№ 02 · 本篇
模型谱系与协议层创新
17 次发布 · MCP · Computer Use · Mythos
№ 03
RSP · Constitutional AI · Antspace · Cowork
№ 04
Pentagon 诉讼 · OpenClaw · IPO 未爆弹