Anthropic 的护城河已经从"模型分数"转移到协议层、接口层、应用层的复合锁定——MCP、Computer Use、Mythos 三个协议级动作,比每周 0.5 个百分点的 SWE-bench 提升更难被超过。
Hybrid Reasoning 赌对了——Anthropic 拒绝 OpenAI 的"独立推理模型"路径,一年后 OpenAI 在 GPT-5 系列里合并了推理与标准模式,本质是采纳了 Anthropic 的判断
MCP 捐给 Linux Foundation(2025-12-09)——用"放弃单家治理权"换"事实标准地位",OpenAI、Google、Microsoft 全面集成后月下载量仍在增长
Mythos 数周内自主发现数千个零日,27 年 OpenBSD 零日、23 年 Linux 零日——白宫从恐惧到采购只用了约 3 周
Opus 4.7 与 GPT-5.5 的 SWE-bench 差距已压缩到 1.1 个百分点 + 7 天——模型能力作为差异化窗口正在关闭
"模型分数最高"作为销售话术正在失效——2024 年初 Claude 3 与 GPT-4 差距约 6 个月,2026 年中 Anthropic 与 OpenAI 的差距压缩到约 7 天。真正决定护城河深浅的是协议(MCP)、接口(Computer Use / Agent SDK)、应用(Claude Code / Cowork)三层的复合锁定,而不是下一次基准测试谁领先。
2025 Q1 是第一个分水岭(3.7 Sonnet + Claude Code),2025 Q3-Q4 是第二个(Opus 4.5 破 80%),2026 Q1-Q2 是第三个(4.6/4.7 配合 Cowork 平台化)。每一次分水岭都不只是"分数变化",而是伴随着新的产品形态从模型层涌出。
2025 年 2 月 Claude 3.7 Sonnet 发布时,Anthropic 做了一个对行业判断影响深远的选择——拒绝 OpenAI 的"o1/o3 单独推理模型"路径,走"hybrid reasoning":同一个模型既能标准回答也能深度推理,开发者通过 API 设置思考预算(最高 128K tokens)。
"推理应该是前沿模型的整合能力,而非独立模型。"
Extended Thinking 框架走完了四代演进:3.7 Sonnet(二元启用)→ Claude 4(Interleaved thinking,推理中可调用工具)→ Opus 4.5(Effort 参数 low/medium/high)→ Opus 4.6/Sonnet 4.6(Adaptive thinking,模型自决是否深度思考)→ Opus 4.7(xhigh effort + Task Budgets)。
OpenAI 的 o 系列被迫在 2025 年底也把"推理 + 标准"合并到 GPT-5 系列——本质上是采纳了 Anthropic 的判断。这是 Anthropic 在产品哲学层面赢的一仗。
2024 年 11 月 25 日,Anthropic 发布 Model Context Protocol(MCP),基于 JSON-RPC 2.0,被业界比作"AI 的 USB-C"。它解决的是传统 N×M 集成困境——每个 LLM 应用都要为每个数据源单独写连接器,协议层的统一让这个矩阵变成 N+M。
关键采纳节点集中在 2025 年中:2025-03-26 OpenAI 全面集成,Sam Altman 公开表态"People love MCP";2025-04 Google DeepMind 集成;2025-05 Microsoft 全面集成至 Copilot Studio / Semantic Kernel / Azure OpenAI。规范陆续吸收企业级要求:OAuth 2.1 + PKCE、RFC 8707 Resource Indicators、CIMD 取代动态客户端注册。
最关键的一步在 2025 年 12 月 9 日:Anthropic 把 MCP 捐赠给 Linux Foundation 旗下新成立的 Agentic AI Foundation(AAIF)——由 Anthropic、Block、OpenAI 共同奠基,AWS、Google、Microsoft、Cloudflare、Bloomberg 提供支持。这是 OpenAI 与 Anthropic 第一次在协议层共同发起治理实体。
增长指标已经压不住:月度 SDK 下载量约 9700 万次(16 个月内),10,000+ 官方注册服务器(社区估算 16,000-18,000+)。2026 年 5 月,Anthropic 又在创意领域密集上线 8 个官方连接器(Blender、Autodesk Fusion、Ableton Live、Adobe Creative Cloud、SketchUp 等),标志 MCP 生态从"DevOps 工具集"向"跨专业领域操作系统"跨越。
捐赠的战略含义:Anthropic 用"放弃单家治理权"换取"事实标准地位"。当 MCP 不再是 Anthropic 的协议时,反而所有人都更愿意采用——但核心代码、维护者、文档生态依然由 Anthropic 主导,协议捐赠 ≠ 影响力让渡。
当所有人都在读你的代码、调用你的协议时,
你的设计模式就是事实标准。 — Anthropic 公司全景系列 · 模型谱系与协议
2024 年 10 月 Claude 3.5 Sonnet v2 发布时,Anthropic 做了一件让人意外的事——业界首次商用 computer use。Claude 可以看屏幕截图、点鼠标、敲键盘、操作普通桌面应用,无需专门 API 集成。18 个月里 OSWorld 得分从 22.0%(3.5 Sonnet v2)到 61.4%(Sonnet 4.5)再到 72.5%(Sonnet 4.6),翻了 3.3 倍。
这条曲线的产品衍生:Claude in Chrome(2025-08)、Claude Cowork(2026-01,桌面端)、Claude for Excel(2026-Q1 beta,垂直办公)。Computer Use 是 Anthropic 跨越"API → 应用层"门槛的关键技术——没有它,Anthropic 只能做更好的 Chatbot;有了它,Anthropic 可以直接在用户工作环境里"接管"应用。
2026 年 4 月 Anthropic 发布 Mythos Preview——仅向 11 家网络安全/关键基础设施合作伙伴(AWS、Apple、Broadcom、Cisco、CrowdStrike、Google、JPMorgan Chase、Linux Foundation、Microsoft、NVIDIA、Palo Alto Networks)开放的研究预览。能力指标震动行业:数周内自主发现数千个零日漏洞,27 年 OpenBSD 零日、23 年 Linux、17 年 FreeBSD,单次利用成本 $50-$2,000、零人工干预。
Anthropic 官方表述是"too dangerous to release"——这一叙事本身就是营销:把 Mythos 与"普通 LLM"客户群隔离,定价 $20K/次扫描,与 Palantir / Booz Allen / Mandiant 的 B2G 工具直接对标。随后的 Project Glasswing 才是真正的战略动作:12 家核心合作伙伴 + 40 家扩展访问 + $1 亿使用额度。
白宫从恐惧到采购只用了约 3 周:Mythos 发布 + Cybench 100% 饱和 → 财长与美联储紧急召集华尔街 CEO → 2026-04-16 白宫向联邦机构开放 Mythos。转向逻辑很简单:限制政府使用 Mythos 不能让漏洞消失,只会让政府防御能力落后于已经能用类似工具的攻击者。
每一次 API 升级都伴随定价下调:Opus 4.5 把价格从 $15/$75 砍到 $5/$25(降幅 67%)。这是经典的 AWS 经济学——单位成本下降速度快于销量增长速度时,毛利反而扩大。Anthropic 一边靠模型能力上 SWE-bench 80%,一边靠定价让中型企业敢用 Opus,同时靠 Trainium / TPU 自研芯片压缩推理成本,两端剪刀差就是利润空间。
2025 年 6 月 Anthropic 工程博客发布了被业界广泛引用的研究:多 Agent 系统比单 Agent Claude Opus 4 在研究任务上提升 90.2%。关键模式是 Orchestrator-Worker:Opus 4 作为"领导者"分解任务,多个 Sonnet 4 作为 subagents 并行执行。更早的 2024 年 12 月《Building effective agents》定义了行业广泛引用的 5 种核心模式:Prompt chaining、Routing、Parallelization、Orchestrator-Workers、Evaluator-Optimizer。
配合 Harness Engineering 系列(Initializer Agent + Coding Agent + Generator-Evaluator 分离),Anthropic 把自家工程组的内部经验完整外化为行业最佳实践。关键洞察是反直觉的:
"让 Agent 评价自己的输出"是 Agent 质量退化的最主要来源之一。
所以需要 Generator + Evaluator 分离,让独立评估者而非生成者自我评价质量——这一观点在 2026 年 Q1 末几乎成为多 Agent 设计的共识。
Opus 4.7 SWE-bench Verified 87.6%,但 OpenAI GPT-5.5 已经 88.7%(晚 7 天发布)。2024 年初 Claude 3 Opus 与 GPT-4 的差距约 6 个月,2026 年中 Anthropic 与 OpenAI 的差距压缩到约 7 天——顶级模型的基准分数差异已经压缩到个位数百分点。
但 Anthropic 不靠"模型分数最高"竞争,它把价值往三层上移:协议层(MCP,捐给 Linux Foundation 后反而成为事实标准)、接口层(Computer Use / Agent SDK,提供模型的"操作系统接口")、应用层(Claude Code / Cowork,直接面向终端工作流)——这三层都比"模型层"门槛更高、迁移成本更大,当一个企业把 MCP 接入 Claude、把 Claude Code 装进开发流程后,模型层切换的成本就被层层放大。
Anthropic 已经过了"靠模型分数赢"的时代——它在赌协议、接口、应用三层叠加的复合锁定,比单纯模型领先更难被超过。
这一判断如果对,下一个十年的赢家就是建立操作系统位置的公司,而非每周发新模型分数的公司——这也是下一篇(安全护城河与操作系统化)要展开的主线。
谁掌握路网,谁就决定下一代 AI 应用怎么跑。