DEEPDIVE / [热点专题] · 文化观察 · 语言风格 DD · 0065 · 2026-07-24
CASEFILE · 语言风格 / 11 家厂商 · 178 篇官方 Blog / 2026-07-10 快照

AI 黑话指数

我们抓取了 OpenAI、Anthropic、Google DeepMind、Meta AI、Microsoft Research、xAI、Mistral,以及 Qwen、DeepSeek、智谱 GLM、月之暗面 Kimi 共 11 家厂商最新的 178 篇官方 Blog/资讯文章,跑了一遍可读性、黑话密度、词汇丰富度分析。结论有点反直觉:读起来「最轻松」的 DeepSeek,恰恰是黑话塞得最密的那家;文风最像学术论文的不是 DeepMind 之外的谁,而干脆就是 DeepMind 自己。

AI Buzzwords · DeepDive  |  2026-07-24  |  约 3,200 字 · 阅读 9 分钟  |  冯小平 + Claude
样本规模
178
英文 9 家 151 篇 · 中文 2 家 27 篇
最难读
16.3
DeepMind · Flesch-Kincaid 年级
黑话密度最高
40.3
DeepSeek · 每千词行业术语数
年度第一黑话
962
"agent" · 是第二名 eval 的 2.7 倍
§ 01 / 方法论

怎么量化用词复杂度

我们没有满足于「读起来感觉谁更晦涩」这种主观印象,而是写了一个统一的 Python 分析脚本,对每家厂商最新 10–20 篇官方文章(剔除导航栏、页脚、纯代码块和纯表格后的正文)跑三组指标。

可读性:Flesch-Kincaid Grade(对应美式学制年级,越高越难读)与 Flesch Reading Ease(0–100,越低越难懂),只适用于英文文本——中文没有成熟的等价公式。黑话密度:自建一份约 60 个英文 + 40 个中文 AI 行业高频术语词典(agent、RAG、mixture-of-experts、多模态、强化学习……),统计每千词出现的术语次数。词汇丰富度(TTR):不重复词数 / 总词数,越接近 1 说明用词越不重复。

样本规模因厂商而异:Mistral、xAI、Microsoft、DeepSeek 各 20 篇,Anthropic、DeepMind、Meta 各 15 篇,OpenAI 16 篇,智谱 GLM 15 篇,Kimi 12 篇,Qwen 因抓取时遭遇速率限制只拿到 10 篇——这些差异和更细的局限,见文末「局限性」一节。

§ 02 / 可读性

谁的 Blog 读起来最累

在能算出 Flesch-Kincaid 分数的 9 家英文厂商里,Google DeepMind 是最难读的(年级 16.3,相当于研究生阅读水平),紧随其后的是 Qwen(16.0)和 Meta AI(15.5)——三家的共同点是官方 Blog 里塞了大量长复合句和被动语态,读起来更像论文摘要而不是新闻稿。反过来,DeepSeek(11.1)、xAI(12.3)、Mistral(12.5)读起来「最轻松」,但这里要打一个问号——DeepSeek 没有真正的博客,我们抓到的是 API 文档站更新公告和 GitHub README,这类文本习惯用短句和列表堆信息,天然拉低年级分数。

Flesch-Kincaid 可读性年级 · 越高越难读9 家英文厂商
Google DeepMind
16.3
Qwen
16.0
Meta AI
15.5
Microsoft Research
15.0
OpenAI
14.5
Anthropic
13.4
Mistral AI
12.5
xAI
12.3
DeepSeek*
11.1

* DeepSeek 无真正博客,样本为 API 更新公告 + GitHub README,文体特殊,见正文说明。

一句话对比更直观。Google DeepMind 的一句话是这样的:「For example, if a robot was asked, 'Based on my location, can you sort these objects into the correct compost, recycling and trash bins?' it would need to search for relevant local recycling guidelines on the internet, look at the objects in front of it and figure out how to sort them based on those rules — and then do all the steps needed to completely put them away.」——69 个词,读者要在脑子里挂住五六个从句才能读完。同一批样本里,DeepSeek 的句子是这样的:「Rivals Gemini-3.0-Pro.」「128K context for both.」「Enhanced capabilities.」「Reduced hallucinations.」——四句加起来不到 20 词的电报体。但请注意,这四句短句里 "context"、"hallucinations" 本身就是黑话——这正是下一节要说的问题。

§ 03 / 黑话密度

谁把黑话讲得最密

这是全篇最反直觉的一张图。DeepSeek 的黑话密度全场最高(40.3‰,每千词出现约 40 次行业术语),是密度最低的 Kimi(6.1‰)的近 7 倍。紧随其后的是 Qwen(33.3‰)和 Microsoft Research(32.7‰)——三家的共同点,是它们的「官方文字」本质上更接近技术团队写给同行看的文档,而不是公关团队写给大众看的通稿。

黑话密度 · 每千词术语出现次数11 家厂商全量
DeepSeek
40.3‰
Qwen
33.3‰
Microsoft Research
32.7‰
Google DeepMind
14.8‰
智谱 GLM
13.1‰
OpenAI
13.9‰
Anthropic
11.2‰
Kimi
6.1‰

对照上一节的可读性排名会发现一个有意思的错位:DeepSeek 读起来最「简单」,但黑话最「密」——短句 + 高密度专业名词,语法上不费力,但对不熟悉这个领域的人来说信息密度反而更高,是一种典型的「电报体」写法。想象一下:「V4-Pro 采用 DSA 稀疏注意力,1M 上下文默认开启,Agentic Coding 首次超越闭源 SOTA」——每个词都认识,连起来才发现全是黑话。

Microsoft Research · 单句 6 个术语

"Memora sets new state-of-the-art on LoCoMo and LongMemEval, outperforming Mem0, RAG, and full-context inference while using up to 98% fewer context tokens."

Anthropic · 同类产品发布,几乎不需要翻译

"The reliability and safety we've prioritized in building Claude, paired with UST's experience in governance and regulated delivery, enables this work to move out of a pilot and into the systems that run a business."

三句话说的都是「我们的技术很强/很可靠」,但 Microsoft 和 Qwen 选择用行业黑话直接证明,Anthropic 选择用「可靠性」「治理经验」「从试点走向生产系统」这类普通商务读者也能秒懂的词——同一件事,两种完全不同的「翻译成本」分配方式。

§ 04 / 统计陷阱

词汇丰富度:是真丰富,还是文章太短

TTR(Type-Token Ratio,不重复词数 / 总词数)榜单上,DeepSeek(0.642)、xAI(0.560)排在最前,看起来像「用词最讲究、最少重复」。但这个指标有一个众所周知的统计陷阱:文章越短,不重复词的比例天然越高——一篇 200 字的公告很难出现同一个词说三遍,一篇 1600 字的深度技术解读则几乎必然反复提到 "model"、"agent"、"benchmark" 这些核心词。

把 TTR 和篇幅放在一起看会更清楚:DeepSeek(平均 233 词/篇)、xAI(399 词/篇)、Kimi(447 词/篇)恰好是样本里文章最短的三家,TTR 也确实排在前列——这更像是长度造成的统计假象,而不是真的「遣词造句更丰富」。相反,Microsoft Research(1579 词/篇,TTR 0.392)和 OpenAI(1466 词/篇,TTR 0.393)的 TTR 垫底,恰恰是因为文章够长,核心术语被迫反复出现。如果一定要在控制长度的前提下比较,字数相近的 Anthropic(943 词)、Mistral(948 词)、Meta(967 词)三家 TTR 也非常接近(0.45 上下),说明同等篇幅下用词多样性其实旗鼓相当。

§ 05 / 年度热词

"Agent" 统治一切

把 9 家英文厂商的黑话词频合并统计,结果毫无悬念——"agent" 一个词出现了 962 次,是第二名 "eval"(359 次)的 2.7 倍。不管是 OpenAI 的 Agentic 工作流、DeepMind 的多智能体安全研究,还是 Meta 的品牌案例,几乎每家都在拼命证明自己「最懂 agent」。

英文热词 Top 6 · 9 家合计出现次数
agent
962
eval
359
token
187
RAG
180
benchmark
179
agentic
159

中文两家合并统计后,热词榜首是「推理」(118 次)、「多模态」(52 次)、「工具调用」(30 次)——和英文榜单的 "agent / eval / token" 体系明显不是同一套话语:中文更强调「推理」「多模态」这类能力描述词,英文更强调 "agent"、"eval" 这类产品/评测范式词,侧面印证了中英文 AI 圈子在术语选择上的分化。

§ 06 / 文风画像

11 家厂商,一句话画像

  • OpenAI长文叙事派,篇幅第二长(1466 词),可读性中等偏难,"agent/eval" 是绝对主角。
  • Anthropic黑话密度全场最低的西方大厂,读起来最像严肃新闻通稿,安全/政策议题拉高了叙述完整性。
  • Google DeepMind全场最难读(研究生年级),研究论文既视感最强,几乎不迁就非专业读者。
  • Meta AI案例研究体,大量「某医院/某机构用 SAM 做了什么」的合作故事,黑话密度中等偏高。
  • Microsoft Research样本里最长(1579 词)+ 黑话密度西方第一(32.7‰)——本质是因为微软没有统一的公司 AI 博客,用的是 Research Blog,天然更学术。
  • xAI两极分化:融资/合作公告一句话打发,模型发布长文又极度技术流,风格反差全场最大。
  • Mistral AI句子最短的欧洲代表(18.6 词/句),产品发布节奏快、文字利落。
  • Qwen英文技术博客画风,接近 arXiv 论文导读,黑话密度中国厂商里最高(33.3‰)。
  • DeepSeek没有博客,靠 API 更新日志和 GitHub README 拼凑样本,句子最短但黑话密度全场第一,「电报体」典型代表。
  • 智谱 GLM中文厂商里最长文(1226 字),技术报告气质浓厚,但黑话密度反而中等偏低。
  • Kimi中文厂商里最「轻」,内容藏在开发者平台产品笔记里而非独立博客,黑话密度全场最低。
§ 07 / 局限性

这不是语料学论文

这份测评是一次基于真实抓取数据的横向参照,不是能发论文的语料库语言学研究,几点局限需要读者知晓:

体裁不完全对等:Microsoft 用的是 Research Blog(学术向),Qwen 用的是 GitHub Pages 技术博客,DeepSeek 根本没有博客,Kimi 的中文内容主要来自开发者平台产品笔记——这些和 OpenAI/Anthropic/DeepMind 相对统一的「公司新闻页」不是同一种文体。黑话词典是自建的一份约 100 项中英文术语清单,覆盖面有限,用的是子串匹配,跨语言绝对值不建议直接比较。Flesch-Kincaid 用的是启发式音节估算,不是学术标准方法,绝对数值会有偏差,但厂商间相对排序参考价值仍然成立。TTR 对文章长度高度敏感,本文没有做长度归一化,请勿脱离篇幅单独解读。样本量不统一(10–20 篇不等),且都是 2026 年 7 月上旬的一次快照,厂商博客风格会随产品周期调整而变化。

黑话密度,是能力的信号还是护城河的信号?

回到开头那个反直觉的发现——DeepSeek 读起来最轻松,黑话却塞得最密。这背后其实是一个更大的问题:当一家厂商的「官方 Blog」其实是写给同行看的技术公告,而不是写给公众看的品牌叙事,黑话密度衡量的就不是「这家公司多爱用行话」,而是「这家公司有没有一支公关团队去把黑话翻译成人话」。中国大模型厂商普遍缺乏西方意义上的 corporate blog 传统,这究竟是公关成熟度的差距,还是不同技术传播文化下的正常分野——这是留给读者自己判断的问题。

同样是「我们发布了新技术」,翻译成本各不相同
方法论和数据可复用——想用同一套脚本测别的厂商、别的时间窗口,脚本与原始数据见文末