§ 01 / 起点

一个用短剧探针的调研报告,
自己指出了自己的问题

起点是一份第三方调研报告,提议用"真人短剧 vs AI短剧"的用词差异来预测大众说话风格的演变。这份报告很诚实地做了自我批判:短剧是高度程式化的"舞台口语",观众看剧到内化台词这条因果链从没被验证过,而且题材、受众、制作流程三重因素混在一起,测出来的用词差根本说不清是不是AI污染。

报告自己给出了修正方向——换一个更干净的探针,直接追踪AI生成内容向人类语言扩散的路径。这份研究执行了这个建议,把探针换成了同一条新闻本身沿媒体传播链的扩散过程:AI实验室官方发布 → 专业科技媒体 → 中文AI垂类自媒体 → 社交/短视频平台,四层追踪同一个事件,从根本上消除了短剧探针的题材混淆问题。

§ 02 / 设计

四层链路,
同一事件配对

Tier0是实验室官方发布(OpenAI/Anthropic/Google DeepMind的Blog,DeepSeek/阿里通义/智谱/腾讯的官方渠道);Tier1是专业科技媒体(TechCrunch/The Verge/Ars Technica,或极客公园/财新/36氪);Tier2是量子位一类的AI垂类自媒体;Tier3是抖音、小红书、微博、B站上的社交/短视频扩散,经TikHub API抓取。

四个研究问题:AI用词指纹密度是否随层级单调变化(RQ1);下游文本相对上游是逐字引用还是独立改写,这个"复述距离"是否和AI味相关(RQ2);具体数字(参数量、跑分、价格)沿链条是否退化(RQ3);AI味/夸张度是否影响互动量、评论区是否出现"一眼AI"式反噬(RQ4)。

数据抓取有一条硬规矩:不用任何会先经过小模型摘要改写的抓取工具——包括WebFetch。因为测的就是LLM污染程度,用一个LLM工具去抓原始语料,等于在测量基线里先偷偷掺了一层未被记录的AI改写。所有网页正文改用原始HTTP请求+trafilatura抽取,遇到反爬机制(Cloudflare人机验证、36氪的拖拽拼图验证)一律不绕过,直接记为不可用数据源。

§ 03 / 扩样

从12个事件到29个,
从353篇到1,040篇

试点版覆盖12个事件(2025年11月-2026年8月,7英文+5中文)。扩展版新增17个事件,往两个方向拉:加入此前没覆盖的实验室(xAI Grok 4、Meta Llama 4、Mistral 3、Moonshot Kimi K2/K3、MiniMax M2、百度文心5.0、Amazon Nova 2、Perplexity Sonar API),以及拉长时间窗口到更早的同实验室事件(GPT-5/5.1、Claude Opus 4.5/Sonnet 4.5、Gemini 2.5 Pro、DeepSeek V3.2、Qwen3初代、GLM-4.6)。时间跨度从6-9个月拉到20个月。

层级v1试点v2扩展说明
Tier0 官方博客9篇29篇用真实浏览器会话找回全部OpenAI官方博客
Tier1 科技媒体19篇52篇
Tier2 垂类自媒体15篇36篇
Tier3 社交/短视频210条823条每平台Top15,v1为Top5
种草笔记补充样本100条100条未扩,见§05
合计353篇/条1,040篇/条约22.8万词

加深Tier3采样深度(Top5→Top15)不增加API调用成本——TikHub单次搜索本身就返回15-20条原始结果,试点只用了前5条。真正花的是找回被拦截信源的功夫:用真实浏览器会话(复用已登录状态,不是headless伪装)重试此前被403的URL,OpenAI全部5篇官方博客、Meta AI Blog、Perplexity官网都正常渲染,没有出现任何人机验证挑战——说明当初的403只是针对默认请求头的简单UA拦截,不是需要"破解"的强反爬。但36氪的部分页面在真实浏览器下触发了明确的拖拽拼图验证,截图确认后,本研究选择不解,直接记为不可用数据源。

§ 04 / 核心结果

什么站住了,
什么没有

RQ1 · 指纹密度峰值在信源,方向成立,幅度下修方向成立

19个英文事件里,官方博客(Tier0)的AI用词指纹密度均值1.59/千词,专业媒体转述后(Tier1)降到0.94/千词,下降41%(Wilcoxon p=0.125,19个事件里方向高度一致,但仍未过0.05)。试点时n=4,看起来是暴跌73%,现在看那更像是小样本方差的夸张效应。

AI用词指纹密度按层级对比图
图1 · 英文Tier0→Tier1、纯中文Tier1→2→3的AI用词指纹密度(v2扩展数据,n=19 / n=9事件)
数据来源:本研究原始数据(data/processed/stats_summary.json,未公开发布,见文末说明)

试点阶段n=7算出来的ρ=-0.80,p=0.03,扩到n=22后变成ρ=+0.16,p=0.47——方向反转,原结论不成立。

RQ2 · 复述距离与AI指纹密度的相关性 未复现

试点阶段基于7个事件,观测到"Tier2→Tier3复述距离越大、Tier3的AI指纹密度越低"的强负相关,据此推翻了原报告"自媒体是找LLM洗一遍稿"的猜测。把事件数扩到22个后,相关系数不仅衰减,方向还反转成弱正相关,且远未达显著。诚实的结论是:现有数据不支持复述距离和AI指纹密度之间存在任何稳定的线性关系,无论是原报告猜测的正相关,还是试点观测到的负相关。

RQ3 · 数字保真度沿链条走弱,但趋势比想象中弱

以Tier0公布的参数量、跑分、价格等"显著数字"为基准,下游各层保留比例的跨事件趋势检验:试点n=25观测,ρ=-0.27,p=0.19;扩展后n=77观测,ρ=-0.13,p=0.28——方向没变,但强度进一步减弱。一个站得住的定性模式是:技术参数越密集的信源(比如Qwen3.7那种25分钟、192个数字的长博客),下游保留率被稀释得越狠;而只公布几个关键数字的信源(比如DeepSeek-V3.2-Exp),保留率能到50%以上。

夸张标题带来更高互动量——这条几乎不需要证据的常识,在823条数据上也没能站住。

RQ4 · 夸张词密度与互动量的相关性 未复现

夸张煽动词密度分组与Tier3内容平均互动量对比图
图2 · 夸张词密度分组 vs Tier3平均互动量(v2扩展,n=823,ρ=0.04,p=0.29,不再显著)
数据来源:本研究TikHub抓取数据,抖音/小红书/微博/B站

试点用210条数据算出p=0.009的显著正相关;扩到823条后掉到p=0.29。AI用词指纹密度与互动量始终无关(试点p=0.84,扩展p=0.34,两版一致),这个空结果反而是本研究里最稳健的发现之一——可以比较有信心地说,至少在这批语料里,"AI腔"不影响传播效果。

评论区"一眼AI"反噬:325条评论,真阳性0

把评论样本从11个视频220条扩到21个视频325条,扫描"一眼AI/AI写的/没人味"等词后出现4条疑似命中,逐条复核发现全部是"尴尬流汗"表情包触发了过宽的"尬"字匹配——没有一条评论真的在说这文案是AI写的。抽查实际评论发现,观众在"AI大模型新闻"类视频下讨论的是DeepSeek和OpenAI的价格战,压根不关心文案风格。这个反噬现象很可能是体裁特定的,不是大众对AI写作风格的普遍排斥。

§ 05 / 扩展模块

种草笔记:
唯一"转正"的发现

额外采集了5个数码品类(手机/耳机/笔记本电脑/智能手表/相机测评种草,100条笔记)的小红书数据,和主实验Tier3中同平台的AI新闻类笔记做体裁对照,检验"污染程度更多是内容类型的属性,还是平台的属性"。

v1试点v2扩展
AI新闻类笔记样本量n=58n=309
AI指纹密度:种草 vs AI新闻笔记p=0.28 不显著p=0.013 显著
夸张词密度:种草 vs AI新闻笔记p=0.056 边缘显著

同一平台上,种草笔记的AI用词指纹密度显著更高,AI新闻反应类笔记的夸张煽动词密度更高(边缘显著)——这支持"内容体裁比平台本身更能预测污染模式"。也说明不是所有试点发现在扩样后都会消失,有的会像这里一样从"趋势"变成"显著",区别往往在于原始效应是否真实存在。

§ 06 / 局限与方法论

关键词法本身
有系统性偏差

人工交叉核验发现两类明显误判:DeepSeek官网的电报体changelog几乎没有修辞堆砌,人工判断高度人类原生,但技术性用词偶然命中词表,测得指纹密度反而是全样本第二高(假阳性);Anthropic官方博客的通用商务文案感很明显,但用词不在60词词表内,测得指纹密度为0(假阴性)。这印证了中文自媒体"去AI味"军备竞赛会让纯关键词法系统性低估污染水平这一预判——纯关键词密度不能单独作为污染程度的结论性证据

反噬关键词表也暴露了同样的精度问题:单字"尬"把"尴尬流汗""尬笑"这类无关表情包用语误判成了"AI味"指控。未来应改用更长的短语匹配或分类模型。

本研究是观测性设计,即便扩到29个事件仍远小于强因果推断所需的规模,所有结论应视为探索性发现。本次扩样最重要的方法论教训:多数统计检验的p值和相关系数在n<10时极不稳定,任何"惊喜的显著结果"都该被当成假设,直到在独立或更大样本上复现——包括这份报告自己v1版本里那两个后来被推翻的发现。

§ 07 / 后续

还值得挖的
几个方向

训练数据/模型坍缩反馈闭环——如果AI实验室官方发布文案本身已是"污染源头",而这些文案又会被爬虫抓去训练下一代模型,"AI污染AI自己发布的公关文案"可能是比"AI污染大众语言"更容易被忽视的一条反馈回路,但需要训练基础设施才能验证。

种草笔记的AI生成占比值得独立扩到更多品类、更大样本,结合平台官方AIGC标注做校准。中文纵向语料的"AI词渗透"追踪目前仍是学界空白,本研究的方法论(同语言相邻层相似度+数字保真度+LLM裁判交叉验证)可以直接复用,只是要把横截面的事件样本换成纵向的季度追踪语料。