EP.65 · 2025-12-12
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 12 月当时的判断,未按后来的发展修改。
2025-12-12 · 72 分钟 · 逐话题

一年趴在 5% 以下的那张榜,半年冲到了 50 分

这期有一张涨得很吓人的曲线:一道专门设计成「人觉得简单、AI 觉得很难」的题,主流模型整整趴在 5% 以下大半年,从年中开始一路冲到 40、50 分。

本期话题
  1. AI 开始席卷地摊生意
  2. 那张智力测试榜,半年从 5% 冲到 50
  3. 这一周还在发生的几件事
01

AI 开始席卷地摊生意

有人列了一批例子,说 AI 正在席卷地边摊。第一个是 AI 调香:报上你的名字和 MBTI,它给你调一款「适合你」的香。纯粹的情绪价值,但吸引力是真的。去电商平台搜一下,确实有专门做这个的,还自己做了 App——把 MBTI 和偏好扔进去,后面大概率就是跑一遍模型,出一个几种香的配比。

准不准根本不重要,买个开心就行。

另一个是 AI 手串。这个领域的特点是:一,很赚钱;二,极其不透明——每颗珠子到底值多少钱,没有任何市场参考价,怎么搭配、配方怎么讲究,也全靠说法。这种「定价靠叙事」的行业,恰恰是最容易被 AI 生成的叙事接管的。

02

那张智力测试榜,半年从 5% 冲到 50

这套评测的思路是:给你左边一个图和它的答案,再给你一个新图,问答案是什么,本质是智力测试题。宗旨就是「对人相对简单,对 AI 很难」。

曲线是这样的:今年年中以前,主流模型基本都趴在 10% 以下,很多在 5% 以下。从年中开始猛涨——两周前发的一个版本拉到三十几分、接近 40;另一个拉到 40 出头、45;还有号称能到接近 50 的。

升级版的题上,最高跑到了 52.9 分。

涨得太快,直接产生了连锁反应:据说有个版本本来还想再往后推一推,是被这张榜逼着提前发的。

相关信源
03

这一周还在发生的几件事

硬件侧:H200 的出口被放开。

效率侧:推理效率被单独拎出来讲——同代模型之间,效能差距在变大而不是变小。

提示词侧:有研究发现,「你是某某领域专家」这类人设提示词,在困难的事实性问题上并不能提升准确率。这是个挺反直觉、但对日常用法很有用的结论。

相关信源
  • 专家人设提示词并不能提升困难事实性问题的准确率 — 宾夕法尼亚大学沃顿商学院 当期信源清单
  • OpenRouter · State of AI 当期信源清单
每周 AI 情报 · AI Buzzwords · EP.65 · 2025-12-12 · 1 小时 12 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾