这期有一张涨得很吓人的曲线:一道专门设计成「人觉得简单、AI 觉得很难」的题,主流模型整整趴在 5% 以下大半年,从年中开始一路冲到 40、50 分。
有人列了一批例子,说 AI 正在席卷地边摊。第一个是 AI 调香:报上你的名字和 MBTI,它给你调一款「适合你」的香。纯粹的情绪价值,但吸引力是真的。去电商平台搜一下,确实有专门做这个的,还自己做了 App——把 MBTI 和偏好扔进去,后面大概率就是跑一遍模型,出一个几种香的配比。
准不准根本不重要,买个开心就行。
另一个是 AI 手串。这个领域的特点是:一,很赚钱;二,极其不透明——每颗珠子到底值多少钱,没有任何市场参考价,怎么搭配、配方怎么讲究,也全靠说法。这种「定价靠叙事」的行业,恰恰是最容易被 AI 生成的叙事接管的。
这套评测的思路是:给你左边一个图和它的答案,再给你一个新图,问答案是什么,本质是智力测试题。宗旨就是「对人相对简单,对 AI 很难」。
曲线是这样的:今年年中以前,主流模型基本都趴在 10% 以下,很多在 5% 以下。从年中开始猛涨——两周前发的一个版本拉到三十几分、接近 40;另一个拉到 40 出头、45;还有号称能到接近 50 的。
升级版的题上,最高跑到了 52.9 分。
涨得太快,直接产生了连锁反应:据说有个版本本来还想再往后推一推,是被这张榜逼着提前发的。
硬件侧:H200 的出口被放开。
效率侧:推理效率被单独拎出来讲——同代模型之间,效能差距在变大而不是变小。
提示词侧:有研究发现,「你是某某领域专家」这类人设提示词,在困难的事实性问题上并不能提升准确率。这是个挺反直觉、但对日常用法很有用的结论。