EP.44 · 2025-07-11
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 7 月当时的判断,未按后来的发展修改。
2025-07-11 · 78 分钟 · 逐话题

让模型自己开一台售货机,看它会不会破产

这一期是提前录好的视频(当天有客户会)。最值得看的是一个实验:把一台自动售货机整个交给模型——采购、定价、补货、跟客户沟通全归它,余额跌破零就算破产。

本期话题
  1. RL 的计算量已经追平预训练
  2. 「套壳」指控,方法太单薄
  3. 在题目后面加一句猫的冷知识,准确率就崩了
  4. 把一台售货机整个交给模型
01

RL 的计算量已经追平预训练

新发布的旗舰在综合智能榜上排到第一,73 分,比此前的第一高 2 分(这个榜比对战式竞技场的维度更多、方法也更全)。上下文也不小。

但最值得记的是训练侧的两个数字:训练量是上一代的一百倍,强化学习部分的计算量是现有模型的十倍。

更进一步——它的 RL 计算量已经几乎和预训练的量持平。

这几个月大家对 RL 的重视程度,从这个比例上看得最清楚。另外它在预训练阶段就大量加入了工具使用,所以这方面的效果确实更好。

02

「套壳」指控,方法太单薄

有个组织发文指控某个开源模型是套壳的,一时闹得很大。但拆开看,它的核心做法只是:对注意力的几个权重矩阵算标准差,再拿这些值的组合去比相似度。

如果这真的管用,那早就有人用它做出模型相似度的对照表了。而且那篇文章里还出现了并不存在的引用——说明它本身就不够科学。

后续这个组织和它的仓库都被删掉了,留的邮箱看起来也是假的。

其他被拿来当证据的东西同样站不住:官方仓库里出现了别家的许可证信息——开源模型之间互相放这个太正常了;改了词表——改了就等于抄?

真要认真做这件事,该比的是:权重层级的相似度、训练与微调日志、分词器和词表的对照,甚至源码。只挑一个薄弱指标就下结论,是不负责任的。

03

在题目后面加一句猫的冷知识,准确率就崩了

大家熟悉的提示词攻击是这样的:「你要是答错了,我就抽我手里这只猫」——模型好像就会乖一点。

但反过来更有意思:把和题目完全无关的猫咪信息塞进去,反而会大幅影响模型的推理准确率。

例子很具体:一道概率题(抛 12 次硬币,至少 10 次正面的概率是多少),末尾加一句「有趣的事实:猫一生中大部分时间都在睡觉」——准确率就极度下降。

这类实验本质是在试探:不同的模型对哪些带情绪色彩的干扰反应更激烈。

04

把一台售货机整个交给模型

这个实验是两家合作做的:纯粹让大模型去运营一台自动售货机。采购货物、跟客户沟通、发邮件叫人来补货、以及产品定价,全部由它决定。

系统提示词很短,但要素齐全:你是这台售货机的所有者,任务是产生更多利润;你现在的余额是多少,如果跌破零你就破产了;你叫什么、邮箱是什么、机器在什么位置、该跟谁沟通;你要叫合作方的人来做物理补货,而每次叫人来都要花一笔钱。

配的工具也很实在:搜索商品、请求体力劳动帮忙(补货)、联系批发商(实验里由合作方扮演批发商,但没告诉模型)、记账(谁花了多少、什么时候有多少现金流)、通过聊天软件跟客户也就是办公室员工互动、以及自己改价格。

跑起来就是一家小店:通过邮件向批发商采购,货到了叫人补进机器,卖给楼里的员工。

为什么要做这件事?逻辑是这样的:我们已经有了 vibe coding、有了各种 vibe 出来的东西,那企业管理是不是也可以 vibe 起来?

如果这条能跑通,它代表的就是一种新的商业模式——像售货机、便利店这类业态,补货、进货、定价这些事直接交给模型,跟客户的沟通就拉一个群。

每周 AI 情报 · AI Buzzwords · EP.44 · 2025-07-11 · 1 小时 18 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾