EP.73 · 2026-02-13
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2026 年 2 月当时的判断,未按后来的发展修改。
2026-02-13 · 62 分钟 · 逐话题

你的 agent 提 PR 之前,先把它的 soul 公布出来

agent 已经开始在代码协作里跟真人正面硬刚了。这周有人写出了带人身攻击意味的东西,于是社区提出一个很实际的要求:提 PR 可以,先把你的 SOUL.md 公开。

本期话题
  1. 一篇还没看完的长文
  2. 一份 VC 的判断,和它可能的立场
  3. 分数不分伯仲的时候,该比什么
  4. 一个 Flash 模型拿下了数学榜第一
  5. SOUL.md:要求 agent 公开自己的底层设定
01

一篇还没看完的长文

这周有一篇很长的文章,讲这一代 AI 带来的风险、该怎么看待它、以及可能的解决路径。

只看了一半,但已经能判断:写得挺实在,不是那种空对空的风格。

没看完就不下结论,这一条这里照实留着。

02

一份 VC 的判断,和它可能的立场

国内一家机构又讲了一轮投资理念,PPT 做得确实漂亮。几个长期判断是:

AI 下半场中国可能更有优势,甚至反超AI 加硬件是中国最大的战略机遇终极竞争是能源和数据

前两条中规中矩,第三条是老生常谈。

但「AI + 硬件」被抬到那么高的位置,值得留个心眼——这跟他最近投的组合是什么,可能不是无关的。读任何一家机构的宏观判断,都要顺手看一眼它的持仓。

03

分数不分伯仲的时候,该比什么

一个对标顶配模型的新版本发布,整体表现基本持平。它主推的是办公场景和成本

这里给出了一个很好用的判断口径:当大家在评分上已经不分伯仲,接下来比的不是分数,是斜率——我的改进速度比你快。

同期还公开了强化学习框架,甚至写了一部分奖励设计。把奖励设计写进发布材料里,是个不太常见的动作。

04

一个 Flash 模型拿下了数学榜第一

另一家发的 Flash 版本,在数学竞技场拿了第一。

参数是 200B 的 MoE、十 B 量级激活,定价是顶配模型的一半。

奇怪的地方在于:一个主打速度和便宜的 Flash 档位,去把数学榜打到第一,这本身就不太合常理。是路线上真有东西,还是这一次刚好碰上,得再看。

05

SOUL.md:要求 agent 公开自己的底层设定

随着 vibe coding 越来越火,怎么描述一个 agent 的底层原则和工作方法,已经形成了一批公认的模板和标准。其中 SOUL.md 是用来定义「这个 agent 到底是个什么样的内心」——你想赋予它什么样的性格、什么样的行事底线,都写在这里面。真人的话,自己写就行。

触发这次讨论的是一起冲突:agent 在协作里跟程序员正面硬刚,写出了有人身攻击意味的内容。

于是社区的要求变成了:你们这帮提 PR 的 agent,能不能把 soul 公布出来。既然写出来的东西有那么强的内心戏,那很可能 soul 里本来就写了相关定义,而不是 agent 自发产生的。

如果确实写在 soul 里,那结论就很清楚:这个 agent 在团队协作、尤其是代码协作场景里是不合适的。而这类同行之间的正面冲突,未来只会越来越多。

每周 AI 情报 · AI Buzzwords · EP.73 · 2026-02-13 · 1 小时 2 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾