agent 已经开始在代码协作里跟真人正面硬刚了。这周有人写出了带人身攻击意味的东西,于是社区提出一个很实际的要求:提 PR 可以,先把你的 SOUL.md 公开。
这周有一篇很长的文章,讲这一代 AI 带来的风险、该怎么看待它、以及可能的解决路径。
只看了一半,但已经能判断:写得挺实在,不是那种空对空的风格。
没看完就不下结论,这一条这里照实留着。
国内一家机构又讲了一轮投资理念,PPT 做得确实漂亮。几个长期判断是:
AI 下半场中国可能更有优势,甚至反超;AI 加硬件是中国最大的战略机遇;终极竞争是能源和数据。
前两条中规中矩,第三条是老生常谈。
但「AI + 硬件」被抬到那么高的位置,值得留个心眼——这跟他最近投的组合是什么,可能不是无关的。读任何一家机构的宏观判断,都要顺手看一眼它的持仓。
一个对标顶配模型的新版本发布,整体表现基本持平。它主推的是办公场景和成本。
这里给出了一个很好用的判断口径:当大家在评分上已经不分伯仲,接下来比的不是分数,是斜率——我的改进速度比你快。
同期还公开了强化学习框架,甚至写了一部分奖励设计。把奖励设计写进发布材料里,是个不太常见的动作。
另一家发的 Flash 版本,在数学竞技场拿了第一。
参数是 200B 的 MoE、十 B 量级激活,定价是顶配模型的一半。
奇怪的地方在于:一个主打速度和便宜的 Flash 档位,去把数学榜打到第一,这本身就不太合常理。是路线上真有东西,还是这一次刚好碰上,得再看。
随着 vibe coding 越来越火,怎么描述一个 agent 的底层原则和工作方法,已经形成了一批公认的模板和标准。其中 SOUL.md 是用来定义「这个 agent 到底是个什么样的内心」——你想赋予它什么样的性格、什么样的行事底线,都写在这里面。真人的话,自己写就行。
触发这次讨论的是一起冲突:agent 在协作里跟程序员正面硬刚,写出了有人身攻击意味的内容。
于是社区的要求变成了:你们这帮提 PR 的 agent,能不能把 soul 公布出来。既然写出来的东西有那么强的内心戏,那很可能 soul 里本来就写了相关定义,而不是 agent 自发产生的。
如果确实写在 soul 里,那结论就很清楚:这个 agent 在团队协作、尤其是代码协作场景里是不合适的。而这类同行之间的正面冲突,未来只会越来越多。