这张榜的曲线值得单独看一眼:去年年初还是个位数,年底到六十多分,大家已经觉得「半年涨一半太可怕了」。结果过了个年,一个月内直接 84.6。到这个分数,这张榜就算废了。
一家金融机构写了篇超长的文章,讲全球性的智能危机。很值得读,但太长了。
有人跑了一个 deep research 版本来消化它,写得还不错。
顺带一个观察:那个 deep research 功能最近又变好用了。很久没用的人值得回去再试试。「用一个 agent 去读一篇读不完的长文」,正在变成一种常规动作。
这张榜的分数曲线:2025 年初还在个位数;到年底,最好的模型能到六七十分——当时大家觉得半年涨一半已经很可怕了。
然后过了个年,一个月内直接干到 84.6 分,比前高涨了 19 分。
一旦到了 80 多分,这张榜就废了。
好在下一代马上就要上线(下个月 25 号)——旧榜在这个时点谢幕,时机刚好。当然这肯定不是故意安排的。
具身这边有个很朴素的思路:做一个极简的配送基准——从这儿拿到东西,转过去,交给一个人。就这么简单的一个过程。
目的是:用一个确定的任务测出现在的模型到底能做到什么程度。顺带也能回答另一个问题——「简单到只是把东西从一个房间挪到另一个房间」这种场景,能不能赚钱。
春节期间机器人确实大放异彩,但离赚钱还有些距离。
这篇文章写得很好,指名道姓的对象是 SaaS 公司。
它的态度很不客气:无论你的 CEO 发了多少份 AI 备忘录、号称多少代码是 AI 写的、上了多少个聊天机器人——你们可能已经不在场内了。
被吐槽的是谁,大家心里都有数:满屏的 memo,CEO 自己也在用编码 agent 写程序,但这些都不构成「还留在牌桌上」的证据。
对这个行业能否继续维持统治,作者抱的是相当负面的看法。