EP.74 · 2026-02-27
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2026 年 2 月当时的判断,未按后来的发展修改。
2026-02-27 · 71 分钟 · 逐话题

过一个年,那张榜从 60 多分直接干到 84.6

这张榜的曲线值得单独看一眼:去年年初还是个位数,年底到六十多分,大家已经觉得「半年涨一半太可怕了」。结果过了个年,一个月内直接 84.6。到这个分数,这张榜就算废了。

本期话题
  1. 一篇很长的研报,和用 deep research 读它
  2. 一个月涨 19 分,这张榜废了
  3. 把「把东西从一个房间搬到另一个房间」做成基准
  4. 「你们已经被踢出竞赛场,只是还不知道」
01

一篇很长的研报,和用 deep research 读它

一家金融机构写了篇超长的文章,讲全球性的智能危机。很值得读,但太长了。

有人跑了一个 deep research 版本来消化它,写得还不错。

顺带一个观察:那个 deep research 功能最近又变好用了。很久没用的人值得回去再试试。「用一个 agent 去读一篇读不完的长文」,正在变成一种常规动作。

02

一个月涨 19 分,这张榜废了

这张榜的分数曲线:2025 年初还在个位数;到年底,最好的模型能到六七十分——当时大家觉得半年涨一半已经很可怕了。

然后过了个年,一个月内直接干到 84.6 分,比前高涨了 19 分。

一旦到了 80 多分,这张榜就废了。

好在下一代马上就要上线(下个月 25 号)——旧榜在这个时点谢幕,时机刚好。当然这肯定不是故意安排的。

03

把「把东西从一个房间搬到另一个房间」做成基准

具身这边有个很朴素的思路:做一个极简的配送基准——从这儿拿到东西,转过去,交给一个人。就这么简单的一个过程。

目的是:用一个确定的任务测出现在的模型到底能做到什么程度。顺带也能回答另一个问题——「简单到只是把东西从一个房间挪到另一个房间」这种场景,能不能赚钱。

春节期间机器人确实大放异彩,但离赚钱还有些距离。

04

「你们已经被踢出竞赛场,只是还不知道」

这篇文章写得很好,指名道姓的对象是 SaaS 公司。

它的态度很不客气:无论你的 CEO 发了多少份 AI 备忘录、号称多少代码是 AI 写的、上了多少个聊天机器人——你们可能已经不在场内了。

被吐槽的是谁,大家心里都有数:满屏的 memo,CEO 自己也在用编码 agent 写程序,但这些都不构成「还留在牌桌上」的证据。

对这个行业能否继续维持统治,作者抱的是相当负面的看法。

每周 AI 情报 · AI Buzzwords · EP.74 · 2026-02-27 · 1 小时 11 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾