EP.33 · 2025-03-21
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 3 月当时的判断,未按后来的发展修改。
2025-03-21 · 41 分钟 · 逐话题

比起「agentic」,predictive agent 这个词实在得多

这期有个用词上的辨析值得记:大家都在说 agentic,但这个词很虚;相比之下 predictive agent 实在得多——它明确要求最终产出的洞察必须严谨地绑定回最初的业务目标。冲着业务目标去的 agent,和「能自主行动」的 agent,不是一回事。

本期话题
  1. 榜单上的两个变化
  2. agentic 很虚,predictive agent 不虚
  3. 推特上开始流行「@ 一下模型,问这是不是真的」
  4. 一个把工程案例讲透的开源仓库
  5. Gemini 的 Canvas:比 Artifacts 快很多
01

榜单上的两个变化

Chatbot Arena 上头几名变化不大,仍是 Grok 3、GPT-4.5 和 Gemini 2 那一档(Grok 3 的 preview 版和正式版这次合并了)。

两个值得注意的:Cohere 的 Command A 性能比不过 R1、也不如 V3,但它体量小,而且在安全性、企业级隐私上做了大量对齐,靠这个占住了位置。

另一个更意外:腾讯混元刚发的 0226 版本,跑分基本和 GPT-4 没什么差别了。这种后发跟进的能力还是挺强的。

02

agentic 很虚,predictive agent 不虚

有两篇讲 agentic enterprise 的文章,用单 agent 和多 agent 去组织企业工作。看看就好——技术上没有实质变革,讲的多半是管理层面的事。

但里面有个词值得单拎出来:predictive agent

它比 agentic、比泛泛的 agent 都更有实际意义,因为它有硬约束:最终产出的洞察,必须严谨地绑定回最原始的业务目标。冲着业务目标做的 agent,和「能自主行动」的 agent,完全是两件事。

03

推特上开始流行「@ 一下模型,问这是不是真的」

最近推特上一个新习惯:在某条推文下面 @ 一个模型,问 is this true

比如有传言说某位政客将公布加密资产零资本利得税的政策,下面就有人直接 @ 模型求证。

事实核查这件事,正在从「去某个网站查」变成「在原地把模型叫过来」。

04

一个把工程案例讲透的开源仓库

有个开源 repo 收了大量端到端案例——LaTeX 的 OCR、写书的工作流等等,每个都一步步教你怎么做。

作者会在推特上卖配套的课,但代码本身是开源全放的。想补工程实践,这个仓库挺值得刷。

05

Gemini 的 Canvas:比 Artifacts 快很多

上周还在说 Gemini 能生成图片,这周它就把标准功能里加上了 Canvas——和 Artifacts 是一个思路,直接生成 Web 应用。

两个实测感受:速度比 Artifacts 快很多生成出来的应用风格做得挺好,而且很一致。同期它也把不少新模型一起放进了 Gemini 的入口里。

每周 AI 情报 · AI Buzzwords · EP.33 · 2025-03-21 · 41 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾