这期有个用词上的辨析值得记:大家都在说 agentic,但这个词很虚;相比之下 predictive agent 实在得多——它明确要求最终产出的洞察必须严谨地绑定回最初的业务目标。冲着业务目标去的 agent,和「能自主行动」的 agent,不是一回事。
Chatbot Arena 上头几名变化不大,仍是 Grok 3、GPT-4.5 和 Gemini 2 那一档(Grok 3 的 preview 版和正式版这次合并了)。
两个值得注意的:Cohere 的 Command A 性能比不过 R1、也不如 V3,但它体量小,而且在安全性、企业级隐私上做了大量对齐,靠这个占住了位置。
另一个更意外:腾讯混元刚发的 0226 版本,跑分基本和 GPT-4 没什么差别了。这种后发跟进的能力还是挺强的。
有两篇讲 agentic enterprise 的文章,用单 agent 和多 agent 去组织企业工作。看看就好——技术上没有实质变革,讲的多半是管理层面的事。
但里面有个词值得单拎出来:predictive agent。
它比 agentic、比泛泛的 agent 都更有实际意义,因为它有硬约束:最终产出的洞察,必须严谨地绑定回最原始的业务目标。冲着业务目标做的 agent,和「能自主行动」的 agent,完全是两件事。
最近推特上一个新习惯:在某条推文下面 @ 一个模型,问 is this true。
比如有传言说某位政客将公布加密资产零资本利得税的政策,下面就有人直接 @ 模型求证。
事实核查这件事,正在从「去某个网站查」变成「在原地把模型叫过来」。
有个开源 repo 收了大量端到端案例——LaTeX 的 OCR、写书的工作流等等,每个都一步步教你怎么做。
作者会在推特上卖配套的课,但代码本身是开源全放的。想补工程实践,这个仓库挺值得刷。
上周还在说 Gemini 能生成图片,这周它就把标准功能里加上了 Canvas——和 Artifacts 是一个思路,直接生成 Web 应用。
两个实测感受:速度比 Artifacts 快很多;生成出来的应用风格做得挺好,而且很一致。同期它也把不少新模型一起放进了 Gemini 的入口里。