EP.30 · 2025-02-28
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 2 月当时的判断,未按后来的发展修改。
2025-02-28 · 56 分钟 · 逐话题

别再罗列 MMLU 了,直接告诉人这测的是什么能力

这期有个很小但可以直接抄的产品细节:发布页别再堆 MMLU 这类基准名了,直接告诉读者这一项测的是「研究生级别的推理能力」还是「用工具的能力」。对企业客户来说,前者根本看不懂,后者一目了然。

本期话题
  1. Claude 3.7 在 coding 上确实很强
  2. SmolVLM 2:视觉模型真的跑进端侧了
  3. NotebookLM 的前创始成员出来创业了
  4. 开源面试官:值得看的是它的 system prompt
  5. 把基准名字换成人话
01

Claude 3.7 在 coding 上确实很强

3.7 Sonnet 这个模型很强,尤其是在 coding 领域

顺带提一句它背后那套东西——Anthropic 的 Economic Index:他们做了一套能高度匿名化地分析所有 Claude 用户对话的技术,从真实使用中看人们到底拿模型干什么。这比任何问卷都可靠。

02

SmolVLM 2:视觉模型真的跑进端侧了

HuggingFace 发的 SmolVLM 2 系列有三档:256M、500M 和 2.2B这个量级是真的可以跑在端侧了,而且效果出乎意料地好。

演示很扎实:定住一帧,问画面里有多少个物体、各是什么职务,能答;「帮我解释一下这本书是什么书」「这是个什么帽子」,也能答。这些全都跑在手机上——性能功耗够的话,跑到眼镜上也没问题。

视频理解也可以。最有意思的一个测试是指着两个杯子问「哪个是冲 espresso 的」,它答左边那个;再问牛奶在哪,也答对了。

03

NotebookLM 的前创始成员出来创业了

Google NotebookLM 原创始团队里有人离职创业,做了个新产品。他们的判断是:现有产品形态是落后于先进能力的——模型能力已经到了,但让人能理解、能定制、能用起来的那层没跟上。

所以公司要做的就是这件事:让 AI 更容易被理解、定制和使用,而且明确要走开源开放的路子,方向上偏向 for science。具体做什么还没细说,但值得一直盯着。

同样值得盯的还有 Perplexity 那个浏览器产品。

04

开源面试官:值得看的是它的 system prompt

有个开源项目做的是面试系统:定义各种语音和偏好、写 system prompt、再定义希望它问哪些面试问题以及深度和难度,然后生成一个链接就能开始面试。

这类项目的价值同样在提示词——把它的 system prompt 翻出来看,比读代码有用得多。

05

把基准名字换成人话

这是这期最值得直接抄的一条。大部分模型的发布页下面都堆着 MMLU 之类的名字——DeepSeek 官网首页也是这样。对企业客户来说这非常不友好:他根本不知道这些缩写是什么意思。

Anthropic 的做法是把基准名字淡化,直接告诉你这一项测的是什么

「研究生级别的推理能力」「agentic 的编码能力」「使用工具的能力」「多语言问答」「视觉理解」「视觉推理」「指令遵循」——一下就人话了。

这个设计完全可以照搬:别扔 MMLU 这种缩写,直接说这项到底考验的是什么能力。

每周 AI 情报 · AI Buzzwords · EP.30 · 2025-02-28 · 56 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾