这期有个很小但可以直接抄的产品细节:发布页别再堆 MMLU 这类基准名了,直接告诉读者这一项测的是「研究生级别的推理能力」还是「用工具的能力」。对企业客户来说,前者根本看不懂,后者一目了然。
3.7 Sonnet 这个模型很强,尤其是在 coding 领域。
顺带提一句它背后那套东西——Anthropic 的 Economic Index:他们做了一套能高度匿名化地分析所有 Claude 用户对话的技术,从真实使用中看人们到底拿模型干什么。这比任何问卷都可靠。
HuggingFace 发的 SmolVLM 2 系列有三档:256M、500M 和 2.2B。这个量级是真的可以跑在端侧了,而且效果出乎意料地好。
演示很扎实:定住一帧,问画面里有多少个物体、各是什么职务,能答;「帮我解释一下这本书是什么书」「这是个什么帽子」,也能答。这些全都跑在手机上——性能功耗够的话,跑到眼镜上也没问题。
视频理解也可以。最有意思的一个测试是指着两个杯子问「哪个是冲 espresso 的」,它答左边那个;再问牛奶在哪,也答对了。
Google NotebookLM 原创始团队里有人离职创业,做了个新产品。他们的判断是:现有产品形态是落后于先进能力的——模型能力已经到了,但让人能理解、能定制、能用起来的那层没跟上。
所以公司要做的就是这件事:让 AI 更容易被理解、定制和使用,而且明确要走开源开放的路子,方向上偏向 for science。具体做什么还没细说,但值得一直盯着。
同样值得盯的还有 Perplexity 那个浏览器产品。
有个开源项目做的是面试系统:定义各种语音和偏好、写 system prompt、再定义希望它问哪些面试问题以及深度和难度,然后生成一个链接就能开始面试。
这类项目的价值同样在提示词——把它的 system prompt 翻出来看,比读代码有用得多。
这是这期最值得直接抄的一条。大部分模型的发布页下面都堆着 MMLU 之类的名字——DeepSeek 官网首页也是这样。对企业客户来说这非常不友好:他根本不知道这些缩写是什么意思。
Anthropic 的做法是把基准名字淡化,直接告诉你这一项测的是什么:
「研究生级别的推理能力」「agentic 的编码能力」「使用工具的能力」「多语言问答」「视觉理解」「视觉推理」「指令遵循」——一下就人话了。
这个设计完全可以照搬:别扔 MMLU 这种缩写,直接说这项到底考验的是什么能力。