EP.36 · 2025-05-09
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 5 月当时的判断,未按后来的发展修改。
2025-05-09 · 62 分钟 · 逐话题

「你可以定制,但要遵守未来的全球标准

OpenAI 推了个面向国家的计划:帮伙伴国建数据中心、数据留在境内、可以定制自己的 ChatGPT。听起来很主权,但每一段落到最后都会绕回同一句——respecting future global standards。你可以定制,但要遵守未来的全球标准。

本期话题
  1. OpenAI for Countries:定制,但要守未来的标准
  2. Prover V2 的套路:用验证器造 CoT 数据
  3. 语音生成的情绪,已经相当能骗人了
  4. agent 需要自己的前端
  5. 让 AI 操作安卓手机:七个任务跑通三个
01

OpenAI for Countries:定制,但要守未来的标准

这个计划的关键词密度很高——通篇都是「民主 AI」。本质上做的是主权大模型这门生意:给伙伴国建数据中心,把数据放在对方自己的管控范围内,每个国家可以定制自己的 ChatGPT。

但每一段的结尾都会绕回同一句话:respecting future global standards——你虽然可以定制,但要遵守未来的全球标准。

而「未来的全球标准」由谁来定,文件里没说。

02

Prover V2 的套路:用验证器造 CoT 数据

DeepSeek 的数学证明模型走的还是熟悉的路子,但前半段值得拆开看:

把数学任务分解,借助形式化工具做严格的 verifier;通过验证的部分再用 V3 改写成带 CoT 的证明——这样攒出一个高质量的、用于强化学习的 CoT 数据集。

接着把这批 CoT 数据和大量非 CoT 数据合在一起,在 V3 base 上用 GRPO 做强化学习,得到 671B 版本的 Prover V2。整体思路和 R1 很像,差别在于前半段的数据是靠「可自动验证的任务 + 验证器」造出来的。

最后是老套路:把 671B 蒸馏成 7B 版本,两者能力都不弱。

03

语音生成的情绪,已经相当能骗人了

测了一轮带情绪的语音生成。念新闻稿的效果就很稳;要求「生成一段很戏剧化的」,出来的东西低沉、带着一丝不易察觉的颤抖,情绪层次相当足。

顺带一个产品细节的吐槽,做对话类产品的都该注意:用户在输入法里按回车是想换行,不该被直接当成提交事件触发推理。这个细节 Google 那边处理得就比较好。

04

agent 需要自己的前端

一个越来越清楚的判断:agent 需要属于自己的前端。

而这个前端绝对不是为了炫技、为了表明「我的模型多聪明」——那件事对最终用户根本不重要,只对模型厂商重要。

05

让 AI 操作安卓手机:七个任务跑通三个

拿一个让 AI 控制安卓手机的开源项目做了实测,接了一圈模型——OpenAI、DeepSeek、GLM 等等。

结果挺惨:只跑通了三个任务。

两个原因都存在:一方面项目本身还不够强;另一方面也确实反映了模型能力——即便是 OpenAI,对国内很多中文应用的支持也比较差。

这类实测的价值就在这里:榜单上的分数和「能不能真的把手机上的活干完」,中间隔着很远。

每周 AI 情报 · AI Buzzwords · EP.36 · 2025-05-09 · 1 小时 2 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾