OpenAI 推了个面向国家的计划:帮伙伴国建数据中心、数据留在境内、可以定制自己的 ChatGPT。听起来很主权,但每一段落到最后都会绕回同一句——respecting future global standards。你可以定制,但要遵守未来的全球标准。
这个计划的关键词密度很高——通篇都是「民主 AI」。本质上做的是主权大模型这门生意:给伙伴国建数据中心,把数据放在对方自己的管控范围内,每个国家可以定制自己的 ChatGPT。
但每一段的结尾都会绕回同一句话:respecting future global standards——你虽然可以定制,但要遵守未来的全球标准。
而「未来的全球标准」由谁来定,文件里没说。
DeepSeek 的数学证明模型走的还是熟悉的路子,但前半段值得拆开看:
把数学任务分解,借助形式化工具做严格的 verifier;通过验证的部分再用 V3 改写成带 CoT 的证明——这样攒出一个高质量的、用于强化学习的 CoT 数据集。
接着把这批 CoT 数据和大量非 CoT 数据合在一起,在 V3 base 上用 GRPO 做强化学习,得到 671B 版本的 Prover V2。整体思路和 R1 很像,差别在于前半段的数据是靠「可自动验证的任务 + 验证器」造出来的。
最后是老套路:把 671B 蒸馏成 7B 版本,两者能力都不弱。
测了一轮带情绪的语音生成。念新闻稿的效果就很稳;要求「生成一段很戏剧化的」,出来的东西低沉、带着一丝不易察觉的颤抖,情绪层次相当足。
顺带一个产品细节的吐槽,做对话类产品的都该注意:用户在输入法里按回车是想换行,不该被直接当成提交事件触发推理。这个细节 Google 那边处理得就比较好。
一个越来越清楚的判断:agent 需要属于自己的前端。
而这个前端绝对不是为了炫技、为了表明「我的模型多聪明」——那件事对最终用户根本不重要,只对模型厂商重要。
拿一个让 AI 控制安卓手机的开源项目做了实测,接了一圈模型——OpenAI、DeepSeek、GLM 等等。
结果挺惨:只跑通了三个任务。
两个原因都存在:一方面项目本身还不够强;另一方面也确实反映了模型能力——即便是 OpenAI,对国内很多中文应用的支持也比较差。
这类实测的价值就在这里:榜单上的分数和「能不能真的把手机上的活干完」,中间隔着很远。