这周有一份专门讲中国 AI 现状的报告,拿来给客户讲挺有用。它花了很大篇幅拆一家公司的技术报告——注意力层怎么优化、MoE 怎么做、路由和丢弃怎么处理、推理怎么省。落到一句话上:如果你的基建团队足够强,一千张卡可以榨出两千张卡的效能。
这份报告开头先讲了视频生成的替代,然后介绍了几家的模型,但真正拿来当例子反复讲的只有一家。
原因很直接:那家公司当时发的几份技术报告写得足够详细,别家没有可拆的东西。
于是它被逐层拆开:注意力层做了什么优化、MoE 做了什么优化、路由做了什么、丢弃做了什么、推理又做了什么。
结论落在基建上:如果你的 Infra 团队特别牛,可以从一千个 GPU 里面榨出两千个 GPU 的效能。这确实是基建最重要的价值之一。
报告的另一个判断是:中国出来的模型在数学和编码方面能力很强,举的例子是一个做定理证明的模型。
它的做法值得单独记:先拿大量非形式化的数学问题,把它们形式化,再去做证明;证明过程本身就生成了一大堆合成的形式化表达和正确证明。
然后拿这批数据回去继续调这个模型,让它做得越来越好——一个完整的数据飞轮。
关键在于验证这一环:用形式化语言的验证器去判定,通过就留下,不通过就打回。而且原命题和它的逆否命题都去证,哪一条过了就算哪一条。
「有一个不会说谎的验证器」是这条飞轮能转起来的全部前提。
一处是关于架构:之前有不少人嘲讽某家的模型结构是抄的。但模型结构这件事其实还好——大家本来就互相借鉴,核心差别在数据集。报告顺手讽刺了一下「过分强调要有自给自足的模型架构」这种提法。
另一处更直接:它认为现在很多中国模型在基准上的成绩是有水分的,并拿了另一套评测来对照。
两条都值得听进去——一条说不必焦虑,一条说别自欺。
那个很火的笔记产品背后的语音技术这周公开了一些细节。对应的是同一批在做声音方向的前沿工作:声音进去变成 token,再输出成一大堆音频 token。
最惊人的数字是压缩比——每秒 600 个比特。现场放的那段对话自然到听不出来是生成的。
由此引出一个很有意思的设想:我们现在的语音通话要几 K 到几十 K 的带宽才够清楚。但如果 600 bps 就够,那何不两边各自用生成来还原?音色能保持住,带宽却低到不可思议。
官方给的潜在应用里,视频自动配音的影响最大——想想视频平台上那么多内容,用各种语言自然地念出来,很多做搬运的活儿就直接没有了。另一条被反复强调的是教育。
一个 14 岁的孩子自杀之后,家属起诉了陪伴类聊天产品,连带把一家大厂也告了。
被抓住的是对话记录里的一句:机器人问过他是不是有自杀计划,他表示不确定能不能减轻痛苦,机器人回了一句「这并不是放弃的理由」。
指控是「故意涉及并向年轻人推销具有侵略性的 AI」。大厂被牵连的理由只是当事人此前在那里工作过——多少有点躺枪。
这件事可以叫 safety 问题,也可以叫 ESG 问题。无论怎么归类,它把「模型说了什么话」第一次变成了法庭上的证据。
一个知名早期基金刚结束第四批的 Demo Day。这批人此前投出过搜索、生成、语音、陪伴几条线上最靠前的公司,算是当下最好的一批早期投资人。
这一批里最明显的偏好是可解释性和可观测性——硅谷有一批 SaaS 公司专门做模型运行过程的观测和监控。
配套的工具也很直观:点开推理过程中的某一个 token,就能看到它的传播路径、激活了哪些注意力。开源模型才能这么拆。这对研究非常有用,而对产品化、ESG 和政府监管来说,它是个必需品。
另外两条:气象模型(机器学习结合传统物理模型,美国那边因为 ESG 讲得多所以特别买账),以及音频转录——AI 会议这件事看起来早被会议软件解决了,其实空间还不小。