这期有个很实用的信息卫生习惯:看到「AI 公开反抗人类」这类标题、配着天网剧照的文章,直接划走。真要判断,就顺着链条回到最原始那条推文,看研究者本人到底写了什么——多数时候和标题差得很远。
开源的数字人方案已经到了这个程度:给一张图片加一段音频,就能生成一小段说话或唱歌的视频。
边界也很清楚:动作幅度稍大或者比较特殊的动作,效果就一般;但短时长、动作幅度不大的场景,已经做得相当好了。
又一次印证了那个观察——视频生成这块,国内确实挺强。
当时炒得很热的一条:所谓 o3 开始公开反抗人类。
读法很简单:但凡看到配着天网剧照的这类文章,直接忽略就行。
然后顺着链条往回走——它源自一条推文,发布方是一家做安全研究的机构,看起来靠谱一些。那就直接去读原推,看研究者本人到底写了什么。
回到原文,往往会发现描述的现象和「反抗人类」这个说法之间,隔着好几层加工。
这个方法挺巧:拿大量已有行业知识的多领域时序数据,训一个扩散模型。
推理时输入的是一个从没见过的领域的少量数据,外加一段文字描述——说明这个图表大致呈现什么样的形态。模型据此合成该领域的新数据。
由此实现三件事:少样本快速适配(少量样本就能生成一批高质量的领域数据);自然语言控制生成(比如「前期平稳、后期震荡」,直接按描述造出对应形态);面向下游任务定向生成。
一个扩散模型加上已有的领域数据,就把「跨域泛化造数据」这件事做成了。
有一类尝试是让模型直接生成讲解图——看效果多半是在网页里用 SVG 画出来的,和 Artifacts 刚出来时那种做法一脉相承。
适用面很明确:线性函数、分段函数的连续性分析这类相对简单的内容,可以直接生成教学视频,K12 拿去就能用,中文也支持。
注意到它是因为 Cursor 和它合作了。它的定位很纯粹——只做 code review。
能力包括:为提交生成 summary、对整段代码做 walkthrough、做时序分析、经典的 code review 与安全检查,以前 lint 干的那些活它也都能做。用户量已经不小。
在一个所有人都想做「全能 agent」的时候,只做一件事并且做进别人的工作流里,反而是更稳的位置。