EP.38 · 2025-05-30
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2025 年 5 月当时的判断,未按后来的发展修改。
2025-05-30 · 52 分钟 · 逐话题

看到「天网」配图的文章,直接划走就行

这期有个很实用的信息卫生习惯:看到「AI 公开反抗人类」这类标题、配着天网剧照的文章,直接划走。真要判断,就顺着链条回到最原始那条推文,看研究者本人到底写了什么——多数时候和标题差得很远。

本期话题
  1. 一张图一段音频,就能生成会说话的视频
  2. 「o3 反抗人类」这条新闻该怎么读
  3. 用扩散模型合成没见过领域的时序数据
  4. 用生成图讲课,K12 可以直接拿去用
  5. CodeRabbit:只做 code review 这一件事
01

一张图一段音频,就能生成会说话的视频

开源的数字人方案已经到了这个程度:给一张图片加一段音频,就能生成一小段说话或唱歌的视频。

边界也很清楚:动作幅度稍大或者比较特殊的动作,效果就一般;但短时长、动作幅度不大的场景,已经做得相当好了。

又一次印证了那个观察——视频生成这块,国内确实挺强。

02

「o3 反抗人类」这条新闻该怎么读

当时炒得很热的一条:所谓 o3 开始公开反抗人类。

读法很简单:但凡看到配着天网剧照的这类文章,直接忽略就行。

然后顺着链条往回走——它源自一条推文,发布方是一家做安全研究的机构,看起来靠谱一些。那就直接去读原推,看研究者本人到底写了什么。

回到原文,往往会发现描述的现象和「反抗人类」这个说法之间,隔着好几层加工。

03

用扩散模型合成没见过领域的时序数据

这个方法挺巧:拿大量已有行业知识的多领域时序数据,训一个扩散模型。

推理时输入的是一个从没见过的领域的少量数据,外加一段文字描述——说明这个图表大致呈现什么样的形态。模型据此合成该领域的新数据。

由此实现三件事:少样本快速适配(少量样本就能生成一批高质量的领域数据);自然语言控制生成(比如「前期平稳、后期震荡」,直接按描述造出对应形态);面向下游任务定向生成

一个扩散模型加上已有的领域数据,就把「跨域泛化造数据」这件事做成了。

04

用生成图讲课,K12 可以直接拿去用

有一类尝试是让模型直接生成讲解图——看效果多半是在网页里用 SVG 画出来的,和 Artifacts 刚出来时那种做法一脉相承。

适用面很明确:线性函数、分段函数的连续性分析这类相对简单的内容,可以直接生成教学视频,K12 拿去就能用,中文也支持。

05

CodeRabbit:只做 code review 这一件事

注意到它是因为 Cursor 和它合作了。它的定位很纯粹——只做 code review。

能力包括:为提交生成 summary、对整段代码做 walkthrough、做时序分析、经典的 code review 与安全检查,以前 lint 干的那些活它也都能做。用户量已经不小。

在一个所有人都想做「全能 agent」的时候,只做一件事并且做进别人的工作流里,反而是更稳的位置。

每周 AI 情报 · AI Buzzwords · EP.38 · 2025-05-30 · 52 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾