这周最疯的是诺贝尔奖——物理奖给了 Hopfield 和 Hinton,化学奖背后是 AlphaFold 那一套。技术侧最有意思的是 Cursor 团队的访谈:他们讲了在用户问题和最终代码之间做一层组件空间的必要性,也被直接问到「GitHub Copilot 要是接上 o1,你们怎么办」。
化学奖这边比较好记,基本就是 AlphaFold 那一套技术对生物学带来的影响。
物理奖跟这个行业关系更直接,两个名字要记住:Hopfield 和 Hinton。学过机器学习的都知道 Hopfield 网络,而 Hinton 至少在反向传播算法里有很大贡献。
Hopfield 那套的来路值得一说:它的物理学依据是自旋玻璃(spin glass)这个概念——借助它设计出一套让机器具备一定「记忆性」的算法,能把输入的东西转换、复原出来。
GPT-4o 语音发布时大家都在问「打断是怎么做到的」。答案是背后的 vendor——LiveKit。
它官网介绍里着重说明的正是 interruption handling,而 OpenAI 就是它的客户之一。它的官方示例里,第一个写的就是和 LiveKit 集成,推流反倒排第二——在这一代流式 AI 技术里,推流本身已经不是最关键的部分了。
全球做 AI streaming 的头部就那几家,Agora(国内是声网)是另一家。要做全球化的这类应用,选型基本在这个小圈子里。
Cursor 团队讲了个挺重要的设计观:他们的 craft 有点像 React——先有一批组件,用的时候按动态要求渲染出来。
尤其是软件工程、特别是前端这类工作,在用户的问题和最终代码之间腾出一层「组件空间」,是非常重要的。直接从自然语言跳到代码,中间少了这层就很难稳定。
被问到「如果 GitHub Copilot 加上 o1,对 Cursor 有什么影响」,他们的回答是——那我们就倒闭吧。玩笑归玩笑,Copilot 接 o1 并不是个不确定的事,肯定会做。
技术细节还提了两点:用 MoE 处理「输入大量 token、输出比较少」的场景时特别有效;另外用了推测解码——先用小模型多路生成,再拿大模型判断结果,等于在大模型之外做了一层多路推理。
借 Reflection 这个模型聊到一个定义问题:衡量一个模型是不是开源,绝不是「权重开放了就行」。
维度多得多——数据、工具链、中间过程的数据,都算。按这套标准,Reflection 当时算是相对最开放的一个,所以有人专门拿它做复现,还总结出了一些反思。
微软有个 AI System 的课程 repo,可以直接问它「帮我列一下有哪些内容」。看它的响应过程不像简单 RAG,中间还有 CoT,做得挺不错。
缺点也很明确:只能针对单个 repo,跨多个仓库不行——本来最想要的恰恰是跨仓检索。跨 repo 那个能力当时在 Copilot 付费版里才有。
之前介绍过 Sakana 的 AI Scientist,现在微软也在做同一件事——RD-Agent,覆盖各领域的 research,例子里有金融领域的数据构建。
流程和 AI Scientist 很像:想出一个 idea → 提出假设 → 做实验 → 最后把它开发出来。demo 还很贴心地做了中文版。
Perplexity 本质是研究型的对话式搜索引擎。有个(没什么科学依据但挺有意思的)区分:Google 更适合没有明确目的性的搜索;Perplexity 更擅长「how do I ⋯」和「summarize ⋯」这类有明确诉求的问题。
它的 Discovery 有点像今日头条,但不只是爬取——每条都会做总结、优化,还带 citation,并根据内容给你推荐追问。
一句话定位:适合实时核查和信息摘要。