这期两条线。一条是 coding agent:SWE-bench Verified 出来了,Cosine 的 Genie 号称 30 分,而当时公开榜首才 20 分——各家开始自建行业数据集。另一条更有意思:有人把 AlphaGo 那套蒙特卡洛树搜索搬进了 agent 的规划环节,还顺手拿它生成 DPO 的训练数据。
Comet 发的这篇讲 RAG evaluation 的文章,其实是一门很长的免费课程里的一部分——整个系列叫 digital twin,第十节和第十一节是 evaluation 部分。
文章很长,整篇都在讲怎么拿 Ragas 做完整的 RAG 评测。要学 RAG 或大模型应用开发,这个系列非常值得从头跟;真要动手做 RAG,这一篇基本不可或缺。
LlamaIndex 的创始人做了一个事件驱动(event-driven)的多 agent 框架。和把流程写死成一条链不同,事件驱动的组织方式让多个 agent 之间的协作关系更松,也更接近真实系统的样子。
SWE-bench 这类基准里的数据,很多是「提了什么 issue、这个 issue 最后怎么被 resolve」的真实记录。OpenAI 出的 Verified 版本,是朝端到端解决 coding 问题迈的一大步——它是怎么构建这份数据的,比分数本身更值得研究。
同期 Cosine 也构建了自己的数据集。大家不约而同地在 SWE 这条路上越走越远,各自建各自的行业基准——这边有 Verified,那边有 Cosine 自己那套。
Cosine 的 Genie 是一套端到端的 AI agent,功能做得相当全。它号称在 SWE-bench 上拿到 30%——而当时公开榜单最头部的也只有 20 分左右。
这个差距当时看是很扎眼的。也正因为差得多,「它的分数是怎么来的、数据集是不是自己的」这类问题就变得比分数更值得追。
这期最有意思的一个东西。它的演示是订餐厅:查有没有空位 → 没查到 → 去 Google Maps 查 → 回来再查一遍 → 找到 10 点的位子。看着像普通 agent,但底下的机制不一样。
核心是 MCTS(蒙特卡洛树搜索)——AlphaGo 那套。用它来并发地展开好几条 planning 路径,每条都往前探,一旦某条出问题就剪枝。过程中还大量用了自我反省的能力。
更少见的是第二个用法:他把 MCTS 生成的内容拿去做 DPO 的训练数据。用搜索树产出偏好数据来做对齐,这个组合当时第一次见到。
整个循环最后长成了和人一样的样子:定计划 → 跑脚本 → 看结果 → 更新计划。代码也开源了。
Sakana 这家公司的开源项目 AI Scientist——自动产出论文,自己发表,paper 也能搜到。
当场的反应是又好笑又警觉:现在 peer review 很多也已经是自动生成的了——那再配一个 review 生成器,整条链就闭环了。论文代写这个行当,可能是最先被冲的。