给它一个话题,STORM 自动在互联网上做多轮调研、模拟不同专家视角互相提问,最终输出一篇带引用的完整维基百科级别报告——整个过程无需人工干预。
Stanford OVAL(Open Virtual Assistant Lab)由计算机科学系 Monica Lam 教授创立——她是编译器与系统领域的传奇学者,近年将研究重心转向 AI 助手与知识发现,实验室的使命是打造"有效且可信的 AI 助手",加速知识发现的过程。
用 LLM 写长文章有一个根本矛盾:越早让模型动笔,产出越依赖训练数据、缺乏新鲜信息;越晚动笔,积累的上下文越多,但模型注意力有限,长上下文质量会下降;传统检索增强(RAG)虽然能注入外部信息,却是"查一次、写一篇",缺少真正意义上的迭代探索。STORM 的洞察来自一个朴素的观察:人类写维基百科条目时,是先做大量有结构的调研、不断追问修正认知,最后才落笔的。
STORM 全称 Synthesis of Topic Outlines through Retrieval and Multi-perspective Question Asking(通过检索与多视角提问合成话题提纲)。运行流程是:先在 Wikipedia 中定位相关话题、建立知识图谱;再让 LLM 模拟多个关注点不同的"专家"视角(如技术研究者、伦理学家、产品经理、媒体记者);每个专家视角向"知识整合 Agent"提问,Agent 把问题拆成搜索查询、检索互联网、过滤可靠来源、合成答案再反馈给专家,形成多轮问答循环;积累足够的问答后生成多层级提纲,最后基于提纲和检索到的原始资料逐节写作,每个论断都带可追溯的引用链接。
STORM 原始论文发表于 NAACL 2024(《Assisting in Writing Wikipedia-like Articles From Scratch with Large Language Models》),确立了多视角模拟对话的范式。2024 年,OVAL 推出升级版 Co-STORM(EMNLP 2024),核心改变是把"纯自主模式"变成"人机协同模式":用户可以在任意时刻打断 Agent 的调研流程、提出新问题或修正方向,Agent 在生成提纲前会与用户确认知识结构,让最终报告更贴近用户的真实信息需求,而不是系统自己认为重要的内容。
STORM 代码库已开源,支持 GPT-4o、Claude 3.5、Gemini 及本地模型作为 LLM 后端,Bing Search、You.com、Tavily、DuckDuckGo 等多种搜索引擎,向量/稀疏/混合检索策略,以及 Markdown、HTML、带引用维基格式的多种输出。上线以来已被约 100 万用户使用,GitHub 仓库拥有超过 1.3 万 Star,在 AI 研究工具类开源项目中排名前列。
与同期的 OpenAI Deep Research、Perplexity Pages、Google Deep Research 相比,STORM 的差异点在于完全开源、可在自研基础设施上部署,学术可复现(论文配有完整实验和评估指标),且检索策略、LLM 后端均可模块化替换。OVAL 目前正把这套方法论向生物医学文献库做深度适配,目标是帮助科研人员发现跨论文的隐性联系——这是通用商业产品难以触达的专业垂直场景。
STORM 最初的叙事是"整个过程无需人工干预",但仅仅一年后,OVAL 自己推出的 Co-STORM 就把"纯自主"改成了"用户可以随时打断"。这不是简单的功能迭代,而是对最初假设的一次隐性修正——一个完全自主的调研 Agent,其提纲和判断标准仍然是系统自己认定的重要性,而不必然对齐用户真实的信息需求。学术界能诚实地在论文里记录这种转向,是 STORM 区别于商业产品叙事的地方,但也说明"自主 Agent 写报告"这件事,比最初设想的更依赖人类在关键节点的介入。
STORM 的调研起点是 Wikipedia 知识图谱,这意味着它天然更擅长处理"已有相当积累、维基百科已建立条目框架"的话题,而在真正前沿、尚未被系统总结的领域——恰恰是 OVAL 现在想攻克的生物医学场景——其多视角提问和检索路径的有效性还缺少同等分量的公开验证。100 万用户和 1.3 万 Star 证明的是通用场景的产品市场契合度,不完全等同于生物医学深度适配的既成事实。
作为完全开源、模块化、学术可复现的系统,STORM 面对的另一重竞争压力来自 OpenAI、Google、Perplexity 等公司几乎同时推出的"Deep Research"类产品——这些产品有更强的工程资源和更紧密的模型-产品耦合。STORM 的护城河更多在于开放性和可审计性,而不是绝对性能领先,这是一条典型的学术开源项目在商业化浪潮中的生存路径。
STORM 最重要的贡献不是"AI 能写报告",而是证明了"调研 → 结构化 → 写作"可以被拆解成一条可复现、可开源的推理链条。但从 STORM 到 Co-STORM 的转向本身就是最诚实的判断:完全自主的知识生产在今天仍然需要人类在关键节点把关,开源与可审计,才是它能在商业 Deep Research 产品夹击下继续存在的理由。
首次发布 2026-08-17