这一周 X 上聊得最多的是 AGI 分级——Bloomberg 参加了 OpenAI 一场内部会议,把他们的五级定义透了出来。这期先把这套分级和 DeepMind 那套学术版放在一起看,然后过了 agent 技术栈这一年的变化:memory 层和 IDE 层都冒出来了,但真正能用的 agent 调试工具还很缺。
Bloomberg 参加了 OpenAI 的一场内部会议,把他们对未来 AI 的分级透了出来,Level 1 到 Level 5。
Level 1 是 chatbot——就是现在 ChatGPT 这个级别。Level 2 是 reasoner,OpenAI 自己的说法是 approaching,很快就能到。
L2 主打的是人类级别的 problem solving。这其实和一直以来对客户的说法对上了——大模型本质是台 reasoning machine,一台推理机器。按这个分级看,那个状态是有可能够得着的。
DeepMind 去年发过一篇更学术的 Levels of AGI。它是个二维表:纵轴是 performance(能力),横轴是泛化度(narrow 还是 general)。
从「没有 AI」往上走,第一档叫 emerging——等于或略微超过没有专业技能的普通人。按这个标准,ChatGPT、Bard、Llama 这一代都还只在 emerging 这一格,只是涌现出了一点能力。
再往上两档是 competent(超过 50% 有技能的成年人)和 expert(超过至少 90%)。两套分级放一起看,OpenAI 那套更像路线图,DeepMind 这套更像尺子。
有机构在持续跟踪 agent 基础设施。去年那版技术栈很薄:agent 的核心技能就 action、planning、memory 三样,其中 planning 和 action 被认为就是模型本身的能力,memory 相当于数据库,context 是给模型做 ETL 准备,platform 层管托管、评测和构建框架。
到今年 6 月这版,丰富了不止一个量级,明确分成了好几层,最上面是应用层。一年时间,这个栈从「模型 + 几个配件」长成了真正的分层结构。
这期一个明确判断:这个领域很缺 IDE。写 agent 应用时,能把 flow、对话更新、工具调用这些自动可视化出来的调试工具,能极大提高效率。
对照当时最火的 Claude Artifacts:你去搜会发现,没有人拿 Artifacts 做出过有商业价值的东西。而面向开发者的 flow 调试工具是真有价值的。
早前 Grok 出过 prompt IDE 那类东西,但现在需要的已经不只是 prompt 本身,而是整个 flow 和 agent 的调试。
微软那套 GraphRAG 是自己从头实现的,没用第三方框架,代码量不小,主要逻辑都在 index 那部分。
开源社区有人做了个复现版,用 LlamaIndex 自带的一个简单带参数的 graph 实现,跑得挺快,可以照着 notebook 一步步做完。
关键在下一步:作者说要把它迁到 Neo4j。大部分企业的图库用的就是 Neo4j——接上之后,这套东西的可扩展性和企业采用的可能性会高得多。
Data-Juicer 是这期推荐的项目:做大模型相关的数据 pipeline 工具层,覆盖的环节非常多,pretrain 和 fine-tuning 的数据处理都能接。
顺带聊到一个现实:国内真正重要、且公司还在持续投入的开源项目很少。原因也不复杂——开源这件事是有成本的,你得跟老板交代清楚为什么做。
code2prompt 读你的代码,然后做知识树那类知识工程的事。比较实用的一个用法是文档化:选一个 document 模板,它会遍历所有源码,帮你把代码文档写出来。
做代码相关产品的团队会对这类工具感兴趣。
端侧:有个 SDK 同时兼容 Linux、Mac、iPhone、安卓。iPhone 那边能跑通,是因为新的机器学习 SDK 把 Metal 那套封装得足够抽象,新版 iOS 上兼容性都不错。做 demo 挺合适。
ISO 42001:这是一个 AI 管理体系方面的认证。之前有人问培训体系是不是按它的大纲走的——把它整合进培训或教育体系是有参考意义的。
提示词管理工具:自己测过 Langfuse 那一类,感觉一般;有推荐说 Athina 是个很好的选择,当时还没试。