EP.10 · 2024-07-19
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2024 年 7 月当时的判断,未按后来的发展修改。
2024-07-19 · 68 分钟 · 逐话题

OpenAI 内部把 AI 分成了五级,说自己快到第二级了

这一周 X 上聊得最多的是 AGI 分级——Bloomberg 参加了 OpenAI 一场内部会议,把他们的五级定义透了出来。这期先把这套分级和 DeepMind 那套学术版放在一起看,然后过了 agent 技术栈这一年的变化:memory 层和 IDE 层都冒出来了,但真正能用的 agent 调试工具还很缺。

本期话题
  1. OpenAI 的五级:现在是 L1,说快到 L2 了
  2. 对照 DeepMind:按能力和泛化度两轴分
  3. Agent 技术栈:一年之内明显变厚了
  4. 最缺的是 agent 的 IDE
  5. GraphRAG 的开源复现,下一步接 Neo4j
  6. 阿里的 Data-Juicer,以及国内开源的现实
  7. code2prompt:把代码读成知识工程
  8. 零碎:端侧兼容、ISO 42001、提示词管理
01

OpenAI 的五级:现在是 L1,说快到 L2 了

Bloomberg 参加了 OpenAI 的一场内部会议,把他们对未来 AI 的分级透了出来,Level 1 到 Level 5

Level 1 是 chatbot——就是现在 ChatGPT 这个级别。Level 2 是 reasoner,OpenAI 自己的说法是 approaching,很快就能到。

L2 主打的是人类级别的 problem solving。这其实和一直以来对客户的说法对上了——大模型本质是台 reasoning machine,一台推理机器。按这个分级看,那个状态是有可能够得着的。

02

对照 DeepMind:按能力和泛化度两轴分

DeepMind 去年发过一篇更学术的 Levels of AGI。它是个二维表:纵轴是 performance(能力),横轴是泛化度(narrow 还是 general)

从「没有 AI」往上走,第一档叫 emerging——等于或略微超过没有专业技能的普通人。按这个标准,ChatGPT、Bard、Llama 这一代都还只在 emerging 这一格,只是涌现出了一点能力。

再往上两档是 competent(超过 50% 有技能的成年人)和 expert(超过至少 90%)。两套分级放一起看,OpenAI 那套更像路线图,DeepMind 这套更像尺子。

03

Agent 技术栈:一年之内明显变厚了

有机构在持续跟踪 agent 基础设施。去年那版技术栈很薄:agent 的核心技能就 action、planning、memory 三样,其中 planning 和 action 被认为就是模型本身的能力,memory 相当于数据库,context 是给模型做 ETL 准备,platform 层管托管、评测和构建框架。

到今年 6 月这版,丰富了不止一个量级,明确分成了好几层,最上面是应用层。一年时间,这个栈从「模型 + 几个配件」长成了真正的分层结构。

04

最缺的是 agent 的 IDE

这期一个明确判断:这个领域很缺 IDE。写 agent 应用时,能把 flow、对话更新、工具调用这些自动可视化出来的调试工具,能极大提高效率。

对照当时最火的 Claude Artifacts:你去搜会发现,没有人拿 Artifacts 做出过有商业价值的东西。而面向开发者的 flow 调试工具是真有价值的。

早前 Grok 出过 prompt IDE 那类东西,但现在需要的已经不只是 prompt 本身,而是整个 flow 和 agent 的调试。

05

GraphRAG 的开源复现,下一步接 Neo4j

微软那套 GraphRAG 是自己从头实现的,没用第三方框架,代码量不小,主要逻辑都在 index 那部分。

开源社区有人做了个复现版,用 LlamaIndex 自带的一个简单带参数的 graph 实现,跑得挺快,可以照着 notebook 一步步做完。

关键在下一步:作者说要把它迁到 Neo4j。大部分企业的图库用的就是 Neo4j——接上之后,这套东西的可扩展性和企业采用的可能性会高得多。

06

阿里的 Data-Juicer,以及国内开源的现实

Data-Juicer 是这期推荐的项目:做大模型相关的数据 pipeline 工具层,覆盖的环节非常多,pretrain 和 fine-tuning 的数据处理都能接。

顺带聊到一个现实:国内真正重要、且公司还在持续投入的开源项目很少。原因也不复杂——开源这件事是有成本的,你得跟老板交代清楚为什么做。

07

code2prompt:把代码读成知识工程

code2prompt 读你的代码,然后做知识树那类知识工程的事。比较实用的一个用法是文档化:选一个 document 模板,它会遍历所有源码,帮你把代码文档写出来。

做代码相关产品的团队会对这类工具感兴趣。

08

零碎:端侧兼容、ISO 42001、提示词管理

端侧:有个 SDK 同时兼容 Linux、Mac、iPhone、安卓。iPhone 那边能跑通,是因为新的机器学习 SDK 把 Metal 那套封装得足够抽象,新版 iOS 上兼容性都不错。做 demo 挺合适。

ISO 42001:这是一个 AI 管理体系方面的认证。之前有人问培训体系是不是按它的大纲走的——把它整合进培训或教育体系是有参考意义的。

提示词管理工具:自己测过 Langfuse 那一类,感觉一般;有推荐说 Athina 是个很好的选择,当时还没试。

每周 AI 情报 · AI Buzzwords · EP.10 · 2024-07-19 · 1 小时 8 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾