EP.12 · 2024-08-02
AI Buzzwords · 档案
档案重建版 — 这一期的页面是后来根据当期录播逐字稿与信源清单还原的,按主讲当天的讲述顺序组织,不做事后追加。文中判断都是 2024 年 8 月当时的判断,未按后来的发展修改。
2024-08-02 · 36 分钟 · 逐话题

十万张卡塞进一个 RDMA 网络里

这期比较短。最扎眼的是 xAI 那个集群的工程细节——十万张卡、一万多个节点,而且号称跑在单一个 RDMA 网络里。另外聊了模型可解释性正在从「看神经元」转向「看 feature」,以及做企业数据 pipeline 时集团和子公司该怎么分层。

本期话题
  1. 流式消息不适合人吸收,需要一层 briefing
  2. 十万张卡,一个 RDMA 网络
  3. 解释模型:从看神经元转向看 feature
  4. 把 BPO 交给 agent
  5. 集团型企业的数据 pipeline 该怎么分层
01

流式消息不适合人吸收,需要一层 briefing

开场先聊了个信息消费的问题:有一个统一的 inbox、大家都往里 share,是件好事。但光有 inbox 不够。

流式的消息真的没有人擅长吸收,也不适合繁忙的脑力工作者。中间必须有一道汇总或者 briefing 的工序——这也正是这个每周分享存在的意义。

02

十万张卡,一个 RDMA 网络

xAI 那个集群的工程细节值得记:大量水冷、8 路 HGX 的 GPU。按这个配置算,十万张卡对应的是一万多个节点

最不寻常的是网络:它号称整个集群跑在单一个 RDMA 网络里。十万张卡的单 RDMA 网络,此前没见过。当时还有分析在追究这套网络到底是谁做的。

03

解释模型:从看神经元转向看 feature

有工具能比较深入地分析大模型推理时到底发生了什么。做法变了:不再像「用 GPT-4 分析 GPT-2」那篇那样,低层地追究每个神经元在理解什么;而是以 feature 为单位,看这句话激活了模型里的哪些 feature。

这个能力的实际价值有两块:给客户解释模型行为时有据可依,做科研时也是趁手工具。

往外推一层会发现是同一件事:我们正在一层层解构大模型的运行原理——模型层面把神经元抽成 feature,应用层面也在抽离分层,比如 GraphRAG 就是把 RAG 拆得更分层,解释性因此好得多。

04

把 BPO 交给 agent

有人做了个 BPO(业务流程外包)方向的尝试。BPO 的范围就是企业最想外包出去的那些活:客服、记账、支付、电话联络、行政管理、技术支持。

他的做法是拿 Dify 这类工具把这些流程搭起来。这个方向的合理性在于:这些业务本来就已经被企业定义成「可外包」的标准流程了——流程越标准,agent 越好接。

05

集团型企业的数据 pipeline 该怎么分层

大型集团有大量子公司,它们和总部怎么配合,是做企业数据时绕不开的问题。当时的判断是:总部以自己的身份做基础的元数据治理和模型训练,再决定在哪一层把能力暴露给子企业。

pretrain 那条 pipeline 的环节大致是:多来源数据接入,其中很重要的一环是 data streaming(数据集成)——不只是一次性导入,得有持续的数据流进来;到 fine-tuning 阶段做 QA 化、graph 化;然后是 cleansing,清洗本身有一大堆步骤;洗完还要做数据评估

评估这步有个细节值得注意:同一份数据会被从不同维度评估,不同维度权重不同,加权之后的数据才进入训练流程。工具层面当时在用的有 Data-Juicer、OmniParser 这类。

每周 AI 情报 · AI Buzzwords · EP.12 · 2024-08-02 · 36 分
档案重建版,依据当期录播逐字稿与 Notion 信源清单还原。← 返回分享列表
▶ 本期分享 · 视频导览 滑动到文章 · 高亮卡片点击播放对应讲解 收起 ▾