这期前半场过了一遍上周 AI 院分享的四条线——长文本、多模态、推理加速、评测,后半场主要是 a16z 那两篇刚出的企业级报告。中间穿插了几个当时挺新鲜的东西:有人拿管理学的领导力概念去评测大模型,有人把 RAG 用的 embedding 直接并进大模型做成单体,还有从 logits 反推出 ChatGPT 3.5 大概只有 7B 的攻击方法。
这期开场先过了一遍上周四 AI 院那场分享的笔记。整场主要围绕四个话题:长文本模型、多模态、推理加速、评测。
这四条当时基本就是学术侧最集中的四个方向。分享里有不少细节当场没听太清,所以这里只做一遍粗过——真想深入的,按关键词自己往里挖会更有效率。
有几门课当时值得一看:Google 那门生成式 AI Explained属于比较偏入门的,两三个小时能过完。另外有人整理了 9 门课,大部分是 NVIDIA DLI 出的,涵盖 RAG、怎么构建应用等。
其中AI in Data Center 那门比较特别——和算力中心那类部门沟通时,这门课给的语言体系是有用的。
当时判断接下来比较值得关注的一类落地场景是 data scientist / 研究部门——学校里的 lab、公司里的研究部门,都会希望有一套让大模型辅助做 research 的工具链。
这个方向的特点是需求真实、路径清楚,比泛泛的「企业智能化」要具体得多。
聊到端侧时有个很实际的判断:Windows 本里那块 NPU 谁能用、谁说了算。芯片厂并没有把应用内置进整机的权利,真正有决策权的是联想、华为这类整机厂商。
所以端侧模型要铺开,绕不开的是和做电脑的人谈,不是和做芯片的人谈。
政务行业讲了很多年智慧大脑。到了大模型时代,它显然不该再是干具体活的那层——不是做 CV、人脸识别那些。最直接的想象是把它当成开场的意图路由,但那一层太薄了。
这期看到一篇论文提供了另一个思路:把管理学里的 leadership(领导力)概念拿来用。这篇研究让不同模型在一个游戏环境里生活、交流,观察它们表现出的领导力水平,看哪个模型更像个领导。
这是当时第一次看到有人把管理学和大模型评测结合起来。它演示了不少视频——两个角色看到了什么、聊了什么、怎么做数据分析、下一步往哪走,中间要用到大量多模态能力。
当时流传的一个说法是 ChatGPT 3.5 大概是 7B。这个数字怎么来的?靠一种针对输出层 logits 向量的攻击方法——从最后那层的隐藏维度反推模型规模。
具体实现当时没细看,但做安全的人已经在研究这篇了。这类攻击的意义在于:模型规模这种被当作商业机密的信息,可能通过 API 就能反推出来。
后半场主要是 a16z 刚出的企业级报告。它最有冲击力的部分是用钱说话——把各类工作的成本下降直接列出来:图像生成便宜了十万倍量级,法律文书查询便宜了五十万倍量级。
另一组数是模型从哪来:55% 左右是从云服务厂商拿的,其余通过 model provider——而 model provider 背后几乎也都站着云厂商。
顺带还有一篇 Top 100 GenAI 应用的榜单,当时看下来认识的没几个。
这期最有意思的一个模型是 Contextual AI 做的:把 RAG 用的 embedding 和大模型本身整合成一个单体模型。
好处很直接——你不再需要一个单独的 embedding 模型。同一个模型既能做 embedding,也能做对话。整条 RAG 链路因此少了一个组件。
最后过了几个 agent 框架。CrewAI 当时评价最好,原因不在功能而在示例——其他几个框架的 example 都太玩具了,不像正常工作里会碰到的场景;CrewAI 的示例是做股票分析、为会议做准备、做一个 landing page,这些更接近真实需求。
另外还提了一个专门面向 chat 的界面框架,比 Gradio、Streamlit 那类通用工具更合适做对话产品;以及一个把链接植入大量开源项目 README 来做增长的部署平台——手法很聪明,社区因此起得很快。