这期有篇带吐槽性质的文章问了个很实在的问题:按现在的训练投入倒推,整个 AI 产业的收入得做到 6000 亿美元才撑得住,而当时还差 5000 亿。缺口只能靠开拓全新的业务场景来补——这也解释了为什么 o1 那么被在乎:它不是在卷原来那块地。
Air Street 发的这份报告 200 多页,内容量不亚于当年斯坦福那份 AI Index。
研究部分里几个值得记的点:多模态的进展、RL 对 LLM 和 VLM 的影响,以及蒙特卡洛树在这一代模型里扮演的角色——大家普遍猜测 o1 这一代用的就是类似 AlphaGo 那套树搜索,来做提前的 planning。
另外提到一条容易被忽略的线:分布式低通信训练——已经有人基于这套方法去训 Llama 级别的模型。
有个思路当时越看越重要:让模型把「怎么改代码、怎么加单元测试、在什么条件下才算通过审核」这套思考过程显式写出来。
本质是把一个黑盒过程变成人类可以 review 的 routine。审的不再是结果,是过程。
有篇文章把选择说得很直白:你去 Infra 层,会被 NVIDIA 干死;你去 model 层,会被 Meta 和 OpenAI 夹死。
剩下的建议是:去打传统的系统集成商。理由是——模型本身的很多问题你确实处理不了,但普通用户面对一个空白的输入框时的茫然,就是你的机会。
顺带把「套壳」这个说法也更新了:它认为套壳已经进化成了认知原生架构。这帮人确实很会造词,但这些词是有价值的——它决定了你怎么理解自己在生态里的商业位置。总把自己定义成套壳,就只能拿套壳的估值。
一篇带吐槽性质的文章做了笔账:按现在训练这些模型的投入倒推,整个 AI 产业的收入需要达到 6000 亿美元,而当时距离这个数还差 5000 亿。
怎么补?只能随着模型能力增强去开拓新的业务场景、新的收入来源——在老场景里卷是补不上的。
这正好解释了 o1 为什么那么被在乎:它不是在卷原来那批模型,它是卷到了新的领域去。
有家公司做了个可解释性产品,思路是不断挖掘推理过程中各个节点的激活状态,以及这些节点背后对应的语义。
拿来解决的正是那类经典问题——「9.11 和 9.8 哪个大」这种,模型答错时到底是哪儿出的问题,能一层层看下去。
OpenAI 那篇讲 routine generation 的案例,现在看比当时更重要。
做法是:把「取消我的 payment master」这样一句操作描述,直接变成一段 routine——具体做什么事、调哪个 API、每一步是什么、每步调什么接口,最后连需要哪些 function definition 都给你定义出来。
几百个 token 的任务描述,生成上千个 token 的 routine,而这段 routine 足以完成整个任务。
文章开头那句是关键:开发客服系统时,最初的一步就是把知识库里的文章,变成一系列 routine。
实践部分做了两件事。一是把微软的 RD-Agent 接到 GLM-4 上跑——当前这类项目生成的代码都不长,所以在国产模型上效果也还不错。
二是 bolt.new:你让它干什么它就写什么代码,比如让它做个 blog,它写完、跑起来、渲染出来,依赖全都自己搞定。也 port 到了 GLM-4 上,能跑通。
共同的注意事项:这类项目都极其费 token。