这期后半场刷了两场 demo day——OpenAI 的和 Meta 在旧金山的黑客松。前半场有个很具体的工程结论:把 OpenAI 生态的开源项目迁到别的模型上,真正卡住的往往不是大接口,而是 JSON mode 这种不起眼的小特性。
Altman 买下了 chat.com 和 ai.com,两个域名都指向 ChatGPT。
这个动作的路数很熟悉——跟马斯克学的:先把最短、最贵、最不可能被超越的那个词占住。
李继刚这个名字在圈子里已经很有名了,他写的几条 prompt 传播极广。当时最火的是「汉语新解」——一段 prompt 就让模型输出一张成体系的图解。
值得注意的不是技巧本身,而是一个非 AI 从业者,仅靠提示词就做出了传播量级远超多数产品的东西。
从算力集群的分布看,A100 时代还有中国的位置,到了 H100 集群这一档,基本全是美国。
欧洲这边,Mistral 手上的算力相对多一些;英国的处境反倒很尴尬——投资额不算少,但拿得出手的东西很少。相关的坊间八卦是 Inflection 被并购时,英国方面曾以安全问题提出过问询。
算力需求本身只会继续变大,讨论的重点也从「有多少卡」转向了什么样的角色在这条计算产业链上能占住生态位。
办过几次开发者培训之后发现一个很实在的问题:把基于 OpenAI API 的开源项目迁移到别的模型上,成本比想象中高得多。
除去开发者自身的技术因素,核心卡点是 API 兼容度。嘴上说兼容了 chat completion,但真正挡住迁移的是那些小特性——比如 JSON mode。一个小接口不支持,整个开源项目就 port 不过来。
这也是当时想做的一件事:把传统 chat 类 API 和新的实时类 API 的形态差异系统梳理一遍,因为兼容性问题在实时这条线上只会更多。
OpenAI 的 real-time API console 那个开源 demo 效果相当惊艳:本地做 VAD(语音活动检测),说完直接接上工具调用——问多伦多天气,它当场返回 21 摄氏度、风速 6.5 公里每小时。
工程上的观察是:VAD 这一环换成 LiveKit 那套效果会更好;另外这类 demo 自己接一遍其实相当麻烦,有个现成的 console 可参考价值很大。
Meta 在旧金山那场黑客松里,有几个项目值得记:给科学家用的、专门审 pull request 的,以及最有意思的 Profiler AI。
它做的事是:找出代码里拖累性能的地方,提出修改建议,然后在沙箱里真的把代码跑起来,量化改完之后性能提升了多少。
软件工程里这类「有明确度量、能自动验证」的优化点其实一大堆,是 agent 最容易站住的场景。同期还有个说法在传:Google 的新代码里已经有 20% 是 AI 写的。