有人给 o1 做了 IQ 测试,拿了 120 分。分数本身是噱头,但它指出了一个真实的心理转折:此前所有模型都在 80 到 90 分区间,面对这样一批伙伴你是没有压力的;突然来一个比你高的,那种压力不会按线性增长。
有人拿 o1 做 IQ 测试,测了几次,得了 120。
重点不在分数有多高,而在于之前所有模型都落在 80 到 90 多分这个区间。面对一批智商八九十的伙伴,你是没有任何压力的。突然冒出一个比你高的——这种压力不是线性增长的,它会带来一些别的问题。
Altman 说 o1 相当于 GPT-2 那个阶段。但 Boris Power 的说法更具体:它更像 GPT-3 的位置。
这个对照有实际意义:GPT-3 大概是 2020 年发布的,到 2022 年底才有 ChatGPT。如果 o1 真在 GPT-3 那一格,那么从「模型能力就位」到「产品形态成立」之间,历史上隔了差不多两年。
一位数字游民写了篇文章,讲怎么用费曼学习法配合大模型学东西,阅读量对他来说非常高。
他的组合是三样:费曼学习法 + 用英文解释 + 刻意练习。费曼学习法本身大家都熟——能给别人讲清楚才算学会。他加的那层是:让 AI 给你出问题,你用英文解释给 AI 听;这套流程能跑通,说明你不但学会了,而且是用英文的思维方式学会的。
抓住这波阅读量,他随即发起了一个 build in public:产品很快上线——扔一个 PDF 进去就能对话。虽然问题还不少,但整个开发过程他全程公开分享,这件事本身比产品更有看头。
有篇文章分析当时大模型「做不了高级的事」,结果几天后就被打脸了。
但它仍然值得看——价值不在结论,在于它拆解「瓶颈的本质是什么」时用的那几个分析维度。结论会过期,分析框架不会。
很多人习惯把点子随手画在餐巾纸上。Napkin Dev 做的就是:你扔一张餐巾纸草图进去,它直接给你生成应用。演示里画一个简单表单,它就写出了 React 代码。
这类东西之前也有,但这次不一样的地方是 Llama 3.2 Vision 90B 效果好很多,而且免费用。更关键的是它开源——背后 API 里 generate code 那一段到底怎么做的,可以直接翻出来看。
Salesforce 推了 Agentforce,接了不少数据源——CRM,以及 Slack 频道里的各种聊天内容,用来辅助销售:跟进商机、发现线索。
意图很清楚:Salesforce 买 Slack 图的就是这个——用聊天里的上下文来做销售辅助。
同期两笔大的:Groq 和沙特阿美在建号称世界最大的 AI 推理中心;微软和贝莱德在做一个约 1000 亿美元规模的 AI 数据中心。
这和年初斯坦福那份报告里 Infra 投资激增的趋势是接上的——那条曲线看起来还会继续。