这周最直接的一条:主产品被摆到了压倒一切的位置,广告、agent 平台这些外围的事全部往后推。同一周的另一张表更值得看——开放模型月度榜的前三名,全是中国模型。
在一次访谈里正式承认进入了 code red 阶段,核心是全力保 ChatGPT。
代价是把广告、agent 平台这类外围应用推迟。广告其实已经能看到苗头了——有人提问时,底下会被推一条「要不要找个健身课」之类的东西,直接引流到具体品牌。也有人说那只是开发者接入 SDK 造成的,但方向是明摆着的。
被提高优先级的是两件事:一是让那八亿量级的活跃用户更会用 ChatGPT;二是图像生成,以及模型行为在竞技场类评测里的表现。
「中美模型差多少」这个问题,这期给了一个可操作的算法:看同档位模型的发布时间差。
Kimi K2 Thinking 到 Gemini 3 Pro,发布时间大概隔了一个月出头。撑死就是一个月。
但分数上还是有差距的——同一项从 67 到 73,不是能忽略的距离。时间接近不等于能力接近,这两件事得分开看。
很符合它自身定位的一组发布:一个写代码的 agent,一个做安全(渗透测试那类)的 agent,一个做运维的 agent。
从写代码到部署上线,一整条链上都安排了 agent。这不是模型能力的比拼,是把 agent 直接嵌进已有的云产品序列里。
有一份评模型开放度的打分,维度是权重够不够多、能不能通过开源权重真正拿到东西,打的是离散分。第一象限——也就是大家最希望看到的那一格——只有两家在里面。其余大部分都落在比较低的位置。
纯看透明度的话,最高的是 DeepSeek,GLM 也算比较高。
另一张是每月更新的开放模型排行榜。上个月的前三:K2 Thinking、GLM-4.6、Qwen 235B。这张榜几乎就是一张中国模型榜。再往下才轮到别家。