这期有个类比很扎实:移动互联网时代持续赚钱的是云厂商,那 agent 时代的「云厂商」是什么?说白了就是房东、就是地主——谁能站在中间收租,谁就赢。
先从一个老问题说起:聊天式应用的出现,对搜索巨头是不是致命打击?有几个百分点的流量确实从搜索引擎流走了,流量总量也在下降。
答案是「是的,但不是你想的那样」。关键在于流走的是哪一类流量。
问「碳原子有多少质子」这类问题,有知识价值但基本没有商业价值;问「最好的羽毛球拍是什么」这类问题,才是有商业价值的。
所以 5% 以内的流量损失,一方面确实是新应用带来的变革,另一方面也要看清损失的是前一类还是后一类。
顺带一句:做生成式引擎优化的公司现在国内外都冒出来不少,值得关注。
一个很小的模型在某个推理榜上表现亮眼,引发了一轮讨论。官方的分析给出了几条结论:
一、模型结构本身的影响其实很小——一旦尺寸到了某个数量级,结构的影响就没那么大了,即使换上奇奇怪怪的新算法,差别也不大。
二、真正关键的是「外循环」:把输出的东西再吃回去,结合之前的输出去反思接下来要输出什么。这一步对性能提升尤为重要。
三、跨任务的迁移学习好处有限——大部分效果来自特定任务上学到的特定方案,说白了就是它记住了答案。
四、预训练数据增强非常重要。那类题目本身数量很少,所以做了大量增强——旋转、变换,生成很多新版本再拿去训练,影响挺大。让训练数据有更多样性,本身就很有帮助。
一个开源旗舰悄没声地又发了新版本,是一个同时支持推理模式和非推理模式的混合模型。
重点提升的能力里,第一条就是混合思考:通过改模板、改提示词就能让它进出思考模式。
值得单独夸一句的是它的文档写法:几乎从不造词,直观、直接地把事情说清楚——通篇找不到那种硬凑出来的 buzzword。
有家公司做得很垂:你给它已知的一两行线索,它返回这个人的结构化个人信息——全名、公司邮箱、公司信息、职位、代码仓库账号等等。
而且每一条信息都带 grounding:告诉你这条是从哪儿来的。
商业背景调查这类需求是实打实的。而且它天然适合按效果收费——查到了才付钱,查不到就不收。
同期还有个可视化工具:把一堆文档的句向量聚类效果画出来,示例数据是各种酒的描述,按密度看的时候图确实很漂亮,每个点就是一个句子的嵌入。看嵌入效果或者聚类的时候挺有用。
一个很好玩的小项目:你给它一条指令——盯着某款笔记本或者某款新无人机,有没有低于某个价位的新货出现——它就不断帮你看。
为什么非要用大模型?因为卖家的描述全是自由文本,得靠模型去匹配「用户的需求」和「卖家的描述」。
而且最后还要靠模型判断新出现的这个货跟你的需求到底匹配度高不高——你可以用大白话设定对卖家的要求,符合就建议,不符合就不建议,并且给出不建议的理由。
这是这期最值得记的一段推理。
移动互联网时代持续赚钱的是云厂商。那 agent 时代的云厂商是什么?说白了就是房东,就是地主。
对应的现实案例很直接:某家大资本这些年一直在买住房和房地产,花点成本装修一下租出去,做成订阅式的住房,装修完租金立刻涨好几倍。
更关键的是配套的软件:一套 AI 驱动的房地产管理工具,最核心的功能是定价——每一套房租应该定多少。
因为它同时握有大量需求侧和供给侧的信息,就可以做动态的最优化:既保证一定租得出去,又保证收到尽可能高的租金。
这是个很好的标杆案例:如果你背后有一个大资本,那就专门给它做一个用 AI 赋能的产品,让它在自己的领域里变成那个收租的平台角色。