新一代推理模型最大的争议不在于它多强,而在于它不给你看中间过程。这期给了一个很直接的判断:那些被藏起来的推理内容,可能恰恰是模型能力最本质的部分。
先讲的是一份做得相当漂亮的分享(用的是设计工具自带的幻灯片功能——现在好多新公司都用它来做 PPT)。
第一个要点是怎么做一个可扩展的全栈系统:中间加一个控制面板层,把各种加载器、读取器和元数据都收进去;同时接好几个 agent,用消息队列串起来,架构上才扩得动。
第二个是表格与复杂文档解析:号称 SOTA 级别的做法,本质就是大量并发地用多模态模型来做 parser。几个月前测过一次,效果很一般;但这条路值得再测——如果真提升很大,「用多模态模型做解析」本身就是个挺好的服务方向。
第三个是命名的变化:agentic RAG 现在改叫 agentic reasoning 了,配的那张 agent 高阶/低阶策略图值得抄。
新的推理模型不展示中间的思考过程。给出的解释是:那些内容里有很多是规则性的东西,而规则在很多情况下并不能用思维链推理的方式来证明——硬塞进思维链里是塞不进去的。
但这件事的另一面挺可怕:那些被藏起来的推理内容,可能才是模型能力最核心、最本质的展现。
包括对下一代的教育,这些过程本身可能是有帮助的。但不放出来,大家就只能看到结果。
于是你只能 follow 一个看似很合理的推理过程——永远只能吃到鱼,学不会钓鱼。
《人类简史》作者的新书这周出了,讲的是从技术视角、信息论视角看这一代 AI 的进展。
其中一个判断很锋利:上一代技术争夺的是注意力,这一代争夺的是 intimacy——亲密度。
生成式 AI 厉害的地方不在于能生成文字、图片、视频,而在于它可以跳过一切中间系统,直接跟人对话,并且假装成一个人。
这是它能力最大的那个点。
上一代那批 AI 硬件基本已经过时了。现在被讨论的是手环、戒指、随身挂件这一类。
它们本质上做的都是健康和安全——监测睡眠、活动、体温这些指标。
为什么现在集中出现?因为大家发现大模型分析这种时序数据也挺行,一定程度上已经能做了。那接下来缺的就只有一样东西:数据。怎么尽可能贴近用户的生活场景,把数据薅过来。
做不了模型,那就做数据的采集者——这是一条清晰得多的路。
还有一类是虚拟陪伴的挂件。让人意外的是:在这么重视数据隐私的环境里,这些随身录音的设备居然被接受了。
有一套提示词工程的课程,形式是十几个连续的笔记本:从最简单的用法开始,一步一步教怎么调提示词。
中间穿插小测验——有些部分要你自己写,不写就跑不通。
所有讲解都在笔记本里,完全不需要 PPT。
最近这家在提示词这个领域上确实是全面发力:自己出,开源社区也在给它贡献东西。