从推理扩展到人形机器人,从万能多模态到科学 AI——2025 年以来,AI 领域同时在六条赛道上发生了可能被教科书记录的变化。这是一份速览式的全景地图,不是深挖——其中几条赛道我们已经在别的 DeepDive 里深入拆过,这里只做定位和交叉引用。
核心逻辑:不只是训得更大,而是让模型在推理时「多想」。OpenAI o3 让模型回答前经历隐藏思维链;DeepSeek-R1 证明推理能力可通过纯强化学习涌现,无需监督微调作为前置步骤;Claude 的 Extended Thinking 提供 budget_tokens 参数,让开发者直接控制「思考」的计算量。英国 AI Safety Institute 的 Frontier AI Trends Report 将其列为 2025-2026 年最重要的能力跃迁。推理不再是固定的训练后能力,而成了可调节的资源投入。
核心逻辑:单一模型同时理解并生成文字、图像、音频、视频。2026 年 5 月 Google 发布 Gemini Omni,DeepMind 将其定义为「世界模型」——不是通过逐帧像素预测生成视频,而是理解物体的物理属性、连续性和时序关系;OpenAI 的 Sora 2、字节跳动 Seedance 2.0 同步升级世界模拟能力。多模态不再是「把几个模型拼起来」,而是单一模型对物理世界的统一理解。
核心逻辑:从补全代码到独立完成软件工程任务。SWE-bench Verified 从 2023 年约 10% 冲到 2026 年初 Claude Opus 4.6 的 80.8%(GPT-5.2 80.0%,Gemini 3.1 Pro 80.6%);约 85% 开发者已定期使用 AI 编程辅助工具,Claude Code 发布 6 个月内达年化 10 亿美元营收。软件工程的劳动分工正在重写——开发者越来越多扮演「架构决策者」而非「代码实现者」。
这条赛道我们在「机器经济」「Agent 工程演进」两篇 DeepDive 里已有更深拆解,此处不重复展开 → agent-economy · agent-engineering-evolution
核心逻辑:语言模型的能力终于开始迁移到物理世界。NVIDIA Isaac GR00T 是专为人形机器人设计的基础模型;Figure AI 在宝马工厂持续部署超 11 个月,新建年产能 12,000 台的工厂;2025 年机器人融资达 386 亿欧元,占全球风险投资 9%,其中「世界模型」赛道融资从 13 亿欧元飙升至 65 亿欧元。Sony AI 的 Project Ace 是第一个已知的、能以职业级水平打败人类的自主系统——竞技乒乓球,且是真实部署而非演示。
核心逻辑:AI 开始真正加速科学发现,而不只是辅助文献检索。AlphaFold 3 不再只预测蛋白质结构,而是能同时建模蛋白质、DNA、RNA 和小分子相互作用,蛋白质-配体对接准确率达 76.4%,比此前方法提升 1.8 倍。药物发现正从「AI 预测候选分子」进化到「AI 设计并验证整个分子-靶点-机制链」,过去需要十年的靶点发现周期正被压缩至数月。同样的范式正在气候科学、材料发现、数学证明等领域复制。
核心逻辑:不是激活所有参数,而是针对每个 Token 只调用「必要的专家」。自 2025 年初起,几乎所有前沿模型都采用了 MoE 架构——DeepSeek-V3/R1、Llama 4、Mistral Large 3、Gemini 全家族。Mixtral 8x7B 拥有 467 亿参数,但推理速度等同于 130 亿参数模型;Gemma 4 的 260 亿参数实际只激活约 40 亿。MoE 不只是效率提升,它重塑了模型能力与成本的关系——是前面五项技术得以经济落地的基础设施前提。
这六大技术看起来各自独立,但有一条隐线贯穿始终:AI 正从「单点工具」走向「通用基础设施」——足够通用,足够高效,足够便宜。接下来的问题不再是「AI 能不能做到」,而是「谁来决定它做什么」。