Agents & Models

智能体与模型

模型能力、Agent 工程、协议与运行时——机器本身在变成什么。
21 篇文章。

Agent 工程 12

  1. Work Agent 元年:OpenClaw、Hermes、WorkBuddy 们的 User Stories 全景

    OpenClaw 346k star、Hermes 15 亿美元估值、腾讯 WorkBuddy 下场——三条赛道同时收敛,Work Agent 品类元年的用户故事全景

  2. AI 编程周记回顾:三个月后,哪些判断经住了时间

    回看 2026 年 4-5 月三篇 AI 编程周记快照,以事后回顾视角评估每个判断的保质期——哪些被行业自身迅速超越,哪些预告了后来才成形的概念

  3. 循环工程:当你不再 prompt,而是设计驱动 Agent 的系统

    继 Prompt Engineering、Context Engineering 之后 AI 工程的第三代范式:把人从每一轮对话里抽走,改为设计一套自动发现、派活、验证、记忆的系统去驱动 Agent

  4. WebMCP:Google 要把整个网页变成 AI 的 API

    Google 与微软在 W3C 推进的 WebMCP 标准提案——让网站主动声明可供 Agent 调用的工具,跳过截图识图式浏览器自动化,梳理其与 Anthropic MCP 的关系与安全隐患

  5. Meta 的 1250 亿美元赌局:从聊天机器人到 Agentic 帝国

    Meta 2026 年 1150-1350 亿美元 AI 资本支出背后的 Agentic 战略——社交图谱、Ray-Ban 显示屏眼镜、开源 Llama Stack 三重护城河,以及 20 亿美元收购 Manus 被中国监管叫停暴露的执行层缺口

  6. Code with Claude 2026 · 从模型公司到 Agent 平台

    Anthropic 开发者大会全景解读,从单一模型 API 到完整 Agent 平台的产品叙事转变

  7. LLM from Scratch · 全栈 LLM 系统

    从随机权重预训练到推理服务的完整 LLM 全栈实现:8 层架构、约 1 万行代码、零外部 API/权重,RTX 5090 上 70 秒训出会调用工具的 agent

  8. 机器经济元年:Agent 如何拿到钱包、身份与第一份工作

    综合梳理 Agent 基础设施生产化、互联网流量主体迁移、支付与身份协议铺设、企业工作流 Agent 化四条线索,用 VendingBench 经营数据检验机器经济地基之上的治理缺口

  9. Agent 工程进化论:从 Harness 稳定到自主迭代

    「Harness 稳定 → 互联网基础设施 → 安全分水岭 → 自主进化 → 执行层商业化」五阶段演进主线,Kimi K2.6 12 小时连续运行 / MiniMax M2.7 百轮自改 / 9 秒删库事件 / Karpathy AutoResearch 一手数据

  10. Agent基础设施战:平台、标准与执行环境的控制权争夺

    OpenAI 开源 Symphony 编排标准对撞 Anthropic MCP、GitHub Copilot 席位转按量计费、沙箱执行环境安全事故频发(9 秒删库 + 70-100% 函数调用劫持)、OpenAI Workspace Agents 正面进攻——AI 竞争重心已从模型能力转向基础设施控…

  11. Claude 桌面版开发者模式完全指南:从 MCP 配置到远程连接器

    MCP 服务器配置与生态、桌面扩展市场、三层调试工具、远程 Custom Connector,以及权限边界和 token 消耗实战陷阱

  12. 一周奠基 Agent 经济:Cloudflare Agents Week 2026 全景解读

    Stripe Projects 让 Agent 自主完成账户注册/支付令牌化/部署闭环、八层技术图谱、Stripe ACP vs x402 支付协议之争、Cloudflare 三层护城河战略

模型前沿 9

  1. 2026 年六大前沿 AI 技术全景

    六条同时在发生的 AI 技术赛道速览:测试时计算、原生多模态、AI 编程 Agent、Physical AI、AI for Science、混合专家架构(MoE)

  2. 自进化学习八层论:从训练场到自进化公司

    综述自进化 AI 系统的八层技术栈——训练环境、模型权重、外部记忆、技能文档、工作流代码、计算底座、AI 研发闭环(RSI)与组织本身,覆盖 R-Zero、SEAL、Absolute Zero、Agent0、AlphaEvolve、POET 等代表工作

  3. Toward Enactive AI · Sutton 把具身认知摆上 RL 的桌面

    Rafiee & Sutton 立场论文拆解 · enactive 四概念(经验 / 动作-感知不可分 / 自治 / 具身)× AI 现状对照 · RL 结构性共振但非等价 · 留四问,含 MCP / computer-use 时代「软件 agent 算不算具身」的本体论一问 · arXiv:260…

  4. Interaction Models:Mira Murati押注的「交互即智能」

    Thinking Machines Lab 发布 TML-Interaction-Small:276B MoE 原生实时音视频交互模型,turn-taking 延迟 0.40 秒,双模型协作架构

  5. AI黑盒与测量危机:三层失明的认识论崩塌

    评测体系在外部表现(benchmark 饱和/长上下文退化)、内部状态(171 个情感向量与行为解耦)、能力边界(ARC-AGI-3 仅 0.37% vs 业余爱好者破解 60 年 Erdős 猜想)三层同时失效

  6. 从 $15 一篇论文到 Nature 发表:AI Scientist 的科研自动化之路

    Sakana AI 的 AI Scientist 从 2024 年 8 月首发到 2026 年 3 月 Nature 正式发表并升级为 Workshop 级别自动化科学发现,量化科研生产函数 4-5 个数量级成本差异

  7. 垃圾数据与下一次能力跃升

    Karpathy:Llama 3 信息压缩率仅 0.07 bits/token,前沿模型庞大是数据质量低下的代价而非算力堆叠必然 · 私有企业数据收购 vs 公开数据供给萎缩 · 推理模型作为绕过数据瓶颈的新路径

  8. 长上下文的三角悖论:效率、准确性与泛化性的不可能取舍

    ArXiv 理论论文形式化证明长上下文架构无法同时在效率、准确性、泛化性三者最优,类似 CAP 定理之于分布式系统

  9. 情感向量与行为解耦:打开 AI 黑盒的第一批发现

    Anthropic 171 个因果情感向量研究,机制可解释性打开 AI 黑盒的早期一批发现