§ 01 一周时间线:从仓库泄露到企业管控

这件事的节奏比大多数模型发布都快,值得先把时间线摆清楚。

9 月 3 日凌晨,发布前十几个小时。 有人翻 OpenAI 官方仓库 openai-cua-sample-app,发现一个由内部账号提交的 PR #71,分支名叫 gpt6-computer-use-images,新增了 gpt6-js-imagegpt6-py-image 两个环境。Token Gremlin 去 GitHub 历史里核对后发了一句:"That's computer use."——GPT-6 会主打什么,这时候已经没有悬念。

9 月 3 日。 OpenAI 官方推文只有两句话:"This is GPT-6 Astra. Anything you can do on a computer, Astra can do for you. Fast." 发布视频致敬的是 1979 年 MIT 建筑机器组的 "Put That There" 演示,据 Browserbase 工程师 Kyle Jeong 9 月 7 日的统计,这条推文当时已有 1.31 亿播放。宝玉转述,总裁 Greg Brockman 在发布前的媒体沟通会上说,他个人认为 OpenAI 已经做到了 AGI,"未来回头看,可能就是这个模型"。

9 月 4 日。 API 开放 gpt-6-astra,标准定价每百万 token 输入 10 美元、输出 50 美元。OpenAI 计算机使用团队同时宣布:搭配 Astra,ChatGPT 的 computer use 快了近 2 倍;而且 harness 层的优化是通用的,用旧的 GPT-5.6 Sol 也能快约 60%Sac 转引的官方说法)。同一天,OpenAI 计算机使用团队核心成员 Maximilian Sieb 宣布离职,他的告别帖有 230 万播放,里面有一句话概括了这条路线的三年:"我们把模型从订机票时点不准日期,带到了主线模型里的 computer use,再到这周的 Astra。"

9 月 5 日到 6 日。 demo 潮。KEITO 让 Astra 在 Canva 里用鼠标画自己的肖像,84 万播放;Alexey Fateev 给 Astra 和 Claude Fable 5.1 同一张照片、同一个 Paint,配文"Fable 5.1 欠我一个道歉",119 万播放;Mark Kretschmann 看它弹钢琴后问"computer use 是不是已经被解决了"。Will Hu 在发布 48 小时后盘点了 7 个高互动案例,150 万播放,后面会细说。

9 月 7 日。 黄仁勋宣布 "AGI has arrived",并透露 Astra 在超过 10 万套 NVIDIA Grace Blackwell NVLink72 系统上训练。Kyle Jeong 发出源码拆解博客。Bilawal Sidhu 把父母老宅的 3D 扫描交给 Astra 变成可编辑场景,然后"把重力调低、开了一个传送门"。

9 月 8 日。 第一桶冷水。CoArena 发布 CUA KnowledgeBench:花了超过 5 万美元让前沿模型做 12 小时的真实公司工作,Astra "勉强挤进前三"。同一天,Kyle Jeong 宣布用 Stagehand 做翻译层后,Astra 的 computer use 再快 2.5 倍

9 月 9 日。 第二桶冷水。Francesco 团队针对被反复转发的高速演示视频说:预批处理的动作不等于 Agent 实时决策,"这不是今天现实的日常实时 computer use,一年内大概也不会是"。

9 月 10 日。 三件事同一天。OpenAI 的 James Sun 宣布企业级 CUA 管控:站点与应用白名单、上传/下载/历史/CDP 逐项开关、审批力度可调、每一次截图和动作都流到 OpenTelemetry。OpenAI 发布 Agents API,把 Codex harness 搬到云端托管,公测。NeoCognition 发布 ApprenticeBench,给出一个后面会反复引用的判断:"No more CUA tax"——GUI 操作的成功率第一次追平了 API。

§ 02 官方数字:快了一倍,安全指标降了一个量级

OpenAI 发布页在 computer use 这一节给的数据不多,但每一条都可以对照。

指标 GPT-6 Astra GPT-5.6 Sol 第三方对照
OSWorld 2.0(v2026.08.08,离线集) 72.6%,约 40 分钟/任务 65.7%,约 75 分钟/任务 Claude Opus 5:70.2%
ScreenSpot-Pro(无工具) 92.7% 76.9% Claude Fable 5:87.3%
Agents' Last Exam 59.3% 53.6% Claude Opus 5:55.5%
AutomationBench 41.4% 18.1% Claude Fable 5.1:31.4%
Mind2Web 任务完成速度(含 harness 更新) 1.9 倍 基准
内部 CUA 安全 benchmark(越低越好) 2.4%(开 AutoReview 后 1.8%) 22.0% Claude Fable 5.1:9.5%
FIG 1 · OSWorld 2.0(v2026.08.08 离线集):得分 vs 每任务耗时 得分(%,越高越好) 每任务耗时(分钟,越低越好) GPT-6 Astra 72.6 Claude Opus 5 70.2 GPT-5.6 Sol 65.7 050100 GPT-6 Astra ≈40 min Claude Opus 5 未公布 GPT-5.6 Sol ≈75 04590 分数只涨 6.9 个百分点,时间少了约 47%:这次发布"快"比"准"是更大的变化
图 1 · OSWorld 2.0:Astra 得分 72.6%、每任务约 40 分钟;上一代 Sol 65.7%、约 75 分钟(耗时为 OpenAI 的延迟模拟)
数据来源:GPT-6 Astra: A new generation of intelligence(OpenAI 发布页)

几个值得停一下的地方。OSWorld 2.0 的分数只涨了 7 个百分点,时间却少了 47%,这说明"快"比"准"是更大的变化。ScreenSpot-Pro 是纯定位测试(给一张专业软件截图,找到该点的地方),从 76.9% 到 92.7% 是这张表里最大的跃升,也是 X 上"坐标又快又准"这类观感的来源。AutomationBench 翻了一倍多,但绝对值只有 41.4%,意味着一半以上的自动化任务仍然做不成。

安全那一行需要单独解释。OpenAI 用一个"对抗性挑选、专门诱导模型犯错"的 computer use 任务集测不良后果发生率,Astra 是 2.4%,上一代是 22.0%。发布页还提到,在内部评估里 Astra "从未尝试绕过 Codex Auto-Review 的拒绝",即便审查被故意配置成可绕过、且不绕过就无法完成任务。这是 OpenAI 敢把 CUA 推给企业的底气,后面讲管控层时会再回到这里。

FIG 2 · Computer use 相关 benchmark 全景(%) GPT-6 Astra GPT-5.6 Sol 同表中最佳 Claude ScreenSpot-Pro 专业软件截图定位·无工具 92.7 76.9 87.3 Fable 5 Agents' Last Exam 真实软件里的专业任务 59.3 53.6 55.5 Opus 5 AutomationBench 自动化任务 41.4 18.1 31.4 Fable 5.1 内部 CUA 安全 benchmark 不良后果发生率·越低越好 2.4 22.0 9.5 Fable 5.1 050100
图 2 · 定位(ScreenSpot-Pro)是最大跃升,AutomationBench 翻倍但绝对值仍不到一半;安全 benchmark 从 22.0% 降到 2.4%
数据来源:GPT-6 Astra: A new generation of intelligence(OpenAI 发布页)

其他几个数字不直接关乎 computer use,但决定了它的"底盘":Terminal-Bench 4.0 从 37.3% 到 57.9%,ARC-AGI-3 从 7.8% 到 99.9%,FrontierMath Tier 4 到 97.6%。OpenAI 还说 Astra 在网络安全上达到了其 Preparedness Framework 的 "Critical" 阈值,ExploitBench 满分。这些数字和 CUA 的关系是:模型越聪明,完成一个任务需要的回合越少,而回合数正是 CUA 速度的瓶颈。

§ 03 它为什么突然能用了:拆开 Astra 的 CUA 循环

Kyle Jeong 在 Browserbase 做了三年 computer use 的生产化,他 9 月 7 日的博客是目前最清楚的技术拆解,材料来自 Codex 开源仓库和 ChatGPT 客户端源码。他的核心框架一句话:computer use 是 harness(工程)和 model(研究)两个问题,模型决定做什么,harness 负责做到。 两个都得解。

旧路线的病根。 2024 年 10 月 Anthropic 用 Claude 3.5 Sonnet 开了先河,路线是纯视觉:模型看截图,输出像素坐标加动作,再由 Playwright 之类的驱动执行。后来 OpenAI 的 Operator、Google 的 Gemini 2.5 Computer Use 都是这个思路。它的问题在于,模型是在固定视口(比如 1288×711)上后训练的,换一个窗口尺寸就开始点不准;而且截图看不到内部状态——按钮到底是不是禁用的、表单有没有校验通过,只能反复试。

Astra 的路线:把屏幕读成文本,把动作写成代码。 Chrome 里每个网页、大多数桌面应用,都会为无障碍模式自动生成一棵 a11y 树(accessibility tree),把界面上每个元素的角色、标签、状态列成结构化文本。它比截图省 token,而且天然带状态。Astra 优先读这棵树,需要时再补一张截图,然后用代码发出动作。一次典型输出长这样:

{
  "type": "function_call",
  "name": "exec_js",
  "arguments": "{\"code\":\"await page.getByRole('searchbox').fill('browser automation'); ...\"}"
}

也就是说,computer use 现在就是 code mode。OpenAI 的 API 文档甚至直接建议所有 computer use 都走代码执行,浏览器推荐 Playwright,桌面推荐 PyAutoGUI。

架构本身不复杂。 会话开始时,Codex 起一个 Node REPL 保存状态,绑定浏览器或原生应用的操作接口。模型观察(文本、截图或两者)、写代码执行动作,本地一个叫 CodexComputerUseIPC-5 的服务通过原生管道上的 JSON-RPC 把动作落到元素 ID 或坐标上。执行完不算完,Astra 会再观察一次,把当前状态和预期状态对一遍,然后进入下一轮。因为 computer use 天然有状态,这个 REPL 必须撑满整个会话。

FIG 3 · Astra 的 computer use 循环(Codex harness) ① 观察a11y 树 + 截图文本优先·按需截图 ② 决策 · 写代码exec_js → Playwright桌面走 PyAutoGUI ③ Guardian 审查GPT-5.6 Luna 分类high → 阻塞式复核 ④ 执行CodexComputerUseIPC-5JSON-RPC · 原生管道 ⑤ 再观察 · 校验当前状态 vs 预期不符则重试 循环直到任务完成 · 更聪明 → 回合更少 → 更快 Node REPL 保存整个会话的状态:computer use 天然有状态,REPL 必须撑满整个循环 Guardian 常见拦截:权限授予 · 登录与账户级操作 · 敏感数据提交 · 有后果的点击 · 绕过限制 · 破坏性操作 · 越权访问私有数据 发布页数据:内部评估中 Astra 从未尝试绕过 Codex Auto-Review 的拒绝
图 3 · Astra 把屏幕读成 a11y 树、把动作写成代码;Guardian 在执行前做安全审查;REPL 保持会话状态
数据来源:How does Astra's computer use actually work?(Kyle Jeong / Browserbase,基于 Codex 仓库与 ChatGPT 客户端源码)

Guardian:动作执行前的安全审查。 Astra 是唯一要求 auto-review 的模型。机制是用 GPT-5.6 Luna 做后台分类器,评估当前工作流的风险,返回 high 或 low;high 会触发对后续动作的阻塞式审查,审查器输出类似 {"risk_level": "high", "user_authorization": "low", "outcome": "deny"} 的结论。常见的拦截项包括权限授予、登录和账户级操作、敏感数据提交、有后果的点击、绕过限制、破坏性操作、越权访问私有数据。用过 Codex 委派任务的人大概都撞过其中几条。

那它为什么快? Kyle 的回答很朴素:它更聪明,所以回合更少。Astra 在超过 10 万块 GB300 上做的后训练,大量时间花在 computer use 环境里的强化学习。推理速度反而不是主因:一旦超过 300 TPS,瓶颈就在动作执行而不是生成。harness 层的 websocket 预热、连接复用、用 previous_response_id 做增量请求,这些只压缩工具启动时间,不改变每步动作的速度。

有一个旁证很说明问题。Kyle 团队做了一个翻译层,把 Astra 输出的 Playwright 命令转成 Stagehand,速度再快 2.5 倍他给的例子是 Astra 自己决定把整个 logo 的绘制合并成一条命令,一次画完。这正是"聪明 → 回合少 → 快"的具体形态:不是每一笔都更快,而是它知道可以把一百笔打包成一笔。

FIG 4 · "快了多少"的四个数字,四种口径(换算成速度倍数) 仅 harness 优化 · GPT-5.6 Sol OpenAI 计算机使用团队 · "约 60%" 1.6× Astra + 新 harness · Mind2Web OpenAI 发布页 · 任务完成速度 1.9× Astra · OSWorld 2.0 每任务耗时 OpenAI 发布页 · −47% ≈ 1.9× 1.9× Astra + Stagehand 翻译层 Browserbase · 相对 Astra 默认 Playwright 2.5× 四个数字来自不同 benchmark 和基线,不可相乘;共同点是提速主要来自"回合数变少"和 harness,不是推理速度
图 4 · harness 优化让上一代模型也快 60%;Astra 在 Mind2Web 上 1.9 倍;Browserbase 的 Stagehand 翻译层在此之上再快 2.5 倍
数据来源:OpenAI 发布页 + OpenAI 团队推文(经 Sac 转引)+ Kyle Jeong 推文

还没解决的。 Kyle 自己列了三条:观察可能失败(a11y 状态不完整、截图细节不够或者视图已经过期);观察和动作之间状态会漂移,有些应用的 a11y 树变得很频繁,动作就会落空;长时程 computer use 基本没被验证过——压缩做得好可以跑很久,但跑几天、几周之后表现如何,没人看到过。

§ 04 X 上的两种声音

爆款 demo 分四类

把一周里高互动的案例按"它到底在操作什么"归一下类,比按播放量排更有信息量。

第一类,画像。 Canva、Paint、Apple Notes、Kleki,给一张照片,让它一笔一笔勾出来。这类视觉冲击最大,也最没有实用价值。Jesse Lau 说得直接:让 LLM 复制一张图的像素再重画,"属于预先做一个程序就能搞定的事情",纯属浪费 token。但他接着说了一个真有用的场景:打开 TradingView,直接在行情图上画趋势线、阻力线、斐波那契回撤和波浪标注,给出初步读图结论,作为人工交易前的预筛。

第二类,3D 和游戏。 这是流量最大的一类。Annalea 在 Blender 里 one-shot,97 万播放;Kevin Kern 让它在 Blender 里造车;Will Hu 盘点里有 /goal 连跑 5 天的 SimCity 克隆、Manager Loop 跑一周在 Unreal Engine 里逐街搭建的曼哈顿、一张老蒸汽火车图纸变成 3,295 个可编辑对象、600 个 Astra Agent 住进同一个 Unreal 世界。Tykoo 的观察顺便点破了一个副作用:一堆人用 Blender 建 3D,把本来就讲不清楚的"世界模型"定义搅得更乱,李飞飞几天前刚发的模型流量全被抢走。

第三类,生产工具。 这一类播放量不高,但每一条都是有人真的在用。Sac 让 Codex 直接操作剪映粗剪,"作为粗剪完全够用";Kyle Balmer 所有长视频都由 Codex 剪辑,再用 computer use 上传 YouTube、填描述、传封面;AWAMORI 让它从 Illustrator 的落地页设计稿切图到写代码,全程含修改消耗了 Pro 5x 计划周额度的 15%;LinearUncle 用 Keynote 加动画,内容是 Codex 生成的 SVG;cosine 发现不再需要 Figma dev MCP,Astra 直接在 Figma 里看属性、改设计。

第四类,开发验收。 宝玉的评价有 20 万播放:"它不像 GPT-5.6 那样要稍微等一会才操作,现在能很快很精准地帮我测试 App……这带来一个最大的提升,就是让 Agent 从开发到验收形成了完整的闭环。" quark_h 更进一步:要测 Windows 客户端,就开一台 Windows 虚拟机,Mac 远程登录进去,让 Codex 在 Mac 界面上操作 Windows,"测试过程非常丝滑"。

Will Hu 盘点完 7 个案例的结论,和我们看完两百多条推文的结论一致:"以前做 AI 自动化,是先给 Agent 配 API、MCP 和插件,再教它怎么用软件。Astra 的路线,是让模型直接把屏幕当界面、把整台电脑当工具。所以它最可能先改写的,不是内容生成,而是那些功能强、学习成本高、又没来得及做 AI 接口的老软件。"

三桶冷水

第一桶:实时性。 Francesco 团队的判断前面引过了。他们自己录了 QGIS 出图、Preview 批注 PDF、GIMP 转 Inkscape 的多应用演示,每条都注明"手势 1 倍速播放,等待、重试和设置被剪掉,这是剪辑片段,不是完成时长的声明"。Cosmic Raven 的吐槽更具体:"Astra 在 demo 里弹钢琴,然后花 30 秒打开一个 File 菜单。中等推理档在每次点击前都要跑一步思考,这就是你那 30 秒。" 需要说明的是,OpenAI 计算机使用团队成员声称发布视频里的所有 demo 都是实时录制的。两种说法我们都无法独立验证,只能并列放在这里。

第二桶:长时程。 CoArena 的 benchmark 值得多说几句,因为它的设计和常见 benchmark 完全不同。10 个未公开的真实公司任务,每个 5 个种子,一共 50 次运行,每次 12 小时墙钟时间,超过 100 个应用,最后只看工作产物是否合格,二值判定。一个环境是配送中心的班次:仓库系统、SAP 风格的 ERP、团队聊天和邮件,32 个工作窗口,证据随时间陆续到达。结果是最好的 Claude Fable 5.1 做成了 12 次(24%),Astra 勉强前三。更有意思的是分布:一个模型会做的任务,5 个种子里能做成 2 到 3 次;模型之间的差距主要在"10 个任务里有几个根本做得了",头部是 4 个,尾部是 1 个。就算做成了也慢,Fable 5.1 成功运行的中位数是 6,940 个动作、6 小时 22 分钟。CoArena 接下来要花 20 万美元跑 1 天、3 天、7 天的版本。Doug Champion 在评论区质疑这种测法是否合理:"没有 Agent 会在 Gmail 或 Slack 里用鼠标",这个质疑和 NeoCognition 的"GUI 追平 API"结论放在一起看,恰好是当前争论的两极。

FIG 5 · CoArena CUA KnowledgeBench · 12 小时真实公司工作(10 任务 × 5 种子) Claude Fable 5.1 · 表现最好的模型 · 50 次运行 12 / 50 成功 · 24% GPT-6 Astra:"勉强挤进前三"(具体数字未公布) 成功运行的中位耗时 vs 12 小时预算 6 h 22 min 0 h6 h12 h 6,940 个动作 / 次成功运行(中位数) 任务广度决定排名:头部模型能做 4/10 个任务,尾部只有 1/10 同一任务 5 个种子里只成功 2–3 次:可重复性也是短板 下一步:1 天 / 3 天 / 7 天,预算 20 万美元;任务不公开,防止刷榜
图 5 · 12 小时真实工作里最好的模型只做成 24%;就算成功,中位数也要 6,940 个动作、6 小时 22 分
数据来源:CoArena(YC S26):CUA KnowledgeBench 发布线程

第三桶:判断力。 Max Schoening 一句话:"Astra is way too eager to CUA."清凤的例子有 2 万播放:明明有 GitHub CLI,Astra 转头打开 Chrome 试图在网页上创建 issue。Akira 说它"很强,但为什么总做我不想让它做的事"。arjun chintapalli 玩 Cities: Skylines 的结论最尖锐:"能跑但很慢,铺水管这种精细操作做不了;写了个 harness mod 之后就丝滑了。cua 是派对戏法,有用的 Agent 是在 harness 层解决的。"

这三桶水指向同一件事:模型能力已经过线,但"什么时候该用 CUA、什么时候不该"的判断,以及围绕它的工程,还远没有跟上。这恰恰是机会所在。

§ 05 八个新机会

1. 没有 API 的老软件:OpenAI 自己点名的市场

这是全部材料里信号最强的一条。James Sun 在 OpenAI 的原话:"CUA 对企业尤其有用,因为很多工作流发生在没有任何 MCP 或 API 的老旧或自研软件里。" 他说这套管控已经在"全球最大的一批公司"里测试了一个月,采购、财务、QA、GTM、市场、IT 都长出了新工作流。

Sanjin 从国内企业的视角说了同一件事:"很多企业后台、传统软件,没有好用的 API。想接 MCP、写 Skill,往往也得先花大量精力把底层操作打通。与其让所有旧系统重新适配 AI,不如让 AI 学会人原来的操作方式。" 他期待的具体场景是"导出后台数据、整理成表格、上传到另一个系统",跨几个软件连续完成,出错还能自查。

NeoCognition 的 ApprenticeBench 给了这条路线第一份量化证据。他们让 Agent 在一家模拟的加州建筑公司的应付账款部门做 7 个月学徒:学 ERP、从公司历史里学惯例、从反馈里持续学习,处理进项发票错误、供应商沟通、审批流程和政策变更、给账单项目分配成本代码。结论是 Fable 5.1 和 Astra 在这个岗位上超过了人类专业人员,而且"通过 GUI 做和通过 API 做一样好"。项目成员 Boyu Gou 的说法更进一步:"最强的 Agent 现在通过 GUI 成功的次数已经比通过 API 更多。"

对创业者的含义:过去十年"集成"是 SaaS 行业的隐形税,一家企业要接一个新系统,先问有没有 API、再找 FDE(前线部署工程师)写胶水代码。如果 CUA 税真的归零,"有没有 API"就从能不能自动化的门槛,变成了成本高低的问题。RPA 厂商、系统集成商、以及所有靠"我们有连接器"活着的公司,都要重新想自己的护城河在哪。

2. 三层工具栈成为默认:CLI、MCP、CUA 各归其位

X 上真正在生产环境用 Astra 的人,不约而同地描述了同一种分层。Kevin Kern 造车的配置:Blender CLI 跑脚本、批量渲染和导出;MCP 做场景的实时检查和编辑;computer use 负责视觉审查,以及 CLI 和 MCP 都暴露不出来的 UI 操作。Brent Schooley 在一台全新机器上测 DaVinci Resolve,本来想给 Codex 写个插件,结果发现不必要:"我看着 Astra 找到能用 Python 脚本的地方就用脚本,用不了的地方就切 CUA。"

这条分层的意义在于,MCP 不会死,但它的位置变了。过去一年 MCP 是 Agent 接入软件的入口,现在它退到了中间层:能走 API 的走 API,因为更便宜更稳;走不了的地方 CUA 补位。熊布朗做完调研的判断是,开源的 cua 项目已经算成熟方案,但离 Codex 的 computer use 还有差距,他打算把 cua 以插件形式接进自己的 Agent。

对 MCP 开发者的含义:为一个有完整 GUI 的软件专门写 MCP 的价值在下降,除非它能提供 GUI 拿不到的东西(批处理、结构化状态、更低成本)。反过来,"帮 Agent 判断该走哪一层"的路由逻辑,是新的价值点。

3. 开发到验收的闭环:QA 第一次能被 Agent 自己关上

宝玉那句"从开发到验收形成完整闭环"背后是一个具体的工程变化。以前 Agent 写完前端,验证靠人打开浏览器点一遍;现在 Astra 自己开浏览器、点按钮、看结果、修 bug。OpenAI 发布页把"运行前端 QA 检查、确认网站上所有功能都能用"列为 computer use 的标准场景,Cognition 的 Silas Alberti 说 Devin 在发布当天就把 Astra 接进了 harness,"测试视频明显更容易看懂,报告更清楚更简洁"。Lovable 的 CTO Fabian Hedin 则观察到,Astra 在高 effort 档会"把更多迭代花在新构建上,通过浏览器测试做更多验证"。

这打开的不只是"AI 写代码"的下一步,而是整个测试外包和 E2E 测试工具的重估。quark_h 用 Mac 远程操作 Windows 虚拟机测客户端的做法,本质上是把一个专职测试岗位变成了一条 prompt。

4. 不会写代码的人,第一次能做自动化

FleetingBits 的一串思考是这个方向最完整的论证,有 1.2 万播放。他的核心观点:AI 悲观者不理解的一点是,新的模型能力会重置采用曲线。ChatGPT 之后是聊天机器人的采用潮,coding agent 之后是第二波,下一波会由 computer use 驱动,因为 Astra 已经接近能支撑大量自动化的可用度。他自己已经把报销、Airtable、Google Docs、日历和 iMessage 全交给了 Astra,"大量企业办公流程就是按 Google Doc 里的规则把东西从一个 SaaS 复制到另一个 SaaS,Astra 能做这个"。

关键的一句是:"因为 computer use 不要求用户懂任何代码,它能被范围广得多的办公室员工使用——他们知道自己想让模型做什么。"

他同时列出了两个缺口,每一个都是一家公司的题目:一是密码和权限还得人管,"Codex 和 Cowork 里需要内置密钥管理器";二是 computer use 工作流仍然要人来触发,"需要一种简单方式在公司级或团队级账户上设置监视器"。

5. 企业管控与审计层:"CUA 的 SOC"

James Sun 列出的管控项,每一项都对应企业安全团队会问的问题:能限制 CUA 访问哪些站点和应用;能逐项管理上传、下载、历史记录、CDP(Chrome DevTools Protocol);能通过调审批设置来控制人在环的程度;每一次截图、动作和审批都流到 OpenTelemetry,管理员可以审计和回溯每条轨迹。

加上前面讲的 Guardian 和 OpenAI 在发布页上的表态——"额外的安全检查有时会减慢、暂停或停止合法工作,包括防御性网络安全任务;在 ChatGPT 或 Codex 里任务会暂停等你审核,在 API 里任务会直接停"——可以看出 OpenAI 自己把"可控"当成了 CUA 进企业的前提,而不是附加功能。

Yenpro Musik 的一句话点出了审计的必要性:"Agent 喜欢说自己做完了。计算机使用 Agent 普及的那一周,我就不再信这个词了。模型能点击、能打字、能留下一串看起来像工作的痕迹。" 谁来验证这串痕迹是真的工作,就是这一层的生意。轨迹分析、异常检测、合规回放,围绕 OpenTelemetry 数据流做 CUA 专用的安全运营,市场刚刚出现。

6. Harness 层:模型是 OpenAI 的,工程是大家的

这是被讨论最多、也最容易被忽视的机会。Kyle 的翻译层让速度再翻 2.5 倍,arjun 的 harness mod 让 Cities: Skylines 从"派对戏法"变成能用,OpenAI 自己的 harness 优化让上一代模型也快了 60%。三个例子说的是一件事:模型能力过线之后,剩下的提升空间大部分在 harness。

Flrande 的评论带情绪但有信息量:"Codex 爆火都半年了,还给 Astra 摸索出 computer use 的路子,而 A➗ 还在 TUI 上雕花。" 不管你是否同意对 Anthropic 的评价,Codex Desktop 的 harness 确实成了 X 上被拿来比较的基准。

具体的题目已经有人在做:Cosmic Raven 提到的 cua-driver解决桌面端的访问问题,包括文件选择器;Simular 在旧金山科技周办 CUA 聚会,主题就是"CUA 普及之前还需要发生什么";Kyle 提到 Stagehand 做的是 DOM 与 a11y 树的精简快照,把 27k token 的原始 HTML 压到 6k。谁能把观察、动作、状态和失败回放做成开发者一行代码就能接的东西,谁就在这一层站住了。

7. 创意生产的"反向图形学"

Bilawal Sidhu 的实验流程值得完整记下来:2019 年拍的约 400 张 2D 照片,经 RealityScan 做摄影测量得到一个网格;把网格丢进 Blender,让 Astra 把它变成一个完整、干净、可编辑的 3D 场景,材质来自照片扫描,其余用程序化着色器。他的判断是"多模态 LLM 可能已经跨过了反向图形学的鸿沟,对 VFX、AR/VR 到机器人都有巨大影响",但也老实说了缺陷:有些错误是从 RealityScan 的参考网格继承来的,"人在'空间自动补全'上仍然强得多"。他的下一步,是让 Astra 用 CUA 打开摄影测量软件,对照源图像继续修。

OpenAI 发布页的 BenchCAD 数据(从多视角渲染反推 CAD 代码,Astra 95.9% 对 Sol 83.3%)和 Higgsfield CEO "复杂创意工作流 token 少 20%" 的引用,加上 Dimillian 从一句话建筑需求到 Unreal Engine 5 可漫游住宅的开发者博客,说明这不是一两个人的运气。建筑可视化、游戏资产、影视预演,这些过去靠专业人员数天工时的环节,现在的边际成本变成了 token。

8. Agent 入职而不是集成

ApprenticeBench 最有意思的地方不是结果,是设计。它把"部署一个 Agent"建模成"一个新员工入职":没有 FDE,Agent 自己上岗,学系统、学惯例、从反馈里持续学。NeoCognition 的说法是"No FDEs. Agents deploy themselves into the job.",他们认为一到两年内 Agent 能成为跨行业的独立劳动力。

但同一串推文里也给了反面数据,值得记住。人和 Agent 的学习行为不一样:人练得越多越快,Agent 的记忆笔记越多越慢;人需要的笔记远少于 Agent,因为人更擅长压缩学到的东西、记在脑子里。John Rood 在评论里提出真正的杀手级测试:"第 2 个月教一条审批规则,第 6 个月换掉它,然后测 Agent 会不会在不复活旧规则的前提下遵守新规则。持续学习不是累积,是知道什么已经不再成立。"

OpenAI 同一天发布的 Agents API 是这个方向的基础设施:云端托管的 Codex harness,OpenAI 负责编排、长时运行会话和上下文管理。加上发布页提到的 Codex 新特性——模型可以跨上下文窗口保留笔记,旧窗口仍可搜索,而不是每次压缩成一段摘要——"Agent 上岗"在技术上第一次有了闭环。它离真的能用还有多远,要看 CoArena 的 1 天、3 天、7 天结果。

FIG 6 · 八个新机会:证据强度 × 落地时间(作者判断,非量化数据) 现在就能做的生意 等数据 ① 没有 API 的老软件② CLI / MCP / CUA 三层工具栈③ 开发到验收闭环④ 非程序员自动化(缺密钥与触发器)⑤ 管控与审计层⑥ Harness 层⑦ 反向图形学(3D / 视频)⑧ Agent 入职(等 1/3/7 天结果) 证据强度 → X 上零散实测 · 官方数据 · 第三方 benchmark 落地时间 ↑ 待验证 → 6 个月 → 现在 依据:OpenAI 发布页与企业团队推文、NeoCognition / CoArena 两个 benchmark、Browserbase 源码拆解、X 上一线使用者反馈
图 6 · 右上角是证据最硬、现在就能做的四件事;"Agent 入职"证据最弱,要等长时程数据
数据来源:本文 § 05 的综合判断,各点依据见对应小节

§ 06 还没解决的问题

成本与配额。 Moken说 200 美元计划的周额度用 Fable 或 Astra 不到一天就烧完,"订阅制无限用的时代结束了"。山田的经验是 Astra 推荐的中等 effort 档最划算,"一开极高或 Ultra 立刻溶掉"。Yizhou Wang 的抱怨代表了一类真实需求:"用 Astra 去做只需要一个正常人脑的事情很蠢,但其他模型又没有 Astra 的 CUA 能力。" 一个便宜的、CUA 能力过线的小模型,是明显的空位。

安全检查会误伤。 OpenAI 自己承认额外的检查"有时会打断合法工作",并在继续迭代减少不必要的中断。Kyle 补充了一个细节:Guardian 在技术上不保证看到完整的 a11y 树。对做防御性安全工作的人,这意味着 Astra 目前会拒绝写概念验证漏洞利用,更宽松的权限要等 OpenAI Daybreak 项目在未来几周逐步放开。

网站反制。 udit 发现让 Astra 扫一个网站会被 robots.txt 拦下,同样的任务 Codex 的 CUA 却可以做,"大概很快会被补上"。这暴露的是一个更大的问题:当 Agent 用人类的界面访问网站,网站要不要、能不能区分它和人?

密码和权限。 FleetingBits 点名的密钥管理器缺口,James Sun 的管控项里也没有完全覆盖。今天大多数人是让 Agent 复用自己浏览器的登录态在跑,这在个人场景可以,在企业里过不了安全审查。

判断力仍是短板。 "too eager to CUA" 不是一个模型版本能修的问题,它需要 harness 层的路由规则、成本感知,以及更多"什么时候不该用 GUI"的训练信号。

长时程完全未验证。 Kyle 和 CoArena 从两个方向说了同一句话。12 小时是目前的天花板,最好的模型成功运行的中位数已经用掉 6 小时 22 分钟。跨天、跨班次、等待对方回复,这些真实工作的常态,目前没有任何数据。

§ 07 我们的判断

第一,CUA 税归零改变的不是"能不能",而是"贵不贵"。过去有没有 API 决定一个流程能不能被自动化,现在它只决定成本。这意味着所有以"集成难"为护城河的业务,包括 RPA、系统集成和大量 SaaS 连接器,护城河在变浅;而所有因为"没有 API 所以一直手工做"的岗位工作,第一次有了被自动化的路径。这一点我们比较确定,因为 OpenAI 的企业客户数据、NeoCognition 的量化结果和 X 上的一线使用者说的是同一件事。

第二,接下来六个月的赢家在 harness 和管控层,不在模型。模型的能力已经由 OpenAI 和 Anthropic 决定,且两家都过了线;但翻译层能让速度再翻 2.5 倍、harness mod 能让游戏从戏法变成能用、密钥管理和触发器还没有人做好、审计和回放刚刚有了数据流。这些都是创业者能碰的东西。

第三,长时程是真正的分水岭,在它被验证之前,"Agent 上岗"仍然是一句宣传语。24% 的 12 小时成功率、"笔记越多越慢"的学习曲线、以及没有人跑过的跨天任务,都说明现在能交给 Agent 的是"任务",还不是"岗位"。CoArena 的 7 天结果和 ApprenticeBench 的政策反转测试,是接下来几个月最值得盯的两个数字。

研究说明:本文素材于 2026 年 9 月 11 日通过 ego-browser 在 X 上以 "Astra CUA"、"Astra computer use"、"GPT-6 Astra CUA"、"Astra Codex computer use" 四组关键词抓取,覆盖 9 月 3 日至 11 日约 200 条推文及其线程,并交叉核对了 OpenAI 发布页与 Kyle Jeong 的技术博客。所有播放量、点赞数为抓取时快照。X 上关于演示视频是否实时录制的争议,我们无法独立验证,文中两种说法并列。


参考来源 · Sources

官方与技术拆解

Benchmark 与反证

一线使用与观点

作者:冯小平,[email protected]