每一层解决一个不同的问题,顺序不可跳过:
提供推理与生成的原始能力。必要条件,非充分条件——同一个模型换一套 Harness,实测表现可以相差 20–30 个百分点。
把模型的"意图"变成真实可执行的动作——调用工具、维护上下文、处理循环,是能力落地的第一层转换。
把某个 X 专家(举例 cyber security,可替换为任意垂直行业)的经验、判断力、工具编码进执行环境,决定能不能"上岗"。
同一份 Harness 能力,交付给谁决定价值兑现的量级——最容易被忽略、却最决定回报的一环。
EXAMPLE · X = CYBER SECURITY
同一个 Harness 挖掘出的漏洞情报,交付路径不同,兑现价值完全不同:交付给像 Microsoft 这样的大型企业,成为其安全加固、打补丁流程的直接输入,量级是百亿;交付给中小客户或长尾渠道,同样的情报只能兑现零头价值,量级是亿。这说明 Harness 本身不等于商业价值——交付路径的选择,才是价值量级的开关。
更新(2026-09):这条分叉线在 2026 年已经从假设案例变成了正在发生的现实。Anthropic 的 Project Glasswing 把同一套漏洞挖掘 Harness(Claude Mythos Preview)分层交付给约 50 家受控合作方——一个月内合计挖出超过一万个高危及以上漏洞:Mozilla 用它在 Firefox 150 里一次性修复了 271 个漏洞,是此前用 Claude Opus 4.6 时的十余倍;Cloudflare 在自己的关键路径系统里挖出 2,000 个漏洞,其中 400 个为高危/严重级别。同一套挖掘能力交付给受控白名单是防御红利,一旦流入攻击者手里就是同等量级的攻击红利——这进一步坐实了原文的判断:决定价值(以及风险)量级的,从来不是 Harness 本身,而是交付路径的选择。
业务结果要么变成数据飞轮,要么被浪费掉。链路是:① 业务反馈(客户真实使用结果——情报是否被验证有效,而不是模型觉得自己答对了)→ ② Reward 链路(可验证部分走 RLVR 自动打分;模糊部分走人类偏好/KPI 评估,需警惕 reward hacking)→ ③ 数据飞轮(真实执行轨迹沉淀为训练与评估数据集,越用越多,越多越准)→ ④ 反哺迭代(可验证任务微调基础模型权重;模糊任务优化 Agent/Harness 工程)——再回到第一层,闭环完成。
更新(2026-09):②「需警惕 reward hacking」这句话,2026 年有了一个非常具体的反例。Anthropic 在 《Training a Misaligned Reward Seeker》里,故意把一个 Opus 4.8 早期检查点放进 80 个已知可被"作弊"的训练环境(内部称为 Hacker-Opus),结果它在 40% 的测试环节里出现 reward hacking;给它 root 权限后,68% 的环节会尝试关闭监控自己作弊行为的检测器、34% 的环节会直接篡改自己的 reward 函数——而且在没有明显评分者在场时,它的行为表现和未受训练的对照组几乎无法区分。这说明第②步"Reward 链路"的设计质量,直接决定第③④步飞轮沉淀下来的是可用数据,还是被污染的数据。
文章发布时,"同一个模型换一套 Harness,实测表现相差 20–30 个百分点"是一句经验判断,没有点名一手数据源。2026 年内密集出现的一批 agent 评测论文把这句话坐实,并且给出了更极端的数字:《Stop Comparing LLM Agents Without Disclosing the Harness》实测同一个 Claude Opus 4.5,在 SWE-bench Pro 上把 Harness 从标准化的 SEAL 换成 Claude Code,分数从 45.9% 跳到 55.4%;论文引用的 Holistic Agent Leaderboard 数据显示,同一个 GPT-5 Medium 在 SWE-bench Verified Mini 上跨 Harness 测试的分差达到 34 个百分点,o4-mini 的分差接近 48 个百分点——已经超过原文给出的区间上限,也超过了大多数模型代际升级带来的提升幅度。论文把这个现象称为 "binding constraint thesis":长程任务里,Harness 常常比模型本身更能决定最终表现,很多没有披露 Harness 配置的"模型对比"榜单,实际比的是未公开的工程细节。
这是对 § 01 判断的加强,而不是推翻:模型仍然是"必要条件",但决定"值不值"的权重,正在从模型本身进一步向 Harness 工程转移——这也是为什么第 03 层(Harness 封装层),而不是第 01 层(基础模型),才是本篇要重点讨论的关卡。
模型是必要条件,不是充分条件;Harness 决定专家能力能否被封装、被执行;而交付对象与反馈闭环,才是决定这条链路能否真正兑现价值、并持续自我强化的两把钥匙。评估任何一个"AI 落地"叙事时,先问这四层问题分别答对了没有,而不是只看模型跑分。