每一层解决一个不同的问题,顺序不可跳过:
提供推理与生成的原始能力。必要条件,非充分条件——同一个模型换一套 Harness,实测表现可以相差 20–30 个百分点。
把模型的"意图"变成真实可执行的动作——调用工具、维护上下文、处理循环,是能力落地的第一层转换。
把某个 X 专家(举例 cyber security,可替换为任意垂直行业)的经验、判断力、工具编码进执行环境,决定能不能"上岗"。
同一份 Harness 能力,交付给谁决定价值兑现的量级——最容易被忽略、却最决定回报的一环。
EXAMPLE · X = CYBER SECURITY
同一个 Harness 挖掘出的漏洞情报,交付路径不同,兑现价值完全不同:交付给像 Microsoft 这样的大型企业,成为其安全加固、打补丁流程的直接输入,量级是百亿;交付给中小客户或长尾渠道,同样的情报只能兑现零头价值,量级是亿。这说明 Harness 本身不等于商业价值——交付路径的选择,才是价值量级的开关。
业务结果要么变成数据飞轮,要么被浪费掉。链路是:① 业务反馈(客户真实使用结果——情报是否被验证有效,而不是模型觉得自己答对了)→ ② Reward 链路(可验证部分走 RLVR 自动打分;模糊部分走人类偏好/KPI 评估,需警惕 reward hacking)→ ③ 数据飞轮(真实执行轨迹沉淀为训练与评估数据集,越用越多,越多越准)→ ④ 反哺迭代(可验证任务微调基础模型权重;模糊任务优化 Agent/Harness 工程)——再回到第一层,闭环完成。
模型是必要条件,不是充分条件;Harness 决定专家能力能否被封装、被执行;而交付对象与反馈闭环,才是决定这条链路能否真正兑现价值、并持续自我强化的两把钥匙。评估任何一个"AI 落地"叙事时,先问这四层问题分别答对了没有,而不是只看模型跑分。