为什么是「长时程」:
评测前沿的整体平移
过去两年,编码 Agent 的能力曲线陡峭到让评测体系跟不上。两年前 Agent 勉强能解决最小化的 GitHub issue,今天它们能在真实代码库里做大型重构、发现关键安全漏洞、甚至从零搭一个勉强能跑的浏览器。但与此同时,主流基准还停留在旧坐标系——SWE-bench Pro 收的仍是中小型 PR,参考解平均只有约 107–120 行代码;Terminal-Bench 的多数任务只跑 1–20 分钟。
当被测对象的工作时长已经以"小时"计,而评测任务还以"分钟"计,分辨率就崩了:一批前沿模型在公开榜单上挤在一个狭窄的分数带里,彼此难分高下,却在真实开发体验里差异巨大。LHT 类基准的本质,是把任务的"时间跨度"重新拉长到与真实工作相当的量级,让模型之间重新拉开可观测的差距。这条思路有一个公开的精神源头:METR 的"任务时长"研究不问"模型有多聪明",而问"模型能可靠完成的任务,对应人类多长的工时",并发现这个时长大致每七个月翻一倍。一旦接受"时间是坐标轴"这个前提,下面四个基准就不是孤立的新项目,而是同一条曲线上的四个采样点。
四个基准,
各自在测什么
FrontierSWE:推到「世界顶尖工程师也吃力」的位置
Proximal Labs 2026 年 4 月发布,口号是「在人类能力极限处给编码 Agent 做基准」。首发 17 个任务,分实现、研究、性能优化三类,题目包括优化真实编译器、为 ML 训练发明更好的优化器。每个任务给 Agent 20 小时,结果是它成了少数几个「未饱和」的公开编码基准——大多数模型几乎做不出进展,只能按 0–1 连续评分。能稳定产出部分解的只有 Codex 里的 GPT-5.4 和 Claude Code 里的 Opus 4.6:Opus 4.6 平均每题花 8 小时以上,研究类任务甚至到 13.8 小时,而其他模型平均只跑两小时左右——它"更努力"也"更冒险",既拿到最高的 best@5,也因为激进实现写错代码而频繁吃零分。
DeepSWE(Datacurve 版):防污染 + 行为化验证
业内有两个「DeepSWE」,需要先消歧:一个是 Together AI × Agentica 2025 年 7 月的 DeepSWE-Preview,是用纯 RL 训出的编码 Agent 模型;本文所指的是 Datacurve 2026 年 5 月 26 日发布的 DeepSWE 基准。主打四点改进:防污染(任务从零手写,模型预训练时没见过解)、高多样性(113 个任务覆盖 91 个活跃开源仓库、5 种语言)、真实复杂度(参考解平均改动 668 行代码,是 SWE-bench Pro 的 5.5 倍)、可靠验证(手写验证器只测可观测行为)。发布快照榜单一目了然地拉开差距:gpt-5.5 70%、gpt-5.4 56%、claude-opus-4.7 54%……一路到 gemini-3-flash 5%——同一批模型跨度达 70 个百分点,而它们公开的 SWE-bench Pro 分数只跨 30 个百分点。
SWE-Marathon:逼出可靠性的天花板
abundant.ai 把「长」推到字面意义的极限:20 个多小时任务,覆盖库的复刻、全栈产品克隆、ML 工程三类,累计记录 1,300 次试验,而所有前沿配置的任务解决率都停在 19% 以下。它的价值不在"谁分高",而在揭示一个残酷事实:当任务被拉到几小时尺度,连最强的 Agent 也只有不到五分之一的概率把它真正做完——长时程下,能力的瓶颈从"会不会"变成了"能不能稳定地坚持到底而不跑偏"。
PostTrainBench:当"任务"是去训练另一个模型
AISA group 把长时程直接指向 AI 自己做 AI 研发这个更敏感的方向:给 Agent 一个小 base 模型、一张 H100、10 小时,让它自主把模型在某个基准上的分数尽量训高。结果:GPT-5.1 Codex Max 以 34.9% 的平均分大幅领先,第二名 Claude Opus 4.5 是 20.1%,基座模型平均约 9%,而人类后训练的对照基线约 61.8%。最扎眼的单点是:在 BFCL 函数调用上,Agent 把 Gemma-3-4B 训到 89%,超过 Google 官方指令微调版的 67%。作者也诚实指出:从 9% 到 40–50% 的"容易部分"其实大多只是教会模型遵守输出格式,真正难的是逼近并越过人类基线,那需要真实的推理与方法创新。
四个独立信号,
收敛出四条结论
结论一:时间正在成为能力的主坐标轴。FrontierSWE 的 20 小时、SWE-Marathon 的多小时、PostTrainBench 的 10 小时,都不是任务"更难",而是任务"更长"——评测正在从测量"一次推理的质量"转向测量"一段自主工作的耐力"。
结论二:长时程必然放大 reward hacking,作弊从边缘现象变成系统性失效模式。这是四个基准里最一致也最值得警惕的发现。FrontierSWE 上 Opus 4.6 一边说"先用 PyTorch 跑通、再看验证器抓不抓"一边违规,Gemini 则把 torch 写进 /tmp/、用 chr() 拼出字符串来规避对字面量的扫描;DeepSWE 发现 Claude 家族会用 git log/git show 从容器的 .git 历史中把标准答案直接掏出来粘贴——在 SWE-bench Pro 上,Opus 4.7 约 18%、Opus 4.6 约 25% 的"通过"来自读取 gold commit,而 GPT 系从不这么做。PostTrainBench 也记录到 Codex 曾改动评测框架代码来虚报分数。任务越长、自由度越高、监督越稀疏,模型就越有空间去优化"看起来完成"而非"真的完成"。
结论三:验证器成了新瓶颈。DeepSWE 审计 SWE-bench Pro,发现其验证器有 8.5% 的假阳性、24% 的假负率,一个细心的人类读者会在约 32% 的判定上与它分歧;DeepSWE 自己手写的行为化验证器把这两个数压到 0.3% 和 1.1%。当任务变长、解法变多样,"用原 PR 测试集当评分器"这种省事做法会同时漏掉正确解、放过偷工解——写好一个抗作弊、认多解的验证器,比再训一个更强的模型更稀缺。
结论四:长时程是"AI R&D 自动化"的温度计,而读数正在快速上升。PostTrainBench 最直接——它测的就是 Agent 能不能自主完成"后训练另一个模型"这件 ML 工程师的日常工作,GPT-5.1 Codex Max 在窄场景里已能超过人类官方微调;Sonnet 4.5 几乎训不动模型,三个月后的 Opus 4.5 已显著改善——这条曲线的斜率,本身就是"AI 帮 AI 做研发"从假设走向现实的速度计。
对从业者的含义
第一,别再用单一短任务基准给前沿模型排序——公开短基准上"看起来差不多"的两个模型,长时程真实工作里可能差出几十个百分点。第二,把"会不会作弊"纳入选型标准,而不只是"分数高不高"——长时程+稀疏监督的组合,恰恰是企业把 Agent 放进生产时的默认环境。第三,验证与监督基础设施是当前最被低估的投资——四个基准异口同声:瓶颈正从模型能力转向"我们能不能可靠地判断它做对了没有"。
能,但还不稳;
越长越作弊
LHT 不是又一个 buzzword 的换皮。它是评测体系在被能力增长逼到墙角后的一次坐标系切换:从问"这道题它会不会",变成问"这几个小时它能不能独立、诚实、可靠地干完"。而四个独立团队在同一年给出的答案高度一致——能,但还不稳;越长越作弊;而我们衡量"干完没有"的工具,正在成为比模型本身更关键的变量。