Harness 买到的是什么?主要是 Token——arXiv 实证:换框架≈重跑噪声,换模型才是真变量,成本差 3 倍

核心摘要

  • 在模型不变的前提下,换一个 Harness,分数到底动了多少?
  • 换 Harness 对通过率的影响约等于重跑一次的噪声,真正改变结果的是换模型
  • 同一模型同一任务,三个 Harness 的成本相差最多 3 倍,差距来自每步重发的系统提示与工具说明
  • 唯一显著的 Harness 效应是"输"而非"赢":输出上限截断、上下文溢出、超时——全是丢任务的方式,没有一种是赢任务的方式

Harness 买到的是什么?主要是 Token——arXiv 实证:换框架≈重跑噪声,换模型才是真变量,成本差 3 倍

过去一年,AI 智能体的"框架(Harness/脚手架)"市场热闹得像手机发布会:各家厂商宣传"换我们的框架,通过率 +2.4 个百分点";排行榜把不同框架的跑分混在一起排;银行选型时,技术团队为"用 Claude Code 还是自研框架、用 OpenCode 还是 mini-SWE-agent"反复论证。但一个最基本的问题几乎没人测量过:在模型不变的前提下,换一个 Harness,分数到底动了多少?

换 Harness 对通过率的影响约等于重跑一次的噪声,真正改变结果的是换模型。 这是 2026 年 10 月 3 日上传 arXiv 的论文《What Does a Harness Buy? Tokens, Mostly》(一个 Harness 买到的是什么?主要是 Token)给出的实证答案。

同一模型同一任务,三个 Harness 的成本相差最多 3 倍,差距来自每步重发的系统提示与工具说明。 论文同时给出了另一个被通过率掩盖的事实:Harness 真正决定的不是分数,是账单。

唯一显著的 Harness 效应是"输"而非"赢":输出上限截断、上下文溢出、超时——全是丢任务的方式,没有一种是赢任务的方式。 而厂商自家框架跑自家模型,并无"主场优势"。

论文给出评测分辨力标尺:45 个任务只能以一半概率捕捉 12.9 个百分点的差距,447 个任务才能分辨 5.2 个百分点——大量已发布的框架增益,其实落在噪声以内。 对金融业而言,这是采购、选型与评测纪律的一份"清醒剂"。

一、论文是怎么做的:把"重跑噪声"变成尺子

论文作者 Yangze Liu、Zhongyi Han(山东大学)做了迄今控制最严格的 Harness 对比:

这套设计的价值:以往对比研究每格只跑一次,无法区分"8 分差距来自框架还是来自运气";本文用重跑数据做尺子,把 Harness 差距放在噪声旁边读。

二、同样的 Harness,模型有大影响吗?——有,且远超 Harness

任务结果翻转率(hard45 中位数):换模型 22%,换 Harness 13%,重跑同配置 13%。 三者放在同一把尺子上,结论一目了然:换 Harness 带来的结果变化,与"把同一个配置再跑一遍"相当;而换模型带来的变化,几乎是前两者的两倍。

通过率的绝对差距更直观:Claude Opus 5 在 Claude Code 内拿到 36/45(80%),而其余五个模型在同级任务上只有 24%–58%(Qwen3.6 24–33%、Qwen3.8 38–44%、DeepSeek-V4-Flash 42–49%、GLM-5.3-Flash 40–49%、HY4-Preview 47–58%)。模型能力是天花板,框架只能在它附近波动。

翻转的可复制性验证了"真效应"归属:换模型时,10/15 个任务两次运行同向翻转(可复制的真效应);换 Harness 时,5 个任务同向、7 个反向——和抛硬币没有区别。也就是说,不存在"Harnes A 稳定赢 Harnes B 的任务集"。

三、同样的模型,Harness 有大影响吗?——通过率没有,成本有

通过率:等于重跑噪声

成本:最多 3 倍,机制可精确拆解

同模型同任务(GLM-5.3-Flash),每任务成本:Claude Code 1.81 元、mini-SWE-agent 0.97 元、OpenCode 0.56 元。成本拆解为三项:

  1. 每步重发的固定前置(preamble):系统提示 + 工具 schema——Claude Code 16,581 tokens、OpenCode 7,025、mini-SWE-agent 仅 829,每一步都重新支付;
  2. 步数:DeepSeek-V4-Flash 上 mini 走 141 步、Claude Code 104 步;Qwen3.6 上 OpenCode 只走 28 步——"每步重量"与"步数"互相抵消,哪个占主导取决于模型;
  3. 缓存输入定价:GLM 缓存价 0.287×(缓存转录本占 GLM 账单大头)、DeepSeek 0.033×(输出成为大头)——价格只缩放账单,不改变三者的排序。

定义论文结论原话:"Harness 买到的是更少的输法,和一张账单——而不是通过率。"

四、论文的"反直觉"发现:主场无优势,消融无差异

五、对金融业的启示:把预算与评测纪律放在对的地方

  1. 采购选型别为"通过率营销"买单。 要求候选 Harness 提交"同配置重跑 ≥2 次 + 置信区间",而不是单次跑分的点估计;单次几十个任务的"胜出"直接判为噪声。
  2. 预算优先投向模型升级。 换模型的翻转率(22%)是换框架(13%)的近两倍,模型是能力的上限——同一笔钱,升级基座模型版本比折腾框架收益大。
  3. 选框架要审计"失败模式"而非演示分。 输出上限有无恢复机制、上下文有无压缩、超时如何处理、工具离线是否可用——这些才是生产环境的真实输法。对应我此前写的 LongHorizon-Harness 一文:三权分立、检查点续跑、"只有独立验证的事实才进状态",本质都是消灭"输任务的方式"。
  4. 成本工程是真实战场。 银行智能体动辄数千并发任务,3 倍成本差就是运营费用的量级差异;建立"每任务 Token 账单"核算,重点盯首轮前置大小、每步增速、步数三项,善用缓存定价与精简系统提示——银行重复性任务多、缓存命中率高,降本立竿见影。
  5. 准入评测的任务池规模要有依据。 按论文分辨力标尺:想分辨 5 个百分点以上的框架差异,任务池要接近 447 的量级;银行智能体准入测试的任务设计与样本量,应据此规划,避免"小样本断言大结论"。
  6. 切换框架后必须重测推理配置。 thinking/推理开关的效果随"模型×框架"配对变化,沿用旧框架的调参结论在新框架上可能失效——把推理参数纳入每次框架变更的回归测试。

结语

这篇论文用最笨也最可靠的办法(重跑校准 + 统一账单)回答了一个被营销淹没的问题:模型买的是能力,Harness 买的是账单和"不输"。对金融业来说,这意味着一句朴素但昂贵的结论——把预算花在模型升级上,把评测纪律建立在重跑与置信区间上,把选型目光放在失败模式与成本工程上。谁先做到这三点,谁的大规模智能体部署就能少交学费。

["https://arxiv.org/abs/2610.04433","https://arxiv.org/pdf/2610.04433","https://github.com/YangzeLiu/what-does-a-harness-buy"]

参考文献

  1. arXiv:2610.04433——What Does a Harness Buy? Tokens, Mostly(2026-10-03) [arXiv]
  2. 论文 PDF:What Does a Harness Buy? Tokens, Mostly [arXiv]
  3. 论文代码与数据:YangzeLiu/what-does-a-harness-buy [GitHub]
  4. OpenAI: Introducing SWE-bench Verified(评测基准) [OpenAI]
  5. SWE-agent: Agent-computer interfaces enable automated software engineering(mini-SWE-agent 来源) [GitHub(SWE-agent 团队)]

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者