资产保全智能体:该微调基座还是只做 Harness 工程?——一个次序问题,而不是替代问题
核心摘要
- "有了 harness 就不用微调基座",在 Harness-R1 自己报告的数据上就不成立
- 微调与 harness 不在同一层:harness 改的是运行时的上下文、工具、动作校验与执行恢复,微调改的是模型权重
- 反方向同样成立——harness 的收益可以被蒸馏进权重,两者边界可渗透,所以问题不是"选一个",而是"先做什么"
- 对银行资产保全,真正的约束不是模型能力,而是流程与数据有没有线上化
"有了 harness 就不用微调基座",在 Harness-R1 自己报告的数据上就不成立
微调与 harness 不在同一层:harness 改的是运行时的上下文、工具、动作校验与执行恢复,微调改的是模型权重
反方向同样成立——harness 的收益可以被蒸馏进权重,两者边界可渗透,所以问题不是"选一个",而是"先做什么"
对银行资产保全,真正的约束不是模型能力,而是流程与数据有没有线上化
结论是一条次序:先线上化并建评测集,再优先做 harness 工程,最后只在同时满足四项判据的窄任务上考虑微调
素材说明:事实来源仅 8 份已归档文本。一手学术论文 3 篇摘要(arXiv:2608.02276、2609.24974、2603.09619):标题、编号与摘要数字可作一手事实引用,但均为论文自身报告的结果,未经独立复现。监管部分为 2 份二手解读:KD Odden 律所简报(二手,从 PDF 元数据提取的片段)与 Empyrean Solutions 博客(厂商博客,二手);一手监管公报原文未能取得——本机网络下其官方发布页面不可达(TLS 被中断)。故凡涉及范围、生效、支柱、比例原则、生成式 AI 被排除、平行治理架构等内容,一律注明二手解读并建议以官方文本为准;不引述原文与条款号,不虚构生效日期细节;官方发布位置(OCC Bulletin 2026-13)仅作"存在性"信息。媒体报道 2 份均为媒体口径,非监管口径、非行业定论。文中框架、分型、判据、次序与清单均为本文分析/推论。
一、先把问题拆开:两者不在同一层
Harness-R1 摘要对 harness 职责的界定可直接引用:agent harness 负责 "constructs context, mediates tools, validates actions, and recovers execution",即构造上下文、中介工具、校验动作、恢复执行(arXiv:2608.02276)。这句话没有一个字涉及模型参数——它描述的是一个运行时系统。微调改的则是权重,即模型在给定上下文下的输出分布。
| 维度 | 微调(改权重) | harness 工程(改运行时) |
|---|---|---|
| 产物 | 一个模型制品(带数据与版本血缘) | 一次工程变更 |
| 回退 | 无法"未训练"回去 | 通常可回滚 |
| 依赖 | 成规模的稳定标注或轨迹语料 | 可调用工具与可观测日志 |
本文分析:两者层次不同,"哪个更好"是提错的问题;可回答的是收益从哪一层来、约束在哪一层、代价记在谁头上。
二、一手证据:叠加,而非替代
Harness-R1 摘要报告的数字如下(论文自身报告,未经独立复现;基准 WebShop、ALFWorld、DBBench,目标模型 Qwen3.5-9B)。机制是:一个独立的 9B harness 工程师把失败轨迹转成经校验的可执行补丁,由冻结的目标智能体在同批重跑提供结果奖励,训练只更新该工程师。
| 情形 | 论文报告 | 增益 |
|---|---|---|
| 原始 Qwen3.5-9B | 44.3% → 53.6% | +9.3pp |
| 对目标智能体直接微调后,再叠加目标专用 harness 工程师 | 59.2% → 64.2% | +5.0pp |
三条要点:其一,"有了 harness 就不用微调"在数据上不成立——摘要写明 "these gains hold both before and after fine-tuning the target",即增益在微调目标之前和之后都成立。其二,两个数字起点不同:+9.3pp 起于未微调的普通基座,+5.0pp 起于已微调的目标智能体;本文推论:不能因"+5.0pp 小于 +9.3pp"就断定微调后 harness 无用——分母不同,不可直接相减。其三,论文的方向是"共同演化"。
要打破的极端一:把这组数字读成"微调已死、harness 万能"——表中第二行恰恰是"先微调、再叠 harness"。
三、反方向:harness 蒸馏说明边界可渗透
Harness-Zero(arXiv:2609.24974)研究 harness 蒸馏:把领域或实例上优化过的 harness 当作训练时指导,将其诱导的行为迁移进模型权重,使收益在部署换成单一固定 harness 后仍然存活。难点在于两个 harness 的动作空间与可用信息不同,前者的指导不能直接充当监督信号。其机制 agent-as-harness 是:由被优化 harness 引导的 harnessing agent 在目标 harness 的动作空间内先修正学生回答再执行;在这些轨迹上微调后,部署时可撤掉专用 harness。
| 项目 | 论文报告结果(未经独立复现) |
|---|---|
| 同一演化 harness 下的方式比较 | agent-as-harness 优于 code-as-harness |
| 撤掉专用 harness 后基础模型宏平均成功率 | 23.3% → 44.3%,超过仍挂着 harness 时的 41.7% |
本文分析:其一,边界双向可渗透:失败轨迹可以用来改 harness,优化过的 harness 也可以蒸馏进权重。其二,次序上并非"必须先微调":它起点是先有一个优化过的 harness,所以高质量的 harness 轨迹本身就是未来微调的语料。其三,撤掉 harness 后(44.3%)反而高于挂着时(41.7%),说明"harness 一定加分"并不成立。要打破的极端二:把 harness 当成"装上就一定更好"的万能外挂。
四、context engineering 的定位
Context Engineering(arXiv:2603.09619)摘要提出:随着 AI 系统从无状态聊天机器人演进为自主多步智能体,prompt engineering"必要但不充分",故引入 context engineering 作为一门独立学科,关注设计、结构化并管理智能体决策的整个信息环境;该文援引 Google ADK、Anthropic、LangChain、ACE 框架与 Google DeepMind 等产业与学术工作,以及 Deloitte(2026)与 KPMG(2026);并给出五项上下文质量判据:relevance、sufficiency、isolation、economy、provenance,把上下文定位为"智能体的操作系统",其上是 intent engineering 与 specification engineering,构成累积式金字塔。
本文分析:该文给 harness 工程划出内部层级——只写提示词,连门都没进;而 provenance(来源可溯)被列为判据之一,与资产保全的证据链要求同向。本文推论:在资产保全里,"可溯"是业务合规要求,不只是技术指标。
五、资产保全任务分型(本文分析)
本节全部为本文分析,示例为业务类型描述。先给四条判据:① 可度量(能否用可重复指标说清做对没有);② 有稳定标注(有无口径一致、有人负责的历史判定结果);③ 可回退(出错能否撤销或纠正);④ 可归因(收益或损失能否拆到"模型输出"这一层)。
| 任务类型 | 资产保全示例 | harness 够不够 | 是否需微调 | 判据落点 |
|---|---|---|---|---|
| 流程/工具型 | 案件节点流转、押品台账核对、材料齐备性检查、时效监控、外部信息归集 | 够用,应优先做 | 通常不需要 | 四项判据均成立(规则即答案) |
| 文书/口径型 | 法律文书、内部呈批、催收话术、报送口径 | 够用,但须靠 harness 收口 | 一般不需要,除非要固化专有口径 | 可回退取决于文书是否已对外发出;归因较难 |
| 窄分类型 | 材料完整性判断、押品归类、失联线索排序、诉讼可行性初筛 | baseline 够,天花板不够 | 四类中最值得评估微调 | 四项判据可同时成立 |
| 经验判断型 | 该不该诉、能否和解、以物抵债是否划算 | 只能做材料准备与选项呈现 | 不建议微调 | 不可回退;不可归因(依赖协商与市场) |
三条推论:其一,只有窄分类型同时满足四条判据——"资产保全要不要微调"是逐任务的答案,不是部门级的统一答案。其二,流程/工具型与文书/口径型的收益几乎全在 harness 一侧:规则能被写成工具与模板时,往权重里灌知识的边际收益很低。其三,经验判断型最不该微调,因为不可回退与不可归因——微调只会制造"我们提升了模型"的错觉。
六、真正的约束:流程与数据的可得性
据网易转载的媒体报道,北京银行 CIO 明立松在一场研讨会上表示,信贷流程中人工智能嵌入关键业务需完成三项前提工作:一是重构所有业务系统,消除线下与手工操作节点,实现数据标准化与接口统一;二是推动端到端流程全面线上化,覆盖贷前客户筛选、贷中审批、贷后监控及不良资产归因处置;三是在此基础上,识别可由人工智能替代的环节。另据经济观察网报道,一场银行零售资产处置研讨会上,财视中国创始人兼 CEO 朱浩表示,零售信贷类资产"小额、分散、高频"的特点使传统处置手段难以奏效;原银保监会专家徐巍表示,强监管态势已进入 AI 与大数据穿透式监管的新阶段。(两则均为媒体报道中的发言人观点,非监管口径、非行业定论。)
本文推论——两则报道叠起来,是一条对微调最不利的约束链:① 微调的燃料是稳定标注,而资产保全的判定结果大量散落在线下审批、纸质材料、分散系统与人工台账中,线上化之前"历史判定结果"不成其为可用的标注集;② 微调的验收依赖可归因指标,而节点仍含手工操作时指标变化无法拆到模型这一层;③ harness 工程只需可调用的工具与可观测日志,因此总是先可行;④ 线上化本身就在为微调准备语料。本文的前置问题是:这项资产保全任务的历史判定结果,今天能不能用同一种口径取出来? 若不能,微调不是"暂不考虑",而是连输入都还没有。
七、治理的不对称性(本文分析)
7.1 范围与并行架构:均属二手解读
以下均为二手解读,不是对官方公报的直接引用;一手公报原文未能取得,建议以官方文本为准。
据 KD Odden 律所简报解读:该指引由美联储、OCC 与 FDIC 于 2026 年 4 月 17 日联合发布、即刻生效并废止三份此前文件;三大支柱保留但规定性显著减弱、更强调比例与原则;并称生成式与智能体 AI 被以脚注形式整体划出适用范围,机构需另建平行治理架构。据 Empyrean Solutions 说明:保留三大支柱并新增比例原则;机器学习模型在范围内,生成式与智能体 AI 被排除;取消固定验证周期,改为机构自定频率并记录该判断。
官方发布位置为 OCC Bulletin 2026-13,仅作存在性信息记录,本文未取得其原文、不引述其任何条款内容。
7.2 三条不对称
第一,治理成本不构成"少做微调"的理由。 据二手解读,生成式与智能体 AI 被排除在适用范围之外、且需另建平行治理架构,这笔成本无论是否微调都要付。本文分析:把"避免微调"当作节省治理成本,不成立。
第二,"排除只及形式范围,不及风险"。 据 Empyrean Solutions 说明,该排除适用于正式范围,不适用于风险:生成式输出若喂给在范围内的模型,检查者会沿责任链追下去。本文推论:链条要不要被管,取决于输出去了哪里,而不取决于它自己是什么。
第三,定制必须被文档化并纳入验证。 据两份二手解读,购买厂商模型不转移治理义务:机构仍须把任何定制记录下来并纳入验证、自定并书面记录验证频率。本文分析:"微调基座"就是一次定制——但这条指向"记录与验证",不是"禁止"。
7.3 最关键的一处不对称(本文推论)
| 对比项 | harness 变更 | 微调产物 |
|---|---|---|
| 性质 | 一次工程变更 | 一个模型制品 |
| 流程 | 既有变更管理与 SDLC | 模型风险管理与制品生命周期 |
| 回退 | 通常可回滚到上一版本 | 无法"未训练"回去 |
| 血缘 | 版本库与提交记录 | 训练数据、超参、基座版本的血缘 |
三条推论:其一,harness 变更是可回退的工程变更,微调产物是不可撤销的制品——错误代价的形态不同:后者会固化进权重并随制品流转。其二,据二手解读,新指引取消固定验证周期、改由机构自定频率并记录理由——频率可以自定,理由必须写下来。其三,这条不对称决定的是门槛高低,不是允许与否:微调门槛更高,只应在收益足够明确、任务足够窄时使用。
八、决策次序(本文分析)
| 步骤 | 动作 | 通过条件 |
|---|---|---|
| ① | 流程线上化并建立评测集 | 历史判定结果能用一种口径取出;有可重复评测集与基线分数 |
| ② | 做 harness 工程 | 上下文构造、工具接入、动作校验、失败恢复、来源可溯与执行留痕齐备 |
| ③ | 用评测集量化 harness 增益 | 增益可测量、可归因到输出质量 |
| ④ | 筛选窄任务 | 同时满足可度量+有稳定标注+收益可归因+可回退,且已在平行治理架构范围内 |
| ⑤ | 考虑微调,并把 harness 轨迹作为语料 | 前四步全部成立;制品可被文档化、验证、持续监控 |
| ⑥ | 双向迭代 | 呼应 Harness-R1 的"共同演化"与 Harness-Zero 的"harness 蒸馏" |
提醒:第①步不可跳过——没有线上化就没有标注,没有标注就没有监督信号,没有指标就没有验收;第④步四个条件是"与"不是"或",少了"稳定标注"就变成用自己的猜测监督自己;第⑥步不等于"最终都要微调"。
九、行动清单
法务/合规线:① 建立生成式与智能体 AI 资产清单,标注每条链条的输出流向,识别哪些输出进入了在范围内的模型或拨备、评级环节;② 在治理制度中明确定制的文档化与验证要求,把"是否微调、相对基座差异何在"设为必填;③ 书面记录验证频率及其理由;④ 明确微调制品的血缘留存与披露口径;⑤ 确认平行治理架构的归属与边界。
信息科技线:⑥ 把 harness 变更纳入既有变更管理与 SDLC,明确回滚预案与版本记录;⑦ 建立执行留痕与来源可溯能力(上下文来源、工具调用、校验结果、恢复过程);⑧ 搭建可重复的评测集与基线;⑨ 建立微调制品台账(基座、数据、超参、评测、部署范围);⑩ 明确智能体工具链的本地化与数据边界落法(以本机构制度与属地监管要求为准)。
资产保全业务条线:⑪ 按第五节四类做一次任务盘点,标注"属于哪一类、是否满足四条判据";⑫ 优先做完流程/工具型任务(收益最快、治理成本最低);⑬ 对窄分类型任务先建评测集与人工复核闭环,指标稳定后再评估微调;⑭ 对经验判断型任务定位为"harness 准备材料与选项、人做决策";⑮ 建立退回与纠正机制。
最应先动的三项:②、⑧、⑪(分别对应治理对象、共同语言、资源投向三个前置问题)。
FAQ
Q1:有了 harness 工程,是不是就不用微调基座了?
A1:该判断在 Harness-R1 摘要报告的数据上不成立。 论文报告:对目标智能体直接微调之后,再叠加目标专用 harness 工程师,平均成功率仍从 59.2% 提升到 64.2%(+5.0pp),且摘要写明增益在微调前后都成立(论文自身报告,未经独立复现)。本文推论:两者是叠加关系;但叠加不等于每个任务都该微调——仍回到第五节四条判据逐任务判断。
Q2:那是不是应该先把基座微调好,再上 harness?
A2:本文不建议这个次序:Harness-Zero 的路径恰好相反——先用优化过的 harness,再把它诱导的行为蒸馏进权重(论文自身报告)。本文推论:harness 跑通后被校验过的轨迹,才是质量最高的微调语料。
Q3:如果做了微调,SR 26-2 管不管?
A3:须先纠正前提:本文未能取得该指引的一手公报原文(官方发布页面在本机网络下不可达),以下全部来自二手解读,建议以官方文本为准。据 Empyrean Solutions 说明,生成式与智能体 AI 被排除在适用范围之外,但该排除适用于正式范围、不适用于风险——生成式输出若喂给在范围内的模型,责任链会被追下去;对厂商模型,购买不转移治理义务,机构仍须把定制文档化并纳入验证。本文分析:微调基座就是一次定制,并不自动游离在治理之外。
Q4:没有标注数据,评测集从哪里来?
A4:从流程线上化之后的既有判定记录里来,不是从零开始人工标注。 第六节所引 CIO 三项前提的第二项,正是端到端流程线上化并覆盖贷前筛选、贷中审批、贷后监控及不良资产归因处置(据媒体报道,非监管口径)。本文推论:判定结果能否用同一种口径取出,是能否微调的前置问题;此前可先用 harness 跑出可校验的执行轨迹作为初期评测集。
事实来源
- arXiv:2608.02276《Harness-R1》(论文摘要,一手):harness 职责原文与三组数字——44.3%→53.6%(+9.3pp)、微调后叠加专用工程师 59.2%→64.2%(+5.0pp)、增益在微调前后均成立;基准 WebShop、ALFWorld、DBBench。均为论文自身报告,未经独立复现。
- arXiv:2609.24974《Harness-Zero》(论文摘要,一手):harness 蒸馏定义、agent-as-harness 机制,及三项结果——agent-as-harness 优于 code-as-harness;撤掉专用 harness 后 23.3%→44.3%、超过挂着时的 41.7%;三领域 28 种模式平均恢复率 82.3%。均为论文自身报告,未经独立复现。
- arXiv:2603.09619《Context Engineering》(论文摘要,一手):"必要但不充分"、CE 的独立学科定位、五项判据(relevance、sufficiency、isolation、economy、provenance)、IE 与 SE,及其援引的 Google ADK/Anthropic/LangChain、ACE 框架、Deloitte(2026)与 KPMG(2026)。其援引的第三方数据属该文转述。
- KD Odden & Associates 律所简报(2026-04,二手解读,片段式提取):联合发布、即刻生效、废止三份文件、保留三大支柱与四项变化。系从 PDF 元数据提取的片段,可能有缺漏;以官方公报原文为准。
- Empyrean Solutions 博客(厂商博客,二手解读):三大支柱与比例原则、机器学习在范围内而生成式与智能体 AI 被排除、验证频率自定并记录、厂商模型义务、"排除适用于正式范围而非风险"及责任链示例。该文声明不构成法律或监管建议。
- OCC Bulletin 2026-13(官方,未取得原文):仅作存在性记录。 本机网络下该页面不可达(TLS 被中断),故未引述其任何原文、条款号或段落细节;一切表述均来自来源 4、5。请以官方文本为准。
- 网易转载《北京银行 CIO 明立松:布局三类智能体,适配多元任务场景》(媒体报道):三项前提工作与三类智能体划分。均为媒体报道中的个人观点,非监管口径、非行业定论。
- 经济观察网《强监管下的不良资产处置新路径》(媒体报道):"小额、分散、高频"使传统处置手段难以奏效;强监管已进入 AI 与大数据穿透式监管新阶段(发言人为原银保监会专家)。均为会议报道中的发言人观点。
本文推论部分(非来源表述):第一节层次拆分表;第二至四节的判断与推论;第五节的四条判据与四类分型;第六节的约束链;第七节的三条不对称与对比表;第八节六步次序;第九节清单;全部 FAQ。本文不构成监管要求、合规意见或法律意见。
(内容由AI生成,仅供参考)
参考文献
- Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories(arXiv:2608.02276) [arXiv]
- Harness-Zero: Harness Distillation via Agent-as-Harness(arXiv:2609.24974) [arXiv]
- Context Engineering: From Prompts to Corporate Multi-Agent Architecture(arXiv:2603.09619) [arXiv]
- SR 26-2 Briefing | Banks Over $30B in Assets(KD Odden & Associates 律所简报,二手解读) [KD Odden & Associates(二手)]
- What SR 26-2 Means for Community and Regional Banks(Empyrean Solutions,厂商博客,二手解读) [Empyrean Solutions(二手)]
- Model Risk Management: Revised Guidance(OCC Bulletin 2026-13,官方发布位置;本机网络不可达,未取得原文) [OCC(官方,未取得原文)]
- 北京银行 CIO 明立松:布局三类智能体,适配多元任务场景(媒体报道) [媒体]
- 强监管下的不良资产处置新路径:银行零售资产处置与业务发展研讨会(经济观察网,媒体报道) [媒体]