---
title: "资产保全智能体：该微调基座还是只做 Harness 工程？——一个次序问题，而不是替代问题"
date: "2026-09-27"
description: "面向银行资产保全专业领域，回答两个被反复混淆的问题：本地部署的大模型还需不需要微调？有了 harness 工程是否就不必微调基座？本文以三篇 arXiv 论文为一手证据（Harness-R1 报告原始 Qwen3.5-9B 成功率 44.3%→53.6%，而在目标智能体微调之后再叠加专用 harness 工程师，仍从 59.2% 提升到 64.2%），论证两者是叠加而非替代，并以 Harness-Zero 的 harness 蒸馏说明边界可渗透；再据两份二手解读梳理 SR 26-2 的范围与治理不对称性，最后给出资产保全四类任务的分型判据、决策次序与三条线行动清单。"
tags: ["金融科技", "AI治理", "大模型", "智能体", "风险管理", "银行AI", "资产保全", "不良资产", "模型风险管理", "信息科技风险", "金融监管", "Harness工程"]
schema_type: "Article"
references:
  - title: "Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories（arXiv:2608.02276）"
    url: "https://arxiv.org/abs/2608.02276"
    source: "arXiv"
  - title: "Harness-Zero: Harness Distillation via Agent-as-Harness（arXiv:2609.24974）"
    url: "https://arxiv.org/abs/2609.24974"
    source: "arXiv"
  - title: "Context Engineering: From Prompts to Corporate Multi-Agent Architecture（arXiv:2603.09619）"
    url: "https://arxiv.org/abs/2603.09619"
    source: "arXiv"
  - title: "SR 26-2 Briefing | Banks Over $30B in Assets（KD Odden & Associates 律所简报，二手解读）"
    url: "https://kdoden.com/KDOA_SR_26-2_Briefing_Banks_Over_30B.pdf"
    source: "KD Odden & Associates（二手）"
  - title: "What SR 26-2 Means for Community and Regional Banks（Empyrean Solutions，厂商博客，二手解读）"
    url: "https://empyreansolutions.com/blog/what-sr-26-2-means-for-community-and-regional-banks/"
    source: "Empyrean Solutions（二手）"
  - title: "Model Risk Management: Revised Guidance（OCC Bulletin 2026-13，官方发布位置；本机网络不可达，未取得原文）"
    url: "https://occ.gov/news-issuances/bulletins/2026/bulletin-2026-13.html"
    source: "OCC（官方，未取得原文）"
  - title: "北京银行 CIO 明立松：布局三类智能体，适配多元任务场景（媒体报道）"
    url: "http://www.163.com/dy/article/KPTUSB530519D4UH.html"
    source: "媒体"
  - title: "强监管下的不良资产处置新路径：银行零售资产处置与业务发展研讨会（经济观察网，媒体报道）"
    url: "https://m.eeo.com.cn/2026/0521/885015.shtml"
    source: "媒体"
# 注：本文件未写入 AIGC 隐式标识块。按现行标识要求，AIGC 元数据需包含 Label、ContentProducer、
#     ProduceID、PropagateID、ReservedCode1、ReservedCode2 等字段，其中 ProduceID / ReservedCode
#     须由标识服务平台逐篇签发，不能由作者或生成工具自行推定或编造。因此本文件暂留空位，须由作者
#     在取得平台签发的标识值后补充完整，方可发布。
---

**"有了 harness 就不用微调基座"，在 Harness-R1 自己报告的数据上就不成立**

**微调与 harness 不在同一层：harness 改的是运行时的上下文、工具、动作校验与执行恢复，微调改的是模型权重**

**反方向同样成立——harness 的收益可以被蒸馏进权重，两者边界可渗透，所以问题不是"选一个"，而是"先做什么"**

**对银行资产保全，真正的约束不是模型能力，而是流程与数据有没有线上化**

**结论是一条次序：先线上化并建评测集，再优先做 harness 工程，最后只在同时满足四项判据的窄任务上考虑微调**

---

> **素材说明**：事实来源仅 8 份已归档文本。**一手学术论文 3 篇摘要**（arXiv:2608.02276、2609.24974、2603.09619）：标题、编号与摘要数字可作一手事实引用，但**均为论文自身报告的结果，未经独立复现**。**监管部分为 2 份二手解读**：KD Odden 律所简报（**二手，从 PDF 元数据提取的片段**）与 Empyrean Solutions 博客（**厂商博客，二手**）；**一手监管公报原文未能取得**——本机网络下其官方发布页面不可达（TLS 被中断）。故凡涉及范围、生效、支柱、比例原则、生成式 AI 被排除、平行治理架构等内容，**一律注明二手解读并建议以官方文本为准**；**不引述原文与条款号，不虚构生效日期细节**；官方发布位置（OCC Bulletin 2026-13）**仅作"存在性"信息**。**媒体报道 2 份均为媒体口径，非监管口径、非行业定论**。**文中框架、分型、判据、次序与清单均为本文分析／推论。**

## 一、先把问题拆开：两者不在同一层

Harness-R1 摘要对 harness 职责的界定可直接引用：agent harness 负责 **"constructs context, mediates tools, validates actions, and recovers execution"**，即**构造上下文、中介工具、校验动作、恢复执行**（arXiv:2608.02276）。**这句话没有一个字涉及模型参数**——它描述的是一个运行时系统。微调改的则是**权重**，即模型在给定上下文下的输出分布。

| 维度 | 微调（改权重） | harness 工程（改运行时） |
|---|---|---|
| 产物 | **一个模型制品**（带数据与版本血缘） | **一次工程变更** |
| 回退 | **无法"未训练"回去** | 通常可回滚 |
| 依赖 | 成规模的稳定标注或轨迹语料 | 可调用工具与可观测日志 |

**本文分析**：两者层次不同，**"哪个更好"是提错的问题**；可回答的是收益从哪一层来、约束在哪一层、代价记在谁头上。

## 二、一手证据：叠加，而非替代

Harness-R1 摘要报告的数字如下（**论文自身报告，未经独立复现**；基准 WebShop、ALFWorld、DBBench，目标模型 Qwen3.5-9B）。机制是：一个**独立的 9B harness 工程师**把失败轨迹转成**经校验的可执行补丁**，由**冻结的目标智能体在同批重跑**提供结果奖励，**训练只更新该工程师**。

| 情形 | 论文报告 | 增益 |
|---|---|---|
| 原始 Qwen3.5-9B | **44.3% → 53.6%** | **+9.3pp** |
| **对目标智能体直接微调后**，再叠加目标专用 harness 工程师 | **59.2% → 64.2%** | **+5.0pp** |

**三条要点**：**其一，"有了 harness 就不用微调"在数据上不成立**——摘要写明 **"these gains hold both before and after fine-tuning the target"**，即**增益在微调目标之前和之后都成立**。**其二，两个数字起点不同**：+9.3pp 起于**未微调的普通基座**，+5.0pp 起于**已微调的目标智能体**；**本文推论**：不能因"+5.0pp 小于 +9.3pp"就断定微调后 harness 无用——**分母不同，不可直接相减**。**其三，论文的方向是"共同演化"**。

**要打破的极端一**：把这组数字读成"微调已死、harness 万能"——表中第二行恰恰是"先微调、再叠 harness"。

## 三、反方向：harness 蒸馏说明边界可渗透

Harness-Zero（arXiv:2609.24974）研究 **harness 蒸馏**：**把领域或实例上优化过的 harness 当作训练时指导，将其诱导的行为迁移进模型权重，使收益在部署换成单一固定 harness 后仍然存活**。难点在于**两个 harness 的动作空间与可用信息不同，前者的指导不能直接充当监督信号**。其机制 **agent-as-harness** 是：由被优化 harness 引导的 harnessing agent 在**目标 harness 的动作空间内**先修正学生回答再执行；在这些轨迹上微调后，**部署时可撤掉专用 harness**。

| 项目 | 论文报告结果（未经独立复现） |
|---|---|
| 同一演化 harness 下的方式比较 | **agent-as-harness 优于 code-as-harness** |
| 撤掉专用 harness 后基础模型宏平均成功率 | **23.3% → 44.3%**，**超过仍挂着 harness 时的 41.7%** |

**本文分析**：**其一，边界双向可渗透**：失败轨迹可以用来改 harness，优化过的 harness 也可以蒸馏进权重。**其二，次序上并非"必须先微调"**：它起点是**先有一个优化过的 harness**，所以**高质量的 harness 轨迹本身就是未来微调的语料**。**其三，撤掉 harness 后（44.3%）反而高于挂着时（41.7%）**，说明**"harness 一定加分"并不成立**。**要打破的极端二**：把 harness 当成"装上就一定更好"的万能外挂。

## 四、context engineering 的定位

Context Engineering（arXiv:2603.09619）摘要提出：随着 AI 系统从无状态聊天机器人演进为自主多步智能体，**prompt engineering"必要但不充分"**，故引入 **context engineering 作为一门独立学科**，关注**设计、结构化并管理智能体决策的整个信息环境**；该文援引 **Google ADK、Anthropic、LangChain、ACE 框架与 Google DeepMind 等**产业与学术工作，以及 **Deloitte（2026）与 KPMG（2026）**；并给出**五项上下文质量判据：relevance、sufficiency、isolation、economy、provenance**，把上下文定位为**"智能体的操作系统"**，其上是 intent engineering 与 specification engineering，构成**累积式金字塔**。

**本文分析**：该文给 harness 工程划出内部层级——**只写提示词，连门都没进**；而 **provenance（来源可溯）被列为判据之一**，与资产保全的证据链要求同向。**本文推论**：在资产保全里，**"可溯"是业务合规要求，不只是技术指标**。

## 五、资产保全任务分型（本文分析）

**本节全部为本文分析**，示例为业务类型描述。先给四条判据：**① 可度量**（能否用可重复指标说清做对没有）；**② 有稳定标注**（有无口径一致、有人负责的历史判定结果）；**③ 可回退**（出错能否撤销或纠正）；**④ 可归因**（收益或损失能否拆到"模型输出"这一层）。

| 任务类型 | 资产保全示例 | harness 够不够 | 是否需微调 | 判据落点 |
|---|---|---|---|---|
| **流程／工具型** | 案件节点流转、押品台账核对、材料齐备性检查、时效监控、外部信息归集 | **够用，应优先做** | **通常不需要** | 四项判据均成立（规则即答案） |
| **文书／口径型** | 法律文书、内部呈批、催收话术、报送口径 | **够用，但须靠 harness 收口** | **一般不需要**，除非要固化专有口径 | **可回退取决于文书是否已对外发出**；归因较难 |
| **窄分类型** | 材料完整性判断、押品归类、失联线索排序、诉讼可行性初筛 | **baseline 够，天花板不够** | **四类中最值得评估微调** | **四项判据可同时成立** |
| **经验判断型** | 该不该诉、能否和解、以物抵债是否划算 | **只能做材料准备与选项呈现** | **不建议微调** | **不可回退**；**不可归因**（依赖协商与市场） |

**三条推论**：**其一**，只有**窄分类型**同时满足四条判据——**"资产保全要不要微调"是逐任务的答案，不是部门级的统一答案**。**其二**，流程／工具型与文书／口径型的收益几乎全在 harness 一侧：**规则能被写成工具与模板时，往权重里灌知识的边际收益很低**。**其三**，经验判断型最不该微调，因为**不可回退与不可归因**——微调只会制造"我们提升了模型"的错觉。

## 六、真正的约束：流程与数据的可得性

据网易转载的媒体报道，北京银行 CIO 明立松在一场研讨会上表示，**信贷流程中人工智能嵌入关键业务需完成三项前提工作：一是重构所有业务系统，消除线下与手工操作节点，实现数据标准化与接口统一；二是推动端到端流程全面线上化，覆盖贷前客户筛选、贷中审批、贷后监控及不良资产归因处置；三是在此基础上，识别可由人工智能替代的环节**。另据经济观察网报道，一场银行零售资产处置研讨会上，财视中国创始人兼 CEO 朱浩表示，**零售信贷类资产"小额、分散、高频"的特点使传统处置手段难以奏效**；原银保监会专家徐巍表示，**强监管态势已进入 AI 与大数据穿透式监管的新阶段**。（**两则均为媒体报道中的发言人观点，非监管口径、非行业定论。**）

**本文推论——两则报道叠起来，是一条对微调最不利的约束链**：**①** 微调的燃料是稳定标注，而资产保全的判定结果大量散落在**线下审批、纸质材料、分散系统与人工台账**中，线上化之前**"历史判定结果"不成其为可用的标注集**；**②** 微调的验收依赖可归因指标，而节点仍含手工操作时**指标变化无法拆到模型这一层**；**③** harness 工程只需**可调用的工具与可观测日志**，**因此总是先可行**；**④** 线上化本身就在为微调准备语料。**本文的前置问题是**：**这项资产保全任务的历史判定结果，今天能不能用同一种口径取出来？** 若不能，微调不是"暂不考虑"，而是**连输入都还没有**。

## 七、治理的不对称性（本文分析）

### 7.1 范围与并行架构：均属二手解读

**以下均为二手解读，不是对官方公报的直接引用；一手公报原文未能取得，建议以官方文本为准。**

据 **KD Odden 律所简报解读**：该指引由美联储、OCC 与 FDIC 于 2026 年 4 月 17 日联合发布、**即刻生效**并废止三份此前文件；**三大支柱保留**但**规定性显著减弱、更强调比例与原则**；并称**生成式与智能体 AI 被以脚注形式整体划出适用范围，机构需另建平行治理架构**。据 **Empyrean Solutions 说明**：**保留三大支柱并新增比例原则**；**机器学习模型在范围内，生成式与智能体 AI 被排除**；**取消固定验证周期**，改为机构**自定频率并记录该判断**。

官方发布位置为 **OCC Bulletin 2026-13，仅作存在性信息记录，本文未取得其原文、不引述其任何条款内容**。

### 7.2 三条不对称

**第一，治理成本不构成"少做微调"的理由。** 据二手解读，生成式与智能体 AI **被排除在适用范围之外、且需另建平行治理架构**，这笔成本**无论是否微调都要付**。**本文分析**：把"避免微调"当作节省治理成本，不成立。

**第二，"排除只及形式范围，不及风险"。** 据 Empyrean Solutions 说明，**该排除适用于正式范围，不适用于风险**：生成式输出若**喂给**在范围内的模型，**检查者会沿责任链追下去**。**本文推论**：**链条要不要被管，取决于输出去了哪里，而不取决于它自己是什么。**

**第三，定制必须被文档化并纳入验证。** 据两份二手解读，**购买厂商模型不转移治理义务**：机构仍须**把任何定制记录下来并纳入验证**、**自定并书面记录验证频率**。**本文分析**：**"微调基座"就是一次定制**——但这条指向"记录与验证"，**不是"禁止"**。

### 7.3 最关键的一处不对称（本文推论）

| 对比项 | harness 变更 | 微调产物 |
|---|---|---|
| 性质 | **一次工程变更** | **一个模型制品** |
| 流程 | 既有变更管理与 SDLC | 模型风险管理与制品生命周期 |
| 回退 | 通常**可回滚到上一版本** | **无法"未训练"回去** |
| 血缘 | 版本库与提交记录 | **训练数据、超参、基座版本的血缘** |

**三条推论**：**其一**，harness 变更是**可回退的工程变更**，微调产物是**不可撤销的制品**——**错误代价的形态不同**：后者会**固化进权重并随制品流转**。**其二**，据二手解读，新指引**取消固定验证周期、改由机构自定频率并记录理由**——**频率可以自定，理由必须写下来**。**其三**，这条不对称**决定的是门槛高低，不是允许与否**：微调门槛更高，**只应在收益足够明确、任务足够窄时使用**。

## 八、决策次序（本文分析）

| 步骤 | 动作 | 通过条件 |
|---|---|---|
| ① | **流程线上化并建立评测集** | 历史判定结果能用一种口径取出；有可重复评测集与基线分数 |
| ② | **做 harness 工程** | 上下文构造、工具接入、动作校验、失败恢复、**来源可溯与执行留痕**齐备 |
| ③ | **用评测集量化 harness 增益** | 增益可测量、可归因到输出质量 |
| ④ | **筛选窄任务** | 同时满足**可度量＋有稳定标注＋收益可归因＋可回退**，且**已在平行治理架构范围内** |
| ⑤ | **考虑微调，并把 harness 轨迹作为语料** | 前四步全部成立；制品可被文档化、验证、持续监控 |
| ⑥ | **双向迭代** | 呼应 Harness-R1 的"共同演化"与 Harness-Zero 的"harness 蒸馏" |

**提醒**：第①步不可跳过——**没有线上化就没有标注，没有标注就没有监督信号，没有指标就没有验收**；第④步四个条件是"与"不是"或"，少了"稳定标注"就变成**用自己的猜测监督自己**；第⑥步不等于"最终都要微调"。

## 九、行动清单

**法务／合规线**：① 建立生成式与智能体 AI 资产清单，标注每条链条的**输出流向**，识别哪些输出进入了在范围内的模型或拨备、评级环节；② 在治理制度中明确**定制的文档化与验证要求**，把"是否微调、相对基座差异何在"设为必填；③ **书面记录验证频率及其理由**；④ 明确微调制品的**血缘留存与披露口径**；⑤ 确认**平行治理架构**的归属与边界。

**信息科技线**：⑥ 把 harness 变更纳入**既有变更管理与 SDLC**，明确回滚预案与版本记录；⑦ 建立**执行留痕与来源可溯**能力（上下文来源、工具调用、校验结果、恢复过程）；⑧ 搭建**可重复的评测集与基线**；⑨ 建立**微调制品台账**（基座、数据、超参、评测、部署范围）；⑩ 明确智能体工具链的本地化与数据边界落法（**以本机构制度与属地监管要求为准**）。

**资产保全业务条线**：⑪ 按第五节四类做一次**任务盘点**，标注"属于哪一类、是否满足四条判据"；⑫ 优先做完**流程／工具型任务**（**收益最快、治理成本最低**）；⑬ 对**窄分类型任务**先建评测集与人工复核闭环，**指标稳定后再评估微调**；⑭ 对**经验判断型任务**定位为"harness 准备材料与选项、人做决策"；⑮ 建立**退回与纠正机制**。

**最应先动的三项**：**②**、**⑧**、**⑪**（分别对应治理对象、共同语言、资源投向三个前置问题）。

## FAQ

**Q1：有了 harness 工程，是不是就不用微调基座了？**

A1：**该判断在 Harness-R1 摘要报告的数据上不成立。** 论文报告：**对目标智能体直接微调之后，再叠加目标专用 harness 工程师，平均成功率仍从 59.2% 提升到 64.2%（+5.0pp）**，且摘要写明**增益在微调前后都成立**（**论文自身报告，未经独立复现**）。**本文推论**：两者是**叠加**关系；但叠加不等于每个任务都该微调——**仍回到第五节四条判据逐任务判断**。

**Q2：那是不是应该先把基座微调好，再上 harness？**

A2：**本文不建议这个次序**：Harness-Zero 的路径恰好相反——**先用优化过的 harness，再把它诱导的行为蒸馏进权重**（**论文自身报告**）。**本文推论**：**harness 跑通后被校验过的轨迹，才是质量最高的微调语料。**

**Q3：如果做了微调，SR 26-2 管不管？**

A3：**须先纠正前提：本文未能取得该指引的一手公报原文**（官方发布页面在本机网络下不可达），以下**全部来自二手解读，建议以官方文本为准**。据 Empyrean Solutions 说明，**生成式与智能体 AI 被排除在适用范围之外，但该排除适用于正式范围、不适用于风险**——生成式输出若**喂给**在范围内的模型，**责任链会被追下去**；对**厂商模型**，**购买不转移治理义务**，机构仍须**把定制文档化并纳入验证**。**本文分析**：**微调基座就是一次定制**，并不自动游离在治理之外。

**Q4：没有标注数据，评测集从哪里来？**

A4：**从流程线上化之后的既有判定记录里来，不是从零开始人工标注。** 第六节所引 CIO 三项前提的第二项，正是**端到端流程线上化并覆盖贷前筛选、贷中审批、贷后监控及不良资产归因处置**（**据媒体报道，非监管口径**）。**本文推论**：**判定结果能否用同一种口径取出，是能否微调的前置问题**；此前可先用 harness 跑出**可校验的执行轨迹**作为**初期评测集**。

## 事实来源

1. **arXiv:2608.02276《Harness-R1》（论文摘要，一手）**：harness 职责原文与三组数字——44.3%→53.6%（+9.3pp）、微调后叠加专用工程师 59.2%→64.2%（+5.0pp）、增益在微调前后均成立；基准 WebShop、ALFWorld、DBBench。**均为论文自身报告，未经独立复现。**
2. **arXiv:2609.24974《Harness-Zero》（论文摘要，一手）**：harness 蒸馏定义、agent-as-harness 机制，及三项结果——agent-as-harness 优于 code-as-harness；撤掉专用 harness 后 23.3%→44.3%、超过挂着时的 41.7%；三领域 28 种模式平均恢复率 82.3%。**均为论文自身报告，未经独立复现。**
3. **arXiv:2603.09619《Context Engineering》（论文摘要，一手）**："必要但不充分"、CE 的独立学科定位、五项判据（relevance、sufficiency、isolation、economy、provenance）、IE 与 SE，及其援引的 Google ADK／Anthropic／LangChain、ACE 框架、Deloitte（2026）与 KPMG（2026）。**其援引的第三方数据属该文转述。**
4. **KD Odden & Associates 律所简报（2026-04，二手解读，片段式提取）**：联合发布、即刻生效、废止三份文件、保留三大支柱与四项变化。**系从 PDF 元数据提取的片段，可能有缺漏；以官方公报原文为准。**
5. **Empyrean Solutions 博客（厂商博客，二手解读）**：三大支柱与比例原则、机器学习在范围内而生成式与智能体 AI 被排除、验证频率自定并记录、厂商模型义务、**"排除适用于正式范围而非风险"**及责任链示例。**该文声明不构成法律或监管建议。**
6. **OCC Bulletin 2026-13（官方，未取得原文）**：**仅作存在性记录。** 本机网络下该页面不可达（TLS 被中断），**故未引述其任何原文、条款号或段落细节**；一切表述均来自来源 4、5。**请以官方文本为准。**
7. **网易转载《北京银行 CIO 明立松：布局三类智能体，适配多元任务场景》（媒体报道）**：三项前提工作与三类智能体划分。**均为媒体报道中的个人观点，非监管口径、非行业定论。**
8. **经济观察网《强监管下的不良资产处置新路径》（媒体报道）**：**"小额、分散、高频"使传统处置手段难以奏效**；**强监管已进入 AI 与大数据穿透式监管新阶段**（发言人为原银保监会专家）。**均为会议报道中的发言人观点。**

**本文推论部分（非来源表述）**：第一节层次拆分表；第二至四节的判断与推论；第五节的四条判据与四类分型；第六节的约束链；第七节的三条不对称与对比表；第八节六步次序；第九节清单；全部 FAQ。**本文不构成监管要求、合规意见或法律意见。**

*（内容由AI生成，仅供参考）*
