---
title: "自动化会让智能体越调越差——Google RRSI 揭示的 harness 递归进化陷阱，与给银行的四条可落地约束"
date: 2026-09-27
description: "Google Cloud AI Research 在 arXiv:2609.24972 中提出 RRSI，用正则化约束 agent harness 的递归自我进化。真正值得银行注意的不是它的成绩，而是一个负结果：去掉全部正则后，进化集得分升到 92.8（最高），真实场景泛化均值却只有 40.3，几乎等于未进化的基线 39.7——而 RRSI 是 90.5 与 43.6。由于银行只能在自有评估集上度量智能体，这类退化默认不可见。本文拆解七条正则、给出可移植的噪声地板与成本规则 ΔC≤β₀+β₁ΔS，并明确指出真正的瓶颈是金融核心业务缺少自动验证器。"
tags: ["Agent评测", "AI治理", "harness", "模型风险", "自动化优化", "过拟合", "银行业AI", "递归自我改进"]
schema_type: "Article"
---

# 自动化会让智能体越调越差——Google RRSI 揭示的 harness 递归进化陷阱，与给银行的四条可落地约束

**最该看的不是 RRSI 赢了，而是那个负结果：去掉全部正则后进化集得分冲到 92.8（全场最高），真实场景泛化均值却只有 40.3，几乎等于未进化的基线 39.7**

**RRSI 自己的代价是进化集 90.5、泛化 43.6——它用"在自己题目上少拿一点分"，换来了真实场景里唯一为正的提升**

**银行只能在自有评估集上度量智能体，而过拟合恰好发生在评估集上，因此这种退化默认不可见——这是本文最核心的风险判断**

**全部八个基准没有一个是金融任务，最大的约束是我们的核心业务根本没有自动验证器**

## 一、论文做了什么：把 harness 进化认定为一种递归自我改进

论文的第一句概念界定值得单独记住：**一个 LLM 智能体的能力，在很大程度上是被它的 harness 放大的**。harness 指冻结骨干模型之外的一切——提示词、控制流、工具集、记忆、上下文管理。论文把"自动迭代地提出并选择 harness 的组件级修改"明确称为**智能体系统层面的递归自我改进（RSI）**。

**问题出在进化集是有限的，且每一轮都被重复使用。** 作者识别出三种过拟合机制：

1. **基准特定拟合**——任务名、实体、答案被写进提示词
2. **追逐评测噪声**——利用评分波动刷分
3. **复杂度累积**——不加区分地堆料，分数上去了智能体没变好

**RRSI 的核心立场是：正则化搜索过程，而不是收缩 harness 本身。** 所有组件仍然完全可编辑（提示、控制流、配置、上下文管理、工具、技能、记忆、子智能体都可以增删改），约束的是"这一轮能改多少"和"哪些被测出来的增益允许固化"。

**实验设置。** 八个基准、三个领域：编码（Terminal-Bench 2.1、SWE-bench Verified）、智能体工作区（Harvey LAB、JobBench、GDPval、APEX-Agents）、工程设计（EngDesign、Frontier-Eng）。每个领域只在**一个**套件上演化，然后原封不动拿到其余基准上跑。默认策略模型 Claude Opus 4.8，代码 Apache 2.0 开源，项目页还放出了四次真实运行的完整逐轮 diff 与 critic 判定。

## 二、负结果才是本文重点

消融实验（在智能体工作区实例上）给出的四组数字，是整篇论文最有银行价值的部分：

| 配置 | 进化集得分 | 泛化均值（OOD） | 策略 token / trial |
|---|---|---|---|
| 未进化基线 H₀ | — | 39.7 | 1.56 M |
| **RRSI（全套正则）** | 90.5 | **43.6** | 2.42 M |
| 去掉 proposal 侧正则 | 90.7 | 41.9 | — |
| 去掉 selection 侧正则 | 91.5 | 41.0 | 3.59 M |
| **去掉全部正则** | **92.8（最高）** | **40.3** | 3.80 M |

**读法只有一句话：进化集得分与真实泛化在方向上是相反的。**

- 拿最高进化集分数的那一档（92.8），泛化均值 40.3，比基线 39.7 只高 0.6——**在四个数量级的优化投入下等于没优化**
- 拿最低进化集分数的那一档（90.5），泛化均值 43.6，比基线高 3.9——**是全部配置里唯一取得实质提升的**
- 两组之间进化集只差 2.3 分，泛化却差 3.3 分，且**方向相反**

这组对比直接回答了一个银行迟早要面对的问题：**如果我们用自动化手段持续优化智能体 harness，最可能的结果不是变好，而是"在自己的题库上越来越好、在真实业务上原地踏步"。** 更麻烦的是——**我们只看得到前者。**

对比既有方法更糟：论文提到，在办公类任务上，最好的既有方法在泛化上平均只涨 0.9 分，其中**两个方法的最终 harness 比它们出发时的 harness 还差**。RRSI 在同条件下涨 3.9 分，是唯一"泛化增益大于进化集增益"的方法。

## 三、七条正则拆开看：哪些能搬进银行

论文的七条正则分两侧。左侧管"搜索能力怎么花"，右侧管"哪些增益允许变成永久状态"。

### 左侧（proposal 侧）三条

**退火编辑预算。** 早期轮次允许一个候选打包 3 到 4 处协同修改以找到机制，晚期收敛到每轮只改 1 处。论文明确类比神经网络的学习率衰减与 L0 正则。**银行版翻译：这条本质是变更管理原则——探索期允许多点协同，收敛期必须单变量，否则你永远归因不清。**

**证据化信用记账。** 每一个候选都被记录：组件、假设、diff、得分变化、成本变化、是否被接受。**被否决的假设作为负面证据留存**，搜索不会回头重测已被证伪的想法。**银行版翻译：这正是变更台账该有的样子——被否决的方案必须留档，否则同一个坏方案会换个名字再来一次。**

**结构化探索。** 当进展在三轮停滞窗口内始终落在噪声带内，**强制把一个提案额度让给本次运行从未动过的组件**。论文类比熵正则。**银行版翻译：防止在某个已经调不动的提示词上反复微调，把预算强行挪到没人碰过的工具链或检索层。**

### 右侧（selection 侧）四条

**泄漏 critic。** 在**评测之前**否决任何显式编码了任务名、实体名、任务特定取值、答案或基准特定逻辑的编辑，以及"惰性机械"（加了但不生效的零件）。通用的提示词或工具描述改进仍然放行。论文特别强调**为什么必须评测前筛**：一个泄漏的候选一旦拿到被抬高的进化集分数，就会对后续所有轮次产生吸引力。**银行版翻译：这一条在银行语境下不是"过拟合"，而是数据泄露——把客户姓名、账号、案件编号写进提示词，既是过拟合，也可能直接构成合规问题。**

**噪声调整地板（最该立刻抄的一条）。** 用**未改动基线 harness 的重复评测**估出抖动幅度 δ；候选的分数不得低于"历史最好成绩 − δ"。**银行版翻译：这条是本文最可执行的一条。多数机构用 LLM 裁判打分的智能体评测，本身就有可观抖动，但我们从来没有量化过它。** 做法很直接：对当前上线的 harness 重复跑 N 遍，取标准差，得 δ，此后任何候选必须超过"最好成绩 − δ"才算有效增益。

**成本规则。** 额外推理 token 必须由实测增益买单，形式化为 `ΔC ≤ β₀ + β₁·ΔS`。论文类比 L2（Ridge）。**银行版翻译见下节。**

**剪枝。** 近期实测贡献不再为正的组件被标记为删除目标，论文类比 L1（Lasso）。**银行版翻译：这条专治我们共同的老毛病——提示词片段只增不减，越调越长。**

论文也坦承一处方法论限制：**消融是把整组规则一起开关的，并没有逐条隔离每个正则的独立贡献。**

## 四、成本规则：把 token 换成人民币

成本规则的形式 `ΔC ≤ β₀ + β₁·ΔS` 在银行语境下几乎不用改写，只需换单位：

> **新增的推理成本（人民币/笔）≤ 固定容忍额 β₀ + β₁ × 实测质量增益**

它的价值在于把"要不要为了提升质量加成本"这个判断，从主观争论变成**可审计的算式**。配套的剪枝规则则处理另一半问题：**已经花下去、但后来不再产生回报的成本**。论文明确指出，**没有其他既有方法带有这两条规则**。

**一个论文里的具体否决案例值得记住：** 某个编码候选新增了一个任务特定的完成性检查，使 token 消耗**下降 13.6%**，但分数掉了 2.81 分——尽管它更省，被噪声地板否掉了。对照组是一个加入完成性审计与非阻塞轮询的候选，**涨了 3.93 分**，被接受。

**换言之：更便宜但更差，不是改进。** 这条直觉在银行的成本核算里同样成立。

**同时必须诚实看清成本侧的两个数字：**

- RRSI 的最终 harness 是 2.42 M token/trial，**未进化的 H₀ 是 1.56 M**——也就是说，**RRSI 比不进化更贵**，收益有相当一部分是用算力买来的
- RRSI 每 trial 跑 26.3 步，而既有方法是 27.3 到 34.6 步

论文自己的措辞是：RRSI 是"最轻的进化 harness"，轻是相对**未正则化的进化**而言，不是相对**不进化**。**银行的预算测算必须以 H₀ 为基线，不能以"其他自动化方案"为基线。**

## 五、银行版四条硬约束

把上述机制落成可执行的条款：

**约束一：先量噪声地板，再谈自动化。** 对当前生产 harness 重复评测，取 δ，把它写进验收基线。**在此之前任何自动化优化的产出都不具备可解释性**——因为你无法区分"真的提升了"和"这次运气好"。这一条不需要 RRSI 的代码，是一个纯度量动作。

**约束二：泄漏筛查前置为硬否决。** 任何 harness 编辑一旦包含客户标识、账号、案件编号、监管报送口径的具体取值，直接否决，且**必须在评测之前**执行，不接受"先跑分再复查"。把客户数据写进提示词在银行不是效率问题，是泄露事件。

**约束三：成本必须被增益买单，且以未进化基线为参照。** 建立 `Δ成本 ≤ β₀ + β₁·Δ质量` 的算式审批；预算测算一律以当前生产 harness 的实际单位成本为基线，而不是以其他自动化方案的更差成本为基线。

**约束四：留出集永不参与选择，且设基线否决线。** evolve set 用于搜索，held-out 用于否决；**任何在留出集上劣于生产基线的候选，无论进化集分数多高，一律不得上线。** 这条是第二节那个负结果的直接对策——既然自动化优化会制造"进化集更高、真实更差"的候选，那么唯一有效的防线就是留出集拥有绝对否决权。

补充一条变更管理侧的：**探索期允许多点协同修改，收敛期强制单变量。** 这不是机器学习技巧，是让归因成为可能的前提。

## 六、不能照搬的地方：验证器缺失是真正的瓶颈

论文自身的实验设定暴露了它的适用边界，而这道边界在银行更硬。

**八个基准的验证器只有四种形态：** 通过率、LLM 裁判评分、对比人类专家的胜率、冻结的模拟器。**没有一个是金融任务。** 最接近金融的 Harvey LAB 是法律办公任务，其验证方式是"模型裁判按评分表打分"。

**问题在于：RRSI 整套机制的前提是"任务可自动验证"。** 论文的设定里，进化集得分就是"任务与随机轨迹上的平均验证器奖励"。没有验证器，进化循环根本无法闭合。

**而银行的多数核心业务恰恰没有验证器：**

- **信贷审批**——对错要等到还款期，样本期以年计
- **AML 告警定性**——真阳性需要人工复核与外部反馈闭环
- **投顾适当性**——判定依赖监管解释与客户具体情形，没有可自动比对的标准答案
- **反欺诈决策**——对抗性极强，验证器本身容易被攻击

**最接近可用的是 GDPval 的形态：对比人类专家的胜率。** 银行可以类比为"对比资深复核岗的胜率"，但这条路成本高、周期长、样本量小，恰恰是 RRSI 论文里被归为最贵的一类验证。**这意味着银行的 harness 进化在小样本上运行，而小样本正是过拟合的高发区**——RRSI 解决的正是这个问题，但它的 δ、β₀、β₁、三轮停滞窗口这些超参都需要按我们的数据规模重新标定，论文没有给出任何标定方法。

**另外三条边界：**

1. **消融是整组开关的**，没有逐条隔离单个正则的贡献，因此我们无法判断哪一条对我们最关键
2. **只适用于冻结 LLM**，不涉及权重更新；这条对"只能调 harness、拿不到权重"的场景是好消息，但意味着能力上限仍受制于所选模型
3. **论文明确未测试**：更宏大的架构、更丰富的工具生态、更长的自我改进轮次、以及涉及权重更新的场景

## 七、结论：先建否决机制，再开自动化

这篇论文对银行的价值排序，和它的标题给人的印象并不一致。

**最值钱的是那个负结果**："去掉全部正则，进化集 92.8 全场最高，泛化 40.3 几乎等于基线 39.7。" 它用一张消融表证明了**自动化优化存在一种系统性失败模式：把智能体调得在自己的评估集上更好，在真实场景上更差。** 而银行的度量体系天然只看得到前者。

**其次是三条可以直接落地的机制**：噪声地板 δ（用重复运行量出基线抖动）、成本规则 `ΔC ≤ β₀ + β₁·ΔS`（把成本审批变成算式）、泄漏 critic（把客户标识写进提示词定性为硬否决事件）。这三条都不需要 RRSI 的代码，只需要改流程和度量。

**最需要警惕的是不要照搬结论**：RRSI 赢了，不代表"正则化 harness 进化"这个结论可以直接搬到金融场景。**没有自动验证器，就没有进化循环。** 银行的现实路径大概率是：先在有验证器的环节（工单分类、文档抽取、合规问答这类有标准答案或可自动比对的场景）试点，同时把 δ 与成本规则建起来，再考虑向验证器稀缺的环节扩展。

**顺序不能反。** 先建否决机制，再开自动化；否则我们会在自己的题库上把分数越调越高，而真实客户遇到的体验不变甚至变差——而这件事，按第二节的表，我们根本不会知道。

## FAQ

**Q1：银行到底能不能用 RRSI 这套方法？**

A：不能直接用，但**它的三条机制可以立刻用**。RRSI 整套方法要求任务有自动验证器，银行的信贷审批、AML 定性、投顾适当性都做不到这一点。但"噪声地板""成本规则""泄漏前置筛查"这三条与验证器无关，只是度量与流程约束，可以在任何 harness 优化活动之前先建起来。**建议顺序是先建这三条，再谈试点。**

**Q2：为什么"进化集分数最高反而泛化最差"这个结果值得单独强调？**

A：因为它精确描述了银行最容易踩的坑。我们通常只有一套内部评估集，而过拟合恰恰发生在评估集上。论文的消融显示，去掉全部正则后进化集冲到 92.8（全场最高）而泛化只有 40.3，与未进化基线 39.7 几乎相同——**在巨量优化投入下等于没优化**。而进化集分数最低的那一档（90.5）反而拿到了唯一为正的泛化提升（43.6）。**这意味着用进化集分数验收自动化优化，其指标方向本身就是错的。**

**Q3：噪声地板 δ 具体怎么量？**

A：对**未做任何改动的当前生产 harness** 重复评测同一批样本 N 次（N 建议不少于 10），取分数分布的波动幅度作为 δ。此后任何候选必须超过"历史最好成绩 − δ"才算有效增益。论文的做法正是如此：δ 来自"对未改动基线 harness 的重复评测"。**这条不需要 RRSI 的任何代码，是一个纯度量动作，也是本文建议最先做的一件事**——因为在知道 δ 之前，任何自动化优化的产出都无法区分"真提升"与"运气"。

**Q4：成本规则 ΔC ≤ β₀ + β₁·ΔS 在银行怎么落地？**

A：把 token 换成人均单笔成本，把"得分"换成你关心的质量指标即可。形式是一个审批算式：新增的推理成本 ≤ 固定容忍额 + 单位增益容忍系数 × 实测增益。配套的剪枝规则处理另一半——**已经花下去但后来不再产生回报的成本**，对应论文里的"近期贡献不再为正的组件被标记删除"。论文指出没有其他既有方法带这两条规则，而这两条恰好对应银行最熟悉的两个概念：单位成本管控与无效投入清理。

**Q5：泄漏筛查为什么必须放在评测之前？**

A：论文给了明确理由——**一个泄漏的候选一旦拿到被抬高的进化集分数，就会对后续所有轮次产生吸引力**，搜索会持续向它倾斜。放到评测之后才发现，等于让被污染的分数已经污染了搜索方向。银行语境下这条更硬：把客户姓名、账号、案件编号写进提示词不只是过拟合，**是数据泄露事件**，处理性质完全不同。

**Q6：如果 RRSI 都能让六个留出基准全部不退化，是不是说明问题不大？**

A：要看清代价。RRSI 的最终 harness 是 2.42 M token/trial，而**未进化的基线只有 1.56 M**——RRSI 比不进化更贵，收益有相当部分是用算力买来的。它被称为"最轻"，是相对**未正则化的进化（3.80 M）**而言。**银行的预算测算必须以当前生产 harness 的实际单位成本为基线，而不是以其他自动化方案为基线。** 加上它依赖可自动验证的任务、且超参需按自有数据规模重新标定，我的判断是：机制可移植，结论不可外推。

---

*作者毕超，金融行业风险管理从业者。本文仅代表作者个人观点，不构成任何机构立场。*

<script type="application/ld+json">
{
  "@context": "https://schema.org",
  "@type": "Article",
  "headline": "自动化会让智能体越调越差——Google RRSI 揭示的 harness 递归进化陷阱，与给银行的四条可落地约束",
  "datePublished": "2026-09-27",
  "description": "Google Cloud AI Research 在 arXiv:2609.24972 提出 RRSI，用正则化约束 agent harness 的递归自我进化。真正值得银行注意的是一个负结果：去掉全部正则后进化集得分 92.8（全场最高）而泛化均值仅 40.3，几乎等于基线 39.7。本文拆解七条正则，给出噪声地板与成本规则，并指出真正瓶颈是金融核心业务缺少自动验证器。",
  "keywords": ["Agent评测", "AI治理", "harness", "模型风险", "自动化优化", "过拟合", "银行业AI", "递归自我改进"],
  "author": {
    "@type": "Person",
    "name": "毕超",
    "jobTitle": "金融行业风险管理从业者"
  }
}
</script>
*（内容由AI生成，仅供参考）*
