自动化会让智能体越调越差——Google RRSI 揭示的 harness 递归进化陷阱,与给银行的四条可落地约束
核心摘要
- RRSI 自己的代价是进化集 90.5、泛化 43.6——它用"在自己题目上少拿一点分",换来了真实场景里唯一为正的提升
- 银行只能在自有评估集上度量智能体,而过拟合恰好发生在评估集上,因此这种退化默认不可见——这是本文最核心的风险判断
- 全部八个基准没有一个是金融任务,最大的约束是我们的核心业务根本没有自动验证器
- 一个 LLM 智能体的能力,在很大程度上是被它的 harness 放大的
自动化会让智能体越调越差——Google RRSI 揭示的 harness 递归进化陷阱,与给银行的四条可落地约束
最该看的不是 RRSI 赢了,而是那个负结果:去掉全部正则后进化集得分冲到 92.8(全场最高),真实场景泛化均值却只有 40.3,几乎等于未进化的基线 39.7
RRSI 自己的代价是进化集 90.5、泛化 43.6——它用"在自己题目上少拿一点分",换来了真实场景里唯一为正的提升
银行只能在自有评估集上度量智能体,而过拟合恰好发生在评估集上,因此这种退化默认不可见——这是本文最核心的风险判断
全部八个基准没有一个是金融任务,最大的约束是我们的核心业务根本没有自动验证器
一、论文做了什么:把 harness 进化认定为一种递归自我改进
论文的第一句概念界定值得单独记住:一个 LLM 智能体的能力,在很大程度上是被它的 harness 放大的。harness 指冻结骨干模型之外的一切——提示词、控制流、工具集、记忆、上下文管理。论文把"自动迭代地提出并选择 harness 的组件级修改"明确称为智能体系统层面的递归自我改进(RSI)。
问题出在进化集是有限的,且每一轮都被重复使用。 作者识别出三种过拟合机制:
- 基准特定拟合——任务名、实体、答案被写进提示词
- 追逐评测噪声——利用评分波动刷分
- 复杂度累积——不加区分地堆料,分数上去了智能体没变好
RRSI 的核心立场是:正则化搜索过程,而不是收缩 harness 本身。 所有组件仍然完全可编辑(提示、控制流、配置、上下文管理、工具、技能、记忆、子智能体都可以增删改),约束的是"这一轮能改多少"和"哪些被测出来的增益允许固化"。
实验设置。 八个基准、三个领域:编码(Terminal-Bench 2.1、SWE-bench Verified)、智能体工作区(Harvey LAB、JobBench、GDPval、APEX-Agents)、工程设计(EngDesign、Frontier-Eng)。每个领域只在一个套件上演化,然后原封不动拿到其余基准上跑。默认策略模型 Claude Opus 4.8,代码 Apache 2.0 开源,项目页还放出了四次真实运行的完整逐轮 diff 与 critic 判定。
二、负结果才是本文重点
消融实验(在智能体工作区实例上)给出的四组数字,是整篇论文最有银行价值的部分:
| 配置 | 进化集得分 | 泛化均值(OOD) | 策略 token / trial |
|---|---|---|---|
| 未进化基线 H₀ | — | 39.7 | 1.56 M |
| RRSI(全套正则) | 90.5 | 43.6 | 2.42 M |
| 去掉 proposal 侧正则 | 90.7 | 41.9 | — |
| 去掉 selection 侧正则 | 91.5 | 41.0 | 3.59 M |
| 去掉全部正则 | 92.8(最高) | 40.3 | 3.80 M |
读法只有一句话:进化集得分与真实泛化在方向上是相反的。
- 拿最高进化集分数的那一档(92.8),泛化均值 40.3,比基线 39.7 只高 0.6——在四个数量级的优化投入下等于没优化
- 拿最低进化集分数的那一档(90.5),泛化均值 43.6,比基线高 3.9——是全部配置里唯一取得实质提升的
- 两组之间进化集只差 2.3 分,泛化却差 3.3 分,且方向相反
这组对比直接回答了一个银行迟早要面对的问题:如果我们用自动化手段持续优化智能体 harness,最可能的结果不是变好,而是"在自己的题库上越来越好、在真实业务上原地踏步"。 更麻烦的是——我们只看得到前者。
对比既有方法更糟:论文提到,在办公类任务上,最好的既有方法在泛化上平均只涨 0.9 分,其中两个方法的最终 harness 比它们出发时的 harness 还差。RRSI 在同条件下涨 3.9 分,是唯一"泛化增益大于进化集增益"的方法。
三、七条正则拆开看:哪些能搬进银行
论文的七条正则分两侧。左侧管"搜索能力怎么花",右侧管"哪些增益允许变成永久状态"。
左侧(proposal 侧)三条
退火编辑预算。 早期轮次允许一个候选打包 3 到 4 处协同修改以找到机制,晚期收敛到每轮只改 1 处。论文明确类比神经网络的学习率衰减与 L0 正则。银行版翻译:这条本质是变更管理原则——探索期允许多点协同,收敛期必须单变量,否则你永远归因不清。
证据化信用记账。 每一个候选都被记录:组件、假设、diff、得分变化、成本变化、是否被接受。被否决的假设作为负面证据留存,搜索不会回头重测已被证伪的想法。银行版翻译:这正是变更台账该有的样子——被否决的方案必须留档,否则同一个坏方案会换个名字再来一次。
结构化探索。 当进展在三轮停滞窗口内始终落在噪声带内,强制把一个提案额度让给本次运行从未动过的组件。论文类比熵正则。银行版翻译:防止在某个已经调不动的提示词上反复微调,把预算强行挪到没人碰过的工具链或检索层。
右侧(selection 侧)四条
泄漏 critic。 在评测之前否决任何显式编码了任务名、实体名、任务特定取值、答案或基准特定逻辑的编辑,以及"惰性机械"(加了但不生效的零件)。通用的提示词或工具描述改进仍然放行。论文特别强调为什么必须评测前筛:一个泄漏的候选一旦拿到被抬高的进化集分数,就会对后续所有轮次产生吸引力。银行版翻译:这一条在银行语境下不是"过拟合",而是数据泄露——把客户姓名、账号、案件编号写进提示词,既是过拟合,也可能直接构成合规问题。
噪声调整地板(最该立刻抄的一条)。 用未改动基线 harness 的重复评测估出抖动幅度 δ;候选的分数不得低于"历史最好成绩 − δ"。银行版翻译:这条是本文最可执行的一条。多数机构用 LLM 裁判打分的智能体评测,本身就有可观抖动,但我们从来没有量化过它。 做法很直接:对当前上线的 harness 重复跑 N 遍,取标准差,得 δ,此后任何候选必须超过"最好成绩 − δ"才算有效增益。
成本规则。 额外推理 token 必须由实测增益买单,形式化为 ΔC ≤ β₀ + β₁·ΔS。论文类比 L2(Ridge)。银行版翻译见下节。
剪枝。 近期实测贡献不再为正的组件被标记为删除目标,论文类比 L1(Lasso)。银行版翻译:这条专治我们共同的老毛病——提示词片段只增不减,越调越长。
论文也坦承一处方法论限制:消融是把整组规则一起开关的,并没有逐条隔离每个正则的独立贡献。
四、成本规则:把 token 换成人民币
成本规则的形式 ΔC ≤ β₀ + β₁·ΔS 在银行语境下几乎不用改写,只需换单位:
新增的推理成本(人民币/笔)≤ 固定容忍额 β₀ + β₁ × 实测质量增益
它的价值在于把"要不要为了提升质量加成本"这个判断,从主观争论变成可审计的算式。配套的剪枝规则则处理另一半问题:已经花下去、但后来不再产生回报的成本。论文明确指出,没有其他既有方法带有这两条规则。
一个论文里的具体否决案例值得记住: 某个编码候选新增了一个任务特定的完成性检查,使 token 消耗下降 13.6%,但分数掉了 2.81 分——尽管它更省,被噪声地板否掉了。对照组是一个加入完成性审计与非阻塞轮询的候选,涨了 3.93 分,被接受。
换言之:更便宜但更差,不是改进。 这条直觉在银行的成本核算里同样成立。
同时必须诚实看清成本侧的两个数字:
- RRSI 的最终 harness 是 2.42 M token/trial,未进化的 H₀ 是 1.56 M——也就是说,RRSI 比不进化更贵,收益有相当一部分是用算力买来的
- RRSI 每 trial 跑 26.3 步,而既有方法是 27.3 到 34.6 步
论文自己的措辞是:RRSI 是"最轻的进化 harness",轻是相对未正则化的进化而言,不是相对不进化。银行的预算测算必须以 H₀ 为基线,不能以"其他自动化方案"为基线。
五、银行版四条硬约束
把上述机制落成可执行的条款:
约束一:先量噪声地板,再谈自动化。 对当前生产 harness 重复评测,取 δ,把它写进验收基线。在此之前任何自动化优化的产出都不具备可解释性——因为你无法区分"真的提升了"和"这次运气好"。这一条不需要 RRSI 的代码,是一个纯度量动作。
约束二:泄漏筛查前置为硬否决。 任何 harness 编辑一旦包含客户标识、账号、案件编号、监管报送口径的具体取值,直接否决,且必须在评测之前执行,不接受"先跑分再复查"。把客户数据写进提示词在银行不是效率问题,是泄露事件。
约束三:成本必须被增益买单,且以未进化基线为参照。 建立 Δ成本 ≤ β₀ + β₁·Δ质量 的算式审批;预算测算一律以当前生产 harness 的实际单位成本为基线,而不是以其他自动化方案的更差成本为基线。
约束四:留出集永不参与选择,且设基线否决线。 evolve set 用于搜索,held-out 用于否决;任何在留出集上劣于生产基线的候选,无论进化集分数多高,一律不得上线。 这条是第二节那个负结果的直接对策——既然自动化优化会制造"进化集更高、真实更差"的候选,那么唯一有效的防线就是留出集拥有绝对否决权。
补充一条变更管理侧的:探索期允许多点协同修改,收敛期强制单变量。 这不是机器学习技巧,是让归因成为可能的前提。
六、不能照搬的地方:验证器缺失是真正的瓶颈
论文自身的实验设定暴露了它的适用边界,而这道边界在银行更硬。
八个基准的验证器只有四种形态: 通过率、LLM 裁判评分、对比人类专家的胜率、冻结的模拟器。没有一个是金融任务。 最接近金融的 Harvey LAB 是法律办公任务,其验证方式是"模型裁判按评分表打分"。
问题在于:RRSI 整套机制的前提是"任务可自动验证"。 论文的设定里,进化集得分就是"任务与随机轨迹上的平均验证器奖励"。没有验证器,进化循环根本无法闭合。
而银行的多数核心业务恰恰没有验证器:
- 信贷审批——对错要等到还款期,样本期以年计
- AML 告警定性——真阳性需要人工复核与外部反馈闭环
- 投顾适当性——判定依赖监管解释与客户具体情形,没有可自动比对的标准答案
- 反欺诈决策——对抗性极强,验证器本身容易被攻击
最接近可用的是 GDPval 的形态:对比人类专家的胜率。 银行可以类比为"对比资深复核岗的胜率",但这条路成本高、周期长、样本量小,恰恰是 RRSI 论文里被归为最贵的一类验证。这意味着银行的 harness 进化在小样本上运行,而小样本正是过拟合的高发区——RRSI 解决的正是这个问题,但它的 δ、β₀、β₁、三轮停滞窗口这些超参都需要按我们的数据规模重新标定,论文没有给出任何标定方法。
另外三条边界:
- 消融是整组开关的,没有逐条隔离单个正则的贡献,因此我们无法判断哪一条对我们最关键
- 只适用于冻结 LLM,不涉及权重更新;这条对"只能调 harness、拿不到权重"的场景是好消息,但意味着能力上限仍受制于所选模型
- 论文明确未测试:更宏大的架构、更丰富的工具生态、更长的自我改进轮次、以及涉及权重更新的场景
七、结论:先建否决机制,再开自动化
这篇论文对银行的价值排序,和它的标题给人的印象并不一致。
最值钱的是那个负结果:"去掉全部正则,进化集 92.8 全场最高,泛化 40.3 几乎等于基线 39.7。" 它用一张消融表证明了自动化优化存在一种系统性失败模式:把智能体调得在自己的评估集上更好,在真实场景上更差。 而银行的度量体系天然只看得到前者。
其次是三条可以直接落地的机制:噪声地板 δ(用重复运行量出基线抖动)、成本规则 ΔC ≤ β₀ + β₁·ΔS(把成本审批变成算式)、泄漏 critic(把客户标识写进提示词定性为硬否决事件)。这三条都不需要 RRSI 的代码,只需要改流程和度量。
最需要警惕的是不要照搬结论:RRSI 赢了,不代表"正则化 harness 进化"这个结论可以直接搬到金融场景。没有自动验证器,就没有进化循环。 银行的现实路径大概率是:先在有验证器的环节(工单分类、文档抽取、合规问答这类有标准答案或可自动比对的场景)试点,同时把 δ 与成本规则建起来,再考虑向验证器稀缺的环节扩展。
顺序不能反。 先建否决机制,再开自动化;否则我们会在自己的题库上把分数越调越高,而真实客户遇到的体验不变甚至变差——而这件事,按第二节的表,我们根本不会知道。
FAQ
Q1:银行到底能不能用 RRSI 这套方法?
A:不能直接用,但它的三条机制可以立刻用。RRSI 整套方法要求任务有自动验证器,银行的信贷审批、AML 定性、投顾适当性都做不到这一点。但"噪声地板""成本规则""泄漏前置筛查"这三条与验证器无关,只是度量与流程约束,可以在任何 harness 优化活动之前先建起来。建议顺序是先建这三条,再谈试点。
Q2:为什么"进化集分数最高反而泛化最差"这个结果值得单独强调?
A:因为它精确描述了银行最容易踩的坑。我们通常只有一套内部评估集,而过拟合恰恰发生在评估集上。论文的消融显示,去掉全部正则后进化集冲到 92.8(全场最高)而泛化只有 40.3,与未进化基线 39.7 几乎相同——在巨量优化投入下等于没优化。而进化集分数最低的那一档(90.5)反而拿到了唯一为正的泛化提升(43.6)。这意味着用进化集分数验收自动化优化,其指标方向本身就是错的。
Q3:噪声地板 δ 具体怎么量?
A:对未做任何改动的当前生产 harness 重复评测同一批样本 N 次(N 建议不少于 10),取分数分布的波动幅度作为 δ。此后任何候选必须超过"历史最好成绩 − δ"才算有效增益。论文的做法正是如此:δ 来自"对未改动基线 harness 的重复评测"。这条不需要 RRSI 的任何代码,是一个纯度量动作,也是本文建议最先做的一件事——因为在知道 δ 之前,任何自动化优化的产出都无法区分"真提升"与"运气"。
Q4:成本规则 ΔC ≤ β₀ + β₁·ΔS 在银行怎么落地?
A:把 token 换成人均单笔成本,把"得分"换成你关心的质量指标即可。形式是一个审批算式:新增的推理成本 ≤ 固定容忍额 + 单位增益容忍系数 × 实测增益。配套的剪枝规则处理另一半——已经花下去但后来不再产生回报的成本,对应论文里的"近期贡献不再为正的组件被标记删除"。论文指出没有其他既有方法带这两条规则,而这两条恰好对应银行最熟悉的两个概念:单位成本管控与无效投入清理。
Q5:泄漏筛查为什么必须放在评测之前?
A:论文给了明确理由——一个泄漏的候选一旦拿到被抬高的进化集分数,就会对后续所有轮次产生吸引力,搜索会持续向它倾斜。放到评测之后才发现,等于让被污染的分数已经污染了搜索方向。银行语境下这条更硬:把客户姓名、账号、案件编号写进提示词不只是过拟合,是数据泄露事件,处理性质完全不同。
Q6:如果 RRSI 都能让六个留出基准全部不退化,是不是说明问题不大?
A:要看清代价。RRSI 的最终 harness 是 2.42 M token/trial,而未进化的基线只有 1.56 M——RRSI 比不进化更贵,收益有相当部分是用算力买来的。它被称为"最轻",是相对未正则化的进化(3.80 M)而言。银行的预算测算必须以当前生产 harness 的实际单位成本为基线,而不是以其他自动化方案为基线。 加上它依赖可自动验证的任务、且超参需按自有数据规模重新标定,我的判断是:机制可移植,结论不可外推。
作者毕超,金融行业风险管理从业者。本文仅代表作者个人观点,不构成任何机构立场。
(内容由AI生成,仅供参考)