让银行学会自我进化:RSI(递归自改进)的银行业落地路径与治理边界
核心摘要
- 银行 RSI 落地应遵循"教师主导、人类终审",AI 不得自行修改风控规则与关键决策逻辑
- 参数进化限定离线受控;上下文、记忆与 Skill 进化可优先在生产侧探索
- 金融场景坚持"离线优先、受控在线"的混合更新模式,禁止纯在线自进化
- 自进化是能力更是治理命题,可回滚、可审计、可解释是银行落地底线
让银行学会自我进化:RSI(递归自改进)的银行业落地路径与治理边界
过去两年,银行部署大模型时最常问的问题是:「这个模型准不准、稳不稳?」现在,前沿研究提出了一个更进一步的命题:AI 能不能在完成任务的过程中,自己变得越来越强?
这个命题在学术界有一个名字——RSI(Recursive Self-Improvement,递归自改进),也叫自进化(Self-Evolving)。青稞AI 与 MLNLP 社区近期发布的万字综述,系统梳理了这一领域的技术版图:从参数、上下文、记忆、Skill 到 Harness 代码,从链式、树形到图式的进化结构,从自身更新、教师更新到联合更新的权责分工,从离线、在线到混合模式的更新时机。对于正在把 Agent 引入信贷、风控、运营与合规场景的金融机构来说,这套坐标系不仅关乎技术选型,更关乎一套全新的治理命题:当 AI 开始自己修改自己,银行的模型风险管理框架是否跟得上?
全文要点:
- 银行 RSI 落地应遵循"教师主导、人类终审",AI 不得自行修改风控规则与关键决策逻辑
- 参数进化限定离线受控;上下文、记忆与 Skill 进化可优先在生产侧探索
- 金融场景坚持"离线优先、受控在线"的混合更新模式,禁止纯在线自进化
- 自进化是能力更是治理命题,可回滚、可审计、可解释是银行落地底线
本文以该综述为技术坐标,从金融行业视角拆解银行如何借助 RSI 实现自进化,以及哪些进化路径适合银行、哪些必须设限。
一、先理解 RSI:Agent = Model + Harness
RSI 的定义可以概括为:Agent 在与环境交互后,利用任务轨迹与反馈,通过更新机制修改自身状态,并让更新后的状态参与后续任务,以提升未来表现。
理解 RSI 的关键在于一个抽象:现代智能体 = Model + Harness。Model 提供基础的理解、推理与生成能力;Harness 组织模型如何接收信息、积累经验、调用工具并完成任务,具体包括上下文、记忆、Skill、工具和 Harness 代码。
这意味着,AI 的「自我进化」并不只有「更新模型参数」一条路。它可能发生在五个层面:
- 参数进化:把经验直接写回模型权重(如 SEAL)
- 上下文进化:根据任务结果重组下一次推理看到的材料(如 Prime Agent)
- 记忆进化:把经验写入外部长期存储、按需检索(如 ReasoningBank)
- Skill 进化:把多次任务的成功与失败沉淀为可复用做法(如 TRACE)
- Harness 代码进化:改变上下文的构造方式、增删工具或修改执行逻辑(如 SkillSmith)
对银行而言,这个五层框架本身就是一张风险分级地图:进化越靠近模型权重,影响越深、越难回滚;进化越靠近 Harness 外围(记忆、Skill、流程代码),越可控、越可审计。这一判断将贯穿全文。
二、五条进化路径的银行适配度
1. 参数进化:银行应当「缓行」
参数进化把经验写回模型权重,优势是知识直接内化、无需每次检索;代价是更新昂贵、难以定位和撤销,一次错误训练可能影响大量无关任务。
银行业对这条路径必须高度审慎。风控模型、反洗钱模型一旦进入生产,其参数变化直接关系到监管报送、客户定价与授信决策。一次错误的权重更新可能波及成千上万个客户案例,且难以定位是哪一轮更新引入了偏差。在模型风险管理(MRM)框架下,参数进化意味着「模型变更管理」的频率从季度级压缩到实时级,现有治理节奏完全无法承接。
银行可以接受的渐进形态是:在沙盒环境中,用 SEAL 式的 self-edit + 强化学习框架,让模型自行生成「自我更新方案」,但每一版方案都必须走完整的模型验证、独立评审与监管报备流程后才能进入生产。换句话说,参数进化在银行应被限定为「离线、受控、可回滚」的模型再开发流程,而非在线自进化。
2. 上下文进化:信贷长流程的「工作台」
上下文进化针对一个真实痛点:长程任务的持续时间远超单次模型调用。以大型软件开发为例,Agent 可能需要连续工作数小时,反复阅读代码、运行测试、修改方案,但模型上下文窗口有限。Prime Agent 的做法是在模型之外提供持久化工作台(如 IPython REPL),保留代码、变量、文件和计算结果,任务中断后可从上次位置继续。
银行的信贷审批、尽职调查、复杂对公业务恰恰是典型的长程任务。一个授信 Agent 可能要连续工作数小时,依次读取财务报表、征信数据、抵押物信息、行业研究报告,并在多个子系统间调用工具。上下文进化允许它在不丢失进展的前提下持续工作,并把「任务计划—执行轨迹—中间结论」组织成可恢复的工作现场。这条路径几乎不触碰模型权重,风险最低,是银行 RSI 的第一优先级。
3. 记忆进化:把客户经理的经验变成机构记忆
记忆进化把经验写入独立长期存储,并在后续任务中按需检索。ReasoningBank 的洞见在于:直接保存整条轨迹并不理想(太长、太多琐碎细节),应该把成功与失败轨迹整理成简短、可复用的经验;新任务到来时先检索相关策略指导交互,任务结束后再提炼新经验写回。
这对银行的意义非常直接。银行最宝贵的资产之一,是资深客户经理、信贷审批专家、反洗钱分析师的隐性经验——他们知道某类行业的报表要重点看什么,某种交易模式背后可能是什么风险。记忆进化提供了一条把这些隐性经验沉淀为「机构记忆」的技术路径:Agent 每完成一笔业务,就从轨迹中提炼可复用策略,成功做法与失败教训共同入库,并随新证据持续修订。
尤其值得注意的是,记忆进化天然适配银行的知识管理诉求:经验存放在外部存储、可检索、可审计、可人工修订,比参数内化透明得多。唯一需要警惕的是「错误归因的持续污染」——如果一条错误经验写入了记忆库,后续任务可能反复沿用同样的错误。因此银行必须为记忆库配备人工审核与定期淘汰机制。
4. Skill 进化:把标准流程打磨成「肌肉记忆」
Skill 总结「以后遇到同类问题时应该怎样处理」,可以是一组工具使用规则、行为要求、操作步骤或脚本。TRACE 展示了 Skill 进化的威力:在车载助手场景,同一任务连续三次全部成功的比例从 59.9% 提高到 94.5%。
银行场景中,Skill 进化的对象可以是合规操作流程、客服话术、贷后催收策略、报表生成流程。一个对公客户经理 Agent 遇到「客户财报数据异常」时,应该先问清哪些问题、调取哪些数据、遵循哪些合规红线——这些都可以沉淀为 Skill,并在反复执行中持续打磨。Skill 进化的优势在于「局部修改」:一类任务出问题时,只需修改对应 Skill,不必重写整套 Prompt,天然适配银行「流程标准化 + 例外管理」的治理传统。
5. Harness 代码进化:工具链的自优化(银行需谨慎开放)
SkillSmith 更进一步:当任务失败是因为工具能力不足时,反复修改工具说明文字无济于事,系统应能同时修改 Skill 和工具——编辑、组合、拆分甚至停用相关工具。
对银行而言,这条路径触及核心系统边界。Agent 的工具往往对接核心银行系统、支付网络、监管报送接口,允许系统自动增删、修改工具意味着动作空间本身在自我演化。一旦工具演化出现错误,可能直接影响资金类操作的真实执行。银行的开放方式只能是「沙盒内闭环」:Harness 代码进化允许在隔离测试环境中发生,产物必须通过单元测试、接口检查与安全评审,且任何工具变更都要保留完整的版本记录供审计追溯。
三、进化结构:链、树、图的银行版本治理
RSI 系统更新后,新版本如何继承历史结果,可分为链式、树形、图式三种结构。
- 链式进化(SkillFlow):始终只有一个当前版本,实现简单,但前一轮的错误会被下一轮直接继承。银行可以用于低风险、高频的标准化流程(如报表生成),但必须有「错误熔断」机制。
- 树形进化(Darwin Gödel Machine):保留多个版本分支,暂时表现不好的版本也可能成为后续改进的基础。DGM 的 SWE-bench 得分从 20.0% 提升到 50.0%,但一次完整实验约需两周、Token 消耗极高。银行可以用树形结构管理「模型候选版本」——多个并行开发的改进方向同时保留,用 Benchmark 与人工评审择优,但这更适合离线研发流程而非在线生产。
- 图式进化(Mendel Gödel Machine):一次修改同时参考多个来源,跨任务、跨分支比较轨迹,能更准确定位失败根源。Polyglot 得分从 50.8% 提升到 93.2%,显著超过单轨迹基线。银行的复杂风控 Agent 可以从图式进化受益:同一 Agent 在不同场景的轨迹、不同 Agent 在同一任务上的成败,都可以作为交叉验证的依据——这与银行「多维度交叉验证」的风控哲学高度契合。
治理含义很明确:银行应采用「链式执行 + 树形研发 + 图式诊断」的组合——生产环境保持单一稳定版本(链),离线环境并行探索多个改进方向(树),问题诊断时跨场景交叉比对(图)。
四、谁来进化:银行必须坚持「教师主导」
RSI 的更新者可分为三类:Student 自己更新(自身更新)、独立 Teacher 更新(教师更新)、两者协作(联合更新)。
- 自身更新:执行与修改同一主体,省去信息传递,但若 Student 错误理解反馈,错误会被写入长期产物并持续影响后续任务。
- 教师更新(如 Recuris):Student 执行任务,Teacher(Meta-Agent、反思模块)分析轨迹并完成修改,候选修改通过验证后才写入。37 个模型与 Benchmark 组合中 35 个取得提升。
- 联合更新(如 Evo-Harness):Solver 总结候选经验,Evolver 筛选整理并写入,最终内容由两者共同产生。
银行治理的核心红线在这里:金融场景的 RSI 不允许「自己改自己、自己说了算」。 无论技术上是自身更新还是联合更新,银行的制度设计上都必须体现「教师主导」+「人类终审」:
- Agent(Student)负责执行任务和沉淀候选经验;
- 独立的模型治理层(Teacher)负责分析轨迹、诊断问题、筛选经验,并拒绝错误归因;
- 关键变更(涉及风控规则、资金操作、客户权益的 Skill/工具/Harness 变更)必须经过人类专家评审后方可写入;
- 所有更新产物(记忆、Skill、工具、Harness 代码)全量留痕,支持逐版本回滚。
这不仅是技术架构选择,更是监管合规要求:模型风险管理框架要求变更可解释、可审计、可回退,「教师主导 + 人类终审」是银行把 RSI 纳入现有治理的唯一可行方式。
五、何时进化:离线、在线与混合——金融场景的时机纪律
RSI 按更新时机分为离线(训练阶段更新、测试阶段冻结)、在线(边执行边更新)、混合(先离线初始化、再在线续调)。
综述中两个金融相关 Benchmark 给出了重要参照:
- GDPevo 评测离线 RSI,从 CRM、ERP、金融、医疗等真实业务中构造任务,训练题与测试题由同一批规则重新组合。表现最好的配置更新后准确率从 50.63% 提升到 67.07%——但也暴露了差距:直接提供全部规则时准确率可达 91.6%,说明现有 Agent 只能从训练任务中学到部分规则。
- FinEvo-Bench 是面向金融工作流的在线 RSI Benchmark,120 个金融任务组成连续任务流,覆盖六个领域 20 个业务场景。保留经验后平均得分提高 9.33 至 19.37 分,且同场景后三个任务比前三个任务提升更高(6.10 至 8.70 分)——经验积累随时间产生复利效应。
对银行的启示是纪律性的:
银行应采用混合模式,且「离线优先」。 任何自进化系统上线前,必须先在受控环境用历史业务数据完成初始经验积累与验证(离线阶段),通过完整评审后才能进入生产;上线后允许在明确的场景边界内继续积累经验(在线阶段),但每一批新增经验写入前都要经过「教师」筛选与抽样人工复核。纯在线 RSI(边做真实业务边自我更新)在银行现阶段不应被允许——真实客户决策经不起试错,一次错误写入就可能造成实质损失。
同时,FinEvo-Bench 的方法论值得银行借鉴:用「状态重置对照组」分离出经验本身的贡献,用随机打乱任务顺序排除排序假象。银行在验证自进化效果时,需要同样的实验纪律,避免把「模型更强了」误判为「自进化有效」。
六、银行 RSI 落地的治理框架
综合五条路径、三种结构、三类更新者与三种时机,银行建设 RSI 能力应遵循以下治理框架:
1. 分级管控,越靠权重越设限。 参数进化限定为离线研发流程;Harness 代码进化限定为沙盒闭环;上下文、记忆、Skill 进化可优先在生产侧探索,但必须全量留痕。
2. 教师主导,人类终审。 结构性隔离「执行者」与「修改者」,关键变更必须经人工评审;记忆库配置人工审核与定期淘汰机制,防止错误归因持续污染。
3. 离线优先,受控在线。 混合模式推进,先离线积累、验证、冻结,再在场景边界内在线续调;纯在线自进化不进入真实客户决策链路。
4. 可回滚,可审计。 所有自进化产物按版本管理,逐版本可回退;每次更新的触发轨迹、反馈证据、验收标准全量留存,满足监管审计要求。
5. 能力与风险双指标验收。 借鉴综述中的验收标准分类,银行对每次进化不仅要看 Benchmark 得分与业务效果(能力指标),还要监控稳定性、可解释性、合规性、成本与失败率(风险指标),组合指标通过后才能写入。
6. 数据主权与安全边界。 自进化依赖任务轨迹与反馈数据,这些数据本身就是银行最敏感的信息资产。轨迹存储、记忆库、Skill 库的存放位置、访问权限、加密与审计必须遵循数据安全与个人信息保护要求,不得因「自进化需要数据」而放松管控。
七、结语:自进化是能力,更是治理命题
RSI 为银行描绘了一幅诱人的图景:AI 在完成一笔授信审批后,能把经验沉淀下来,让下一次审批更精准;在处理完一批可疑交易后,能把模式识别得更清楚,让下一次监测更敏锐。FinEvo-Bench 的实验已经证明,经验积累在连续金融任务中确实能产生复利效应——这是银行拥抱自进化的技术依据。
但银行与通用 AI 场景的本质区别在于:每一次进化的代价,都可能由真实客户、真实资金与真实监管责任来承担。因此,银行的自进化不能是「放开让 AI 自己长」,而必须是「在严格护栏内让 AI 越长越稳」。参数、上下文、记忆、Skill、Harness 五条路径中,选择哪些开放、哪些设限;链、树、图三种结构中,选择怎样的版本治理;自身、教师、联合三类更新者中,如何落实人类终审;离线、在线、混合三种时机中,如何守住离线优先的纪律——这些选择,最终决定的不是银行 AI 有多聪明,而是银行 AI 有多可信。
自进化是能力,更是治理命题。对金融机构而言,后者比前者更重要。
本文为深度分析文章,技术框架参考青稞AI/MLNLP 社区万字综述《万字长文带你读懂 RSI(自进化,Self-Evolving)》,并结合金融行业场景展开。相关论文来源:
- 青稞AI:《万字长文带你读懂 RSI(自进化,Self-Evolving)》(微信公众平台,2026-09)
- Awesome RSI 仓库:https://github.com/Prism-Shadow/awesome-rsi
- SEAL(Self-Adapting Language Models):https://arxiv.org/abs/2506.10943
- Prime Agent: A Self-Improving RLM Harness:https://arxiv.org/abs/2608.23552
- ReasoningBank: Scaling Agent Self-Evolving with Reasoning Memory:https://arxiv.org/abs/2509.25140
- TRACE: A Self-Evolving Skill Bank for Consistent, Limit-Aware LLM Agents:https://arxiv.org/abs/2608.22793
- SkillSmith: Co-Evolving Skills and Tools for Self-Improving Agent Systems:https://arxiv.org/abs/2606.01314
- SkillFlow: Benchmarking Lifelong Skill Discovery and Evolution:https://arxiv.org/abs/2604.17308
- Darwin Gödel Machine: Open-Ended Evolution of Self-Improving Agents:https://arxiv.org/abs/2505.22954
- Mendel Gödel Machine: Recursive Self-Improving Coding Agents:https://arxiv.org/abs/2608.07645
- Recuris(Recursive Experiential-Working Memory Evolution):https://arxiv.org/abs/2608.24876
- Evo-Harness: Context-to-Harness Skill Compilation:https://arxiv.org/abs/2608.15071
- GDPevo: Evaluating Agent Self-Evolution on Real Business Tasks:https://arxiv.org/abs/2608.03764
- FinEvo-Bench: A Longitudinal Benchmark for Self-Evolving Agents in Professional Financial Workflows:https://arxiv.org/abs/2608.06144
- Mem²Evolve: Towards Self-Evolving Agents:https://arxiv.org/abs/2604.10923