终端 Agent 逼近旗舰:银行长程自主执行能力跃升的机遇与治理边界
核心摘要
- 终端 Agent 逼近旗舰:银行长程自主执行能力跃升的机遇与治理边界 9 月 10 日,腾讯混元联合新加坡国立大学等高校研究者开源终端智能体模型 T1
- 这条消息在开源社区引发的关注,不只是又一个大模型发布,而是把「Agent 能力从哪里来」这个问题的答案,指向了一个此前被低估的方向:模型参数之外,针对真实执行过程的大规模后训练
- T1 没有从零训练,而是直接选择 Qwen3.5 122B A10B 作为基座——一个 122B 参数、单次推理约激活 10B 参数的 MoE 模型——围绕终端环境中的长程任务做监督微调与强化学习
- 结果是:在 Terminal Bench 2.1 上,任务完成率从基础模型的 43.8% 提升到 64.0%,提升了 20.2 个百分点
终端 Agent 逼近旗舰:银行长程自主执行能力跃升的机遇与治理边界
9 月 10 日,腾讯混元联合新加坡国立大学等高校研究者开源终端智能体模型 T1。这条消息在开源社区引发的关注,不只是又一个大模型发布,而是把「Agent 能力从哪里来」这个问题的答案,指向了一个此前被低估的方向:模型参数之外,针对真实执行过程的大规模后训练。
T1 没有从零训练,而是直接选择 Qwen3.5-122B-A10B 作为基座——一个 122B 参数、单次推理约激活 10B 参数的 MoE 模型——围绕终端环境中的长程任务做监督微调与强化学习。结果是:在 Terminal-Bench 2.1 上,任务完成率从基础模型的 43.8% 提升到 64.0%,提升了 20.2 个百分点;同一评测框架下,T1 已接近 Claude Opus 4.6 的 63.8%,与 Claude Opus 4.7 的 66.1% 仅差 2.1 个百分点。
对银行而言,T1 的技术细节值得研究,但更值得思考的是它揭示的三个趋势:长程自主执行正在成为 Agent 的核心能力维度、训练与推理一致性正在成为规模化部署的隐性门槛、评测标准正在从「一次生成」转向「整场任务」。这三个趋势,恰好与银行数字化转型中最难啃的骨头——复杂流程自动化——正面相遇。
一、从「写代码」到「办成事」:长程执行是银行自动化的真正瓶颈
T1 的训练重点,是从单纯生成代码转向在终端环境中持续执行、根据反馈调整并最终完成任务。这组数据最能说明变化:Terminal-Bench 2.1 测试中,基础模型平均需要 41.1 轮交互,SFT 模型平均 31.5 轮,而 T1 平均达到 94.4 轮。论文记录的 6 个最终失败任务,在超时前分别进行了 164 至 473 轮交互。
更长不是低效,而是「愿意继续尝试、检查结果、修复错误」。这正是银行复杂流程自动化长期面临的痛点:传统 RPA 与脚本化方案擅长固定路径,一旦环境变化、字段异常、分支超出预期,流程就中断;而银行真实业务——信贷审批、反洗钱尽调、监管报送、系统运维——恰恰充满了不确定分支与多系统联动。
银行在意的不是模型能写多好的代码,而是模型能否把一件事从头到尾办成。T1 的意义在于证明:通过大量真实终端任务的 rollout 与细粒度奖励设计,模型可以学会「在长链路中不放弃、自我纠错、完成整项任务」。对银行而言,这意味着 Agent 从「问答助手」「代码助手」向「流程执行者」的跨越,具备了技术可行性。
二、细粒度奖励:让 Agent 学会「部分正确」的合规行为
T1 的强化学习奖励没有采用「成功得 1 分、失败得 0 分」的二元方式,而是设置多个 verifier,根据任务完成过程中通过的验证项数量提供细粒度奖励。一个任务包含多个检查条件,模型即使没有一次性完成全部目标,只要通过部分验证也能获得对应奖励。
这个设计对银行场景有直接借鉴价值。银行流程天然是多约束问题:一笔信贷审批既要核查客户资质,又要评估押品价值,还要满足合规留痕、风险限额、反洗钱筛查等多重条件。如果用二元奖励训练 Agent,「全对或全错」的反馈会让模型在长链路中难以学到渐进改进;而细粒度奖励能让模型理解「完成一半→继续走向全部完成」,这与银行希望 Agent 具备的「多环节合规意识」高度契合。
当然,银行场景的 verifier 设计远比终端任务复杂。终端任务可以自动检查命令输出,银行任务则需要把合规要求转化为可验证的检查项——这本身就是一个需要业务专家、合规专家与技术人员共同完成的工程。但方向是明确的:Agent 奖励机制的设计,正在成为模型能力与业务约束之间的翻译层。
三、TITO 与 R3:训练推理一致性是银行部署的隐性门槛
T1 采用 MoE 架构,Agent 长程 rollout 产生大量 token,训练阶段出现一个新问题:模型在推理时生成的内容,到训练阶段未必能按完全相同路径重新计算,差异还涉及专家路由。T1 引入 TITO 与 Rollout Routing Replay(R3)两套机制:TITO 记录 rollout 中实际采样的 token,训练时使用完全一致的 token 序列并在不同 turn 之间漂移修复;R3 记录每个 token 在各 MoE 层选择的专家,训练阶段重放路由结果。数据显示,训练与推理之间的 log-probability 差异从 0.021 降低到 0.013,loss 区域实现零 token drift。
对银行来说,这个技术细节的启示在治理层面。银行部署任何模型都绕不开模型风险管理:模型验证要复现训练时的行为、监控要捕捉部署后的漂移、审计要解释决策路径。长程 Agent 的数百轮交互,任何一个环节出现训练与推理不一致,都可能在后续步骤不断放大——这与银行对「可验证、可监控、可解释」的要求直接相关。
T1 的做法本质上是在「尽可能保留真实执行轨迹」。这给银行一个方法论提示:在引入长程 Agent 时,不能只验收模型的最终能力指标,还要建立对「训练-推理一致性」的验证能力,包括行为轨迹的可复现性、漂移的检测机制、以及专家路由等内部决策的审计留痕。否则,一个在评测中表现优异的 Agent,可能在银行真实环境里因为分布差异而行为失稳。
四、评测标准之变:银行应建立「业务长程基准」
T1 的成绩单包括:Terminal-Bench 2.1 上 64.0%,Long-Horizon Terminal Bench 上 27.9%,Terminal-Bench Hard 上 38.0%。作者团队指出,核心变化不在参数规模,而是针对终端 Agent 的大规模后训练与长程强化学习机制改造。
更值得关注的是评测哲学的变化:过去评价模型看能不能写代码、能不能回答问题、能不能通过一次测试;终端 Agent 出现后,评价标准转向「进入环境、持续调用工具、观察执行结果、处理错误、决定下一步行动」,任务完成时间从一次生成扩展到几十甚至数百轮交互。
这对银行的采购与验收逻辑是重要提醒。当前银行评估大模型,普遍依赖通用基准(如代码、问答、数学)加少量业务样例。但终端 Agent 的经验表明:通用能力与长程执行能力可能是两个维度——T1 的基座 Qwen3.5-122B-A10B 本身已是强模型,真正拉开差距的是针对执行场景的后训练。银行若想评估「Agent 能否在信贷审批、反洗钱、运维场景中办成事」,就需要建立自己的「业务长程基准」:把真实业务流程拆解为多轮交互任务,设置可验证的中间检查点,考察模型在长链路中的完成率、纠错率与合规命中率,而不是只看单轮回答质量。
五、治理边界:长程自主执行的银行风险清单
能力跃升的另一面,是风险形态的升级。当 Agent 从「生成一段文本」进化为「自主执行数百轮操作」,银行面临的已不是传统模型输出风险,而是「自主行动风险」。至少四类问题需要在部署前回答:
其一,越权与操作边界。长程 Agent 在终端环境中可执行命令、调用工具,银行环境中则可能触及交易系统、核心数据库与对外接口。必须建立最小权限与操作边界机制,Agent 的每一步关键动作都应经过授权校验,高危操作须人工确认。
其二,审计与可解释性。数百轮交互意味着决策路径极长,单一环节的错误可能被放大。银行需要完整的轨迹审计能力——记录每一步输入、工具调用、中间输出与最终结果,并支持事后回放与根因定位,以满足监管对模型与操作可解释的要求。
其三,评测与验收的可靠性。通用基准无法覆盖银行业务的合规约束与长程复杂度。银行应自建业务长程基准,并在真实环境小范围试点后再逐步扩大,避免「评测高分、上线失稳」。
其四,供应链与依赖风险。T1 基于 Qwen3.5-122B-A10B 后训练,这提示银行关注基座模型的供应链选择:开源基座的可获取性、许可证条款、后续升级路径,以及后训练方案的可复制性,都应纳入选型评估。
结语
腾讯混元 T1 的技术亮点——长程强化学习、细粒度奖励、训练推理一致性机制——单看每一项都像是模型工程问题;但当它们叠加在一起,指向的是一个对银行更具深远意义的趋势:Agent 正在从「会说话」走向「会办事」,从「单次生成」走向「整场任务」。
对银行而言,这既是复杂流程自动化的新机遇,也是模型风险管理的新课题。机遇在于:长程自主执行能力的成熟,让信贷审批、反洗钱尽调、监管报送等长链路流程的端到端智能化第一次具备技术可行性。课题在于:能力越强、自主性越高,对越权控制、轨迹审计、业务长程评测与供应链治理的要求就越严。技术突破的速度不会等银行,但银行可以决定——让长程 Agent 以何种边界进入业务。
注:本文素材来源于微信公众号「关注AI开源」文章《腾讯混元基于Qwen训出新模型,终端Agent能力逼近Claude旗舰!》(智猩猩AI整理,编辑林夕,2026-09-15),文中 T1 模型数据(Terminal-Bench 2.1 64.0%、训练推理一致性机制 TITO/R3、交互轮次等)均引自该文及腾讯混元开源发布信息;Claude 旗舰对比数据以原文引用为准,具体表现需结合银行场景独立验证。