AI Agent在真实世界的能力边界——兼论对金融业智能体建设的启示

核心摘要

  • ClawBench将153个日常任务搬到144个真实网站上评测
  • 最强模型在真实任务中成功率仅及三成
  • 68个日常任务没有任何模型能够完成
  • 金融业宜加速探索低风险场景、审慎部署操作型Agent

AI Agent在真实世界的能力边界——兼论对金融业智能体建设的启示

ClawBench将153个日常任务搬到144个真实网站上评测

最强模型在真实任务中成功率仅及三成

68个日常任务没有任何模型能够完成

金融业宜加速探索低风险场景、审慎部署操作型Agent

2026年4月,一篇题为《ClawBench: Can AI Agents Complete Everyday Online Tasks?》的论文在arXiv上公开,引发了人工智能应用领域尤其是企业级Agent部署层面的广泛讨论。该研究由加拿大英属哥伦比亚大学、卡内基梅隆大学、滑铁卢大学、香港科技大学、清华大学等多所高校与机构的学者联合完成,其核心贡献在于构建了一个全新的评测基准——ClawBench,将AI Agent的测试环境从传统的静态沙箱推向144个真实生产网站,覆盖购物、旅游、金融、办公、教育等15个细分类别,重点考察Agent完成"写入型"任务(如表单填写、账户操作、跨站协同)的能力。

研究结论令人警醒:当前最前沿的通用大模型Agent,即便在实验室评测中表现优异,一旦面对真实互联网环境的动态性与不确定性,其任务完成率便急剧下降。表现最佳的Claude Sonnet 4.6成功率仅为33.3%,而GPT-5.4更是低至6.5%。更值得关注的是,在全部153个任务中,有68个(占比44.4%)没有任何模型能够完成。

对于正在积极探索AI Agent落地路径的金融行业而言,这份研究提供的不是一份简单的技术报告,而是一面审视现实与预期之间落差的镜子。本文旨在从ClawBench的核心发现出发,探讨其对金融业Agent建设的深层启示。

一、实验室高分不等于生产可用

ClawBench研究揭示的第一个关键事实,是评测环境对模型表现的系统性影响。在传统的WebArena、OSWorld等沙箱评测中,前沿模型能够较为从容地取得65%至75%的成功率,给开发者和决策者以"接近可用"的乐观预期。然而,当同样的模型被置于真实生产网站的复杂环境中时,成功率骤降至三分之一甚至更低——Claude Sonnet 4.6与GPT-5.4在传统基准上的表现几乎一致,在ClawBench上却拉开了显著差距。

这背后的原因值得深究。真实网站的动态性——页面结构变化、反爬机制、动态加载、表单校验逻辑、网络延迟、登录态维护——构成了沙箱环境中不存在的多重不确定性。Agent在沙箱中的流畅表现,很大程度上建立在对静态页面的"隐性熟悉"之上,而真实世界不提供这种便利。

评测维度传统沙箱评测(WebArena等)ClawBench真实网站评测
网站环境自建沙箱、静态HTML、固定DOM144个真实生产网站、动态渲染
鉴权与反爬无真实登录、无反爬机制真实登录鉴权、验证码与反机器人防御
任务性质以只读信息获取为主以写入型、状态变更型任务为主
典型成功率65%-75%最高仅33.3%

二、"只读"与"写入"之间存在能力断层

ClawBench在设计上的一个重要创新,是将考察重心从"只读"任务(信息检索、内容摘要)转向"写入"任务(表单填报、申请提交、账户设置)。研究发现,许多在信息检索类评测中表现优异的模型,在需要多步操作、跨页面导航和精准数据输入的"写入"场景中,表现大幅退化。

这一"读写断层"对于金融业务具有特殊的重要性。金融行业的数字化流程本质上是"写入密集型"的——客户开户、转账汇款、交易下单、贷款申请、保单变更,无一不是需要精确填写的操作性任务。这些操作不仅步骤繁多,且每一步的容错空间都极为有限。一个在信息查询层面表现良好的Agent,完全可能在需要实际执行操作的环节频繁出错,而金融交易的错误代价远高于普通电商购物。

因此,金融机构在推进Agent落地时,必须对"只读型Agent"和"操作型Agent"做出明确区分。前者可以较早在内部知识库问答、研报辅助阅读等低风险场景中部署,而后者——尤其是涉及资金变动和客户敏感信息操作的Agent——则需要在高度隔离的环境中经过漫长而严苛的测试,方可考虑有限度地投入使用。

三、金融领域并非天然的安全区

从ClawBench的分类维度来看,表现最好的模型在"金融"类任务上的成功率(Claude Sonnet 4.6为50%)确实高于购物、旅游等其他多数类别,这或许让金融从业者感到一丝宽慰。然而,这一"相对优势"需要放在两个层面冷静审视。

其一,相对优势并不普遍。金融类任务的较高得分主要由Claude Sonnet 4.6贡献,GPT-5.4、Gemini 3.1 Flash Lite、Kimi K2.5在金融类任务上几乎零完成,GLM-5也仅有16.7%。其二,即便是在金融领域,Agent的绝对成功率仍然远低于可投入实际生产的阈值——"最好"也只是"三分之二的任务仍然失败"。

模型总体成功率金融类成功率
Claude Sonnet 4.633.3%50.0%
GLM-524.2%16.7%
Gemini 3 Flash19.0%33.3%
Claude Haiku 4.518.3%33.3%
GPT-5.46.5%0.0%
Gemini 3.1 Flash Lite3.3%0.0%
Kimi K2.50.7%0.0%

四、根本瓶颈在于"假设生成"而非"工具使用"

另一个值得反复咀嚼的发现,来自与ClawBench同源联动、聚焦金融数据探索分析的关联基准DataClawBench(arXiv:2605.02503,由中山大学陈川课题组联合南方周末科创力研究中心构建)。这一独立研究以492个源自金融智库咨询场景的真实任务,在保留原生噪声的企业、产业、政策三类数据之上评测了8个前沿Agent,并特别标注了任务的中途里程碑以诊断失败发生在哪个环节。

研究者观察到,Agent在复杂任务中的失败,绝大多数发生在任务早期的"探索"阶段——也就是说,Agent根本没能形成有效的分析规划和假设,而并非在执行环节中出现了工具使用或API调用的技术故障。最强的模型整体准确率也仅63.4%,其余模型均低于50%;模型通常在最早期就丢失分析线索。用研究者的表述:模型"可以写SQL,却难以决定哪一条SQL值得写"。

这一发现具有深远的认知层面含义。当前大模型Agent的主流技术路线依赖"推理+行动"的循环架构,业界普遍认为"工具使用能力"是主要的瓶颈。但DataClawBench的研究提示我们,问题可能更根本地存在于"该往哪里走"的假设生成环节。一个Agent如果连需要探索什么方向都无法自主判断,那么即便拥有再强大的SQL执行能力或API调用能力,也无从施展。

在金融分析场景中,这一短板尤为致命。金融分析师的核心价值在于从海量噪音中识别关键信号、提出值得深究的假设、构建分析路径——这些正是当前Agent最不擅长的能力。这意味着,在可预见的未来,AI Agent在金融业更适合扮演"执行者"和"信息整合者"的角色,而非"策略提出者"。将Agent部署于需要自主设定分析框架、自主发现异常模式的任务时,必须保留人类分析师在假设生成和路径规划环节的主导权。

五、安全机制是金融Agent不可妥协的底线

ClawBench在实验设计上的一个审慎之处,是所有Agent任务均在"提交前拦截"的机制下完成——即Agent可以完整模拟操作流程,但最终提交行为被人为阻断,从而不对真实世界产生实际影响。据论文报告,该拦截机制在153次参考执行中实现了100%捕获、零误报。这一设计本身即是对真实部署环境的一种隐喻。

对于金融行业,安全机制的重要性无需赘述。然而,随着Agent自主化程度的提升,许多机构可能面临一个逐渐逼近的风险:当Agent的连续成功率从30%提升到60%、再到80%时,我们是否有足够的制度设计来防止那20%的失败引发实质性的损失?

ClawBench系列研究的结论间接给出了答案:至少在技术成熟度的现阶段,金融机构在部署操作型Agent时,必须在系统架构层面嵌入多重安全保险。具体而言,至少应包括三个层次。

层次安全机制核心作用
第一层人工复核最终提交对资金流转、账户变更、合同签署等关键操作实施硬性人工把关
第二层全链路操作审计记录Agent每一步决策与行动,确保全程可追溯、可复盘
第三层执行限额与熔断阈值频率、金额或异常行为越界时自动终止执行权限

ClawBench研究的价值,不在于否定AI Agent在金融领域的应用前景,而在于以实证的方式划定了一条清晰的能力边界。这条边界告诉我们:当前的AI Agent更像是一位知识广博但经验尚浅的实习生——他可以在查阅资料、整理信息、执行标准化操作方面提供可观的效率提升,但在面对复杂流程、异常情况和新颖问题时,仍然需要人类监督者的密切陪伴。

对于金融机构而言,最务实的策略或许是"加速探索,审慎部署"——在信息检索、文档处理、内部知识管理等低风险环节积极尝试Agent技术,积累工程经验;在涉及客户交互、交易执行、合规判断等高风险环节,则保持充分克制,以人类主导、Agent辅助的模式渐进推进。同时,参照ClawBench的思路建立贴近真实业务场景的内部评测体系,将Agent能力的评估从"能不能答对"推向"能不能做对",这或许是这份研究给予金融业最持久的启示。

常见问题(FAQ)

Q1:ClawBench与传统网页Agent评测基准的本质区别是什么?

A:传统基准(如WebArena、OSWorld)在自建的离线条箱中评测,页面静态、无真实登录与反爬;ClawBench则直接在144个真实生产网站上执行153个"写入型"任务,仅通过拦截层阻止最终提交请求以避免真实副作用。因此其成功率更能反映Agent在真实世界的可用性。

Q2:为何GPT-5.4在传统基准与ClawBench上的表现差异如此悬殊?

A:论文报告Claude Sonnet 4.6与GPT-5.4在传统基准上均可达到65%-75%的成功率,但在ClawBench上分别降至33.3%与6.5%。落差主要来自真实网站的动态渲染、登录鉴权、反爬机制,以及"最终提交"之前的多步精确操作——这些都是沙箱评测缺失的关键干扰。

Q3:金融领域在ClawBench上的表现是否特别差?

A:相反,表现最好的模型在金融类任务上成功率达50%,高于多数类别。但这仅是相对优势:部分模型在金融类几乎零完成(如GPT-5.4为0%),且绝对水平仍远低于可投入生产的阈值,不能据此得出金融Agent已经可靠的结论。

Q4:DataClawBench的"假设生成瓶颈"对金融Agent选型有何指导?

A:数据显示模型失败多发生在早期探索与假设生成阶段,而非查询执行。这提示金融机构应优先把Agent部署在"人类提假设、Agent做执行与整合"的辅助型场景,而在需要自主设定分析框架、自主发现异常的任务上保留人类主导权。


作者毕超,金融行业风险管理从业者。本文仅代表作者个人观点,不构成任何机构立场。

(内容由AI生成,仅供参考)

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者