35B 模型能否胜任银行业务:从 Occamy-1.0 看长流程 Co-work 模型的适配改造路径
核心摘要
- 35B 模型能否胜任银行业务:从 Occamy 1.0 看长流程 Co work 模型的适配改造路径 银行在 AI 落地中反复遇到同一个问题:模型能力榜单上的分数,为什么在真实业务里总是「差一点」?答案往往不在模型大小,而在任务形态
- 银行的大多数核心流程——信贷审批、反洗钱尽调、监管报送、客户运营——不是一次问答,而是几十步、跨系统、状态持续变化的长流程任务
- 而主流模型评测,测的多是单次推理能力
- 阿里 Accio 团队近期开源了 Occamy 1.0,给出了另一种解题思路:从一个 35B 规模的基础模型(Qwen3.6 35B A3B)出发,通过针对长流程 Co work 任务的后训练,让紧凑模型具备端到端执行真实工作的能力
35B 模型能否胜任银行业务:从 Occamy-1.0 看长流程 Co-work 模型的适配改造路径
银行在 AI 落地中反复遇到同一个问题:模型能力榜单上的分数,为什么在真实业务里总是「差一点」?答案往往不在模型大小,而在任务形态。银行的大多数核心流程——信贷审批、反洗钱尽调、监管报送、客户运营——不是一次问答,而是几十步、跨系统、状态持续变化的长流程任务。而主流模型评测,测的多是单次推理能力。
阿里 Accio 团队近期开源了 Occamy-1.0,给出了另一种解题思路:从一个 35B 规模的基础模型(Qwen3.6-35B-A3B)出发,通过针对长流程 Co-work 任务的后训练,让紧凑模型具备端到端执行真实工作的能力。在 Claw-Eval 上,Occamy-1.0 取得 82.2 分,高于 GPT-5.6 Sol 的 81.8 与 DeepSeek V4 Pro 的 81.7,接近 Qwen3.8-Max 的 83.9;Pass^3 达 71.4,相比基础模型 54.8 提升 16.6 分。在模拟跨境经营的 Business Arena 中,最终净值 79,868 美元,同规模模型第一、全部参评模型第三。
对银行而言,这篇技术报告的真正价值不是又一款开源模型,而是它系统回答了三个问题:长流程模型凭什么能胜任复杂工作、评估它是否胜任的关键判据是什么、以及把通用长流程能力适配到银行业务需要做什么改造。本文逐一拆解。
一、银行工作为什么是「Co-work」而非「问答」
Accio 团队定义的 Co-work,不是某一种固定技能,而是模型在持续变化的数字环境里,围绕用户目标协调多种能力,直到完整任务结束。这个定义几乎是为银行业务量身定制的。
一笔信贷审批可能同时涉及:客户资料与征信记录(数据检索)、授信政策与风险限额(规则匹配)、押品估值与现金流预测(计算推理)、审批意见与留痕报告(文书生成),以及系统间的状态更新(工具调用)。信息分散在不同系统,外部状态随每一步操作变化,模型必须对每一步动作负责——这与 Occamy 训练的典型任务高度同构。
这也解释了为什么银行早期 AI 项目「试点多、规模小」:通用模型擅长单点能力,却缺乏在长链路中持续跟踪状态、核验信息、规范调用工具、出错后恢复并最终交付的「工作能力」。Co-work 模型补的正是这块短板。
二、关键判据:判断模型能否胜任银行工作的五个维度
Occamy-1.0 的实测案例给出了一套可迁移的评估框架。对比它与其基础模型在同类任务上的差距,可以提炼出银行评估「模型是否胜任」的五个关键判据。
第一,精确核对能力。 在项目状态核对任务中,基础模型把 Beta 项目逾期任务少算一个,还添加了没有来源支持的依赖关系;Occamy-1.0 准确给出 1 个已完成、2 个进行中、1 个阻塞、4 个逾期的状态,并保留两条来源依赖链。银行场景的对应物是数据核验:监管报送的科目余额、反洗钱的交易计数、客户分层的标签统计,错一个数都是实质性风险。判据不是「模型写得像不像」,而是「结果能否逐项验证」。
第二,副作用控制能力。 清洗 5 条候选人记录、只能发送 1 封 Gmail 的任务中,真正难点是严格控制外部副作用——发少了没完成任务,发多了造成不可逆的重复通知。Occamy 在发送前确认搜索结果为零,只发送一次并回读验证。银行的对应场景无处不在:客户通知、资金划转、系统变更,任何一次重复操作都可能造成不可逆后果。判据是模型能否理解「动作的边界」并主动验证副作用。
第三,交付物可用性。 12 份 PDF 的任务中,基础模型能恢复标题却留下不透明命名;Occamy 生成可读、确定、不会碰撞的新文件名,并把所有产物写入后回读。银行的对应物是报告与档案:风险报告不仅要「生成出来」,还要符合格式规范、可检索、可归档、可审计。判据是交付物是否达到「可继续使用」而非「提取了一些文字」。
第四,失败恢复能力。 两个模型都遇到 PDF 解析失败,都尝试切换到 pdftotext,区别在于后续是否继续推进。效率数据更直观:Occamy 的执行成功率从 62.81% 提升到 77.55%,超时率从 9.88% 降到 2.18%,无效调用率从 1.85% 降到 0.86%。银行的对应场景是异常处理:接口超时、数据缺失、系统切换,模型能否在失败后换路径继续,而不是停在错误上。
第五,成本效率。 Co-work 一次任务几十上百次模型调用,单次成本在整条工作流中滚雪球。Occamy 相比基础模型,轨迹 token 减少 19.5%,工具调用减少 15.2%,轨迹墙钟时间减少 46.4%,完整试次耗时减少 36.6%。对银行意味着:不是所有环节都需要调用最大模型,紧凑模型把「能力-成本最优前沿」向前推进,规模化才具备经济性。
三、适配改造:从通用 Co-work 到银行业务的四步路径
模型在通用任务上胜任,不等于在银行场景中可用。参考 Occamy 的训练方法论,银行可以设计自己的适配改造路径。
第一步,把业务任务重写为「可执行契约」。 Accio 团队把每个训练任务定义为四部分:用户请求、初始世界状态、可用工具、隐藏的评分标准;请求需要的证据必须真实存在且能通过允许的工具获得。银行应做同样的工作:把信贷审批、反洗钱、监管报送等流程拆解为「用户请求 + 系统状态 + 可用工具 + 验证标准」的契约,让训练与评测建立在真实可执行的环境上,而不是「说得像做完了」。
第二步,建立细粒度验证器。 Occamy 的评分器要能分辨「真正完成、什么都没做、只有表面进展」三种结果。银行对长流程智能体的验证,不能只看最终输出文字,而要按中间检查点逐项打分:数据是否来自真实系统、状态是否同步更新、文件是否真实写入、动作是否产生预期副作用。这需要把合规要求与业务流程转化为可自动验证的检查项。
第三步,区分「马拉松」与「冲刺」的能力组合。 Occamy 没有用一条训练路线解决所有问题,而是从同一基础模型训练两个互补 checkpoint:Marathon Expert 强化长任务的状态跟踪、证据使用、错误恢复与完整交付;Sprint Expert 保留指令遵循、工具调用、编程与搜索等通用能力,最后在参数空间合并再继续强化。银行同样需要区分两类能力:一类是长流程执行业务(审批、尽调、报送),一类是短程单点能力(问答、检索、文书),分别设计能力基线,再组合成面向业务场景的「银行专属版本」。
第四步,适配数据主权与监管要求。 银行的后训练必须基于自有业务数据与内部工具环境,这涉及数据出域、模型托管与供应链治理。Accio 通过 Dressage 开源了训练基础设施(多 Harness 执行、代理式轨迹捕获、沙箱集成),银行可参考其「统一轨迹与回放契约」思想,构建自己的智能体训练与评测沙箱,在隔离环境中完成适配改造,守住数据合规底线。
四、银行部署长流程智能体的治理边界
Occamy 报告同时坦承了能力边界:知识密集型文档推理、模拟用户交互、原生浏览器与视觉操作、超时鲁棒性、跨子智能体与多目标联合学习仍有提升空间。银行在部署时必须正视这些边界,并设置对应的治理防线。
其一,人机权责边界。 长流程智能体自主执行数十步操作,银行必须明确哪些环节可自主、哪些必须人工确认。参考智能体动作的「不可逆等级」设计分级授权:只读查询可自主,通知类动作需留痕复核,资金划转与系统变更须人工确认。Occamy 在邮件任务中展示的「副作用控制」,正是银行对智能体的最低要求。
其二,审计与回放能力。 Occamy 的训练基础设施精确记录模型当时看到了哪些 token、生成了什么内容、工具实际返回了什么,支持对真实执行状态进行回放。银行对长流程智能体的监管要求更高:每一步的输入、输出、工具调用与中间状态都应可追溯、可回放、可解释,以支撑模型风险管理与监管检查。
其三,评测的可靠性。 银行不能直接套用 Claw-Eval 等通用基准验收业务智能体。应自建「银行业务长流程基准」:用真实(或高仿真)业务环境、真实工具与可验证评分标准,覆盖信贷、合规、运营等典型长流程,考察完成率、纠错率、副作用控制与合规命中率,并持续更新评测集以对抗过拟合。
其四,供应链与版本治理。 Occamy 基于开源模型后训练,银行选型时应评估基座模型的许可证、升级路径与长期维护;同时建立版本管理机制,记录每次适配改造的基座版本、训练数据与验证结果,确保模型可追溯、可回退。
结语
Occamy-1.0 验证了一条对银行极具参考价值的路线:决定智能体能力上限的,不只是模型有多大,还包括训练任务是否可执行、轨迹是否合理、状态能否回放、结果能否被真正验证。35B 模型在长流程 Co-work 任务上逼近前沿大模型,意味着银行不必等待「超大模型+超高预算」才能实现复杂流程自动化——通过系统化的适配改造,紧凑模型同样可以胜任信贷、合规与运营的长流程工作。
但胜任的前提是改造到位:把业务重写为可执行契约,建立细粒度验证器,区分长跑与冲刺能力,在合规沙箱中完成适配。银行需要回答的不是「模型能不能」,而是「我们有没有把业务变成模型可学习、可验证、可治理的任务」。当这两件事同时完成,长流程智能体才真正从「演示可用」走向「生产可靠」。
注:本文素材来源于微信公众号「关注AI Agent」文章《阿里开源Co-work专用模型,35B也能把长流程工作做完!》(智猩猩AI整理,阿里巴巴Accio团队投稿,2026-09-15),文中 Occamy-1.0 技术数据(Claw-Eval 82.2、Pass^3 71.4、Business Arena 净值 79,868 美元、效率指标等)均引自该文及 Accio 团队技术报告,具体表现需结合银行场景独立验证。