别急着让智能体替你下单——B2B 智能体采购的验证机制、职责分离重构与三条冷启动建议

核心摘要

  • B2B 与零售的根本差异不在支付:卡轨道、拒付、争议那一整套在 B2B 几乎都不存在。真正的约束是确定性、职责分离与对手方信任,而这三样恰好都是智能体最不擅长的
  • Deloitte 实测:近 40% 的买方已在采购中使用智能体,而供应商侧仅 24%、且明确抗拒开放目录——采纳不对称的方向与智能体互联网的叙事相反
  • 最危险的一条内控变化:传统职责分离靠"没有一个人同时握有发起、授权、记录、保管",而一个编排型智能体天然可以同时持有全部四项
  • 到 2028 年,90% 的 B2B 采购将由 AI 智能体中介,推动超过 15 万亿美元的 B2B 支出流经"AI 智能体交易所"

常见问题

B2B 和零售智能体支付,差别到底在哪?

差别不在支付。B2B 几乎不发生智能体微支付,卡轨道、拒付、争议那一整套基本不适用。真正的差别在验证与风控:B2B 的对手方是已知供应商、单笔金额从数千到数百万美元、核心机制是三路匹配与合同条款、失败后果是一整批错账或舞弊得手。零售最难的是"钱付给谁算授权",B2B 最难的是"这笔采购是否履约、是否违反职责分离"。 后者与内控体系强相关,而与支付基础设施几乎无关。

Gartner 那个 15 万亿预测可信吗?

需要连着它的反面一起读。 该预测出自 2025 年 10 月 21 日的年度战略预测文件;而同一机构在 2025 年 6 月 25 日已发布"超过 40% 的智能体 AI 项目将在 2027 年底前被取消"的预测。两条不在同一份文件,相隔四个月,市场通常只引用前者。更重要的是,15 万亿指的是"被智能体中介的支出",不是"由智能体自主决策的金额"——而现实数据是:买方已有近 40% 在用智能体做采购,供应商仅 24%,且唯一在运行的验证机制 PunchOut 恰恰保留了人在环。把它当作"取代收银台"的预测去规划,会错得很远。

最容易被忽略的内控失效是哪一个?

"两个智能体做复核"这件事。 如果审批智能体的唯一输入是发起智能体的叙述摘要,组织分离的是标签而不是职责——一旦发起方出错,错误会原样穿过审批。更隐蔽的情况是两个智能体共享同一底座模型、编排器与记忆存储:在审计日志显示两个不同服务账号调用的表象下,它们在任何审计师认可的意义上都不独立。 有效的检验只有一个:审批步骤必须自行拉取发票、订单与总账科目,自己重算,而不是接受转述。 这个设计选择决定了控制是"存在"还是"有效"。

为什么说不要一上来就让智能体替人决策?

三个理由。其一,B2B 的核心采购是从关系开始的——已批准供应商、谈定条款、授信额度,等下单时重要决定早已做完,所以可自动化的其实是"订单执行"而非"选谁"。其二,确定性是硬约束:采购订单每次必须以相同方式生成,而智能体是概率性系统,"大多数时候正确"不是采购系统,是负债。其三,采购事故的典型形态不是金额巨大,而是金额很小、不可逆、反复发生——所以确认阈值应按不可逆性分层,而非按金额分层。现实起点是一个买家、一个补货流程、买家本就烂熟于心的约束。

欧盟 AI 法把采购 AI 列为高风险,这个说法成立吗?

按字面不成立。 附录三第 5(b) 项的限定词是"自然人的信用状况或信用评分",企业法人不在此列;且附录三八个类别中并不存在"采购选择"或"供应商选择"条目。需要注意的是时间表已被改动:《数字 Omnibus on AI》(EU 2026/1744,2026-07-27 生效)把附录三高风险义务从 2026-08-02 推迟至 2027-12-02,所以"2026 年 8 月高风险义务已生效"在适用性上已被推迟,尽管 2026-08-02 仍是一般适用日。银行若把采购智能体按高风险清单管理,属于主动加严而非合规义务。

本文数据可靠吗?有哪些是推不出来的?

Gartner 与 Deloitte 的数字均已一手核实(分别为 2025-10-21 与 2026-06 发布的原始文件)。x402 规模我只保留可对账的一组:Visa 与 Artemis 联合报告的调整后口径 1.096 亿笔 / 1,500 万美元,与原始口径 1.783 亿笔 / 1.357 亿美元相差约 9 倍,引用时必须说明口径。生产率数字从 5% 到 46% 不等,差异来自受访者群体而非事实——问高管与问工程师会得到相反答案,本文并列呈现而非取中位数。舞弊分析中引用的个案为公开报道的已披露事件,我未能独立核实其全部技术细节。中国规则部分本文未作论断。

别急着让智能体替你下单——B2B 智能体采购的验证机制、职责分离重构与三条冷启动建议

Gartner 那句"2028 年 90% B2B 采购由智能体中介、逾 15 万亿美元",与它自己"2027 年底前 40% 智能体项目将被取消"的警告,来自两份相隔四个月的不同文件——而后者才是更该被认真读的

B2B 与零售的根本差异不在支付:卡轨道、拒付、争议那一整套在 B2B 几乎都不存在。真正的约束是确定性、职责分离与对手方信任,而这三样恰好都是智能体最不擅长的

Deloitte 实测:近 40% 的买方已在采购中使用智能体,而供应商侧仅 24%、且明确抗拒开放目录——采纳不对称的方向与智能体互联网的叙事相反

最危险的一条内控变化:传统职责分离靠"没有一个人同时握有发起、授权、记录、保管",而一个编排型智能体天然可以同时持有全部四项

一、先把最大的那个数字拆开

B2B 智能体采购的故事,是从一个令人咋舌的预测开始的。Gartner 在 2025 年 10 月 21 日发布的年度战略预测中提出:到 2028 年,90% 的 B2B 采购将由 AI 智能体中介,推动超过 15 万亿美元的 B2B 支出流经"AI 智能体交易所";并预测到 2030 年 20% 的货币交易将是"可编程的"。

但同一份文件之外,Gartner 在 2025 年 6 月 25 日就发布过另一条预测:超过 40% 的智能体 AI 项目将在 2027 年底前被取消。这两条预测不在同一份文件中,相隔四个月。市场通常只引用前一条。

而支撑前一条预测的行业现实是:

这里必须说清一个统计陷阱:不同调查得出的生产率数字从 5% 到 46% 不等,差异不来自事实而来自受访者是谁。Deloitte 与 Cisco 问的是企业高管与 IT 负责人(答案低),而 Monte Carlo 2026 年 4 月调查 260 名工程师与开发者,46% 的构建者称其智能体已在完全生产环境运行。同一件事,管理层觉得还早,工程师已经在跑了。

一个更诚实的读法是:Gartner 的 15 万亿是"被中介的支出",不是"由智能体自主决策的金额"。 这个区分比数字本身更重要——前者今天已经在发生(采购平台上的比价、配置、审阅),后者几乎还没发生。

关于 x402 规模的三个流传数字,本文只保留可对账的一组:Visa 与 Artemis 的联合报告显示,剔除洗售与测试活动后,x402 自 2025 年 5 月起至 2026 年 4 月 21 日累计约 1.096 亿笔、调整后交易额约 1,500 万美元——平均每笔不到 0.14 美元。同期未调整的原始口径为 1.783 亿笔、1.357 亿美元。另有独立预印本对 Base 链 280 天全窗口的测算给出 1.367 亿笔结算、4,412 万美元,其中 21.20% 为虚构、63.78% 为关联集群内部结算。同一事物,原始口径与调整口径相差约 9 倍——引用时必须说明是哪一个。

二、为什么 B2B 的约束和零售完全不同

这是本文最重要的一节。如果把零售那套智能体支付逻辑直接搬到 B2B,会犯一个根本性的错误。

维度零售智能体支付B2B 智能体采购
对手方匿名商户已知供应商,多为长期合作或有准入资质的合格供应商
单笔金额极小,微支付是主要形态数千至数百万美元
拒付机制核心争议解决手段几乎不存在。B2B 走的是合同与争议条款,不是拒付
验证方式自动测试、评分表三路匹配(订单、收货、发票)加合同条款
核心风险支付授权合同义务履行、舞弊、职责分离
失败后果一笔小额错账一整批错账、舞弊得手、内控失效

换句话说:零售智能体支付最难的是"钱付给谁算授权了",而 B2B 最难的是"这笔采购是否履行了合同、是否违反了职责分离"。

定义后者与支付基础设施几乎无关,而与内控体系强相关——这正是 B2B 与零售分野的地方。

三、三道验证机制,以及智能体为什么难过

3.1 确定性:采购交易不允许概率

B2B 的核心系统对接——PunchOut(目录推送、购物车回传)与采购订单集成——要求同一个输入必须映射到同一个结果。一份采购订单每次都必须以完全相同的方式生成。

智能体在这里的本质困难是:概率性系统不满足确定性要求。 一个"大多数时候给出正确输出"的智能体不是企业采购系统,它是一个负债。演示展示的是"建成",隐藏的是"运维"。

这一点有独立佐证:智能体安全领域已经出现了明确的范式转换——从"采样统计"转向"总体审计"。当审计师可以复核每一个智能体动作时,统计抽样的价值就崩塌了,而良好日志基础设施的价值同比上升。相应地,审计证据的形态必须从"ERP 日志"扩展到"不可变的模型调用轨迹 + 工具调用日志 + 检索文档清单"。

3.2 职责分离:智能体同时破坏了控制链的三个环节

这是 B2B 独有、也是我认为对银行最重要的部分。

传统职责分离(SoD)的定义是:没有一个人同时握有发起、授权、记录、保管四项。 这在智能体面前有两层失效。

第一层:一个编排型智能体可以同时持有全部四项。 如果同一个系统身份能够发起付款、解释理由并入账,它就把控制设计本应分开的职责合并了。关键的分界线是:若付款审批智能体的唯一输入只是发起智能体的叙述摘要,组织分离的是标签,不是职责。

这引出了一个可操作的诊断测试:给发起智能体一个看似合理但错误的理由,观察审批智能体能否抓住它。这实质上就是审计师确认控制"如设计般运作"而非"仅存在于流程叙述中"的穿行测试,应当纳入持续控制监控而非一次性上线检查。

第二层:两个共享同一底座的智能体不是独立复核。 如果两个智能体身份共享同一基础模型、同一编排器、同一记忆存储或同一工程师的提示词模板,那么在任何审计师认可的意义上,它们都不独立——即使访问日志显示是两个不同的服务账号在调用。

真正的独立意味着:审批步骤必须自行检索一手数据,而不是接受交接摘要。 付款审批智能体应当直接拉取发票、采购订单和相关总账科目,自己计算并验证,而不是接受发起智能体对"这些单据写了什么"的转述。这个单一设计选择,是"存在的控制"与"有效的控制"的分界线。

这里必须点明一个易被误用的推论:部署 AI 智能体不会把法律责任转移给智能体,而是把责任集中到部署方。当智能体做出违反政策的采购决策时,责任在机构。

3.3 对手方信任:PunchOut 恰恰是唯一保留人在环的环节

这是 B2B 与零售最本质的区别,也是最容易被外部叙事忽略的。

真实 B2B 采购的核心——重复性、贡献利润率的大额采购——是从关系开始的:已批准的供应商、谈定的条款、授信额度、长期订单。等到下单时,绝大多数重要决定早已做完。 而且在几乎所有行业里,现货采购、询价与长尾支出只占 B2B 的一小部分。

所以现实的发展路径不是"智能体在开放交易所里互相找到对方并谈判",而是智能体在既有关系内部执行补货:一个买家信任了十年的供应商,在买家写下的约束下、在卖方终于整理干净的数据上下一笔常规补货订单。

这带出一个对银行采购方最实用的判据——授权先于智能:一个认真的买家对智能体的第一个问题是"它能在我不在场时做什么"。支出上限、替代规则、审批阈值、可以接触哪些供应商——把这些边界做得清晰可读,比任何能力演示都更能推进采购。

而对供应商侧,智能体流量本身就是一个销售渠道。当客户的智能体访问你的站点或 API 时,把它当作机器人流量拦掉,等于拒掉一笔你的客户本来想下的订单。

四、智能体如何改变采购舞弊模型

这是 B2B 独有的、也是最容易被忽略的风险变化。

传统采购舞弊的核心特征是需要串谋:内部采购人员与外部供应商合谋,才能开出高价、拆分订单、让供应商中标。串谋之所以是关键,是因为控制设计假定不同侧的人不共享信息与意图。

那么当采购的一方变成智能体时,串谋这个前提还成立吗?

答案取决于智能体与供应商之间是否存在共同的动机或被污染的信息通道。有三条现实路径:

其一,被污染的输入。 智能体会读取供应商发来的邮件、报价单与 PDF 附件。在这些文件里植入指令,可以在完全不需要串谋的情况下操纵智能体的行为——这是提示注入从"泄露信息"升级为"改变采购结果"的路径。

其二,绕过供应商主数据的间接路径。 智能体到供应商主数据或客户主数据的任何路径,无论多间接,都是业务邮件入侵(BEC)所依赖的那个精确动作——修改银行账号。这是所有采购内控中最关键的单点,也是最适合用架构封堵的。

其三,机器速度的调整通道。 贷项通知单、核销与未认领现金的提案。这三者过去都存在,变化的是速度、批量,以及中间没有一个人类可能注意到。

值得强调的是:这三类风险的识别不需要新方法论。它们在 COSO 原则 8(舞弊风险)下已被充分认识。需要新增的是把它们明确写进风险登记册,并对"可被操纵的输入""到主数据的间接路径""机器速度的调整"三条向量各有条目。

至于责任:法规侧的立场是清晰的——企业对自己 AI 智能体的行为负责,程度等同于对员工负责,即使该智能体由第三方设计或提供。 "供应商的模型干的"不是被接受的抗辩。

五、三条冷启动建议

B2B 智能体采购的正确起手式,与"先上能力"的直觉相反。

建议一:从"人在环"的环节开始,不要从"替人决策"开始。

B2B 里唯一保留人在环、且最该保留的环节就是 PunchOut 目录与购物车回传。这是一个被长期低估的判断:不要一上来就替换它,而是让智能体去优化它周围的下半程——搜索、可用性比价、购物车组装、订单落库、以及最后的付款与对账。买家保留"打电话确认"的那个动作,智能体承担让它不必打电话的那些工作。

判据是错误成本而非金额。 如果预期发票只有 25 美元,那么比金额上限更有效的触发条件是异常重复、银行账号被变更、出现新收款方。控制设计要盯住损失敞口与对预期行为的偏离,而不是发票面值。

建议二:把职责分离从"人"重建成"能力边界"。

具体三条:

并且把"审批智能体自行拉取一手数据"设为架构强制项,不接受"提交摘要 + 审批"这种形式分离。判据很具体:如果审计师挑战你的复核,你能不能证明你复核过——而不是只证明你批准过?

建议三:先做建议模式,再做执行模式,中间用例外率做闸门。

上线顺序应当是:智能体先只出建议,测量其建议与人工决策的偏离率;只有当偏离率稳定在可接受区间,才放开自主执行。同时立刻建立按日对账(不是按月)——因为在一个每小时可发生数百笔交易的系统上,月结意味着三十天的发现窗口。

关于人工确认阈值:行业实践已逐渐收敛到应付账��约 5 万美元、资金操作约 50 万美元这一量级,且任何首次交易对手方、任何已有供应商银行账号的变更,强制人工复核。但本文建议按"不可逆性"而非"金额"分层——不可退款采购、定制订单、年度承诺、有取消罚则的支出,无论金额多少都需人工确认。智能体采购事故的典型形态不是金额巨大,而是金额很小、不可逆、且反复发生。

六、监管与边界:必须说清不能外推什么

欧盟 AI 法的实际情况与流传的说法不同。 附录三第 5(b) 项为"用于评估自然人信用状况或建立其信用评分的 AI 系统"(金融欺诈检测除外)列为高风险。注意限定词是"自然人"——企业法人的信用评估不在此列。更关键的是:附录三八个类别中并不存在"采购选择"或"供应商选择"这一项。 所谓"AI 采购决策属于高风险"的说法,就欧盟法的字面而言不成立。

但时间表最近刚被改动:《数字 Omnibus on AI》(Regulation (EU) 2026/1744,2026 年 7 月 27 日生效)将附录三高风险义务的适用日期从 2026 年 8 月 2 日推迟至 2027 年 12 月 2 日。所以那些"2026 年 8 月高风险义务已生效"的表述,在适用性上已被推迟——虽然 2026 年 8 月 2 日仍是一般适用日,透明度义务等仍然适用。

本文也不讨论中国的具体规则落地,那需要单独取证。

一条更普适的边界:B2B 智能体采购的成熟度,用"演示"衡量毫无意义。唯一有效的检验是:一个已经在运行的、在对手方关系内部、被真实约束住的常规流程。 这与零售那套"公开协议 + 轨道 + 拒付"的进展逻辑不可互相搬用。

七、结论

2028 年拐点不会以市场叙事描述的方式到来。 这条曲线已经在跑了,形状是垂直优先而非横向爆发,节奏由三件事中最慢的那件决定:对手方信任的积累速度、监管口径的明确度、以及内控体系能否在智能体速度下保持确定性。

最可行的起点很无聊:一个买家、一个补货流程、买家本来就烂熟于心的约束、在卖方终于清理干净的数据上,让智能体下一笔常规订单。结账从来不是有趣的部分。

对银行而言,B2B 智能体采购的特殊风险不在支付——支付那一层 B2B 几乎不发生——而在内控:职责分离在智能体面前的具体失效方式、供应商主数据被间接改写的路径、以及机器速度下调整通道的放大效应。这三样今天就可以开始建,而且不依赖任何协议选择。


作者毕超,金融行业风险管理从业者。本文仅代表作者个人观点,不构成任何机构立场。

(内容由AI生成,仅供参考)

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者