State of AI 2026 的金融读法:当“推理”成为一门生意,银行业要重算的七笔账
核心摘要
- 产业层面最醒目的数据是:OpenAI 与 Anthropic 合计年化收入运行率(run rate)到夏末已达约 1050 亿美元,而年初约为 300 亿美元;与此同时,固定水平的性能自 2023 年以来每年便宜约 13 倍
- 报告对智能体建设者给出的头号工程结论是"harness(模型外围的提示词、工具、记忆与执行循环)比模型本身更重要"——研究显示更换 harness 对结果的影响是更换模型的 7.8 倍;同一模型只改 harness 即可提升 13 分
- 对金融行业而言,这份报告应当被读成一份"预算与治理重算清单":成本、建设、路线、自主、客户、采购估值、安全合规七笔账都要重新计算
- 报告数据主要是对其他机构(Epoch AI、Artificial Analysis、IDC、Standard Metrics、Ramp、Vercel 等)数据的汇编,预测则是作者团队的判断;它不是一手实验,引用时应回溯原始出处
第九届《State of AI Report 2026》于 2026 年 10 月 8 日发布,共 244 页,由 Air Street Capital 的 Nathan Benaich 主编,是观察全球 AI 技术、产业与治理最有影响力的独立年度报告之一。报告把前沿格局概括为 Anthropic、OpenAI、Google"三强竞赛",并判断基准测试正趋于饱和。
产业层面最醒目的数据是:OpenAI 与 Anthropic 合计年化收入运行率(run rate)到夏末已达约 1050 亿美元,而年初约为 300 亿美元;与此同时,固定水平的性能自 2023 年以来每年便宜约 13 倍。 更便宜的答案与更大的总支出同时出现,这正是"推理经济"的特征。
报告对智能体建设者给出的头号工程结论是"harness(模型外围的提示词、工具、记忆与执行循环)比模型本身更重要"——研究显示更换 harness 对结果的影响是更换模型的 7.8 倍;同一模型只改 harness 即可提升 13 分。 开源模型则在 Vercel 网关处理了 62.7% 的 token、却只占 26.9% 的花费。
对金融行业而言,这份报告应当被读成一份"预算与治理重算清单":成本、建设、路线、自主、客户、采购估值、安全合规七笔账都要重新计算。 下文先拆技术与产业面,再逐一算这七笔账,最后落到中国位置与银行实践。
一、报告是什么:定位与方法论
报告按六部分组织:引言(Introduction)、研究(Research)、产业(Industry)、政治(Politics)、安全(Safety)、预测(Predictions)。需要先说明其方法论特征,以便正确使用:报告数据主要是对其他机构(Epoch AI、Artificial Analysis、IDC、Standard Metrics、Ramp、Vercel 等)数据的汇编,预测则是作者团队的判断;它不是一手实验,引用时应回溯原始出处。 报告每年还会给自己上一年的预测打分——去年十项预测仅两项完全命中、五项部分命中、三项落空。
二、技术面:三强饱和、推理主导、物理 AI 临近
- 前沿三强与基准饱和:Claude Opus 5.5 在 Artificial Analysis 智能指数得 58 分,GPT-6 Astra 与 Gemini 4 Argon 同得 53 分;报告强调"领先取决于测量口径,排名随时变化"。最难的数学基准在 14 个月内从 22% 升到 100%,传统理解与推理测试见顶。
- AI 加速 AI 研发:Anthropic 报告称 Claude 在人工监督下主导了其 26% 的可测量模型研发;"选择哪些实验值得做"成为下一前沿。
- 推理算力反超训练:微软 MAI-Thinking-1(1T 总参、35B 激活的 MoE)把 4864 台 GB200 中的 4096 台用于推理,约为训练分配的 5 倍,单次生成可达 128k token;Kimi K3 使用 5120 万个有状态沙箱(支持暂停/恢复、分叉、快照)。算力的重心正从"训练大脑"转向"让大脑持续工作"。
- 物理 AI 的 GPT-2 时刻:开放数学难题被攻克、AI 辅助药物项目进入 III 期临床、数据与模型授权增长。
三、产业面:1050 亿美元、13 倍降价与 SaaS 冲击
- 收入向头部集中:OpenAI 与 Anthropic 合计年化运行率约 1050 亿美元(年初约 300 亿),在 Ramp 企业付费 AI 支出中两家占约 96%;其运行率 2024 年增长 3.6 倍、2025 年增长 4.7 倍。
- AI 原生公司增长更快:Standard Metrics 二季度初步数据,年化收入 100 万–2000 万美元的公司中,AI 原生(AI 即产品)头部年增 256%,AI-enabled(旧软件加 AI)增 90%;在图表的每个分组里,"外挂 AI"的公司增速甚至慢于完全没有 AI 的公司。 报告同时声明这些对比不能证明"采用 AI 导致增长"。
- 支出极度分化:Top 1% 公司每员工每月在 AI 上花费 7205 美元,中位数公司仅 12.50 美元,相差约 580 倍;VC 支持公司的人均 AI 支出自 2023 年增长 24 倍,其他公司仅 3.9 倍。
- 按席位 SaaS 受冲击:Anthropic 推出面向知识工作者的 Claude Cowork 后,2 月初约 2.85 万亿美元软件股市值一度蒸发,到 9 月多数回升;新需求主要来自法律(企业 Codex 用户增 108 倍)与销售(41 倍),工程仅 5 倍。
- 采用仍处早期:OpenAI 内部 97.9% 员工使用 Codex,企业用户仅 17.3%,个人用户 0.7%。
四、金融行业要重算的七笔账(核心)
1. 成本账:按"完成的任务"计价,而非按 token
推理模型会消耗大量用户看不见的推理 token,使"每百万 token 单价"失去参考意义。Artificial Analysis 的任务成本数据显示:同一基准任务,最便宜的模型仅 0.06 美元、最贵达 7.63 美元,相差超 100 倍;在 20 小时编码基准上,GPT-6 Astra 以每次 1030 美元得 65.5 分,Claude Opus 5.5 以 99 美元得 62.3 分——多花约 10 倍只换 3 分。 银行应建立"每完成一笔业务的 AI 成本"口径(如每完成一份尽调、每处理一笔授信审批),把成本核算与业务价值挂钩,而非采购时只比 token 单价。
2. 建设账:harness 优先,模型其次
研究用三个模型、三套 harness、100 个编码任务测得:换 harness 的影响是换模型的 7.8 倍;GLM-5.1 仅换 harness 就从 52.5% 升到 65.5%;Claude Code 对新模型砍掉 80% 系统提示词而效果无损。 这与我此前解读 arXiv 2610.04433 的结论一致。银行智能体的预算与人力应优先投向工具与 MCP 服务、状态与记忆、可观测、沙箱与验收关卡;为旧模型缺陷写的临时 workaround 会很快过时,不应作为主要资产。
3. 路线账:AI 原生与外挂增强"双轨",但要认清外挂天花板
报告"外挂 AI 不如无 AI"的结论对银行是一记警钟:银行大量 AI 是在旧系统、旧菜单上叠加聊天窗口,属于 AI-enabled,价值天花板明显;但银行受合规、稳态要求约束,又无法像初创公司那样整体原生重构。 务实路径是双轨:核心账务与强合规系统以"外挂增强、风险可控"为主;面向客户的新服务、新渠道(如智能体服务平台、财富顾问)按 AI 原生方式新建,避免新系统一上线就落后。
4. 自主账:开源模型 + 私有化部署进入高性价比区间
开源权重模型在 Vercel 网关处理 62.7% 的 token 却只占 26.9% 的花费;法律科技公司 Harvey 用开源 GLM-5.2 训练专业模型,比 Sonnet 5 运行成本低 54.8%、在其基准上得分还高于 Fable 5。这为银行落实金发〔2026〕8 号文"自主可控"要求提供了经济性证据:开源基座 + 行业后训练 + 自有 harness,可在显著降低成本的同时把数据与模型控制权留在行内。 但 GPU 租金已从低点平均回升约 30%,算力规划应按"稀缺"而非"价格战"假设。
5. 客户账:你的下一个客户,可能是一个"带钱包的智能体"
报告判断"下一个客户是带钱包的智能体"。当智能体自主下单、比价、调用服务,银行的支付、清算、托管、账户体系将面对一类非人类客户:需要解决智能体身份识别与授权、支付额度与风控、可追溯的委托关系、资金托管与争议处理。 这与支付宝已完成 3 亿笔 AI 智能体支付、Token Pay/AI 钱包布局,以及 FLOP"智能体用代币购买算力"的探索相互印证。银行应尽早布局面向智能体的支付与托管接口,并把"智能体客户"纳入反欺诈与授信模型。
6. 采购与估值账:按席位计费瓦解,自建替代上升
麦肯锡《The state of AI in 2026》显示,32% 的组织因能用智能体编码工具自建,已决定放弃采购至少一项软件;报告也记录 OpenAI、Anthropic 均成立了咨询部门帮企业部署。对银行有两层含义:一是采购策略——部分金融软件可转向内部智能体平台自建,传统按席位许可的议价与续约逻辑要重估;二是对金融科技、银行系科技子公司的估值——"卖席位"的收入模型正在被"卖完成的工作/按任务计费"取代,估值口径需前瞻调整。
7. 安全合规账:组合测试、合规时间表与断供备胎
- 安全取决于"模型+harness"组合:同一模型 GPT-5.6 Sol 在 Codex CLI 的容器(containment)测试得 62.3 分,在 Claude Code 仅 39.4 分——银行必须对实际运行的那一对组合做评测,不能只测模型。
- 合规时间表:欧盟《AI 法案》针对招聘、借贷等高风险用途的规则推迟至 2027 年 12 月 2 日启动,聊天机器人与 AI 生成内容的披露规则已生效——有跨境零售/信贷业务的银行应对照排期。
- 断供与地缘风险:美国出口管制曾于 6 月 12 日阻断 Fable、Mythos 访问(Fable 于 7 月 1 日恢复);3 月 1 日伊朗无人机袭击阿联酋两处 AWS 设施——银行需预置并实测"备用模型/备用云区域",避免单点切换失灵。
- 供应链与影子 IT:2026 上半年 21 家主要厂商的高危漏洞数量已超过 2025 全年;开源智能体 OpenClaw 已获 38.8 万 GitHub 星,某安全公司发现 22% 的客户有员工在内部运行——补丁节奏与终端管控都要升级。
五、不能只看分数:完成率与组织能力
报告揭示两个易被忽视的问题,银行尤须警惕:
- 分数掩盖未完成:某模型办公任务得分 77.7%,但实际只完成 44.3% 的任务。银行评估 AI 不能只看 benchmark 分数,必须核验"任务是否真正闭环完成"——这与以日活智能体数(DAA)、实际完成工时穿透 AI 真实产出的思路一致。
- 能力"增强中的削弱":Anthropic 一项研究中,用 AI 学习新程序库的开发者事后测验平均 50 分,不用 AI 的 67 分。银行在推广 AI 提效的同时,要防范初级员工专业判断空心化,需配套刻意训练、专家复核与知识留痕。
六、中国位置与银行业落地
对照中国数据:Stanford AI Index 2026 显示美中 AI 性能差距收窄至约 2.7%,但基础模型透明度指数从 58 降至 40;IDC 预测中国活跃智能体数量将从 2026 年的 495 万个增至 2030 年的 1.97 亿个(复合增速 151.2%),部署渗透率 81.0%;2026 年中国智能算力规模预计达 2576.5 EFLOPS、同比增 87.9%。中国银行业已是全球 AI 落地最密集的市场之一(工行 600+ 场景、邮储 370+、平安 450+)。结合报告,中国银行机构的相对优势在场景密度与工程落地,短板在前沿基座与体系化治理;机会窗口在于用"开源基座+自有 harness+可信治理"走出一条成本可控、自主可靠的规模化路径。
结语
《State of AI Report 2026》的金融读法可以浓缩成一句话:当"推理"成为一门按任务计费、持续发生的生意,银行比拼的就不再是"用没用 AI",而是谁能把 AI 的成本账、建设账、路线账、自主账、客户账、采购账、安全账算得更清楚、更可审计。 报告提供的不是答案,而是一张重算的底稿。对银行风险管理者而言,真正的工作是把这七笔账转译成本机构的预算口径、工程路线与合规台账,在安全边界内把技术红利兑现为可核验的业务价值。
(注:本文事实与引语均来自报告原文及文末列出的解读资料,标注日期;报告数据为其对各机构数据的汇编,性能、收入、成本等口径以原始来源为准,预测为作者判断,均不构成投资建议。)
参考文献
- State of AI Report 2026(官方PDF,2026-10-08) [State of AI Report(Air Street Capital)]
- The frontier is now a three-lab race(官方2026解读·Research) [State of AI Report]
- The State of AI 2026 bets your next customer is an agent with a wallet(kachar.dev,2026-10-08) [kachar.dev]
- State of AI 2026: OpenAI, Anthropic Run Rates Hit $105B(FourWeekMBA,2026-10-08) [FourWeekMBA]
- State of AI 2026: Big Revenue, Big Incidents, AGI 2027(Pulse of Nations,2026-10-09) [Pulse of Nations]
- State of AI report returns for its ninth year with Anthropic atop the benchmarks(Crypto Briefing,2026-10-09) [Crypto Briefing]
- The state of AI in 2026: On the road to ROI(McKinsey/QuantumBlack,2026) [McKinsey & Company]
- 智能体成人工智能增长新引擎 算力跃升为国家战略基础设施(经济参考报/IDC,2026-09-28) [新华社经济参考报]