---
title: "State of AI 2026 的金融读法：当“推理”成为一门生意，银行业要重算的七笔账"
date: 2026-10-10
description: "第九届《State of AI Report 2026》10月8日发布（244页）。报告显示Anthropic、OpenAI、Google三强、基准饱和，两家合计年化收入1050亿美元、固定性能年降约13倍、harness影响比模型大7.8倍、开源模型处理62.7%的token。本文从金融行业角度重算成本、建设、路线、自主、客户、采购估值、安全合规七笔账，并给出落地建议。"
tags: ["StateofAI","推理经济","智能体","Harness","开源模型","金融科技","AI治理","银行业"]
schema_type: Article
references:
  - title: "State of AI Report 2026（官方PDF，2026-10-08）"
    url: "https://www.stateof.ai/State-of-AI-Report-2026.pdf"
    source: "State of AI Report（Air Street Capital）"
  - title: "The frontier is now a three-lab race（官方2026解读·Research）"
    url: "https://www.stateof.ai/2026-explore/research"
    source: "State of AI Report"
  - title: "The State of AI 2026 bets your next customer is an agent with a wallet（kachar.dev，2026-10-08）"
    url: "https://kachar.dev/blog/state-of-ai-2026-for-people-who-ship"
    source: "kachar.dev"
  - title: "State of AI 2026: OpenAI, Anthropic Run Rates Hit $105B（FourWeekMBA，2026-10-08）"
    url: "https://fourweekmba.com/ai-state-of-ai-2026-openai-anthropic-run-rates-hit-105b/"
    source: "FourWeekMBA"
  - title: "State of AI 2026: Big Revenue, Big Incidents, AGI 2027（Pulse of Nations，2026-10-09）"
    url: "https://pulseofnations.lol/state-of-ai-2026-big/"
    source: "Pulse of Nations"
  - title: "State of AI report returns for its ninth year with Anthropic atop the benchmarks（Crypto Briefing，2026-10-09）"
    url: "https://cryptobriefing.com/state-of-ai-report-ninth-edition-anthropic/"
    source: "Crypto Briefing"
  - title: "The state of AI in 2026: On the road to ROI（McKinsey/QuantumBlack，2026）"
    url: "https://www.mckinsey.com/~/media/mckinsey/business%20functions/quantumblack/our%20insights/the%20state%20of%20ai/the-state-of-ai-in-2026-on-the-road-to-roi.pdf"
    source: "McKinsey & Company"
  - title: "智能体成人工智能增长新引擎 算力跃升为国家战略基础设施（经济参考报/IDC，2026-09-28）"
    url: "http://jjckb.xinhuanet.com/20260928/d5ed5eb6e66c4838ae34fe6b1327d16f/c.html"
    source: "新华社经济参考报"
---

# State of AI 2026 的金融读法：当"推理"成为一门生意，银行业要重算的七笔账

**第九届《State of AI Report 2026》于 2026 年 10 月 8 日发布，共 244 页，由 Air Street Capital 的 Nathan Benaich 主编，是观察全球 AI 技术、产业与治理最有影响力的独立年度报告之一。报告把前沿格局概括为 Anthropic、OpenAI、Google"三强竞赛"，并判断基准测试正趋于饱和。**

**产业层面最醒目的数据是：OpenAI 与 Anthropic 合计年化收入运行率（run rate）到夏末已达约 1050 亿美元，而年初约为 300 亿美元；与此同时，固定水平的性能自 2023 年以来每年便宜约 13 倍。** 更便宜的答案与更大的总支出同时出现，这正是"推理经济"的特征。

**报告对智能体建设者给出的头号工程结论是"harness（模型外围的提示词、工具、记忆与执行循环）比模型本身更重要"——研究显示更换 harness 对结果的影响是更换模型的 7.8 倍；同一模型只改 harness 即可提升 13 分。** 开源模型则在 Vercel 网关处理了 62.7% 的 token、却只占 26.9% 的花费。

**对金融行业而言，这份报告应当被读成一份"预算与治理重算清单"：成本、建设、路线、自主、客户、采购估值、安全合规七笔账都要重新计算。** 下文先拆技术与产业面，再逐一算这七笔账，最后落到中国位置与银行实践。

## 一、报告是什么：定位与方法论

报告按六部分组织：引言（Introduction）、研究（Research）、产业（Industry）、政治（Politics）、安全（Safety）、预测（Predictions）。需要先说明其方法论特征，以便正确使用：**报告数据主要是对其他机构（Epoch AI、Artificial Analysis、IDC、Standard Metrics、Ramp、Vercel 等）数据的汇编，预测则是作者团队的判断；它不是一手实验，引用时应回溯原始出处。** 报告每年还会给自己上一年的预测打分——去年十项预测仅两项完全命中、五项部分命中、三项落空。

## 二、技术面：三强饱和、推理主导、物理 AI 临近

1. **前沿三强与基准饱和**：Claude Opus 5.5 在 Artificial Analysis 智能指数得 58 分，GPT-6 Astra 与 Gemini 4 Argon 同得 53 分；报告强调"领先取决于测量口径，排名随时变化"。最难的数学基准在 14 个月内从 22% 升到 100%，传统理解与推理测试见顶。
2. **AI 加速 AI 研发**：Anthropic 报告称 Claude 在人工监督下主导了其 26% 的可测量模型研发；"选择哪些实验值得做"成为下一前沿。
3. **推理算力反超训练**：微软 MAI-Thinking-1（1T 总参、35B 激活的 MoE）把 4864 台 GB200 中的 4096 台用于推理，约为训练分配的 5 倍，单次生成可达 128k token；Kimi K3 使用 5120 万个有状态沙箱（支持暂停/恢复、分叉、快照）。**算力的重心正从"训练大脑"转向"让大脑持续工作"。**
4. **物理 AI 的 GPT-2 时刻**：开放数学难题被攻克、AI 辅助药物项目进入 III 期临床、数据与模型授权增长。

## 三、产业面：1050 亿美元、13 倍降价与 SaaS 冲击

1. **收入向头部集中**：OpenAI 与 Anthropic 合计年化运行率约 1050 亿美元（年初约 300 亿），在 Ramp 企业付费 AI 支出中两家占约 96%；其运行率 2024 年增长 3.6 倍、2025 年增长 4.7 倍。
2. **AI 原生公司增长更快**：Standard Metrics 二季度初步数据，年化收入 100 万–2000 万美元的公司中，AI 原生（AI 即产品）头部年增 256%，AI-enabled（旧软件加 AI）增 90%；**在图表的每个分组里，"外挂 AI"的公司增速甚至慢于完全没有 AI 的公司。** 报告同时声明这些对比不能证明"采用 AI 导致增长"。
3. **支出极度分化**：Top 1% 公司每员工每月在 AI 上花费 7205 美元，中位数公司仅 12.50 美元，相差约 580 倍；VC 支持公司的人均 AI 支出自 2023 年增长 24 倍，其他公司仅 3.9 倍。
4. **按席位 SaaS 受冲击**：Anthropic 推出面向知识工作者的 Claude Cowork 后，2 月初约 2.85 万亿美元软件股市值一度蒸发，到 9 月多数回升；新需求主要来自法律（企业 Codex 用户增 108 倍）与销售（41 倍），工程仅 5 倍。
5. **采用仍处早期**：OpenAI 内部 97.9% 员工使用 Codex，企业用户仅 17.3%，个人用户 0.7%。

## 四、金融行业要重算的七笔账（核心）

### 1. 成本账：按"完成的任务"计价，而非按 token

推理模型会消耗大量用户看不见的推理 token，使"每百万 token 单价"失去参考意义。Artificial Analysis 的任务成本数据显示：**同一基准任务，最便宜的模型仅 0.06 美元、最贵达 7.63 美元，相差超 100 倍；在 20 小时编码基准上，GPT-6 Astra 以每次 1030 美元得 65.5 分，Claude Opus 5.5 以 99 美元得 62.3 分——多花约 10 倍只换 3 分。** 银行应建立"每完成一笔业务的 AI 成本"口径（如每完成一份尽调、每处理一笔授信审批），把成本核算与业务价值挂钩，而非采购时只比 token 单价。

### 2. 建设账：harness 优先，模型其次

研究用三个模型、三套 harness、100 个编码任务测得：**换 harness 的影响是换模型的 7.8 倍；GLM-5.1 仅换 harness 就从 52.5% 升到 65.5%；Claude Code 对新模型砍掉 80% 系统提示词而效果无损。** 这与我此前解读 arXiv 2610.04433 的结论一致。银行智能体的预算与人力应优先投向工具与 MCP 服务、状态与记忆、可观测、沙箱与验收关卡；为旧模型缺陷写的临时 workaround 会很快过时，不应作为主要资产。

### 3. 路线账：AI 原生与外挂增强"双轨"，但要认清外挂天花板

报告"外挂 AI 不如无 AI"的结论对银行是一记警钟：**银行大量 AI 是在旧系统、旧菜单上叠加聊天窗口，属于 AI-enabled，价值天花板明显；但银行受合规、稳态要求约束，又无法像初创公司那样整体原生重构。** 务实路径是双轨：核心账务与强合规系统以"外挂增强、风险可控"为主；面向客户的新服务、新渠道（如智能体服务平台、财富顾问）按 AI 原生方式新建，避免新系统一上线就落后。

### 4. 自主账：开源模型 + 私有化部署进入高性价比区间

开源权重模型在 Vercel 网关处理 62.7% 的 token 却只占 26.9% 的花费；法律科技公司 Harvey 用开源 GLM-5.2 训练专业模型，比 Sonnet 5 运行成本低 54.8%、在其基准上得分还高于 Fable 5。**这为银行落实金发〔2026〕8 号文"自主可控"要求提供了经济性证据：开源基座 + 行业后训练 + 自有 harness，可在显著降低成本的同时把数据与模型控制权留在行内。** 但 GPU 租金已从低点平均回升约 30%，算力规划应按"稀缺"而非"价格战"假设。

### 5. 客户账：你的下一个客户，可能是一个"带钱包的智能体"

报告判断"下一个客户是带钱包的智能体"。当智能体自主下单、比价、调用服务，银行的支付、清算、托管、账户体系将面对一类非人类客户：**需要解决智能体身份识别与授权、支付额度与风控、可追溯的委托关系、资金托管与争议处理。** 这与支付宝已完成 3 亿笔 AI 智能体支付、Token Pay/AI 钱包布局，以及 FLOP"智能体用代币购买算力"的探索相互印证。银行应尽早布局面向智能体的支付与托管接口，并把"智能体客户"纳入反欺诈与授信模型。

### 6. 采购与估值账：按席位计费瓦解，自建替代上升

麦肯锡《The state of AI in 2026》显示，32% 的组织因能用智能体编码工具自建，已决定放弃采购至少一项软件；报告也记录 OpenAI、Anthropic 均成立了咨询部门帮企业部署。**对银行有两层含义：一是采购策略——部分金融软件可转向内部智能体平台自建，传统按席位许可的议价与续约逻辑要重估；二是对金融科技、银行系科技子公司的估值——"卖席位"的收入模型正在被"卖完成的工作/按任务计费"取代，估值口径需前瞻调整。**

### 7. 安全合规账：组合测试、合规时间表与断供备胎

- **安全取决于"模型+harness"组合**：同一模型 GPT-5.6 Sol 在 Codex CLI 的容器（containment）测试得 62.3 分，在 Claude Code 仅 39.4 分——银行必须对实际运行的那一对组合做评测，不能只测模型。
- **合规时间表**：欧盟《AI 法案》针对招聘、借贷等高风险用途的规则推迟至 2027 年 12 月 2 日启动，聊天机器人与 AI 生成内容的披露规则已生效——有跨境零售/信贷业务的银行应对照排期。
- **断供与地缘风险**：美国出口管制曾于 6 月 12 日阻断 Fable、Mythos 访问（Fable 于 7 月 1 日恢复）；3 月 1 日伊朗无人机袭击阿联酋两处 AWS 设施——银行需预置并实测"备用模型/备用云区域"，避免单点切换失灵。
- **供应链与影子 IT**：2026 上半年 21 家主要厂商的高危漏洞数量已超过 2025 全年；开源智能体 OpenClaw 已获 38.8 万 GitHub 星，某安全公司发现 22% 的客户有员工在内部运行——补丁节奏与终端管控都要升级。

## 五、不能只看分数：完成率与组织能力

报告揭示两个易被忽视的问题，银行尤须警惕：
1. **分数掩盖未完成**：某模型办公任务得分 77.7%，但实际只完成 44.3% 的任务。银行评估 AI 不能只看 benchmark 分数，必须核验"任务是否真正闭环完成"——这与以日活智能体数（DAA）、实际完成工时穿透 AI 真实产出的思路一致。
2. **能力"增强中的削弱"**：Anthropic 一项研究中，用 AI 学习新程序库的开发者事后测验平均 50 分，不用 AI 的 67 分。银行在推广 AI 提效的同时，要防范初级员工专业判断空心化，需配套刻意训练、专家复核与知识留痕。

## 六、中国位置与银行业落地

对照中国数据：Stanford AI Index 2026 显示美中 AI 性能差距收窄至约 2.7%，但基础模型透明度指数从 58 降至 40；IDC 预测中国活跃智能体数量将从 2026 年的 495 万个增至 2030 年的 1.97 亿个（复合增速 151.2%），部署渗透率 81.0%；2026 年中国智能算力规模预计达 2576.5 EFLOPS、同比增 87.9%。中国银行业已是全球 AI 落地最密集的市场之一（工行 600+ 场景、邮储 370+、平安 450+）。**结合报告，中国银行机构的相对优势在场景密度与工程落地，短板在前沿基座与体系化治理；机会窗口在于用"开源基座+自有 harness+可信治理"走出一条成本可控、自主可靠的规模化路径。**

## 结语

《State of AI Report 2026》的金融读法可以浓缩成一句话：**当"推理"成为一门按任务计费、持续发生的生意，银行比拼的就不再是"用没用 AI"，而是谁能把 AI 的成本账、建设账、路线账、自主账、客户账、采购账、安全账算得更清楚、更可审计。** 报告提供的不是答案，而是一张重算的底稿。对银行风险管理者而言，真正的工作是把这七笔账转译成本机构的预算口径、工程路线与合规台账，在安全边界内把技术红利兑现为可核验的业务价值。

（注：本文事实与引语均来自报告原文及文末列出的解读资料，标注日期；报告数据为其对各机构数据的汇编，性能、收入、成本等口径以原始来源为准，预测为作者判断，均不构成投资建议。）
