通俗解读:AI 跑多快、谁来盯?Anthropic 给公众的三块'发展仪表盘'

核心摘要

  • AI 开始自己造自己,人类需要一块仪表盘。
  • Anthropic 首次公开三项 AI 发展测量指标。
  • Claude 已主导 26% 的 AI 研发工作。
  • 给 AI 发展减速,前提是看得清它跑多快。

想象一个场景:你是一家公司的老板,你的员工正在以越来越快的速度自我升级——他们甚至开始自己招聘、自己培训新员工。作为老板,你最想知道什么?三件事:他们到底在多大程度上自己干活、你有没有能力盯住他们、公司资源都花到哪儿去了。

AI 开始自己造自己,人类需要一块仪表盘。 Anthropic 首次公开三项 AI 发展测量指标。 Claude 已主导 26% 的 AI 研发工作。 给 AI 发展减速,前提是看得清它跑多快。

这就是 Anthropic 研究院 2026 年 9 月发布的新文章《Measurements for understanding the pace of AI development inside frontier labs》(测量前沿实验室内部的 AI 发展速度)在做的事。它把"AI 发展速度"从一句口号,变成了可以公开核对的三组数字。本文用大白话拆解这篇技术文章,并聊聊它对金融行业的启示。

一、为什么要"测量"AI 发展速度?

先交代背景。Anthropic 的 CEO Dario Amodei 此前多次呼吁"给前沿 AI 发展减速"(We Must Pace the Frontier)。但"减速"是个政策主张,政策要落地,前提是得有数据:AI 到底发展多快?快在哪里?是 AI 自己在加速自己,还是人类在加速它?

过去大家只能看"能力评测"——给模型出题,看它考多少分。这相当于只看"产品说明书",不看"生产线"。这篇新文章补上的正是生产线视角:模型是怎么被造出来的,造的过程里 AI 自己出了多少力,人类又还剩多少控制力。

Anthropic 给出了三个测量维度,并公布了自家 2026 年 8 月的实测快照。

二、测量一:AI 自己干多少活?——"自动化指数"

这是什么: Anthropic 把公司里所有 AI 研发工作(从写代码、跑实验到修故障)编成一本"工作清单",然后给每种工作评定一个"自动化等级"(AL,Automation Level),从 AL0 到 AL5。

可以理解为给员工评级:

测得什么: 截至 2026 年 8 月,在 Anthropic 内部:

翻译成大白话:AI 距离"完全自己造下一代自己"(即所谓的递归自我改进)还有距离,但"人类主导、AI 打下手"的时代已经过去了——现在 AI 已经在四分之一以上的研发工作里扮演"主管",在九成以上的工作里深度参与。

怎么测的: 方法很"笨"也很扎实。7 月的每个星期,随机抽 20% 员工,让一个 Claude 研究 Agent 翻看他们的 Slack 聊天和内部文档,列出他们这周干了啥,汇总出约 1.5 万个细粒度任务,再组织成一棵 542 个节点的"工作树"。之后由另一个 Claude"裁判"给每个节点评级。为了防"自己夸自己",还让人工主管背靠背打分对照:模型与人类打分完全一致率 59%,人类彼此之间反而只有 35%——模型裁判的可靠性至少不差于人类同事。

三、测量二:人类盯得住 AI 吗?——"Agent 监督三件套"

AI 研发越来越自动化,Anthropic 内部同时有约 3 万个 AI Agent 在做研究和工程工作。这么多"数字员工"同时干活,人类怎么保证它们不闯祸?文章给出了三个指标,凑成一套"监控系统体检表":

  1. 覆盖率(coverage):Agent 的动作里有多少被监控?
- 结果:100%。每个动作在执行前先过在线监控,执行后再被离线监控全部吞入分析。
  1. 审查延迟(review latency):从动作发生到被审查,隔多久?
- 结果:自动审查在动作执行前完成;被拦截的动作一周内由人工复审;每周约 10 万份对话记录被标记,其中最高优先级约 50 份升级到人工。
  1. 升级率(escalation rate):多少动作被拦下或标记?
- 结果:分析了 8 月超过 10 亿个决策,只有 0.002%(约 1/47000)被监控拦截;每千份记录中约 1-2 份被标记复审。

这套体系有两个精巧设计:

对普通人的意义:当 AI Agent 数量从几千涨到几百万,哪怕单个 Agent 出事的概率极低,总量也会让"罕见事故"变成"家常便饭"。所以监控不是小题大做,而是规模化的必然要求。

四、测量三:算力都花到哪儿了?——"研发开支账本"

算力是 AI 研发最"硬"的投入,也是最容易被外部核实的指标。Anthropic 把 2026 年 7 月 13 日至 20 日一周内所有算力使用做了分类盘点,重点看一个比例:投给"安全研究"的算力占 AI 研发算力的多少?

定义结果:约 6%。如果只看"AI 驱动的 AI 研发"(即 AI Agent 消耗的算力),这个比例是 约 12%

文章特意强调这是"保守估计":凡是既帮能力又帮安全的工作,一律不计入安全;护栏分类器等额外算力也没算进去。也就是说,真实的"安全投入"比 6% 要高,但口径从严,方便未来跨公司、跨时间对比。

这个指标的价值不在绝对数字,而在"可对比":就像家庭记账,光看一个月花了多少钱意义不大,但坚持记下去,就能看出钱是流向"改善生活"还是"买买买",也能跟邻居家对比。未来如果真要协调"给 AI 减速",算力分配比例可以成为可验证的政策抓手——比如约定"安全研究算力占比不得低于 X%"。

五、三个数字背后的诚实与局限

这篇文章的可贵之处,是把自己的测量漏洞也写了出来:

六、对金融行业的三点启示

作为金融行业风险管理从业者,我读这篇文章最大的感受是:前沿 AI 实验室正在做的事情,和银行业过去二十年做的事情高度同构——用可验证的指标,回应公众对透明度的要求。

第一,"透明度"正在成为 AI 行业的监管语言。 银行被监管要求披露资本充足率、不良率、风险加权资产——一套标准化的"银行体检表"。Anthropic 这篇文章本质上是为 AI 行业起草"体检表":自动化指数、监督覆盖率、算力分配。这些指标未来很可能演化为监管报送项。金融机构在评估 AI 供应商时,应当把"对方能否提供这类可验证指标"纳入尽调清单。

第二,"AI 自己造 AI"的比例,是金融机构必须关注的系统性风险指标。 如果前沿模型的研发越来越依赖 AI 自身(26% 已由 AI 主导),那么模型供应链的风险将不只是"模型会不会出错",而是"造模型的过程人类还看不看得懂"。这对依赖 AI 做风控决策的银行意味着:模型风险管理(Model Risk Management)的边界必须从"模型行为"延伸到"模型的产生过程"。

第三,"Agent 监控"是银行 AI 治理的必修课。 Anthropic 为 3 万个内部 Agent 建立身份、开放通信、在线+离线双监控的做法,完全可以迁移到银行的 Agent 应用场景:为每个自动化 Agent 建立可审计身份,动作全量留痕,异常自动升级人工。文中"10 亿决策中 0.002% 被拦截"的监控体系,正是银行大规模部署 AI Agent 前的安全基线参考。

结语

这篇文章没有给出"AI 发展该不该减速"的答案,但它给出了一个更基础的东西:测量的尺子。没有尺子,任何关于"太快还是太慢"的争论都是空谈。

对公众,这把尺子让"AI 内部发生了什么"第一次有了可核对的数字;对监管者,这把尺子提供了未来政策工具的雏形;对金融行业,这把尺子提醒我们:AI 治理的下一站,不是管住模型"说什么",而是看清模型"怎么被造出来、谁来盯着它、资源流向了哪里"。这三块仪表盘,银行也该给自己装一套。

(本文为金融行业风险管理从业者基于公开资料的通俗解读,不构成投资或采购建议。)

事实来源

(原文为外部公开网页,标注口径以 Anthropic 官方发布为准。)

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者