通俗解读:AI 跑多快、谁来盯?Anthropic 给公众的三块'发展仪表盘'
核心摘要
- AI 开始自己造自己,人类需要一块仪表盘。
- Anthropic 首次公开三项 AI 发展测量指标。
- Claude 已主导 26% 的 AI 研发工作。
- 给 AI 发展减速,前提是看得清它跑多快。
想象一个场景:你是一家公司的老板,你的员工正在以越来越快的速度自我升级——他们甚至开始自己招聘、自己培训新员工。作为老板,你最想知道什么?三件事:他们到底在多大程度上自己干活、你有没有能力盯住他们、公司资源都花到哪儿去了。
AI 开始自己造自己,人类需要一块仪表盘。 Anthropic 首次公开三项 AI 发展测量指标。 Claude 已主导 26% 的 AI 研发工作。 给 AI 发展减速,前提是看得清它跑多快。
这就是 Anthropic 研究院 2026 年 9 月发布的新文章《Measurements for understanding the pace of AI development inside frontier labs》(测量前沿实验室内部的 AI 发展速度)在做的事。它把"AI 发展速度"从一句口号,变成了可以公开核对的三组数字。本文用大白话拆解这篇技术文章,并聊聊它对金融行业的启示。
一、为什么要"测量"AI 发展速度?
先交代背景。Anthropic 的 CEO Dario Amodei 此前多次呼吁"给前沿 AI 发展减速"(We Must Pace the Frontier)。但"减速"是个政策主张,政策要落地,前提是得有数据:AI 到底发展多快?快在哪里?是 AI 自己在加速自己,还是人类在加速它?
过去大家只能看"能力评测"——给模型出题,看它考多少分。这相当于只看"产品说明书",不看"生产线"。这篇新文章补上的正是生产线视角:模型是怎么被造出来的,造的过程里 AI 自己出了多少力,人类又还剩多少控制力。
Anthropic 给出了三个测量维度,并公布了自家 2026 年 8 月的实测快照。
二、测量一:AI 自己干多少活?——"自动化指数"
这是什么: Anthropic 把公司里所有 AI 研发工作(从写代码、跑实验到修故障)编成一本"工作清单",然后给每种工作评定一个"自动化等级"(AL,Automation Level),从 AL0 到 AL5。
可以理解为给员工评级:
- AL0-AL2:AI 基本是"打杂助理",人让干什么就干什么
- AL3(协作):AI 像能干的下属,能在人紧盯下干完一大块活,遇到岔路会停下来问
- AL4(主导):AI 像独当一面的主管,你给它一个方向,它能端到端干完,你只需要抽查
- AL5(完全自主):AI 像全权 CEO,自己发现问题、自己修、自己上线,人完全可以不出现
测得什么: 截至 2026 年 8 月,在 Anthropic 内部:
- 没有任何一块 AI 研发工作达到 AL5(完全自主)
- AI "主导"(AL4 及以上)了 26% 的 AI 研发工作
- AI "协作"及以上(AL3 及以上)覆盖超过 90% 的工作
翻译成大白话:AI 距离"完全自己造下一代自己"(即所谓的递归自我改进)还有距离,但"人类主导、AI 打下手"的时代已经过去了——现在 AI 已经在四分之一以上的研发工作里扮演"主管",在九成以上的工作里深度参与。
怎么测的: 方法很"笨"也很扎实。7 月的每个星期,随机抽 20% 员工,让一个 Claude 研究 Agent 翻看他们的 Slack 聊天和内部文档,列出他们这周干了啥,汇总出约 1.5 万个细粒度任务,再组织成一棵 542 个节点的"工作树"。之后由另一个 Claude"裁判"给每个节点评级。为了防"自己夸自己",还让人工主管背靠背打分对照:模型与人类打分完全一致率 59%,人类彼此之间反而只有 35%——模型裁判的可靠性至少不差于人类同事。
三、测量二:人类盯得住 AI 吗?——"Agent 监督三件套"
AI 研发越来越自动化,Anthropic 内部同时有约 3 万个 AI Agent 在做研究和工程工作。这么多"数字员工"同时干活,人类怎么保证它们不闯祸?文章给出了三个指标,凑成一套"监控系统体检表":
- 覆盖率(coverage):Agent 的动作里有多少被监控?
- 审查延迟(review latency):从动作发生到被审查,隔多久?
- 升级率(escalation rate):多少动作被拦下或标记?
这套体系有两个精巧设计:
- 给每个 Agent 发"工牌"(身份):每个 Agent 有独立身份,所有数据绑定到身份。这样 Agent 之间不会混淆"自己的想法"和"别人的说法",出问题也能精准追责到"哪个 Agent 干的"。
- 让 Agent 公开说话(开放通信):Agent 之间通过共享、开放的消息系统交流,每条消息都带身份、可追溯。这避免了"传话游戏"——A 告诉 B,B 再转述给 C,信息层层失真。
对普通人的意义:当 AI Agent 数量从几千涨到几百万,哪怕单个 Agent 出事的概率极低,总量也会让"罕见事故"变成"家常便饭"。所以监控不是小题大做,而是规模化的必然要求。
四、测量三:算力都花到哪儿了?——"研发开支账本"
算力是 AI 研发最"硬"的投入,也是最容易被外部核实的指标。Anthropic 把 2026 年 7 月 13 日至 20 日一周内所有算力使用做了分类盘点,重点看一个比例:投给"安全研究"的算力占 AI 研发算力的多少?
定义结果:约 6%。如果只看"AI 驱动的 AI 研发"(即 AI Agent 消耗的算力),这个比例是 约 12%。
文章特意强调这是"保守估计":凡是既帮能力又帮安全的工作,一律不计入安全;护栏分类器等额外算力也没算进去。也就是说,真实的"安全投入"比 6% 要高,但口径从严,方便未来跨公司、跨时间对比。
这个指标的价值不在绝对数字,而在"可对比":就像家庭记账,光看一个月花了多少钱意义不大,但坚持记下去,就能看出钱是流向"改善生活"还是"买买买",也能跟邻居家对比。未来如果真要协调"给 AI 减速",算力分配比例可以成为可验证的政策抓手——比如约定"安全研究算力占比不得低于 X%"。
五、三个数字背后的诚实与局限
这篇文章的可贵之处,是把自己的测量漏洞也写了出来:
- AI 当裁判,可能和 AI 选手犯同样的错:自动化指数的评级依赖 Claude 当裁判,裁判和选手可能犯同类错误。对策是引入第三方或他家的模型交叉验证。
- "零幻觉"不等于"零错误":任何测量都只是快照。算力测量只覆盖一周,趋势还没形成;分类器的标签本身也可能不准。
- 算力份额不等于安全投入:一个更高效的安全分类器会降低安全算力占比,但不代表安全工作变少了。
- 独立第三方正在进场:Anthropic 明确表示将把多个组织的独立第三方评估者嵌入公司内部,给予接近内部风控团队的权限,验证安全实践、报告事件、监督这些指标——相当于给自家仪表盘请外部审计师。
六、对金融行业的三点启示
作为金融行业风险管理从业者,我读这篇文章最大的感受是:前沿 AI 实验室正在做的事情,和银行业过去二十年做的事情高度同构——用可验证的指标,回应公众对透明度的要求。
第一,"透明度"正在成为 AI 行业的监管语言。 银行被监管要求披露资本充足率、不良率、风险加权资产——一套标准化的"银行体检表"。Anthropic 这篇文章本质上是为 AI 行业起草"体检表":自动化指数、监督覆盖率、算力分配。这些指标未来很可能演化为监管报送项。金融机构在评估 AI 供应商时,应当把"对方能否提供这类可验证指标"纳入尽调清单。
第二,"AI 自己造 AI"的比例,是金融机构必须关注的系统性风险指标。 如果前沿模型的研发越来越依赖 AI 自身(26% 已由 AI 主导),那么模型供应链的风险将不只是"模型会不会出错",而是"造模型的过程人类还看不看得懂"。这对依赖 AI 做风控决策的银行意味着:模型风险管理(Model Risk Management)的边界必须从"模型行为"延伸到"模型的产生过程"。
第三,"Agent 监控"是银行 AI 治理的必修课。 Anthropic 为 3 万个内部 Agent 建立身份、开放通信、在线+离线双监控的做法,完全可以迁移到银行的 Agent 应用场景:为每个自动化 Agent 建立可审计身份,动作全量留痕,异常自动升级人工。文中"10 亿决策中 0.002% 被拦截"的监控体系,正是银行大规模部署 AI Agent 前的安全基线参考。
结语
这篇文章没有给出"AI 发展该不该减速"的答案,但它给出了一个更基础的东西:测量的尺子。没有尺子,任何关于"太快还是太慢"的争论都是空谈。
对公众,这把尺子让"AI 内部发生了什么"第一次有了可核对的数字;对监管者,这把尺子提供了未来政策工具的雏形;对金融行业,这把尺子提醒我们:AI 治理的下一站,不是管住模型"说什么",而是看清模型"怎么被造出来、谁来盯着它、资源流向了哪里"。这三块仪表盘,银行也该给自己装一套。
(本文为金融行业风险管理从业者基于公开资料的通俗解读,不构成投资或采购建议。)
事实来源
- Anthropic 研究院:《Measurements for understanding the pace of AI development inside frontier labs》(2026 年 9 月),作者 Marina Favaro、Phillie Wright
- 文中数据均出自上述文章 2026 年 8 月内部快照:自动化指数(AL3+ 超 90%、AL4+ 为 26%、无 AL5)、Agent 监督(约 3 万 Agent、100% 覆盖、0.002% 拦截率、每周约 50 例最高优先级升级人工)、算力分配(AI 研发算力约 6% 投向安全、AI 驱动研发中约 12%)
- 背景关联:Dario Amodei《We Must Pace the Frontier》(2026)、Anthropic《Recursive Self-Improvement》(2026)、Epoch AI 自动化等级量表(AL0-AL5)
(原文为外部公开网页,标注口径以 Anthropic 官方发布为准。)