Fable 5.1 提示词泄露之后:对后训练开源模型的五点启示

核心摘要

  • 护栏是可剥离层,开权重模型的安全需下沉到权重
  • 版权对齐正在成为后训练的必备工程项
  • '永不存储'说明隐私治理要从数据进入训练管线
  • 工具与运行时组装是后训练的高价值竞速区

Fable 5.1 提示词泄露之后:对后训练开源模型的五点启示

核心摘要

导语

2026年9月2日深夜,一场"发布即裸奔":Anthropic 发布 Fable 5.1 与 Mythos 5.1,ARC Prize 验证其 ARC-AGI-2 达90.0%(每任务3.12美元)、ARC-AGI-1 达97.5%(每任务1.40美元),因 Token 效率提升,平均推理成本较上代下降约32%。数小时后,越狱研究者 Pliny the Liberator 抛出一份超过27.5万字符的系统提示词,Fable 5.1 的"底牌"全面曝光(新智元,2026-09-02)。

事件最锋利之处不在"被破解"本身,而在于泄露物的性质:这27.5万字并非一句人格设定,而是一份完整的运行时组装指令——核心行为逻辑、记忆系统、搜索与版权规则、Artifacts 与计算机使用指南、插件路由,以及全部46个工具的 JSON 架构,而官方当日仅公布了约2.7万字。新款模型因此被扒出大量不可示人的治理细节:明文禁止重现1928年后的受版权歌曲、诗歌与书籍片段;禁止在 SVG/CSS/HTML 输出中绘制任何已知角色、Logo 与专辑封面(点名刺猬索尼克与《好饿的毛毛虫》);清单式规定"永不存储"的敏感类别;对心理状态仅做支持不诊断,毒品话题走"减害"路线;还展示了44分钟解开1653年悬案密码(Cyphral Distich)的横向推理能力。

对后训练(Post-training)与开源模型生态而言,这不是一个娱乐性八卦,而是一份可 indexing 的工程标本。以下五点启示,值得从事模型对齐、开源发布与行业落地的人认真对待。

启示一:护栏是"可剥离"的顶层,开权重模型要重估安全交付模型

事件的关键事实是:Fable 5.1 与 Mythos 5.1 是同一个权重,区别仅在安全护栏;而护栏主要承载于提示词层——因此发布数小时即被完整提取。这意味着模型产品的差异化安全层,恰恰是攻击者最易剥离的一层

对开源(Open Weights)模型而言,这一启示被放大到极致:模型权重公开后,"提示词级护栏"对任何人都不再构成屏障。任何依赖 System Prompt 做唯一安全闸门的开源部署,安全水准都取决于部署者自己。启示是双重的:

一是安全要尽量下沉到权重层。真正的抗绕过能力应来自安全对齐阶段——偏好优化、风险评估、拒绝行为的权重内化,而不是浮在表面、一删即空的提示词。开源生态需要把"安全后训练"当作与推理能力同等重要的发布物,提供可复现的安全对齐配方与护栏评测,而非只发布裸权重加一份免责声明。

二是开权重不等于免责。一旦护栏可被剥离,责任归属就变得尖锐:模型能力公开了,谁为滥用负责?事件示范了"服务化护栏"的另一种形态——权重开源、护栏托管,把高风险行为留在受控运行面。对金融等敏感行业,直接复用开源权重前,必须自行承担安全后训练的验收责任。

启示二:版权对齐从"可选"走向后训练的"必备工程"

泄露文本中占比可观的是版权规则:以1928年为界对受版权作品的"绝不重现",连字符、Logo、专辑封面都在禁令内,甚至细化到输出媒介(SVG/CSS/HTML)。这是后训练阶段为规避侵权风险而做的内容记忆抑制与输出约束,是持续投入的合规工程。

对开源模型的启示很直接:训练数据的版权可知性与输出侧的内容审计,不能再当作后置的、可选的加分项。开源生态往往强调数据透明度,但版权对齐的成本(清洗、去学习、输出过滤、生成内容检测)同样必须被显式建模为后训练的一个环节,否则越是强大的开源权重,越容易被用于规避版权限制的二次加工。中国法律环境下的商用开源部署,尤其需要把"可追溯合规"纳入后训练与发布清单。

启示三:"永不存储"是类别级的记忆治理,隐私要从功能开关进入训练管线

Fable 5.1 记忆系统的"永不存储"清单是一份罕见的行业标本:未成年人身份信息、种姓、移民状态、犯罪记录、心理与精神推断、性史、自残倾向等类别被系统自动分类、永久排除并在后台强制清空。这不是一个隐私开关,而是一条类别级的数据处理红线,它要求记忆架构具备"识别类别—阻断写入—后台清除"的完整链路。

对开源模型,特别是要遵守个人信息保护法规的机构而言,启示是:隐私设计必须前移到数据管线与后训练约束中,而非依赖上线后的功能开关。开权重意味着"删除请求"无法用关停服务来敷衍——权重一旦外泄,遗忘几乎不可执行,因此必须在训练与记忆设计阶段就做类别级过滤与"无痕"架构。谁能把隐私治理做进训练的基因,谁才真正适合承载敏感行业的记忆型应用。

启示四:工具与"运行时组装"是后训练的高价值竞速区,指令架构即是知识产权

27.5万字里最有工程含金量的,是全部46个工具的 JSON 架构、插件路由与 Artifacts/计算机使用指南。这些不是提示词装饰,而是"教会模型行动"的后训练产物——决定模型能否可靠地调用工具、组装工作流、交付结果。官方只披露冰山一角,恰恰说明这类资产被视为核心知识产权。

对开源模型的启示在于:后训练的竞争焦点正从"语料对话"迁移到"工具与 Agent 组装"。开源社区若能把工具调用指令、运行时组装规范、评测集作为一等资产开源,将极大降低后训练复现门槛;反过来,采购方在评估开源模型时,不能只看基准分,要看它的"工具装配体质量"——这往往是闭源旗舰与开源权重真实差距所在。

启示五:能力与成本的工程张力,指向"后训练效率"竞赛

ARC-AGI-2 90.0%、ARC-AGI-1 97.5% 的绝对值可观,但更值得注意的是"平均推理成本较上代降低约32%"上榜——能力与成本的比值,正在成为旗舰模型发布的统一叙事。对开源模型而言,这提示后训练的价值坐标不止"更强",还有"更省":Token 效率、蒸馏、推理时优化都是开源社区可复现的差异化空间,而非只能靠堆算力硬追。

面向开源社区与行业的行动建议

把这五点收拢成可执行动作:

  1. 发布物升级:开源权重应附带"安全对齐配方 + 护栏卡 + 版权审计 + 记忆治理声明"四件套,把隐性后训练资产显性化、可评测化。
  2. 护栏分层:高风险行为走"开源权重+托管护栏"双层架构,把不可剥离的部分留在受控运行面。
  3. 蒸馏与指纹:建立系统提示词指纹与水印能力,让"提示词窃取-再包装"可被识别,保护后训练投资的权益。
  4. 隐私前移:把类别级"永不存储"式设计纳入数据管线默认值,而非事后补救。
  5. 机构采购视角:无论是银行还是其他敏感行业,评估开源模型应把安全护栏强度、版权合规、记忆治理纳入后训练验收清单——基准分数只是起点,能不能"安全地行动"才是及格线。

结语

Fable 5.1 的"发布即被扒",表面上是一次提示词泄露的公关事故,实质上是后训练时代的第一次大规模"资产盘点"曝光:它让行业第一次看清,现代旗舰模型的差异化,很大程度藏在权重之外的运行时指令、治理规则与工具装配里。对开源模型而言,这份标本既是警示,也是路线图——把安全、版权、隐私、工具把后训练真正做厚,把隐性资产做成可复现、可评测、可治理的一等资产,开源模型的价值才不会被"裸权重"三个字锁死。

作者:金融行业风险管理从业者

关于作者

毕超,博士、高级工程师(计算机技术专业),金融行业风险管理从业者。

清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。

研究方向:大语言模型、数字金融、金融科技。2024年获北京市西城区"西融计划"青年拔尖人才。

了解更多:关于作者