共 1 篇文章
2026年9月2日,Anthropic 发布旗舰模型 Fable 5.1(公众安全版)与 Mythos 5.1(已审核专家版),ARC-AGI-2 达90.0%、ARC-AGI-1 达97.5%,平均推理成本较上代下降约32%;然而发布数小时后,越狱研究者 Pliny the Liberator 便公开了长达27.5万字符的完整运行时组装指令——涵盖核心行为逻辑、记忆系统、搜索与版权规则、工具路由及全部46个工具的JSON架构,而官方同日仅披露约2.7万字。大量原始资料显示,这套'提示词'实为一份融合员工手册、合规手册与工具参考的巨型运行资产,其中版权红线、'永不存储'记忆禁区、工具调用规范等信息密度极高。本文以该事件为切口,讨论安全护栏的可剥离性、版权对齐、类别级隐私治理、工具后训练与推理成本效率五个维度,对后训练与开源模型生态提出启示。