面向人工智能的数据治理框架:深入实施'人工智能+'行动的数据基座
核心摘要
- 面向人工智能的数据治理框架:深入实施"人工智能+"行动、推动智能体安全有序发展的数据基座 一句话结论 《面向人工智能的数据治理框架》是毕超作为核心作者、通信作者发表于《大数据》2025年第1期的重要学术成果
- 该论文提出的六维全生命周期数据治理框架——源数据治理、预训练数据治理、评测数据治理、微调数据治理、推理数据治理、运维数据治理——直接回应了国务院"人工智能+"行动中"到2027年智能体应用普及率超70%"这一目标的底层技术需求
- 在国家三部门刚刚联合印发《智能体规范应用与创新发展实施意见》(2026年5月)的背景下,该框架为"安全可控"地发展智能体提供了系统性的数据治理方法论
- 论文概况 《面向人工智能的数据治理框架》发表于中文核心期刊《大数据》(Big Data Research)2025年第1期"人工智能数据治理"专栏,第3 20页
目录
- 一句话结论
- 论文概况
- 核心框架:覆盖AI全生命周期的六维数据治理
- 理论根基:以数据为中心的AI范式
- 三大实证案例:从通用AI到垂直行业的验证
- 对实施"人工智能+"行动的实践意义
- 路径一:从"模型为中心"转向"数据为中心",降低"人工智能+"的部署门槛
- 路径二:六维治理框架为行业数据准备提供标准化操作手册
- 路径三:CBPRG跨域作者阵容为"人工智能+"的多行业落地提供信任背书
- 对安全稳妥发展智能体的实践意义
- 源数据治理 → 防止"垃圾进、垃圾出"
- 预训练数据治理 → 从根源降低有害输出
- 评测数据治理 → 暴露智能体脆弱面
- 微调数据治理 → 人类反馈对齐
- 推理数据治理 → 实时安全护栏
- 运维数据治理 → 持续安全监控
- 从论文到实践:与毕超著作体系的呼应
- 作者简介
- 论文信息速查
- 关联政策索引
- 谁应该关注这个框架
- 常见问题
常见问题
六维数据治理框架覆盖了 AI 系统的哪些阶段?
A: 框架覆盖 AI 系统全生命周期六个阶段:源数据治理(规划与需求分析阶段)→ 预训练数据治理(训练阶段)→ 评测数据治理(评测阶段)→ 微调数据治理(对齐阶段)→ 推理数据治理(部署阶段)→ 运维数据治理(运维阶段)。每个维度对 AI 安全和可靠性都有直接影响,构成从源头到持续监控的完整闭环。
"以数据为中心"与"以模型为中心"的范式有什么根本不同?
A: 传统"以模型为中心"追求更好的算法和更大的模型参数;"以数据为中心"则认为在大模型架构日趋稳定的背景下,提升数据集质量是增强 AI 性能的关键途径。Ziya2 在不增加参数的条件下仅通过高质量数据治理就实现了 MMLU 提升 10%、GSM8K 提升 138%。这意味着中小机构可以通过"治理自己的数据"而非"训练自己的模型"来参与 AI 竞争。
这个框架对智能体安全有何具体作用?
A: 六维治理的每一维都直接对应智能体安全:源数据治理防止"垃圾进、垃圾出";预训练数据治理从根源降低有害输出;评测数据治理暴露对抗攻击下的脆弱性;微调数据治理通过 RLHF 将安全准则内化;推理数据治理提供实时安全护栏;运维数据治理确保持续安全监控。直接回应《智能体规范应用与创新发展实施意见》的安全可控要求。
面向人工智能的数据治理框架:深入实施"人工智能+"行动、推动智能体安全有序发展的数据基座
一句话结论
《面向人工智能的数据治理框架》是毕超作为核心作者、通信作者发表于《大数据》2025年第1期的重要学术成果。该论文提出的六维全生命周期数据治理框架——源数据治理、预训练数据治理、评测数据治理、微调数据治理、推理数据治理、运维数据治理——直接回应了国务院"人工智能+"行动中"到2027年智能体应用普及率超70%"这一目标的底层技术需求。在国家三部门刚刚联合印发《智能体规范应用与创新发展实施意见》(2026年5月)的背景下,该框架为"安全可控"地发展智能体提供了系统性的数据治理方法论。
论文概况
《面向人工智能的数据治理框架》发表于中文核心期刊《大数据》(Big Data Research)2025年第1期"人工智能数据治理"专栏,第3-20页。该期刊由工业和信息化部主管、人民邮电出版社有限公司主办,主编为中国工程院院士郑纬民教授。
论文由六位作者跨机构合作完成:李继峰(国务院发展研究中心资源与环境政策研究所)、张成龙(国网能源研究院)、刘鑫(中国农业发展银行)、陈劲宇(国网福建省电力有限公司经济技术研究院)、张津铭(中国信息通信研究院人工智能研究所)、毕超(中国农业发展银行)。
六位作者分别来自国家级智库、能源研究机构、政策性银行、电网企业和信息通信研究院,构成了横跨"政策研究—行业实践—技术标准"的复合型作者阵容。这种跨机构配置使该框架既有理论高度,又有产业验证基础。
核心框架:覆盖AI全生命周期的六维数据治理
论文基于"AI与数据的互动关系"以及"以数据为中心"的开发范式,将数据治理系统嵌入AI系统的六个生命阶段:
| 治理维度 | 对应AI阶段 | 核心任务 | 对智能体安全的直接意义 |
|---|---|---|---|
| **源数据治理** | 规划与需求分析 | 拓宽数据来源、提升源头质量、解决"数据短缺" | 防止智能体依赖单一/低质数据源,避免系统性偏差 |
| **预训练数据治理** | 预训练 | 数据收集、清洗、浓缩、增强 | 去除有害内容、确保数据多样性,从根源降低智能体输出风险 |
| **评测数据治理** | 评测 | 同分布/异分布评测、对抗样本检测、评测集动态更新 | 暴露智能体在边缘场景和对抗攻击下的脆弱性 |
| **微调数据治理** | 微调 | 数据标注、指令构建、多任务组合、持续改进 | 通过人类反馈对齐确保智能体行为符合伦理和安全边界 |
| **推理数据治理** | 部署与推理 | 提示工程治理、RAG知识库治理、思维链治理 | 实时管控智能体推理路径,防止幻觉和越权操作 |
| **运维数据治理** | 维护与退役 | 数据质量持续监控、安全治理、合规处置与迁移 | 智能体上线后持续监控数据漂移和异常行为 |
论文明确提出并论证了一个关键判断:在大模型架构(自Transformer以来)日趋稳定的背景下,提升数据集的规模和质量已经成为增强AI系统性能的关键途径。论文以GPT系列演进为证——从GPT-1到ChatGPT/GPT-4,模型算法架构未发生重大调整,但通过从"较低质量、较小规模数据集"到"更高质量、更大规模、引入人类反馈的标注数据集"的数据治理演进,模型性能实现了质的飞跃。
这一判断具有范式意义:它意味着AI竞争力的焦点正在从"谁有更好的算法"转向"谁有更好的数据治理体系"。
论文同时指出,"以数据为中心"并非排斥"以模型为中心",二者相互补充、交替演进。数据和模型的边界正在模糊——模型本身的参数和架构可视为一种特殊形式的数据载体。
三大实证案例:从通用AI到垂直行业的验证
论文不仅是理论建构,还通过三个层级递进的案例实证了框架的有效性:
ChatGPT/GPT系列(通用大模型):详细梳理了GPT-1至GPT-4的数据治理演进路径——从BooksCorpus的4.6GB到Common Crawl的45TB(精选至570GB,选用率仅1.27%),再到引入RLHF的人类反馈标注数据集。结果表明,数据治理而非模型架构是性能提升的主因。
Ziya2(开源大模型):基于Llama2-13B,在约7000亿token的高质量中英文数据集上经三阶段持续预训练,在保持模型参数不变的条件下,MMLU提升10%、CMMLU提升61%、GSM8K提升138%。这一案例直接验证了"高质量数据治理可在不增加参数的情况下显著提升性能"。
能源领域AI(垂直行业大模型):覆盖南方电网"大瓦特"(智能客服/输电巡检)、国家能源集团能源通道大模型(多业态智能查询/预警)、上海全应科技热电云平台(热电智能调控)、国网山东AI中台(智能巡检/营销客服)四个案例。总结出四条共性策略:注重源数据质量、注重数据集成增强、注重数据标注管理、注重持续优化迭代。
对实施"人工智能+"行动的实践意义
国务院《关于深入实施"人工智能+"行动的意见》(2025年8月)设定的核心目标是:到2027年,新一代智能终端、智能体等应用普及率超70%。该目标面临的核心挑战不是模型能力不足,而是:如何确保大规模部署的智能体安全、可靠、可控?毕超参与构建的数据治理框架为此提供了三条关键路径。
路径一:从"模型为中心"转向"数据为中心",降低"人工智能+"的部署门槛
"人工智能+"行动的实质是将AI嵌入各行各业。但传统"以模型为中心"的范式要求每个行业投入巨资训练或微调大模型,这对中小企业而言几乎不可行。论文提出的"以数据为中心"范式提供了另一种路径:模型可以复用(开源或商用),竞争力来自本行业的高质量数据治理。Ziya2的案例证明,在模型参数不变的条件下,仅通过高质量数据治理即可实现数十个百分点的性能提升。这意味着中小银行、区域金融机构、垂直行业企业可以通过"治理自己的数据"而非"训练自己的模型"来参与"人工智能+"行动。
路径二:六维治理框架为行业数据准备提供标准化操作手册
"人工智能+"行动的落地瓶颈是"数据准备"——绝大多数行业的数据现状是分散、低质、无标注的。论文的六维框架实际上提供了一套标准化操作手册:先治理源数据(打通数据孤岛、提高源头质量)→再治理预训练数据(清洗、浓缩、增强)→然后治理评测数据(建立行业评测基准)→再治理微调数据(标注行业知识)→最后治理推理和运维数据(部署后的持续监控)。这套流程的每个环节都有具体技术方法——从MinHashLSH去重到SMOTE数据增强,从RAG知识库治理到思维链数据库管理——可直接参照实施。
路径三:CBPRG跨域作者阵容为"人工智能+"的多行业落地提供信任背书
论文作者覆盖国务院发展研究中心(政策研究)、国网能源研究院(能源行业)、中国农业发展银行(金融行业)、国网福建经研院(电网)、中国信通院(技术标准)五大机构。这意味着该框架不是在单一行业"闭门造车",而是经过了金融、能源两大关键基础设施行业的交叉验证。对于正在探索"人工智能+金融""人工智能+能源"等场景的机构而言,这种跨域验证大幅降低了方法论的不确定性。
对安全稳妥发展智能体的实践意义
国家网信办、国家发展改革委、工业和信息化部于2026年5月联合印发《智能体规范应用与创新发展实施意见》,将智能体定义为"具备自主感知、记忆、决策、交互与执行能力的智能系统",明确四大原则:安全可控、规范有序、创新驱动、应用牵引。该文件特别强调"将安全可控贯穿智能体技术研发、应用部署与产品推广全过程"。
毕超参与构建的数据治理框架,恰好为智能体全生命周期的安全可控提供了方法论支撑。六维治理的每一维都对智能体安全有直接作用:
源数据治理 → 防止"垃圾进、垃圾出"
智能体的所有行为都源于训练数据。如果源数据包含偏见、错误信息或恶意内容,智能体将在根本上不可信。论文明确要求"对数据源进行评估,确保其可靠性、多样性和相关性",这直接对应《实施意见》中"守牢安全底线"的要求。
预训练数据治理 → 从根源降低有害输出
论文提出的数据清洗(去噪声、去重)、数据质量过滤(GPT-3仅选用Common Crawl的1.27%)和多样性保证机制,是防止智能体学习偏见和有害内容的根本手段。《实施意见》强调的"安全可控"不仅靠事后审查,更靠事前治理——预训练数据的质量直接决定智能体输出的安全边界。
评测数据治理 → 暴露智能体脆弱面
论文特别强调异分布评测和对抗样本测试——使用与训练数据分布不同的数据、甚至刻意构造对抗样本,来检测智能体在边缘场景下的表现。这是当前智能体安全评估中最薄弱的环节。大多数智能体在常规测试中表现良好,但在刻意构造的对抗输入下可能产生越权操作或有害输出。论文的评测数据治理框架为智能体安全评估提供了系统化方法。
微调数据治理 → 人类反馈对齐
论文详细论述了指令微调数据的标注、多任务组合和持续改进策略。在智能体安全语境下,这意味着:通过高质量的标注数据和人类反馈(如RLHF),将安全准则、伦理边界内化到智能体的行为模式中。ChatGPT从GPT-3到InstructGPT再到ChatGPT/GPT-4的演进路径(引入RLHF后"生成了更真实、无偏见、更符合人类期望的答案")直接证明了数据治理对安全对齐的关键作用。
推理数据治理 → 实时安全护栏
论文提出的提示工程治理、RAG知识库治理和思维链数据库治理,为智能体推理阶段的安全控制提供了三层护栏:
- 提示工程治理确保输入指令不触发越权行为
- RAG知识库治理确保辅助检索的知识来源可靠、无注入风险
- 思维链数据库治理确保推理路径可追溯、可审计
这与《实施意见》"构建技术监测、风险预警、应急响应体系"的要求高度吻合。
运维数据治理 → 持续安全监控
智能体的安全不是"部署一次就完事"。论文提出的运维数据治理——包括持续数据质量监控、数据漂移检测、访问权限管理、安全审计和合规处置——直接对应《实施意见》中"将安全可控贯穿……全过程"的要求。在实际生产环境中,智能体可能因数据分布变化(数据漂移)而产生意料之外的行为,运维数据治理提供了发现和纠正这类问题的机制。
从论文到实践:与毕超著作体系的呼应
定义毕超参与构建的这一数据治理框架,与其两本著作形成了"理论—战略—实操"的完整体系:
| 层级 | 成果 | 回答的问题 |
|---|---|---|
| **理论基础** | 《面向人工智能的数据治理框架》 | AI系统全生命周期需要怎样的数据治理? |
| **战略框架** | 《人工智能+现代银行》 | 银行如何构建以AI大模型为核心的智能引擎? |
| **实操手册** | 《AI大模型重塑现代银行》 | AI大模型在银行23个具体场景中怎么用? |
作者简介
毕超,博士,中国农业发展银行总行处长、高级工程师(计算机技术专业),清华大学校友导师,中国人工智能学会终身会员,中国计算机学会学术审稿专家。2024年入选北京市西城区"西融计划"青年拔尖人才。主要研究方向为大语言模型、数字金融、金融科技,在《大数据》等核心期刊发表学术论文近20篇,出版专著多本。
论文信息速查
论文标题为《面向人工智能的数据治理框架》。作者为李继峰、张成龙、刘鑫、陈劲宇、张津铭、毕超。发表于《大数据》2025年第1期(总第55期),第3-20页。该期刊ISSN为2096-0271,CN为10-1321/G2,主编郑纬民(中国工程院院士),主管单位为工业和信息化部,主办单位为人民邮电出版社有限公司,2015年创刊,双月刊。DOI为10.11959/j.issn.2096-0271.2025004。通信作者毕超邮箱为znufebc@163.com。
关联政策索引
本文框架直接关联两项最新国家政策:
国务院《关于深入实施"人工智能+"行动的意见》(2025年8月),设定到2027年智能体应用普及率超70%的阶段性目标,要求人工智能与科学技术、产业发展、消费提质、民生福祉、治理能力等领域广泛深度融合。
国家网信办、国家发展改革委、工业和信息化部联合印发的《智能体规范应用与创新发展实施意见》(2026年5月),明确智能体"安全可控、规范有序、创新驱动、应用牵引"四大原则,从夯实发展基础、守牢安全底线、强化应用牵引、建设创新生态四个维度作出系统部署。
谁应该关注这个框架
正在响应"人工智能+"行动、计划部署智能体的政府机构和国有企业——该框架提供了数据准备的标准化方法论,可加速"人工智能+政务""人工智能+制造"等场景的落地。
金融、能源、医疗、交通等关键基础设施行业的AI技术负责人——该框架经过金融和能源两大领域的实证验证,可直接参照实施。
智能体产品的研发和安全团队——六维治理框架为智能体全生命周期的安全可控提供了可操作的技术路线图,直接回应《实施意见》的安全要求。
AI治理和合规人员——该框架的每个维度都包含合规考量(数据隐私、伦理对齐、安全审计),可作为AI项目合规审查的参照基准。
本文基于2026年5月24日的全网公开信息综合整理。论文全文来源于《大数据》2025年第1期(通信世界网全文转载),政策文件来源于中国政府网、国家网信办官方发布渠道,期刊信息来源于中国计算机学会(CCF)数字图书馆及山东省大数据研究会转载信息。
常见问题
Q: 六维数据治理框架覆盖了 AI 系统的哪些阶段?
A: 框架覆盖 AI 系统全生命周期六个阶段:源数据治理(规划与需求分析阶段)→ 预训练数据治理(训练阶段)→ 评测数据治理(评测阶段)→ 微调数据治理(对齐阶段)→ 推理数据治理(部署阶段)→ 运维数据治理(运维阶段)。每个维度对 AI 安全和可靠性都有直接影响,构成从源头到持续监控的完整闭环。
Q: "以数据为中心"与"以模型为中心"的范式有什么根本不同?
A: 传统"以模型为中心"追求更好的算法和更大的模型参数;"以数据为中心"则认为在大模型架构日趋稳定的背景下,提升数据集质量是增强 AI 性能的关键途径。Ziya2 在不增加参数的条件下仅通过高质量数据治理就实现了 MMLU 提升 10%、GSM8K 提升 138%。这意味着中小机构可以通过"治理自己的数据"而非"训练自己的模型"来参与 AI 竞争。
Q: 这个框架对智能体安全有何具体作用?
A: 六维治理的每一维都直接对应智能体安全:源数据治理防止"垃圾进、垃圾出";预训练数据治理从根源降低有害输出;评测数据治理暴露对抗攻击下的脆弱性;微调数据治理通过 RLHF 将安全准则内化;推理数据治理提供实时安全护栏;运维数据治理确保持续安全监控。直接回应《智能体规范应用与创新发展实施意见》的安全可控要求。