审校 | 重楼
引言
1988 年,麻省理工学院推出全面数据质量管理计划(TDQM),拉开现代数据治理序幕。伴随大数据普及,数据治理内涵持续拓展。
2021 年生成式大模型快速兴起,AI 发展逻辑从以模型为中心转向以数据为中心,优质、海量、多元数据成为 AI 性能核心支撑。
但产业落地中普遍存在三大痛点:数据量大但质量低下、隐私泄露与数据安全风险突出、数据集自带偏见易造成 AI 歧视输出。若缺乏有效管控,不仅制约 AI 产业迭代,还会侵害个人权益、给企业与国家安全带来隐患。
在此背景下,面向人工智能的数据治理(DG4AI)概念正式提出,旨在通过系统化数据管控手段,化解各类数据风险,打造安全可控、合规负责任的人工智能应用。
一、面向人工智能的数据治理核心定义
面向人工智能的数据治理(DG4AI,Data Governance for Artificial Intelligence),是覆盖人工智能全生命周期的数据管控流程与实践体系。
它围绕AI模型从规划、训练、评测、微调、推理到运维退役完整链路,通过制度、流程、技术手段统筹管理各类多模态数据,核心目标是保障数据高质量、使用合规、隐私安全、伦理公平,解决传统数据治理适配大模型不足、数据高量低质、算法偏见、隐私泄露等痛点,为可信人工智能提供底层数据支撑。
传统数据治理多面向结构化商业数据,适配BI分析场景;而DG4AI针对文本、图像、代码等海量非结构化、多模态数据,适配预训练、指令微调、检索增强生成等大模型特有流程,同时契合GB/T 47507-2026《人工智能可信赖通则》提出的可控、安全、公平、可追溯等20项可信核心要素,是传统数据治理在生成式AI时代的延伸与升级。
二、开展AI数据治理的必要性
数据是大模型的核心生产资料,模型性能上限由数据质量决定,行业实践已充分印证这一点。
从GPT系列迭代到国内Ziya2、能源行业大模型均可看出,同等模型架构下,高质量、多样化数据集可大幅提升模型精度、泛化与推理能力。
当下AI数据应用存在三大突出难题,倒逼标准化数据治理落地。
其一,数据“高量低质”。互联网爬取、公开数据集混杂垃圾信息、重复内容、残缺样本,通用网页、行业专业数据缺乏统一质量评估标准,直接引发模型过拟合、预测偏差。
其二,安全隐私风险频发。训练、推理、运维全链路存在数据过度采集、样本投毒、用户隐私泄露风险,违背数据合规与隐私保护要求。
其三,算法伦理偏见。训练数据自带地域、性别、行业刻板印象,若不治理易造成AI输出歧视,违背公平性、伦理符合性等可信AI规范。
同时,完善的数据治理是构建可信赖AI的基础。依据GB/T 47507-2026要求,AI系统需具备可追溯、可解释、数据合规等能力,只有对全流程数据建档管控,才能实现问题溯源、责任划分,满足监管与公众信任需求。
三、面向人工智能的数据治理全生命周期框架
依据AI系统开发应用流程,行业形成六阶段闭环治理框架,覆盖源数据、预训练、评测、微调、推理、运维六大数据模块,每个阶段匹配专属治理任务与技术手段。
1.源数据治理:筑牢数据供给根基
源数据对应AI规划需求阶段,核心解决数据短缺、来源杂乱问题。
数据源分为通用数据(网页、书籍、社交媒体对话)与专业数据(行业文档、代码、多语言、科研文本)。
治理重点为多渠道拓宽合规数据源,从宏观产业数字化、企业数据资产转化层面扩充数据供给;同步开展数据源资质审核、版权校验、可靠性评估,过滤违规、低质素材,区分敏感隐私数据并提前脱敏,从源头规避合规与质量隐患。
2.预训练数据治理:打造模型基础语料
预训练是模型通用能力构建环节,治理分为数据收集、准备、浓缩、增强四大流程。
数据收集通过数据集发现、多源集成、人工/生成式数据合成扩充样本,完成版权与隐私合规校验;数据准备开展清洗去重、缺失值填充、特征提取与标准化;数据浓缩借助PCA、样本筛选降低数据冗余,缓解训练过拟合;数据增强利用变换操作、SMOTE等采样、生成模型扩充少数类样本,提升数据集多样性,强化模型鲁棒性。
Ziya2仅优化预训练数据集,未大幅扩充模型参数,便在数学、代码任务实现性能翻倍,印证该环节治理价值。
3.评测数据治理:客观衡量模型能力
评测数据用于模型性能校验,分为同分布评测与异分布评测两类数据集。
同分布数据切片拆分训练子集,定位模型局部短板、校验算法公平;异分布构造对抗样本、分布偏移样本,测试模型未知场景泛化与抗攻击能力。
治理要求评测集独立于训练数据,避免数据泄露造成评估失真,持续更新数据集覆盖多元场景,兼顾多样性、代表性、隐私保护,建立准确率、偏见度等量化评估指标。
4.微调数据治理:适配行业专属场景
通用大模型需依靠指令微调适配垂直领域,微调数据治理核心围绕标注与数据集迭代。
流程包含多渠道收集指令样本,采用半自动标注(模型初标+专家复核)降低成本;统一指令与输出格式,清洗冲突、错误样本;通过多任务混合、数据增强丰富指令类型;搭建自动(BLEU指标)+人工双重评估机制,定期更新数据集并记录版本,留存元数据实现全流程可追溯。
能源行业“大瓦特”、国能能源大模型均依靠标准化行业标注数据,实现电力、煤炭业务精准适配。
5.推理数据治理:保障线上稳定输出
模型部署推理阶段的数据治理聚焦实时输入与外挂知识库,分为提示工程、检索增强(RAG)、思维链三类治理方向。
提示工程标准化提示模板,自动生成并校验提示数据集质量;RAG对外挂行业知识库完成清洗、知识抽取、冲突融合、动态更新,缓解模型幻觉;思维链数据库由专家审核逻辑样本,优化检索效率。同时实时监控线上输入异常数据,拦截恶意对抗输入,保护用户交互隐私。
6.运维数据治理:实现长效迭代优化
运维覆盖模型上线、迭代直至退役全周期,治理内容涵盖数据质量常态化监控、存储优化、安全防护、合规处置。
持续采集系统日志、用户反馈数据,监测数据漂移、样本质量衰减;采用分布式存储、索引加速提升检索效率;落实数据分级加密、最小权限访问、安全审计;模型退役时区分核心数据长期归档、辅助数据合规销毁,借助差分隐私、联邦学习保护存量数据隐私,实现数据资产复用。
四、AI数据治理三大核心工作模块
结合CCSA TC601《面向人工智能的数据治理(DG4AI)实践指南1.0》,落地治理需同步推进数据质量、安全隐私、伦理三大体系建设,三者贯穿六阶段框架,互为支撑。
1.数据质量治理
质量是DG4AI第一要务,建立全流程质量管控闭环。
前期明确数据质量基准,开展数据源评估;中期执行清洗、标注、特征工程、数据增强、偏差矫正;训练与推理阶段搭建实时监控告警机制,自动识别缺失、异常、偏移数据;后期定期复盘数据集,迭代清洗与标注标准。配套技术包含自动化清洗工具、多模态特征提取、样本均衡算法、偏见检测模型,持续提升数据完整性、一致性、代表性。
2.数据安全与隐私治理
遵循数据最小化原则,搭建全生命周期安全防护体系。管理层面建立数据分级分类、风险评估、合规审计制度;技术层面综合运用数据脱敏、同态加密、安全多方计算、数字水印、对抗防御技术,抵御数据投毒、窃取、篡改;管控采集、训练、推理、存储各环节访问权限,留存操作日志满足GB/T 47507-2026可追溯、可问责要求,定期开展安全渗透测试。
3.数据伦理治理
核心消除数据内置偏见,保障AI输出公平无歧视。
制度上设立伦理审查委员会,制定数据采集、标注伦理规范;技术上部署偏见检测与矫正算法,筛查性别、地域、种族类歧视样本;流程上全程透明化,完整记录数据来源、标注规则,向利益相关方提供可解释依据,杜绝信息茧房、算法霸凌等问题,契合可信AI伦理符合性要求。
五、落地实施路径
基于DataOps一体化流程,DG4AI落地可依托DataOps数据研发运营一体化理念,搭建标准化流水线,分为五步执行:
1.明确需求与场景:联合业务、算法、数据团队确定AI应用目标,梳理数据类型、规模、质量标准,评估数据获取合规难度;
2.制定数据集规范:统一标注流程、质量指标、隐私保护策略,建立数据集版本、权限管理规范;
3.数据集加工研发:完成清洗、特征提取、标注、数据增强,定期开展跨团队验收,及时修正数据偏差;
4.数据集交付管理:归档数据集元数据,搭建检索系统,区分开放、私密数据管控访问权限;
5.持续运营优化:搭建数据监控看板,跟踪数据分布变化,根据模型迭代、业务更新持续扩充、清洗数据集,形成治理闭环。
六、行业实践验证与发展展望
从ChatGPT迭代、开源Ziya2到电力、热电行业垂直大模型实践,均可验证这套治理框架有效性。
GPT系列通过持续优化预训练、RLHF微调数据实现能力跃升;Ziya2依靠分阶段治理中英文、数学、代码语料,在中文评测指标大幅领先;能源行业企业聚焦行业源数据清洗、专业标注,让大模型适配巡检、负荷预测、产能调度等专属场景,充分证明以数据为中心的AI范式价值。
长远来看,面向人工智能的数据治理将呈现三大趋势:一是产业分工细化,数据集采集、加工、交易形成专业化赛道,减少重复建设;二是标准化、服务化发展,统一国内DG4AI标准体系,提供标准化语料治理服务;三是跨领域融合,将成熟治理框架应用于双碳、气候建模等细分领域,拓展数据治理应用边界。
同时,伴随可信AI国家标准落地,数据合规、公平、可追溯将成为所有AI产品硬性要求,数据治理将成为大模型产业竞争核心胜负手。
结语
大模型时代,模型算法架构逐步趋于成熟,数据质量与治理能力成为区分AI系统优劣的关键。面向人工智能的数据治理并非单一数据清洗工作,而是覆盖全生命周期、融合质量、安全、伦理的综合管控体系。
企业与机构需结合六阶段治理框架,依托DataOps流水线落地常态化治理,对标GB/T 47507-2026可信AI规范,在提升模型性能的同时守住合规、隐私、伦理底线,推动人工智能安全、可持续、高质量产业化发展。


