打印纸张 字号选择:超大 行高 带图打印 返回原文

首页 > 文库 理论大视野 时政

高质量数据集夯实人工智能发展数据底座

2026年07月27日 11:09

当前,人工智能正以前所未有的速度嵌入千行百业,成为发展新质生产力的重要引擎。然而,大模型训练、行业应用落地、智能系统迭代,都离不开高质量的海量数据。数据常被比作人工智能的“燃料”,但低质量、碎片化、不合规的数据非但不能驱动模型进步,反而会放大算法偏见、产生虚假信息、带来安全隐患。因此,深刻认识高质量数据集建设的战略意义,把握其基础性、紧迫性和全局性价值,是确保人工智能发展行稳致远必须回答好的重要命题。

从人工智能自身的技术发展规律来看,高质量数据集是突破其发展瓶颈的基础和前提。人工智能的突破依赖算法、算力和数据三大基石。近年来,我国在算法创新和算力部署上取得了长足进步,但数据层面的短板依然存在。事实上,互联网上规模庞大的公开数据虽然体量庞大,却充斥着噪声、偏差、重复和虚假信息,用这样的数据训练模型,极易出现“幻觉”、偏见甚至失控风险。与此同时,高价值的行业数据长期散落在不同主体之间,缺乏统一标准、规范标注和持续更新机制,形成了形态各异的“数据孤岛”。没有高质量数据集,再先进的算法和再强大的算力也难以发挥作用。建设高质量数据集,就是要系统性地开展数据采集、清洗、去噪、标注、增强、对齐和质检等工作,构建覆盖文本、图像、音频、视频等多模态、多领域、多场景的标准化数据集。只有筑牢这一技术根基,才能确保人工智能技术迭代不偏离技术发展规律、不陷入低水平重复。

从数据要素市场化改革的深层逻辑来看,高质量数据集是优化数据治理、释放数据要素价值的关键载体。数据要真正成为生产要素,不能止步于原始记录,必须经过治理、加工和标注等环节,形成可流通、可交易、可保护隐私的高质量数据集。当前,数据确权、定价、流通等制度仍在探索中,高质量数据集建设恰恰可以成为数据要素市场化的“先导工程”。通过建立数据质量评估体系、分级分类标准和合规流通机制,高质量数据集能够以产品化、资产化的形式进入市场,激发数据供给端的积极性,带动数据清洗、标注、审计、安全等新兴服务业态发展。更为重要的是,建设高质量数据集可以倒逼数据治理能力提升。通过明确数据采集、标注等各环节的责任主体与合规标准,推动形成可追溯、可审计的数据治理闭环,为人工智能的健康发展和规范应用提供可操作的制度保障,避免因数据质量问题引发系统性风险。

从人工智能赋能千行百业的现实需求来看,高质量数据集是推动“人工智能+”行动落地的重要要素。“人工智能+”的本质不是堆砌技术概念,而是把人工智能嵌入生产流程、管理决策和服务体系,实现降本、提质、增效与创新。然而,不同行业的业务逻辑、数据形态和合规要求千差万别,通用大模型难以直接适配特定场景。只有依托高质量、高相关性、高标注精度的行业数据集,才能训练出真正懂行业、懂业务、懂场景的专业模型。在医疗领域,高质量医学影像和电子病历数据集是辅助诊断、药物研发模型落地的先决条件;在金融风险防控方面,时序完整、标注精准、覆盖长周期的交易数据集,直接决定了反欺诈模型的识别能力;在自动驾驶领域,涵盖各类路况、天气和边缘场景的高质量视频数据集,更是安全驾驶模型的命脉所在。当前,我国不少行业仍缺乏公开、规范的数据集,导致“人工智能+”行动在落地时面临“数据荒”“标注难”“适配慢”等现实困境。加快建设面向重点行业的高质量数据集,推动公共数据、行业数据、企业数据的有序开放与安全共享,正是打通“人工智能+”赋能通道的关键所在。

从全球科技竞争的战略格局来看,高质量数据集是提升我国人工智能国际竞争力的必争之地。全球人工智能竞争,在深层次上是数据治理能力和数据质量的较量。现阶段,主要发达国家竞相抢占全球数据治理规则主导权,纷纷将数据视为核心战略资源加快前瞻布局。我国拥有超大规模市场优势和海量数据资源,若不能将其转化为高质量、高价值、可机读的数据集,就可能在国际竞争中受制于人。建设高质量数据集,有助于构建自主可控的人工智能数据底座,是支撑人工智能技术迭代升级、实现高水平科技自立自强的必然要求。

(作者系中国社会科学院大学政府管理学院教授)

文章来源:http://www.71.cn/2026/0727/1297802.shtml