• 我的订阅
  • 科技

建设高质量数据集,让人工智能更聪明(新视点)

类别:科技 发布时间:2025-05-21 06:01:00 来源:人民资讯

本文转自:人民日报

什么是高质量数据集?简单来说,就是高价值、高密度、标准化的数据。

“数据之于大模型,就像石油之于汽车。原油只有经过一系列复杂的过程炼化成汽油后,才能供汽车使用。同样,海量原始数据需要经过‘炼化’形成高质量数据集,才能助力大模型精准学习数据特征与规律,有效提升其对不同场景和任务的适应能力。”中国信息通信研究院副院长魏亮告诉记者,数据集的质量影响人工智能的“智商”,近期发布的深度求索系列模型训练中,大量使用了高质量推理数据集,凸显了高质量数据的重要性,“大模型与垂直领域深度融合,同样也需高质量数据集的支撑。”

建设高质量数据集,有关方面在积极行动。国家数据局等17部门联合印发的《“数据要素×”三年行动计划(2024—2026年)》提出,“推动科研机构、龙头企业等开展行业共性数据资源库建设,打造高质量人工智能大模型训练数据集”。第八届数字中国建设峰会上,国务院国资委发布首批10余个行业、30项央企人工智能行业高质量数据集,涵盖了电网调度AI负荷预测数据集、核电SPV设备健康诊断、运行异常及故障预测数据集、金融大模型数据集等。

“随着基础模型开源态势的形成,各方在算力和模型算法层面的差距正在不断收窄,数据要素价值更加凸显,已成为人工智能竞争的核心领域。”国务院国资委规划发展局副局长胡武婕表示,要推动行业高质量数据集加速汇聚共享,为人工智能产业提供充足“养分”,从而持续进行不同场景的训练优化,推动基础模型在千行百业落地应用。

目前,高质量数据集建设还存在不少挑战。魏亮说,一方面,行业大模型对数据的需求多样,不同行业部门对模型场景数据的需求各不相同,增加了数据处理和管理的复杂度。另一方面,在行业大模型的实际建设中,对于构建和采买的数据没有统一衡量标准,不同行业、不同数据源的数据完整性和准确性可能参差不齐,影响了大模型的训练效果和预测准确性,造成训练资源浪费。

4月30日,《高质量数据集建设指南(征求意见稿)》发布。全国数据标准化技术委员会提出,将强化标准引领,分三类建设高质量数据集:一类为“通识数据集”,包含面向社会公众、无需专业背景即可理解的通用知识,主要用于支撑通用模型落地应用;一类为“行业通识数据集”,包含面向行业从业人员、需要一定专业背景才能理解的行业领域通用知识,主要用于支撑行业模型落地应用;一类为“行业专识数据集”,包含面向特定业务场景相关人员、需要较深的专业背景才能理解的行业领域专业知识,主要用于支撑业务场景模型落地应用。

国家数据局副局长夏冰表示,数据集的质效提升是人工智能赋能实体经济的“催化剂”,下一步,国家数据局将构建部际联通、央地协同的工作机制,推动高质量数据集标准体系研究,促进数据、技术、场景对接,构建多元协同的数据标注产业生态,夯实人工智能发展数据根基。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2025-05-21 08:45:03

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

本文转自:人民日报我国人工智能核心产业企业数量超过四千五百家运营商加快布局人工智能(新视点)本报记者 王 政《 人民日报 》( 2024年10月30日 第 18 版)一句话唤起应
2024-10-30 06:24:00
...制造加快发展。三维可视化仿真技术、大数据模型、局部人工智能应用在钢企逐步扩大应用,利用工业互联网技术实现智能化生产过程管控和智慧化企业运营管理的企业分别达到79.6%和57.
2024-09-04 07:13:00
...。2023年全国数据生产总量达32.85泽字节,同比增长22.44%,人工智能等数据驱动的技术创新加速突破,数据产业和服务向各行业领域广泛渗透,新产品、新模式、新业态持续涌现
2024-09-18 06:30:00
...》等2个项目入选广东省科技计划项目;获批参与《面向人工智能生成视听内容监管技术方法与机制研究》等4项2023年广电总局中长期计划项目;被广东省工业和信息化厅认定为2023年专
2024-05-23 21:01:00
...全球第一,产品应用于政务、金融等领域。置身科大讯飞人工智能体验馆,各种智能场景让人眼前一亮:讯飞工业听诊系统靠“听声”诊断设备异常、星火大模型已装车近6000万辆、智慧教育服
2024-05-29 07:42:00
...,产业规模接近3万亿元物联网应用不断拓展广度深度(新视点)本报记者 刘温馨《 人民日报 》( 2023年09月20日 第 18 版)河北廊坊临空经济区,每根灯杆、每个水表、每
2023-09-20 06:30:00
...民政府同意,近日,省人民政府办公厅印发《贵州省推动人工智能高质量发展行动方案(2025—2027年)》,全文如下:贵州省推动人工智能高质量发展行动方案(2025—2027年)
2025-01-08 01:00:00
本文转自:人民日报本报记者  王云杉开通运营!近日,太原轨道交通1号线正式开通初期运营,与既有2号线形成“力”字轨道交通网络架构,太原地铁由此进入“换乘时代”。顺利贯通!2月25
2025-03-12 06:02:00
AI数据服务助推人工智能行业高速发展
...,二十届中央财经委员会第一次会议召开,会上提出要把握人工智能等新科技革命浪潮,适应人与自然和谐共生的要求,保持并增强产业体系完备和配套能力强的优势,高效集聚全球创新要素,推进
2023-05-11 12:00:00
更多关于科技的资讯:
中国优秀AI企业2026年展望:AI技术迭代深化引领商业化规模化落地 全球AI产业进入技术深耕与商业化兑现双轮加速期,中国优秀AI企业迎来价值释放关键窗口
2026-01-16 17:14:00
8个省级高质量数据集、324家省级“晨星工厂” 临沂扎实筑牢“人工智能+”发展根基
鲁网1月16日讯 (记者 李文静)数据是赋能人工智能训练的原材料。1月16日上午,临沂市人民政府新闻办公室召开新闻发布会
2026-01-16 17:18:00
中新经纬1月16日电 题:中国电影IP的长期主义,还缺什么?作者 张志鹏 中国广告协会文创与IP专业委员会副主任近日,玩具制造商桑尼森迪正式递表港交所
2026-01-16 17:22:00
贾国龙最新发声:今晚10点 将就罗永浩对西贝的重大污蔑诽谤全面回应
华商网讯 1月16日,西贝贾国龙发文称,将就罗永浩对西贝的重大污蔑诽谤一一全面回应。据了解,此前,1月16日,罗永浩再次发长文回应西贝贾国龙近日言论
2026-01-16 18:46:00
第七届皖新传媒读者节全省启动
大皖新闻讯 1月17日起,以“阅见万象 奔向前程”为主题的第七届皖新传媒读者节在全省新华书店市、县门店正式拉开帷幕,活动将持续至2月1日
2026-01-16 18:55:00
双主题活动+三重深度体验,金鸡湖教育集团科技节展现赋能成长新路径
江南时报讯 当知识课堂与前沿科技相遇,当学校携手行业大咖跨界联动,金鸡湖教育集团的科技节彻底点燃了整个校园。两大主题活动
2026-01-16 17:06:00
刘典(学者)2025年春天,《杭州模式:DeepSeek与中国算谷》出版了。对我而言,一本书写完了,从来不是结束,而是带着这些思考
2026-01-16 16:56:00
时间枝头 生活向新
这些关于“具体生活”的探索与坚守,既是过往一年的珍贵注脚,更铺就了通往新岁的温暖底色。 吴卓平回顾过去这一年,杭州的文化
2026-01-16 16:56:00
苏州黄埭镇新型电力电子OPC创新社区启动
江南时报讯1月15日,位于苏州市相城区黄埭镇的新型电力电子OPC创新社区正式启动。作为相城区的工业重镇,黄埭镇拥有深厚的制造业底蕴和完善的产业链配套
2026-01-16 16:56:00
千问App大规模功能上新,实现一句话找真题、讲难题
1月15日,千问App实现大规模功能上新,支持用一句话实现超过400项任务。其中,学习领域的“办事力”显著增强,用户只需一句话即可找卷子
2026-01-16 14:00:00
Z世代购物车|排队两小时!“年轻人的十字绣”为何火热?
中新经纬1月16日电 (王玉玲)一种名为“拼豆”的手工像素画在社交平台上持续火热。在小红书上,话题“我染上了拼豆”浏览量近28亿次
2026-01-16 14:23:00
赋能全民数字素养:AI学联社在杭正式启航 助推人工智能能力平权
随着生成式人工智能(AIGC)在全球范围内触发生产力变革,如何让AI技术从“实验室”走入“百姓家”,成为数字经济高质量发展的关键命题
2026-01-16 14:53:00
健康消费成新春主流,龙角散“健康新年糖”引领年货新趋势
农历新年临近,年货采购逐渐进入高潮。与以往追求包装喜庆、口味传统的年货选择不同,一股“健康化”风潮正悄然改变着春节消费市场
2026-01-16 15:27:00
可操控格斗机器人对战!2026安庆AI机器人科技展将展出百余件AI机器人
大皖新闻讯讯 1月16日,记者从2026安庆AI机器人科技展发布会上获悉,为展示我国在AI机器人科技领域所取得的成就
2026-01-16 15:29:00
“智齿智能客服”完成生成式人工智能服务登记
近日,北京市互联网信息办公室(网信办)发布了《北京市生成式人工智能服务已登记信息公告( 12 月 26 日)》,公告显示
2026-01-16 15:29:00