• 我的订阅
  • 科技

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

类别:科技 发布时间:2024-08-24 09:32:00 来源:机器之心Pro

AIxiv专栏是机器之心发布学术、技术内容的栏目。过去数年,机器之心AIxiv专栏接收报道了2000多篇内容,覆盖全球各大高校与企业的顶级实验室,有效促进了学术交流与传播。如果您有优秀的工作想要分享,欢迎投稿或者联系报道。投稿邮箱:liyazhou@jiqizhixin.com;zhaoyunfeng@jiqizhixin.com

该论文作者来自于鹏城实验室多智能体与具身智能研究所及南方科技大学、中山大学的师生团队,包括林倞教授(研究所所长,国家杰青,IEEE Fellow),郑锋教授,梁小丹教授,王志强(南科大),郑浩(南科大),聂云双(中大),徐文君(鹏城),叶华(鹏城)等。鹏城实验室林倞教授团队致力于打造多智能体协同与仿真训练平台、云端协同具身多模态大模型等通用基础平台,赋能工业互联网、社会治理与服务等重大应用需求。

今年以来,具身智能正在成为学术界和产业界的热门领域,相关的产品和成果层出不穷。今天,鹏城实验室多智能体与具身智能研究所(以下简称鹏城具身所)联合南方科技大学、中山大学正式发布并开源其最新的具身智能领域学术成果 ——ARIO(All Robots In One)具身大规模数据集,旨在解决当前具身智能领域所面临的数据获取难题。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

论文题目:All Robots in One: A New Standard and Unified Dataset for Versatile.General-Purpose Embodied Agents 论文链接:http://arxiv.org/abs/2408.10899 项目主页:https://imaei.github.io/project_pages/ario/ 鹏城实验室具身所网站链接:https://imaei.github.io/

作为具身机器人的大脑,想要让具身大模型的性能更优,关键在于能否获得高质量的具身大数据。不同于大语言模型或视觉大模型用到的文本或图像数据,具身数据无法从互联网海量内容中直接获取,而需通过真实的机器人操作来采集或高级仿真平台生成,因此具身数据的采集需要较高的时间和成本,很难达到较大的规模。

同时,当前开源的数据集也存在多项不足,如上表所示,JD ManiData、ManiWAV 和 RH20T 本身数据量不大,DROID 数据用到的机器人硬件平台比较单一,Open-X Embodiment 虽然达到了较大规模的数据量,但其感知数据模态不够丰富,而且子数据集之间的数据格式不统一,质量也参差不齐,使用数据之前需要花大量时间进行筛选和处理,难以满足复杂场景下具身智能模型的高效率和针对性的训练需求。

相比而言,此次发布的 ARIO 数据集,包含了2D、3D、文本、触觉、声音 5 种模态的感知数据,涵盖操作和导航两大类任务,既有仿真数据,也有真实场景数据,并且包含多种机器人硬件,有很高的丰富度。在数据规模达到三百万的同时,还保证了数据的统一格式,是目前具身智能领域同时达到高质量、多样化和大规模的开源数据集。

对于具身智能的数据集而言,由于机器人有多种形态,如单臂、双臂、人形、四足等,并且感知和控制方式也各不相同,有些通过关节角度控制,有些则是通过本体或末端位姿坐标来驱动,所以具身数据本身比单纯的图像和文本数据要复杂很多,需要记录很多控制参数。而如果没有一个统一的格式,当多种类型的机器人数据聚合到一起,需要花费大量的精力去做额外的预处理。

因此鹏城实验室具身所首先设计了一套针对具身大数据的格式标准,该标准能记录多种形态的机器人控制参数,并且有结构清晰的数据组织形式,还能兼容不同帧率的传感器并记录对应的时间戳,以满足具身智能大模型对感知和控制时序的精确要求。下图展示了 ARIO 数据集的总体设计。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

图 1. ARIO 数据集总体设计

ARIO 数据集,共有 258 个场景序列,321064 个任务,303 万个样例。ARIO 的数据有 3 大来源,一是通过布置真实环境下的场景和任务进行真人采集;二是基于 MuJoCo、Habitat 等仿真引擎,设计虚拟场景和物体模型,通过仿真引擎驱动机器人模型的方式生成;三是将当前已开源的具身数据集,逐个分析和处理,转换为符合 ARIO 格式标准的数据。下面展示了 ARIO 数据集的具体构成,以及 3 个来源的流程和示例。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

图 2. ARIO 数据 3 个来源

真实场景的高质量的机器人数据不易获取,但意义重大。鹏城实验室基于 Cobot Magic 主从双臂机器人,设计了 30 多种任务,包括简单 —— 中等 —— 困难 3 个操作难易等级,并通过增加干扰物体、随机改变物体和机器人位置、改变布置环境等方式增加样例的多样性,最终得到 3000 多条包含 3 个 rgbd 相机的轨迹数据。下面展示了不同任务的采集示例以及采集视频。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

图 3. ARIO 真实机器人数据采集示例

得益于 ARIO 数据的统一格式设计,能够很方便地对它的数据组成进行统计分析。下图展示了从 series、task、episode 三个层面对 ARIO 的场景(图 a)和技能(图 b)的分布进行统计。从中可见,目前大部分的具身数据都集中在室内生活家居环境中的场景和技能。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

除了场景和技能,在 ARIO 数据中,还能从机器人本身的角度进行统计分析,并从中了解当前机器人行业的一些发展态势。 ARIO 数据集提供了机器人形态、运动对象、物理控制变量、传感器种类和安装位置、视觉传感器的数量、控制方式比例、数据采集方式比例、机械臂自由度数量比例的统计数据,对应下图 a-i。

以下图 a 为例,从中可以发现,当前大部分的数据来源于单臂机器人,人形机器人的开源数据很少,且主要来源于鹏城实验室的真实采集和仿真生成。

总说具身智能的数据太贵,鹏城实验室开源百万规模标准化数据集

图 5.ARIO 数据集分类统计

更多关于 ARIO 数据集的详细信息与下载链接,请参考论文原文与项目主页。

以上内容为资讯信息快照,由td.fyun.cc爬虫进行采集并收录,本站未对信息做任何修改,信息内容不代表本站立场。

快照生成时间:2024-08-24 11:45:03

本站信息快照查询为非营利公共服务,如有侵权请联系我们进行删除。

信息原文地址:

...户真实评价数据, 2021年承接文化和旅游部旅游服务质量标准化研究项目,推动行业标准落地,在数据分析和标准研究方面有较好的理论基础。基于此,实验室综合运用云计算、大数据、NL
2022-12-21 06:55:00
...特色实验教学空间和功能室建设得到系统加强,教育装备标准化、信息化、现代化水平明显提升,基本建成与经济社会发展、高质量教育体系建设相适应的设施设备支撑体系。具体将从三个方面着手
2024-06-17 09:06:00
...:科技日报国内智能计算标准制定工作尚处于起步阶段,标准化工作对智能计算及相关产业的发展具有基础性、支撑性、引领性作用,是推动智能计算产业创新发展的关键抓手。◎本报记者 江耘
2023-07-10 02:35:00
数智化实验室,解放研发人员双手
...化实验取代大量人类操作环节,增强实验过程的精确度、标准化与一致性,从而提高人类的创新能力与效率,驱动AI算法在更广阔的化学空间中搜索和设计新药。记者在实验室内看到,百余台机器
2024-05-24 06:20:00
盛元广通中小型检测机构实验室信息管理系统LIMS
随着实验室的发展,用标准化管理当前的实验室,是为实验室的进一步提高科研发展水平做准备。对于中小型检测机构,选择适合其规模和需求的LIMS系统是很重要的。让样品登记,实验室数据,结
2023-08-28 11:22:00
英博云多款智算产品发布,首提「单位有效算力成本」新指标
...本”这一评价体系及计算公式,为行业提供了一套全新的标准化评估体系。与传统以装机算力、设备成本、机电成本和运维成本等固定支出为核心的评价体系不同,“单位有效算力成本”将评价重点
2024-12-13 14:47:00
盛元广通基因测序实验室管理系统
...中,确保数据的完整性和可访问性。确保数据的一致性和标准化对于不同系统间的信息互通至关重要。■质量控制确保实验室内的操作流程标准化和规范化,包括样本处理、实验操作、数据采集和存
2023-12-11 11:36:00
浪潮KaiwuDB 联合信通院数据库应用创新实验室召开数据库技术研讨沙龙
...据库技术有限公司联合数据库应用创新实验室、中国通信标准化协会大数据技术标准推进委员会(CCSA TC601)主办的“夯实数据库技术底座,探索智能时代发展新篇章”主题技术沙龙在
2023-10-27 17:45:00
...亚、丹麦、荷兰等7个国家直接采标应用,被德国工业4.0标准化组织推荐使用……“新一代科技革命就是要让工厂里所有设备通过物联网技术进行连接,像手机与手机之间一样‘自由通信’。”
2024-04-16 04:17:00
更多关于科技的资讯:
聚力突破·破局增长|装库科技礼包事业部金九银十启动会成功举办
8月29日,装库科技礼包事业部在中国·成都举办“聚力突破·破局增长”金九银十启动会。来自全国的团队成员齐聚一堂,通过董事长致辞
2025-09-02 09:17:00
以“智”赋能,济南机器人产业加速奔跑
大众网记者 赵晓丹 济南报道近年来,济南市将机器人产业作为标志性产业链重点培育,通过政策引导、生态构建与企业攻坚“三力齐发”
2025-09-02 09:53:00
8月20日3时,在开滦股份吕家坨矿新副井800米井筒深处,一条敷设在罐道上的光纤精准捕捉到一组异常声波频率。30秒后,位于提升机车房的数据分析基站屏幕显示
2025-09-02 10:05:00
河北新闻网讯(闫丽颖、唐福刚)2025年以来,开滦股份范各庄矿秉持科技保安、科技兴安理念,大力推广顶板智能动态监测系统
2025-09-02 10:13:00
南京六家企业入选国家级5G工厂江宁开发区企业占据“半壁江山”南报网讯(通讯员毛欣悦记者张希)近日,工信部对《2025年5G工厂名录》进行公示
2025-09-02 07:36:00
烟台联通全力保障2025秋季开学通信畅通
胶东在线8月29日讯随着2025年秋季开学季的到来,烟台各大高校陆续迎来返校师生。为保障新学期校园网络高效稳定运行,烟台联通充分利用暑假关键窗口期
2025-09-02 05:00:00
科大讯飞亮相2025未来外贸大会,AI翻译成破局外贸新蓝海关键引擎
8月26日,2025未来外贸大会在广州白云国际会议中心顺利举行,大会主题为“本地账户链全球,共拓外贸新蓝海”。本次大会由中国B2B外贸金融平台XTransfer主办
2025-09-01 11:12:00
聚焦数博会丨丰浩建设科技:引领建筑行业数字化变革
2025中国国际大数据产业博览会吸引了全球目光,来自江苏常州的江苏丰浩建设科技有限公司作为建筑科技领域的创新先锋,携前沿技术与创新成果精彩亮相
2025-09-01 11:37:00
今年以来,广东南粤银行中山分行积极响应国家科技自立自强战略部署,深度融入区域科技创新生态建设,以科技金融为重要抓手,持续优化服务模式
2025-09-01 14:14:00
华为XMAGE“共见·安吉”:持续推动移动影像技术突破与美学共鸣
8月29日至31日,华为XMAGE“共见·安吉”影像主题活动在浙江安吉举办,华为研发专家与全球专业摄影师围绕移动影像技术发展与创作实践展开深度交流
2025-09-01 14:14:00
不止玫瑰与黄金 七夕\
消费日报网讯(记者马佳丽)今年七夕节,消费市场热度依旧,不仅各类商品成交量显著增长,更反映出人们在情感表达上的多元化与升级趋势
2025-09-01 15:18:00
第六代市场未开先火,铺火,支付更火
在义乌,一场激烈的 “战争” 正在悄然上演。义乌第六代市场核心项目全球数贸中心迎来招商热潮,自 6 月起分批启动的招投标阶段
2025-09-01 15:23:00
2025年以来,中国光大银行坚持以客户为中心,将数字技术深度融入业务创新与运营,聚焦“光大云缴费”、手机银行、“薪悦通”等平台
2025-09-01 15:27:00
ICML 2025收录作业帮成果:大模型能量基偏好模型领跑教育适配
日前,第42届国际机器学习大会(ICML 2025)在加拿大温哥华会议中心盛大举行,基于在前沿技术领域的多年探索与深耕
2025-09-01 15:33:00
榆树炸鸡腿与美团达成战略合作,携手赋能数字化升级
近日,知名中式炸鸡品牌榆树炸鸡腿与生活服务领域巨头美团正式签署战略合作协议。双方宣布将围绕物联网应用、大数据分析、企业规范化管理及外卖业务优化等核心领域展开深度融合
2025-09-01 15:33:00