2025.6.5AI时代的石油
- 类比自动驾驶,数据对具身智能至关重要,优质数据集驱动智能体感知环境、加速模型训练,助力机器人完成复杂任务。
- 具身智能模型需多源异构数据(视觉、触觉、力觉、运动轨迹等),需通过机器人实操或仿真模拟采集,通用标准化数据集为行业刚需。
- 当前数据集多聚焦特定机器人 / 场景,通用性待提升,构建高质量、多样化数据集是基础工作。
- 真实数据:通过传感器在真实环境交互中采集,来源包括机器人遥操、动作捕捉,优势为高真实性,缺点是成本高、效率低。
- 仿真数据:虚拟环境生成,通过构建场景模拟交互,优势为低成本、高效率、可控性强,缺点是 “虚实差距” 需与真实数据互补。
一、投资要点
·数据是具身智能突破的关键
-
类比自动驾驶,数据对具身智能至关重要,优质数据集驱动智能体感知环境、加速模型训练,助力机器人完成复杂任务。
-
具身智能模型需多源异构数据(视觉、触觉、力觉、运动轨迹等),需通过机器人实操或仿真模拟采集,通用标准化数据集为行业刚需。
-
当前数据集多聚焦特定机器人 / 场景,通用性待提升,构建高质量、多样化数据集是基础工作。
·数据分类:真实数据与仿真数据
-
真实数据:通过传感器在真实环境交互中采集,来源包括机器人遥操、动作捕捉,优势为高真实性,缺点是成本高、效率低。
-
仿真数据:虚拟环境生成,通过构建场景模拟交互,优势为低成本、高效率、可控性强,缺点是 “虚实差距” 需与真实数据互补。
-
未来将混合使用两类数据,短期仿真数据解决简单任务(如运动),长期真实数据支撑复杂任务(如精细操作)。
·现状与开源数据集
-
高质量数据多为厂商自采,真机数据成本高昂(需设备、人力、时间),但开源数据集丰富(如智元、谷歌、国地共建中心等)。
-
仿真数据依赖场景生成引擎,技术路径包括 “合成视频 + 3D 重建”(如 Hillbot、群核科技)和 “AIGC 直接合成 3D 数据”(如 ATISS、DiffuScene)。
·投资方向观察与相关公司
- 具身智能数据集的企业:均胜电子(数据场)、海天瑞声(机器人数据集)、索辰科技(数据仿真)、华如科技(数据仿真)。
·风险提示
- 政策不及预期、企业 IT 预算不足、市场竞争加剧。
二、具身智能数据集基本概念
·四大关键因子
-
具身智能依赖算法、算力、机器人硬件、数据四大因子,其中数据是当前世界级难题。
-
算法:国内有 ChatGPT、Deepseek、通义千问等领先模型;算力:国外以英伟达、AMD 为主,国内寒武纪、海光信息等快速突围;硬件:中国产业链丰富;数据:需解决可交互数据的采集与训练问题。
·数据供给瓶颈
-
具身智能无法像大语言模型利用互联网数据,需通过实操或仿真采集多模态数据,且场景多元(本体形态、应用场景差异大),通用数据集稀缺。
-
数据集质量关键:采集标准、训练有效性、模型泛化能力,决定机器人 “智能” 水平。
·数据采集的价值与难点
-
价值:
-
促进通用智能形成:支持复杂环境任务能力;
-
增强环境理解:捕捉动态交互、力学反馈等多维信号;
-
支持任务迁移:提升模型从特定到通用任务的泛化能力;
-
提升实时决策:通过 “感知 - 理解 - 反馈” 闭环实现精准操作。
-
难点:
| 难点类别 | 描述 |
|---|---|
| 高昂成本 | 需专业设备、场景搭建、专家示教,单次成本远高于图像 / 文本数据 |
| 数据复杂性 | 多模态信息(图像、语音、力觉等),需高时空同步性与标注规范 |
| 覆盖面不足 | 现实场景复杂,难以覆盖全部潜在任务 |
| 仿真 - 现实差距 | 仿真策略难以直接迁移至真实机器人 |
| 设备差异性 | 不同机器人传感器类型、精度、采样率差异大,数据难以共享 |
三、国内外具身智能真实数据集现状
·数据采集方式
-
直接接触(真机数据):机器人本体直接交互采集,成本高但真实性强;
-
间接接触(人工控制):通过遥操或动作捕捉采集,效率较高但依赖人工。
·开源高质量数据集
| 数据集名称 | 发布机构 | 发布时间 | 演示数量 | 场景任务 | 动作技能 | 采集方式 |
|---|---|---|---|---|---|---|
| AgiBot World | 智元机器人、上海人工智能实验室 | 2024.12 | 100 + 万条 | 100 + 种 | 数百个 | 遥操作双臂机器人 + 灵巧手 |
| Open X-Embodiment | Google Deepmind 等 21 家机构 | 2023.10 | 140 万条 | 311 种 | 527 个 | 单臂 / 双臂 / 四足等 22 种机器人 |
| DROID | Stanford、UC Berkeley 等 13 家机构 | 2024.03 | 7.6 万条 | 564 种 | 86 个 | 遥操作单臂 |
| RT-1 | Google Deepmind | 2022.12 | 13.5 万条 | 2 种 | 2 个 | 遥操作单臂 |
| BridgeData V2 | UC Berkeley、Google 等 | 2023.09 | 6 万条 | 24 种 | 13 个 | 遥操作单臂 + 脚本编程 |
| RoboSet | CMU、Meta | 2023.09 | 9.85 万条 | 38 种 | 12 个 | 遥操作单机械臂 + 脚本编程 |
| BC-Z | Google、UC Berkeley、Stanford | 2022.02 | 2.6 万条 | 1 种 | 12 个 | 遥操作单机械臂 |
| MIME | CMU | 2018.10 | 8260 条 | 1 种 | 20 个 | 遥操作单机械臂 |
| ARIO | 鹏城实验室、南方科技大学等 | 2024.08 | 300 万条 | 258 种 | 345 个 | 遥操作主从双臂机器人 |
| RoboMIND | 国地中心、北京大学等 | 2024.12 | 5.5 万条 | 279 种 | 36 个 | 单臂 / 双臂 / 人形机器人 |
| RH20T | 上海交通大学 | 2023.07 | 11 万条 | 7 种 | 140 个 | 遥操作单臂 |
·典型数据集案例
智元:AgiBot World
-
全球首个百万真机数据集,基于全域真实场景(家居、餐饮、工业等),覆盖 100 + 场景、3000 + 操作对象,80% 为长程任务(60-150 秒)。
-
采集设备:移动式双臂机器人,配备 8 摄像头(360° 感知)、6 自由度灵巧手、六维力传感器,数据规模超谷歌 Open X-Embodiment 10 倍,质量达工业级标准。
谷歌:Open X-Embodiment
- 整合 60 个现有数据集,统一为 RLDS 格式,涵盖 22 种机器人形态、311 个场景、527 项技能,训练模型 RT-1-X(Transformer 架构)和 RT-2-X(视觉语言模型)。
国地共建中心:RoboMind
- 2024 年 12 月发布,支持多本体(单臂 / 双臂 / 人形机器人)、279 项任务、61 种物体,覆盖家居、厨房、工厂等场景,以真机数据为主,计划首批开源 10 万条。
特斯拉 Optimus
- 数据来源:VR 遥操 + 动捕手套采集人类操作数据,结合自动驾驶存量数据与高精度仿真数据,支持多任务训练。
国内首个数据采集标准
-
2024 年 11 月,国家地方共建中心牵头立项《人工智能 具身智能 数据采集规范》(国内首个行业标准),规范数据格式以促进共享开源。
-
2025 年 1 月,启用全国首个异构人形机器人训练场(上海),容纳 102 台机器人,支持多场景、多任务数据采集,推动数据标准化。
四、国内外具身智能仿真数据集现状
仿真数据技术路径
-
场景合成分为场景生成(Gen)与模拟(Sim),技术路径包括:
-
路线一:合成视频 + 3D 重建
-
流程:生成视频 / 图像→重建为点云 / Mesh→转为结构化语义模型。
-
代表:Hillbot(利用 NVIDIA Cosmos 生成视频 + SAPIEN 模拟器重建)、群核科技(酷家乐 3D 重建 + 物理仿真)、李飞飞 “World Models” 项目。
-
路线二:AIGC 直接合成 3D 数据
-
技术:图神经网络(GNN)、扩散模型(Diffusion)、注意力机制(Attention)+ 程序化生成。
-
代表:ATISS、LEGO-Net、DiffuScene、RoomFormer、Infinigen(CVPR 2024)。
典型企业与平台
·群核科技
-
技术:SpatialLM(空间理解模型)+SpatialVerse(物理正确模拟器),构建室内场景数据集,支持机器人训练叠被子、开关冰箱等任务。
-
数据:3.2 亿月活跃用户、7780 万设计方案,生成接近真实物理特性的虚拟环境。
Hillbot
-
核心:3D 生成式 AI + 自主模拟器 SAPIEN,通过文字提示生成 3D 对象,替换为仿真环境中的物理对象,实现低成本数据生成。
-
流程:NVIDIA Cosmos 生成视频→Sapien/ManiSkill 解析重建→标签化资产替换→物理仿真。
World Labs(李飞飞)
- 2024 年发布高保真仿真平台,生成逼近物理世界的 3D 环境建模,支持空间数据建模与动态交互推理。
智元:AgiBot Digital World
- 2025 年开源仿真框架,集成海量 3D 资产、专家轨迹生成机制,支持 5 类场景(家居 / 商超 / 办公 / 餐饮 / 工业)、180 + 物品、12 类原子技能(抓 / 放 / 推 / 拉等),生成高质量仿真数据。
Genesis(CMU)
- 2024 年开源生成式物理引擎,支持可微分模拟,兼容多种材料与机器人任务,生成速度较传统模拟器提升 81 倍(如模拟 106-DOF 网格时 FPS 达 2440 万)。
英伟达:Isaac Sim 4.5
- 结合 Cosmos 世界基础模型,生成可控合成数据,支持机器人感知训练;GR00T Blueprint 可通过少量人类示范生成大量轨迹数据。
仿真与真实数据互补关系
-
仿真数据优势:高效、低成本、可扩展,适合预训练;真实数据确保模型在现实中的可靠性,复杂任务必需。
-
技术框架:“3D 场景合成 + 仿真模拟 + 现实交互”(Sim2Real),通过数据混合提升模型泛化能力。
五、数据质量与标准化
质量要求与评价方法
-
中国信通院联合 34 家单位编制《具身智能数据集质量要求及评价方法》,指标包括完整性、一致性、多样性、真实性、易用性、实用性、可扩展性。
-
生产操作规范:覆盖数据采集、清洗、标注、管理、使用全流程;组织管理制度:人员培训、安全合规等机制。
首个行业标准发布
- 2024 年 11 月,《人工智能 具身智能 数据采集规范》立项,统一数据格式,推动开源共享;2024 年 12 月发布《具身智能标准化研究报告》《RoboMIND 数据集及评测报告》,指引行业发展。
六、相关公司
均胜电子
- 布局 “数据场”,聚焦机器人数据采集与处理,支持多场景数据闭环。
海天瑞声
- 提供机器人数据集,覆盖多模态数据采集、标注,适配具身智能模型训练需求。
索辰科技
- 专注数据仿真,提供物理引擎与虚拟场景生成解决方案,支持高效合成数据。
华如科技
- 深耕仿真技术,为具身智能提供场景模拟与数据生成服务,应用于工业、民生等领域。
七、风险提示
-
政策不及预期:具身智能相关政策推进可能受多方因素影响,节奏与力度低于预期。
-
企业 IT 预算不足:IT 支出影响数据采集、仿真平台建设进度,制约行业发展。
-
市场竞争加剧:行业前景广阔,可能吸引更多企业入局,导致技术同质化与价格竞争。