← 返回历史研报
LEGACY REPORT / #108行业分析

2025.6.5AI时代的石油

报告摘要SUMMARY
  1. 类比自动驾驶,数据对具身智能至关重要,优质数据集驱动智能体感知环境、加速模型训练,助力机器人完成复杂任务。
  2. 具身智能模型需多源异构数据(视觉、触觉、力觉、运动轨迹等),需通过机器人实操或仿真模拟采集,通用标准化数据集为行业刚需。
  3. 当前数据集多聚焦特定机器人 / 场景,通用性待提升,构建高质量、多样化数据集是基础工作。
  4. 真实数据:通过传感器在真实环境交互中采集,来源包括机器人遥操、动作捕捉,优势为高真实性,缺点是成本高、效率低。
  5. 仿真数据:虚拟环境生成,通过构建场景模拟交互,优势为低成本、高效率、可控性强,缺点是 “虚实差距” 需与真实数据互补。
约 11 分钟历史公开研报原始页面 ↗

一、投资要点

·数据是具身智能突破的关键

  1. 类比自动驾驶,数据对具身智能至关重要,优质数据集驱动智能体感知环境、加速模型训练,助力机器人完成复杂任务。

  2. 具身智能模型需多源异构数据(视觉、触觉、力觉、运动轨迹等),需通过机器人实操或仿真模拟采集,通用标准化数据集为行业刚需。

  3. 当前数据集多聚焦特定机器人 / 场景,通用性待提升,构建高质量、多样化数据集是基础工作。

·数据分类:真实数据与仿真数据

  1. 真实数据:通过传感器在真实环境交互中采集,来源包括机器人遥操、动作捕捉,优势为高真实性,缺点是成本高、效率低。

  2. 仿真数据:虚拟环境生成,通过构建场景模拟交互,优势为低成本、高效率、可控性强,缺点是 “虚实差距” 需与真实数据互补。

  3. 未来将混合使用两类数据,短期仿真数据解决简单任务(如运动),长期真实数据支撑复杂任务(如精细操作)。

·现状与开源数据集

  1. 高质量数据多为厂商自采,真机数据成本高昂(需设备、人力、时间),但开源数据集丰富(如智元、谷歌、国地共建中心等)。

  2. 仿真数据依赖场景生成引擎,技术路径包括 “合成视频 + 3D 重建”(如 Hillbot、群核科技)和 “AIGC 直接合成 3D 数据”(如 ATISS、DiffuScene)。

·投资方向观察与相关公司

  1. 具身智能数据集的企业:均胜电子(数据场)、海天瑞声(机器人数据集)、索辰科技(数据仿真)、华如科技(数据仿真)。

·风险提示

  1. 政策不及预期、企业 IT 预算不足、市场竞争加剧。

二、具身智能数据集基本概念

·四大关键因子

  1. 具身智能依赖算法、算力、机器人硬件、数据四大因子,其中数据是当前世界级难题

  2. 算法:国内有 ChatGPT、Deepseek、通义千问等领先模型;算力:国外以英伟达、AMD 为主,国内寒武纪、海光信息等快速突围;硬件:中国产业链丰富;数据:需解决可交互数据的采集与训练问题。

·数据供给瓶颈

  1. 具身智能无法像大语言模型利用互联网数据,需通过实操或仿真采集多模态数据,且场景多元(本体形态、应用场景差异大),通用数据集稀缺。

  2. 数据集质量关键:采集标准、训练有效性、模型泛化能力,决定机器人 “智能” 水平。

·数据采集的价值与难点

  1. 价值

  2. 促进通用智能形成:支持复杂环境任务能力;

  3. 增强环境理解:捕捉动态交互、力学反馈等多维信号;

  4. 支持任务迁移:提升模型从特定到通用任务的泛化能力;

  5. 提升实时决策:通过 “感知 - 理解 - 反馈” 闭环实现精准操作。

  6. 难点

难点类别 描述
高昂成本 需专业设备、场景搭建、专家示教,单次成本远高于图像 / 文本数据
数据复杂性 多模态信息(图像、语音、力觉等),需高时空同步性与标注规范
覆盖面不足 现实场景复杂,难以覆盖全部潜在任务
仿真 - 现实差距 仿真策略难以直接迁移至真实机器人
设备差异性 不同机器人传感器类型、精度、采样率差异大,数据难以共享

三、国内外具身智能真实数据集现状

·数据采集方式

  1. 直接接触(真机数据):机器人本体直接交互采集,成本高但真实性强;

  2. 间接接触(人工控制):通过遥操或动作捕捉采集,效率较高但依赖人工。

·开源高质量数据集

数据集名称 发布机构 发布时间 演示数量 场景任务 动作技能 采集方式
AgiBot World 智元机器人、上海人工智能实验室 2024.12 100 + 万条 100 + 种 数百个 遥操作双臂机器人 + 灵巧手
Open X-Embodiment Google Deepmind 等 21 家机构 2023.10 140 万条 311 种 527 个 单臂 / 双臂 / 四足等 22 种机器人
DROID Stanford、UC Berkeley 等 13 家机构 2024.03 7.6 万条 564 种 86 个 遥操作单臂
RT-1 Google Deepmind 2022.12 13.5 万条 2 种 2 个 遥操作单臂
BridgeData V2 UC Berkeley、Google 等 2023.09 6 万条 24 种 13 个 遥操作单臂 + 脚本编程
RoboSet CMU、Meta 2023.09 9.85 万条 38 种 12 个 遥操作单机械臂 + 脚本编程
BC-Z Google、UC Berkeley、Stanford 2022.02 2.6 万条 1 种 12 个 遥操作单机械臂
MIME CMU 2018.10 8260 条 1 种 20 个 遥操作单机械臂
ARIO 鹏城实验室、南方科技大学等 2024.08 300 万条 258 种 345 个 遥操作主从双臂机器人
RoboMIND 国地中心、北京大学等 2024.12 5.5 万条 279 种 36 个 单臂 / 双臂 / 人形机器人
RH20T 上海交通大学 2023.07 11 万条 7 种 140 个 遥操作单臂

·典型数据集案例

智元:AgiBot World

  1. 全球首个百万真机数据集,基于全域真实场景(家居、餐饮、工业等),覆盖 100 + 场景、3000 + 操作对象,80% 为长程任务(60-150 秒)。

  2. 采集设备:移动式双臂机器人,配备 8 摄像头(360° 感知)、6 自由度灵巧手、六维力传感器,数据规模超谷歌 Open X-Embodiment 10 倍,质量达工业级标准。

谷歌:Open X-Embodiment

  1. 整合 60 个现有数据集,统一为 RLDS 格式,涵盖 22 种机器人形态、311 个场景、527 项技能,训练模型 RT-1-X(Transformer 架构)和 RT-2-X(视觉语言模型)。

国地共建中心:RoboMind

  1. 2024 年 12 月发布,支持多本体(单臂 / 双臂 / 人形机器人)、279 项任务、61 种物体,覆盖家居、厨房、工厂等场景,以真机数据为主,计划首批开源 10 万条。

特斯拉 Optimus

  1. 数据来源:VR 遥操 + 动捕手套采集人类操作数据,结合自动驾驶存量数据与高精度仿真数据,支持多任务训练。

国内首个数据采集标准

  1. 2024 年 11 月,国家地方共建中心牵头立项《人工智能 具身智能 数据采集规范》(国内首个行业标准),规范数据格式以促进共享开源。

  2. 2025 年 1 月,启用全国首个异构人形机器人训练场(上海),容纳 102 台机器人,支持多场景、多任务数据采集,推动数据标准化。

四、国内外具身智能仿真数据集现状

仿真数据技术路径

  1. 场景合成分为场景生成(Gen)与模拟(Sim),技术路径包括:

  2. 路线一:合成视频 + 3D 重建

  3. 流程:生成视频 / 图像→重建为点云 / Mesh→转为结构化语义模型。

  4. 代表:Hillbot(利用 NVIDIA Cosmos 生成视频 + SAPIEN 模拟器重建)、群核科技(酷家乐 3D 重建 + 物理仿真)、李飞飞 “World Models” 项目。

  5. 路线二:AIGC 直接合成 3D 数据

  6. 技术:图神经网络(GNN)、扩散模型(Diffusion)、注意力机制(Attention)+ 程序化生成。

  7. 代表:ATISS、LEGO-Net、DiffuScene、RoomFormer、Infinigen(CVPR 2024)。

典型企业与平台

·群核科技

  1. 技术:SpatialLM(空间理解模型)+SpatialVerse(物理正确模拟器),构建室内场景数据集,支持机器人训练叠被子、开关冰箱等任务。

  2. 数据:3.2 亿月活跃用户、7780 万设计方案,生成接近真实物理特性的虚拟环境。

Hillbot

  1. 核心:3D 生成式 AI + 自主模拟器 SAPIEN,通过文字提示生成 3D 对象,替换为仿真环境中的物理对象,实现低成本数据生成。

  2. 流程:NVIDIA Cosmos 生成视频→Sapien/ManiSkill 解析重建→标签化资产替换→物理仿真。

World Labs(李飞飞)

  1. 2024 年发布高保真仿真平台,生成逼近物理世界的 3D 环境建模,支持空间数据建模与动态交互推理。

智元:AgiBot Digital World

  1. 2025 年开源仿真框架,集成海量 3D 资产、专家轨迹生成机制,支持 5 类场景(家居 / 商超 / 办公 / 餐饮 / 工业)、180 + 物品、12 类原子技能(抓 / 放 / 推 / 拉等),生成高质量仿真数据。

Genesis(CMU)

  1. 2024 年开源生成式物理引擎,支持可微分模拟,兼容多种材料与机器人任务,生成速度较传统模拟器提升 81 倍(如模拟 106-DOF 网格时 FPS 达 2440 万)。

英伟达:Isaac Sim 4.5

  1. 结合 Cosmos 世界基础模型,生成可控合成数据,支持机器人感知训练;GR00T Blueprint 可通过少量人类示范生成大量轨迹数据。

仿真与真实数据互补关系

  1. 仿真数据优势:高效、低成本、可扩展,适合预训练;真实数据确保模型在现实中的可靠性,复杂任务必需。

  2. 技术框架:“3D 场景合成 + 仿真模拟 + 现实交互”(Sim2Real),通过数据混合提升模型泛化能力。

五、数据质量与标准化

质量要求与评价方法

  1. 中国信通院联合 34 家单位编制《具身智能数据集质量要求及评价方法》,指标包括完整性、一致性、多样性、真实性、易用性、实用性、可扩展性。

  2. 生产操作规范:覆盖数据采集、清洗、标注、管理、使用全流程;组织管理制度:人员培训、安全合规等机制。

首个行业标准发布

  1. 2024 年 11 月,《人工智能 具身智能 数据采集规范》立项,统一数据格式,推动开源共享;2024 年 12 月发布《具身智能标准化研究报告》《RoboMIND 数据集及评测报告》,指引行业发展。

六、相关公司

均胜电子

  1. 布局 “数据场”,聚焦机器人数据采集与处理,支持多场景数据闭环。

海天瑞声

  1. 提供机器人数据集,覆盖多模态数据采集、标注,适配具身智能模型训练需求。

索辰科技

  1. 专注数据仿真,提供物理引擎与虚拟场景生成解决方案,支持高效合成数据。

华如科技

  1. 深耕仿真技术,为具身智能提供场景模拟与数据生成服务,应用于工业、民生等领域。

七、风险提示

  1. 政策不及预期:具身智能相关政策推进可能受多方因素影响,节奏与力度低于预期。

  2. 企业 IT 预算不足:IT 支出影响数据采集、仿真平台建设进度,制约行业发展。

  3. 市场竞争加剧:行业前景广阔,可能吸引更多企业入局,导致技术同质化与价格竞争。

HISTORICAL ARCHIVE / 2025.06.05本文为冻结的历史归档,不再更新。
全文检索

查找信息

搜索索引将在首次使用时加载。