EgoWorld-100W 数据集概览
EgoWorld-100W 数据集概览

BLOG / EgoWorld-100W

EgoWorld-100W:具备丰富真实世界多样性的百万级自中心数据集

百万级规模只是起点。EgoWorld-100W 的核心思路,是从广域覆盖走向规模沉淀,以四维结构化重构真实世界数据,释放数据多样性潜能——让数据不仅能回答“模型见过什么”,更能回答“模型在多少种条件组合下见过、还能迁移到什么”。

当具身操作模型真正进入开放环境时,挑战往往不只是“有没有见过这个动作”,而是“有没有在足够丰富的条件组合里见过这个动作”。同样是抓取,面对的可能是家庭场景中的衣物,也可能是工业场景中的零件,或者物流场景中的包裹;同样是打开,可能对应不同材质、不同结构、不同执行手配置下的完全不同控制约束。

这也是 EgoWorld-100W 想解决的核心问题。相比只用视频数量、小时数来定义数据规模,EgoWorld-100W 更关注数据多样性:数据究竟覆盖了哪些操作条件,以及这些条件能否进一步支撑模型在未见任务上的迁移与泛化。

EgoWorld-100W 是一个基于单目头戴视角采集的大规模第一人称操作数据集。其中“100W”的“W”来自中文计数“万”,表示百万量级。当前版本具备以下多样性特征:

  • 100 万+ 条第一人称操作视频,累计时长 10,000+ 小时
  • 3,000+ 名参与者在真实环境中完成采集
  • 覆盖 8 类真实场景
  • 估计形成 20 万+ 个互不重复的视觉背景
  • 基于分层抽样统计,估计覆盖 2,800+ 类物体语义类别、190+ 类动作
  • 估计形成 80,000+ 种细粒度物体变体与 57 万+ 种动作实例

相较于单纯扩大规模,EgoWorld-100W 更强调数据的多样性和结构化组织方式。整个数据集围绕场景(Scene)、物体(Object)、动作(Action)和手性(Handedness)四个维度进行组织与分析,用于支撑泛化研究、诊断性评测以及大规模预训练。换句话说,这不仅是一套大的数据,更是一套多样的、更适合做模型泛化研究的数据。

从全局分布观察数据的真实世界覆盖

为获得 EgoWorld-100W 的真实世界覆盖情况,我们从 EgoWorld-100W 中随机抽取了10%的数据样本,提取 DINOv2 自监督视觉特征,并通过 UMAP 将高维表征投影到二维平面。图中的每个点对应一条视频样本,颜色表示其所属的 8 大场景。

从可视化结果可以看到,不同场景形成了具有一定辨识度的聚类结构,同时整体分布仍保持连续且密集。这意味着数据并不是由少量孤立场景简单拼接而成,而是在真实世界环境、光照条件、背景结构和物体外观等方面形成了更广泛的连续覆盖。也正因为具备这样的整体分布特征,后续围绕场景迁移、物体迁移和组合迁移的分析,才有了更直观的分析依据。

四维覆盖分布可视化
全局样本分布

从覆盖到四维结构化:EgoWorld-100W 的核心定位

从全局分布可视化的角度来看,EgoWorld-100W 的数据在整体层面形成了连续且密集的覆盖——不同场景并非孤立聚集,而是在真实世界多样性上产生了广泛交叠。但“覆盖得广”只是起点,EgoWorld-100W 的核心思路,是从广域覆盖走向规模沉淀,以四维结构化重构真实世界数据,释放数据多样性潜能。

要让这份数据真正服务于泛化研究,还需要回答一个更前置的问题:这些覆盖是如何被组织起来的,以及它们能否被拆解为可分析、可对比、可迁移的结构单元。

EgoWorld-100W 的每条视频均配备视频级自然语言任务描述(Task),用于概括整段操作过程的主要语义。Task 并非简单的分类标签,而是对“这段视频在完成什么任务”的完整语义概括。每个 Task 可进一步拆解为 1–3 个 Sub-Task,每个 Sub-Task 对应一个不可再分的操作步骤。例如,一段“泡茶”的 Task 可能被拆解为“取茶杯”、“倒水”、“放置茶杯”三个 Sub-Task。Sub-Task 是 EgoWorld-100W 中用于覆盖统计、样本对比与迁移分析的最小操作单元。

Sub-Task 词云
Sub-Task 语义分布
Sub-Task 样本示例
Sub-Task 样本示例

在 Task/Sub-Task 的双层结构之上,EgoWorld-100W 进一步围绕场景(Scene)、物体(Object)、动作(Action)和手性(Handedness)四个维度对每个 Sub-Task 进行系统组织。这意味着,数据不再只是按视频堆叠的集合,而是按“操作条件组合”组织的结构化资产:

  • 场景:家庭、工业、办公、零售商业、餐饮服务、物流、公共空间及其他——同一动作在不同场景中对应不同的视觉线索与物理约束
  • 物体:除语义名词外,还关注材质刚度、几何尺度、功能角色等与操作直接相关的属性——同一语义名词在不同属性组合下可能对应完全不同的交互策略
  • 动作:不仅包含动作类别,还覆盖”同一动作在不同上下文中的执行实例”——动作语义与其执行条件绑定,而非孤立的动词标签
  • 手性:左手、右手、双手等执行配置——对双臂和人形机器人而言,手性变化会直接改变规划与控制结构

这种组织方式意味着,EgoWorld-100W 不再只是一个由海量视频堆叠而成的数据集合,而是一套能够回答“模型究竟见过什么、没见过什么、还能迁移什么”的结构化数据资产。研究者不再只能按单一维度浏览数据,而是可以在四维交叉条件下精准定位所需样本。

“四维结构化”相较单纯规模的价值

在具身操作任务中,数据多样性并不天然带来泛化能力。真正影响模型迁移表现的,是数据是否覆盖了足够丰富的操作条件组合。

传统数据集通常以视频数量、总时长或动作类别数来衡量规模,但这些指标无法回答一个核心问题:模型在未见过的“场景-物体-动作-手性”组合上表现如何?例如,模型可能在大量“家庭场景 + 右手抓取杯子”的数据上表现良好,但一旦切换到“工业场景 + 抓取杯子”或“家庭场景 + 左手抓取杯子”,性能就可能显著退化,单一维度的规模统计掩盖了这类组合层面的覆盖缺口。

基于这一判断,EgoWorld-100W 的四维覆盖分析框架将操作条件拆解为上述四个维度。在真实部署中,模型面对的通常不是单独变化的某一个维度,而是多个维度共同变化后的任务组合。因而,四个维度的交叉覆盖情况,比单一统计量更能反映数据对模型泛化的支撑能力。通过将每个 Sub-Task 锚定在四维结构中,研究者可以定量分析训练数据在任意维度组合上的覆盖密度,识别覆盖薄弱区域,并有针对性地补充数据这也是 EgoWorld-100W 将“规模”进一步推进到“结构化覆盖”的原因所在。

四维结构化,分别解决什么问题

对EgoWorld-100W中海量 Task 文本的名词与动词抽取与归并统计,可以得到物体与动作的类别规模;结合场景标签与视觉背景估计,可以进一步刻画环境覆盖范围;同时,Task 文本中包含的执行手信息也支持手性维度的归纳分析。将“数量”和“覆盖”放在同一视角下呈现,有助于更清晰地区分“样本很多”和“种类很全、组合很丰富”的差别。这种呈现方式也更贴近模型迁移与泛化所依赖的条件组合空间。

场景

EgoWorld-100W 覆盖 8 大真实场景,整体分布呈现长尾特征:家庭约 34%,工业约 15%,办公约 17%,零售商业约 15%,餐饮服务约 6%,物流约 6%,公共空间约 5%,其他约 2%。除场景类别统计外,数据还估计形成约 20 万个视觉背景,即由采集站位、视角、空间布局和光照差异共同形成的互不重复视觉环境,用于刻画“同一场景大类内部”的环境覆盖广度。

场景占比分布
8 大真实场景占比分布
场景词云
场景语义词云

场景维度的重要性在于,同一动作在不同环境中往往对应不同的视觉线索与物理约束。较高的跨场景覆盖,有助于模型在相同动作和相似物体的多环境实例中学习更稳定的迁移规律,而非依赖单一场景中的局部模式。对于需要走向真实部署的具身系统而言,这类环境变化往往是最先出现、也最难回避的分布偏移来源。

从模型学习的角度看,场景覆盖的价值并不只是让数据“看起来更丰富”,而是让同一类操作在不同环境下反复出现,帮助模型逐步区分哪些信息是与任务本身强相关的,哪些信息只是某个特定环境中的偶然共现。只有当家庭、工业、办公、零售等多类环境被同时纳入训练分布时,模型才更有可能摆脱对单一背景模式的依赖,在面对未见场景时保持更稳定的操作表现。

物体

基于分层抽样统计,从 Task 文本中提取并归并物体名词后,数据估计覆盖 2,800+ 类物体语义类别;若进一步计入颜色、材质纹理、尺寸规格和品牌等外观差异,细粒度物体变体数估计超过 80,000 种。

物体维度的关键并不只在于语义名词数量,而在于操作相关属性的覆盖程度。对于具身操作而言,影响迁移表现的往往是材质刚度、几何尺度和功能角色等因素,而非单纯的名词一致性。基于这一考虑,EgoWorld-100W 对物体类别进行了属性空间层面的统计归纳,用于分析数据覆盖到的典型物体类型。相比“见过多少个名词”,这类属性覆盖更接近模型真正需要迁移的经验基础。

物体属性并行桑基图
物体属性覆盖结构
物体词云
物体语义词云

这类差异在真实操作中十分常见。以“杯子”为例,刚性陶瓷杯、一次性软杯和带盖保温杯在抓取稳定性、受力方式和交互步骤上都可能不同;再如“盒子”,轻型纸盒、塑料收纳盒和带卡扣的工具盒虽然共享相近语义,但对应的开合、搬运和放置策略并不相同。对于模型而言,真正有价值的并不在于是否见过“杯子”或“盒子”这几个词,而是是否见过足够多样的材质、尺寸、结构和功能角色组合。

从这个角度看,物体覆盖的意义并不只是扩大类别清单,而是为模型建立一套更接近真实世界的属性参照系。当数据中同时覆盖柔性与刚性、小件与大件、容器类与工具类、规则结构与复杂结构物体时,模型更有可能在面对未见对象时,沿着属性相似性而不是词面相似性完成经验迁移。这也是物体维度在泛化研究中长期被低估、但实际上极为关键的原因之一。

动作

基于分层抽样统计,从 Task 文本中提取并归并动作动词后,数据估计覆盖 190+ 类动作类别,并可按交互目的归纳为 7 个语义组,包括抓取放置、表面操作、物体状态改变、精细操控、空间移动、收纳组织和工具化检测等。

动作维度的价值不只体现在动作类别数量上,更体现在“同一动作在多样上下文中的重复出现”。例如,同样是“抓取”,在家庭、工业和物流等场景中,目标物体的刚度、尺寸、重量和遮挡条件均可能显著不同。数据来源于 3,000+ 名参与者的自然执行,因而同一动作在速度、力度、姿态与遮挡等方面形成了更丰富的实例分布,使动作语义能够在更复杂的条件组合中被学习与比较。这意味着模型面向的是条件化的操作经验,而非孤立的动词标签。

动作占比分布
动作语义组占比分布
动作词云
动作语义词云

进一步看,动作本身往往具有明显的上下文依赖性。以“打开”为例,在家庭环境中可能对应柜门、抽屉、瓶盖或包装盒,在工业和办公环境中则可能对应设备面板、工具箱、文件柜或收纳结构;“放置”这一动作也并非统一模板,轻放玻璃杯、码放纸箱、归位工具和摆放柔性物体,在接触方式、末端轨迹和稳定性控制上都存在明显差异。对模型而言,真正需要学习的是这些动作在不同对象、不同场景和不同执行风格下的变化范围,而不是一个脱离上下文的抽象动词。

因此,动作覆盖的意义不仅在于扩充动作词表,更在于建立“动作语义与执行条件之间”的对应关系。当同一动作能够反复出现在不同物体属性、不同场景约束以及不同参与者风格之中,模型就更有机会形成可迁移的动作表征。这种覆盖方式对于后续的组合迁移研究尤其重要,因为它能够帮助区分模型究竟是在复用真正的动作经验,还是仅仅记住了某些固定场景里的局部模式。

手性

手性指一项操作由左手、右手还是双手执行的配置方式。对于双臂机器人和人形机器人而言,手性并非附属信息,而是会直接改变规划与控制结构的独立变量。单手操作与双手协同操作在运动链组织、空间约束和力耦合方式上存在明显差异。

EgoWorld-100W 的 Task 中天然包含左右手信息,使同类操作能够在不同执行手配置下进行组织、比较和分析。这为从单手到双手、从一类执行手配置到另一类执行手配置的经验迁移提供了数据基础,也使“手性变化是否会导致性能退化”这类问题具备了更明确的分析入口。

四维结构化释放多样性,EgoWorld-100W 有何不同

如果把 EgoWorld-100W 放到现有自中心操作数据的发展脉络中来看,它并不是对已有数据集的简单重复,而是在规模、采集广度和覆盖组织方式上做了进一步推进。现有代表性数据集各有侧重,例如 EPIC-KITCHENS-100 更偏向厨房场景中的细粒度动作理解,Ego4D 强调跨场景的通用第一视角理解,EgoMimic 和 EgoDex 则更贴近模仿学习与灵巧操作研究。

从公开信息口径来看,几类代表性数据集与 EgoWorld-100W 的对比如下:

代表性数据集能力对比热力图
代表性数据集能力对比

该对比图以统一的维度口径汇总展示代表性数据集在场景覆盖、任务/动作覆盖、物体覆盖、手部相关信息等方面的差异,并用于说明 EgoWorld-100W 在“真实世界多场景 + 大规模采集 + 结构化覆盖”方向上的定位。具体数值与口径以各数据集公开信息为准。

这里的差异不只体现在“数字更大”。对于具身操作来说,单一场景中的大规模采集、受控环境中的高精度数据,以及跨场景但偏理解任务的数据,都有各自明确的研究价值。EgoWorld-100W 更强调的是另一类能力:在真实世界中,以更大范围的场景、物体、动作和手性组合,来释放真实世界数据的全域多样性,支撑模型对未见条件的迁移与泛化。

换句话说,EgoWorld-100W 关注的不只是“是否有足够多的视频”,也包括“这些视频到底覆盖了哪些操作条件”。这也是它与现有代表性数据集之间最重要的定位差异之一。相较于只用时长、任务数或平台数来刻画规模,EgoWorld-100W 进一步把关注点放在结构化覆盖上,希望让数据本身能够服务于更细粒度的泛化分析、诊断评测和预训练研究。

如何挖掘真实场景下的数据分布多样性

EgoWorld-100W 统一采用头戴式单目采集方案。参与者佩戴轻量化的头戴设备,以第一人称视角记录完整的操作过程,能够自然捕获手部动作、物体交互和场景上下文之间的空间关系。单目设定在保留核心操作信息的同时,具备部署灵活、对采集环境干扰小的特点,这对于在家庭、工业、物流等 8 类真实场景中快速铺开 3,000+ 名参与者的大规模作业至关重要。也使整体工程复杂度可控,适合将数据体量持续扩展到百万量级。

为将不同终端输出的异构原始视频转化为可复现的数据资产,整个处理流程包含分辨率归一化、时间轴规范化和元数据绑定等环节,并在此基础上完成场景分类、Task 撰写、中英双语翻译和质量控制。这样的处理链路兼顾了大规模采集的扩展性与后续分析的可审计性,也使数据能够从“原始素材”进一步沉淀为可被研究、训练和评测直接使用的基础设施。

数据处理流程
真实世界采集到结构化数据资产的处理流程

追求多样性的同时,兼顾数据的保真度

除覆盖分析外,数据是否具备支撑实际下游任务的能力同样重要。为验证当前数据资产的保真度,EgoWorld-100W 以手部姿态估计作为示例任务,选用三维手部重建模型 HaMeR 作为基线,在代表性操作片段上评估手部关节精度、相机轨迹精度以及相机到手腕距离精度。

在当前验证设置下:

  • 相机轨迹误差总体 MAE 为 0.0212 m,RMSE 为 0.0276 m
  • 相机到手腕距离误差(双手总体)MAE 为 0.013 m,RMSE 为 0.0168 m
  • 手部关节估计(双手总体)MPJPE 为 0.0126 m,指尖均值误差为 0.0139 m
可用性验证可视化
自中心感知任务保真度验证

上述结果表明,当前数据资产已经具备支撑自中心感知任务的基础条件,尤其适用于与手物交互、双手协同以及操作空间关系建模相关的研究方向。对于一套面向真实世界操作的百万级数据集而言,这类保真度验证也意味着其价值不仅停留在统计层面,而开始具备明确的任务落地能力。

应用方向

正是这种跨场景、跨物体、跨动作的多样性覆盖,让 EgoWorld-100W 在以下几类模型与应用中有着独特的用武之地:

  • 具身模型训练:百万级第一人称操作视频,为 VLA(Vision-Language-Action)模型、视频生成式世界模型以及通用视觉-动作表征学习提供了丰富的训练素材。得益于跨场景、跨物体、跨动作的覆盖结构,模型有机会在预训练阶段接触到更多样化的操作条件组合,从而学习更稳健、更可迁移的表征。
  • 模仿学习与行为生成:对于基于扩散模型或自回归 Transformer 的动作生成方法,EgoWorld-100W 中 3,000+ 名参与者的自然操作风格差异,以及同一动作在不同上下文中的多样化执行方式,为模型提供了天然的多模态示范分布,有助于训练出更灵活、更具鲁棒性的行为策略。
  • 诊断性泛化评测:以四维条件为控制变量,固定三维、变化一维,用于系统性定位模型性能退化的来源。例如,固定场景和物体,仅变化手性配置,即可定量评估模型对执行手变化的敏感程度,这类评测在传统数据集中往往因覆盖不足而难以开展。
  • 组合迁移研究:分析共享部分维度的经验如何迁移到未见组合,避免将泛化问题过度简化为“见过/没见过”的二值划分。Sub-Task 层面的细粒度标注使研究者可以精确控制训练与测试之间的维度重叠程度,为组合泛化研究提供可归因的实验基础。
  • 自中心感知与重建:包括手部姿态估计、手物交互关系理解、操作空间可达性分析以及交互式三维场景重建等。数据中天然包含的左右手信息和单手/双手操作差异,也为双臂协同感知与规划研究提供了有价值的参考信号。

写在最后:从规模到多样,从多样到泛化

EgoWorld-100W 想做的事情其实很清晰——不只是做一个“更大的数据集”,而是把数据从规模统计推进到结构化覆盖,让每一条视频、每一个 Sub-Task 都能服务于具身智能的泛化研究。通过场景、物体、动作、手性四个维度的系统组织,我们希望研究者能够更精细地理解模型的能力边界:它在哪类条件下表现稳定、又在哪类条件下开始退化,以及更重要的是如何通过补充特定维度的训练数据来有针对性地提升泛化表现。

EgoWorld-100W 从立项之初就是一个开放的数据项目,我们希望它不只是我们的数据集,更是整个具身智能社区可以共同使用的基础设施。为此,我们设计了三种合作方式,面向不同身份、不同需求的伙伴:

  • 面向个人研究者:零门槛体验级数据,适合学习探索与想法验证
  • 面向高校与学术团队:全场景覆盖的研究级数据,支持论文合作与联合发表
  • 面向企业与机构:从数据到模型的共创级合作,支持按需定制与商用授权

无论你是在做课程项目、写论文,还是在推进产品落地,我们都希望 EgoWorld-100W 能成为你手中一张好用的拼图。如果你对数据合作、联合研究或者任何形式的交流感兴趣,欢迎通过我们的官方渠道提交申请——我们很乐意和你聊聊。

最后,感谢 EgoWorld-100W 的每一位贡献者,以及所有在具身智能这条路上同行的伙伴。我们希望这张拼图越做越大,让产出的数据真正成为具身智能向前走的地基。