第一人称与第三人称数据采集
用视频训练出来的机器人策略,必须从人类完成任务的示范中学习,而这些示范是从哪个视角录下来的,其重要性不亚于任务本身。第一人称采集——头戴式摄影机——记录的是机器人自己的摄像头将来会看到的画面。但单靠它,会漏掉让示范真正可用的大部分信息:演示者的双手、被操作的物体、驱动动作的身体姿态,这些经常落在画面之外,或被演示者自己的头部遮挡。第三人称采集则来自围绕同一场次布置的固定外部摄影机,补上第一人称视角无法呈现的部分。我们把两者同步录制,作为一份交付物一起交付。
第一人称与第三人称,同场同步采集
每一场次都以同一个时钟同时录下两种视角,因此这一对素材可以真正当作一对来使用,而不必事后再去对齐。
- 头戴式第一人称采集,其构图与稳定性是按任务需求调校的,而不是按通用可穿戴性调校的。
- 外部多视角机位,专门布置来覆盖头戴摄影机看不到的双手、被操作物体与演示者身体姿态。
- 所有视频流之间做时间码同步,让第一人称与第三人称素材逐帧对齐,而不是靠估算对齐。
- 标定数据随素材一并记录——相机内参与机位几何关系在场次当时就采集下来,而不是事后从画面里反推重建。
为什么成对的视角比任何单独一种都更有价值
第一人称流呈现的是演示者所看到的:接近物体的过程、机器人自身摄像头日后将复现的那个视角,以及演示者当时正在据以反应的视觉线索。但它几乎看不到演示者的手实际在做什么,因为头戴摄影机拍的是头朝向的地方,而在任务进行中,双手、工具和被操作的物体有很多时候都在画面之外,或被演示者自己的手臂挡住。第三人称流恰好相反:手部关节动作、抓握方式、物体姿态与身体姿势,都能从固定的外部角度看清,却缺少那个「为第一人称输入而训练的策略」所需要的视角。两种视频流谁也替代不了谁。单独看,任何一种对人来说都有信息量。但同步配对之后,两者合在一起才给到学习系统真正需要的东西——它将来据以行动的视角,加上仅凭那个视角会遗漏的物理细节。公开研究数据集 EgoExo4D 正是这种配对方式如今成为具身智能标准做法、而非某种定制思路的原因:它证明了同步的 ego-exo 采集能产出可训练的数据,而这是任何单一视频流都做不到的。它建立在 Ego4D 之上——后者正是当初把第一人称视频确立为一个研究领域的公开数据集——所补上的,正是多数训练场景实际需要的第三人称那一半。
一个场次如何进行
那些会毁掉一次采集的变量,往往要到回放时才看得见,所以整个流程的编排就是为了在团队撤场之前把它们抓出来。
- 第一条镜头开拍前先做标定,每台相机与机位都对照本场次的参考标记核验一遍,而不是沿用上一场次的假定值。
- 活动脚本事先写好,让同一任务的每一条镜头都按相同顺序执行相同步骤,彼此之间才具备可比性。
- 录制开始前,就任务、机位设备以及本场次特有的失效模式,对操作人员做简报。
- 场次进行中做质量检查——镜头之间就复看素材,而不是攒到一天结束再一次性过一遍。
- 团队撤场前完成当日复核,因为在项目第一天补拍成本很低,而到了第三十天,布景、道具和演员都已散去,补拍实际上不可能了。
遥操作示范
当客户提供设备时,我们支持遥操作采集——机械臂、控制器与操作装置是你的;操作员训练、场次纪律与逐条镜头的质量管控是我们的。这类遥操作示范是视觉-语言-动作(VLA)模型的标准训练输入,而正是这个下游用途,让这里的经济账不同于脚本化的人类活动采集:要凑成一个可用的训练集,单个操作任务所需的示范条数通常要以百计,而不是以十计,因此在这里,吞吐规划与场次可重复性比任何单条镜头的精致程度都更重要。我们从第一次沟通起就按这个量级来规划项目,而不是做到一半才发现。
你会拿到什么
交付物的组织方式是为了能直接进入训练管道,而不是事后再做格式转换。
- 本场次采集的每一路视频流的同步素材——第一人称,以及每一个第三人称机位,全部对齐到统一时间码。
- 所用每一台相机与机位的标定与位姿元数据,随素材一并交付,而不是作为一个独立的重建步骤。
- 逐场次日志,把每一条镜头对应回它所属的脚本步骤与任务变体。
- 如果你需要,同一批素材也可以做标注——我们数据标注页面所描述的标注工作,可直接作用于本页所采集的内容。
常见问题
- 一支团队一天能采集多少素材?
- 这取决于场次实际需要什么,而不是一个固定的日产量:脚本要求多少条不同的镜头、每条镜头有多长、机位之间切换时需要多少次重新标定,以及为了在团队进入下一条之前抓出废镜头而预留了多少场次内复看时间。同一支团队去拍一个短促重复的操作任务,和去拍一份冗长自由的活动脚本,日产量会差得很远。我们会针对你的具体脚本来估算,而不是报一个在你的任务上根本站不住的数字。
- 你们能为我们的任务定制机位方案吗?
- 可以,当任务所需的机位布置超出标准多视角方案的覆盖范围时——比如狭窄的作业空间、不寻常的操作角度,或是你的策略输入所特有的覆盖要求。我们按任务需要呈现什么来设计机位几何关系,而不是套用一个固定的默认配置。
- 第一人称数据的授权同意有何不同?
- 头戴摄影机会把佩戴者看向的一切都录下来,其中经常包括私人环境,以及并非本次拍摄对象、也从未被征询过的旁人。我们第一人称场次的授权书覆盖所有出现在画面中的人,而不只是佩戴摄影机的那一位;而在那些无法从可能入镜的人那里取得同意的场所,我们不拍。这个约束首先限定的是场次能在哪里进行,其次才是它能拍到什么。
- 你们能为自己采集的素材做标注吗?
- 能——对第一人称与第三人称素材的标注,是我们直接作用于自家团队所采素材的一项服务。跨同步视频流的手部姿态、物体追踪与动作分段,如果做标注的团队本来就清楚这些素材当初是怎么架设和标定的,就更容易做对。

