面向 AI 训练的数据采集

决定一个采集项目成败的交付物是规格书,而不是素材本身。一支拍摄团队几乎能称职地执行任何简报;真正会失败的,是一份从未点明关键变量的简报——角度、光照、口音、背景噪声水平。符合一份含糊规格的数据,技术上没错,实际上没用,而且这个失败要等到模型已经拿它训练过之后才会显现。我们会在任何人拿起摄影机之前,先和你一起把规格书写出来。

按书面规格采集

每种数据形态都有自己的一组变量,而一份含糊的简报会把它们留给当天扛着摄影机的那个人去定夺。我们在采集开始前把每一项都用文字钉死,好让一支跨十个场地作业的团队执行的是同一份简报,而不是对它的十种解读。

  • 视频——镜头角度、距离、构图、运动方式与光照条件,因为在单一角度上训练出来的模型,换个角度就泛化不了。
  • 静态图像——分辨率、背景、遮挡程度与光照,逐张指定,而不是交由摄影师自行判断。
  • 音频与语音——麦克风距离、背景噪声水平、说话人口音与人口统计特征,以及录音环境。
  • 文档采集——扫描分辨率、页面状态(手写、印刷、破损)与文件格式,让数据集匹配模型在生产环境中实际会看到的东西,而不是一份干净的样本。
  • 脚本化场景——脚本本身、要求的变体(顺序、措辞、被打断的情况),以及谁扮演哪个角色,好让同一个场景不会被现场每位表演者各自重新演绎一遍。

授权同意与来源可溯

这是企业采购方会先于一切去读的一节,因为它决定了这份数据集究竟能不能用。我们只描述自己实际在做的事,到此为止——不宣称任何认证,也不给出证据之外的保证。

  • 出现在采集素材中的每一个人,在素材被用于任何用途之前都签署了授权书,试点批次也不例外。
  • 授权书归档到具体条目上——那一段视频、那一张照片、那一条录音——而不是归档到它所属的批次上。
  • 保管链按条目留档,从采集时点一直到交付时点,因此来源可以追溯到一份具体的授权书,而不是一句声明。
  • 任何我们拿不出证据的东西——出示不了的授权书、有断点的保管链——一律不交付,无论它的制作成本有多高。

我们的覆盖范围究竟不同在哪里

为全球模型采集的训练数据,大多出自北美和西欧,而这一点是看得出来的:东南亚常见的交通形态、厨房布局、市集摊位、口音与肤色,在那些数据集里要么稀薄,要么干脆缺席。我们在越南及周边地区采集,因为我们的团队与网络本就在那里,这意味着我们交付的素材中的场景、面孔、语言与作业环境,正是西方来源的数据集通常缺少的那些——不是因为我们把价格压低了,而是因为我们本来就站在那个缺口上。

交付

交付是围绕你的管道本来就期待的样子来构建的,而不是围绕我们导出起来方便的样子。

  • 格式——容器、编码、采样率、分辨率——在规格书里就定死,而不是导出时才决定。
  • 元数据结构按你现有的训练管道来设计:字段名、标识符与目录结构,让你直接接入我们发过去的东西,而不必再映射成你自己的格式。
  • 对未通过复核的内容出具退回报告,写明哪一条不合格、为什么,而不是悄悄交一个变小了却没有解释的批次。

常见问题

授权同意是如何留证的?
每一个条目都关联着一份签署的授权书,写明被拍摄者同意了什么、用于何种用途。对已交付批次中的任何条目,我们都可以按要求出示其授权书;如果出示不了,那这个条目当初就不会被交付。
你们会拍摄未成年人吗?
只有在监护人签署同意书、且规格书明确要求的情况下才会。多数采集简报并不涉及未成年人,我们也不会让未成年人作为背景人物被顺带拍进去。
采集期间数据存放在哪里?
存放在项目专属环境中,访问权限仅限于参与该次采集的人员,与其他客户的数据以及我们自己的内部系统相互隔离,直到采集结束。
如果采集进行到一半规格变了怎么办?
已按旧规格完成的工作照原定范围交付并计费;新规格则作为变更单,适用于自那一刻起采集的内容。我们不会拿一份后来才修改的简报,去回溯性地重新解释已经拍完的素材。

告诉我们你需要采集什么

描述一下你需要采集什么、在哪里采集。在有人去订拍摄档期之前,我们会先告诉你规格书里还需要写清哪些内容。

联系我们