AI 训练数据:采集、标注与后训练
模型才是便宜的那部分。一个模型不过是几行配置加一张账单;而它赖以学习的数据集,是一群真正理解任务的人花上数月做出来的——大多数 AI 项目实际卡住的地方,正是这里。我们按你的规格采集数据、完成标注,并且——因为构建 AI 系统本就是我们的主业——我们就是之后必须拿这份数据去训练的人。这一点会改变规格书的写法。
为什么 AI 项目卡在数据上,而不是模型上
团队来找我们时,模型往往已经选好了,却带着一个尚未被命名的数据问题。这个模式高度一致。
- 标注规范是在还没人见过困难样本之前写下的,因此困难样本的标注前后不一致。
- 采集到的数据匹配的是演示环境,而不是部署环境。
- 没人测量过标注员之间的一致性,因此没人知道这些标签究竟有没有意义。
- 数据集把常见情况覆盖得很充分,失败情况却完全没有覆盖,而训练需要的恰恰相反。
- 数据格式必须重写一遍才能进入训练管道,而这次重写又丢失了信息。
我们提供什么
四项能力,可以单独采购,也可以打包成一个完整项目。
- 按书面规格进行数据采集——视频、图像、音频、文档与脚本化场景。
- 面向机器人与具身智能的第一人称与第三人称采集,以同步配对的方式录制。
- 覆盖图像、视频、3D 点云、文档与音频的标注。
- 大模型后训练数据:监督微调示范数据、偏好排序与评测。
标注它的团队,也是拿它训练的团队
多数标注供应商交付完数据集就没了下文,永远不会知道它到底管不管用。而构建 AI 系统是我们的主业,这意味着我们产出的数据集,可能正是我们自己要拿去微调、评测,并在生产环境中为之负责的那一份。这不是营销话术上的区别——它直接决定了标注规范里写什么,因为写规范的人清楚哪些歧义日后会以模型故障的形式冒出来。
我们如何让质量可度量
没有度量支撑的质量宣称一文不值,所以我们给工作过程装上仪表,而不是对结果打包票。
- 每一批次都掺入金标样本,持续打分,而不是等到最后才抽检。
- 多轮复核,且第二轮对第一轮的结果不可见。
- 标注员间一致性以数字形式报告,而不是一句宣称。
- 在模型能完成第一遍的地方引入自动预标注,让人去修正,而不是从零开始。
- 规范像代码一样做版本管理,因为一次规范变更会悄无声息地让此前标注的一切失效。
安全与访问控制
能明确说的,我们就明确说;不能说的,我们就不写。
- 每一个接触你数据的人,在看到任何内容之前都已签署保密协议。
- 权限按项目授予,而非按员工授予,项目结束即撤销。
- 客户数据存放在与我们其他工作相隔离的环境中。
- 项目完成后按合同约定的时间表删除数据。
常见问题
- 你们能接的最小项目是多大?
- 一个试点批次。无论最终规模多大,这都是正确的第一步,因为这是唯一能弄清楚标注规范能否经受真实数据检验的办法。
- 试点批次怎么做?
- 你提供一份有代表性的样本和一条验收标准。我们完成标注,汇报过程中遇到的所有分歧,并据此重写规范。分歧本身才是重点——一个没产生任何分歧的试点,说明它简单到没有信息量。
- 数据和标签归谁所有?
- 归你,包括由它们衍生出的一切。约定的删除日期之后我们不留存任何内容,也绝不会拿客户数据去构建我们自己的数据集。
- 标注员之间意见不一致时怎么办?
- 分歧会被上报,而不是被取平均。由资深复核员裁定,裁定结果再写回规范,让同一类情况不必被判两次。
- 除了英语和越南语,你们还做其他语种吗?
- 把语种和数据量告诉我们再谈。与其勉强接下来做砸,我们宁愿直说人手配不上。

