Skip to content

数据集制作与标注

模型的上限由数据决定。“Garbage in, garbage out”——再强的架构也救不了一堆脏数据。本页系统讲解图像/文本数据集的采集、清洗、标注、质量评估全流程,以及现代自动化标注(自动标注 + 人工校验)流水线。前置阅读:扩散模型、数据预处理。

2025 范式转变:Chinchilla 缩放定律(2022)揭示模型参数与训练数据量需等比例增长后,业界发现单纯”堆数据”收益递减。2024-2025 年,以 Microsoft Phi-4、NVIDIA Nemotron 为代表的模型证明:精心策划的小量高质量数据(含大量合成数据)可以超越粗放爬取的海量数据。数据科学正从”以模型为中心”(model-centric)转向”以数据为中心”(data-centric AI)——不再反复调架构,而是反复改数据。

把做数据集想象成”给一个学徒准备教材”:

  • 采集 = 收集原始教材:从网上爬、自己拍、买现成、用合成数据。教材越多越杂,但混入的错误教材会带偏学徒。
  • 清洗 = 剔除错页和重复:去重(去掉内容几乎一样的教材)、去噪(撕掉水渍和乱码)、过滤低质量(太糊、太小、文不对题)。
  • 标注 = 给教材写答案和解析:给每张图标上”这是什么”、画框标”物体在哪”、写描述。可以是人工写,也可以让一个”已经毕业的学徒”(大模型)先写草稿,人来校验。
  • 评估 = 抽查教材质量:抽样统计标注一致率、类别分布、边界 case 覆盖度。

一句话:好数据集 = 海量 + 干净 + 标注准确 + 覆盖全面,四者缺一不可。

  • 公开网络爬取:如 LAION-5B(50 亿图文对,从 Common Crawl 来)。量大但噪声高,版权和伦理风险需评估。2025 年主流做法是用 HuggingFace DataTrove 或 Allen AI 的 Dolma 流水线对 Common Crawl 做分布式处理,包含 warc 解析 → 语言识别(FastText langid)→ 质量分类 → 去重全链路。详见AI 艺术版权与伦理。
  • 自有业务数据:公司产品积累的真实数据,质量高、贴合业务,但需脱敏和授权。这是企业的核心数据壁垒。2025 年的趋势是建立数据飞轮(data flywheel):模型上线 → 收集真实用户交互数据 → 清洗标注 → 回灌训练 → 模型更强 → 吸引更多用户,形成正向循环。
  • 采购与授权:从 Getty、Adobe Stock、Shutterstock 等购买授权数据,法律风险低但成本高。2024 年起多家数据供应商(如 Scale AI、Appen)提供”RLHF-ready”的偏好标注数据服务。
  • 合成数据:用已有模型生成训练样本。如用 Blender 渲染带完美标注的 3D 物体给目标检测用;用大模型生成指令微调数据。2024-2025 年合成数据地位急剧上升:Phi-4 训练数据中约 50% 为合成数据(由强模型生成的教科书、代码、QA 对);NVIDIA 开源的 Nemotron-4 340B 专门作为”合成数据生成模型”发布,附带全套生成-过滤流水线。优势是标注免费且完美、可控性强;劣势是可能有分布偏差,且过度依赖合成数据会导致模型坍缩(model collapse)——多代自我训练后模型输出多样性逐渐退化,就像复印件反复复印越来越模糊。
  • 去重:精确去重(哈希比对)找完全相同的文件;近似去重(pHash、MinHash、SSCD)找视觉/文本上几乎一样的。不去重会导致模型”背下来”而非”学会”,并虚高评估指标。
  • 质量过滤:用 CLIP 分数、美学评分模型(如 LAION-Aesthetics)、分辨率阈值过滤低质图;用语言模型或规则过滤乱码文本。
  • 毒性过滤:用分类器(Perspective API、内部安全模型)剔除仇恨、暴力、色情内容。
  • PII 脱敏:移除人脸、车牌、身份证号、电话等隐私信息,或做模糊化处理。
  • 图像分类:给整张图一个或多个类别标签。
  • 目标检测:给每个目标画矩形框 + 类别(如 YOLO/COCO 格式)。
  • 语义/实例分割:像素级标注每个像素属于哪个类别/实例(mask)。
  • 关键点:标注人体姿态、人脸特征点等结构化点位。
  • 图文对/描述:为图像写自然语言描述(caption),是扩散模型和 VLM 训练的核心标注。
  • 偏好对:对同一输入的多个模型输出排序,用于 RLHF/DPO 训练。

4. 自动化标注 + 人工校验(现代主流)

Section titled “4. 自动化标注 + 人工校验(现代主流)”

人工标注慢且贵。现代流水线常用”大模型当标注员、人当审核员”:

  • 用强模型(如 GPT-4V、Gemini、专业 VLM)对未标注数据批量生成标签。
  • 用弱监督、一致性约束做交叉验证(同一张图被多个模型标,不一致的送人工)。
  • 人工只处理”模型不确定”和”高价值边界 case”,效率提升十倍。
  • 标注者间一致率(Inter-Annotator Agreement, IAA):多个标注者独立标同一批,用 Cohen’s Kappa 或 Fleiss’ Kappa 衡量一致度。低于 0.6 说明标注指南不清或任务本身模糊。
  • 黄金集:预先准备一批”标准答案”题,混入标注任务里抽查正确率。
  • 数据卡片(Data Card):用文档记录数据来源、构成、标注流程、已知偏差,是数据治理和合规的必备产物。
import torch
from PIL import Image
from transformers import CLIPProcessor, CLIPModel
# 用预训练 CLIP 对一批候选标签做零样本分类,实现"自动标注"
model = CLIPModel.from_pretrained("openai/clip-vit-base-patch32")
proc = CLIPProcessor.from_pretrained("openai/clip-vit-base-patch32")
# 候选类别(实际场景可扩展到几百个,或换成"图文相似度"做 caption 检索)
labels = ["一只猫", "一只狗", "一辆汽车", "一处风景", "一张人脸"]
def auto_label(img_path: str) -> str:
img = Image.open(img_path).convert("RGB")
inputs = proc(text=labels, images=img, return_tensors="pt", padding=True)
with torch.no_grad():
probs = model(**inputs).logits_per_image.softmax(dim=-1)[0]
idx = probs.argmax().item() # 取最高概率类别
return f"{labels[idx]}(置信度 {probs[idx]:.2%})"
# 批量跑完后,置信度低的图片再送人工校验,构成自动+人工流水线
print(auto_label("photo.jpg"))
  • 去重是第一步且必须做:重复数据让模型过拟合特定样本,并虚高评估分数。视觉去重用 SSCD/SSim,文本去重用 MinHash,近年开始用嵌入做语义去重。
  • 标注指南要反复迭代:第一版指南必然有歧义。先标 100 张试标,统计分歧点,修订指南再全量标,IAA 才能上去。
  • 类别平衡很重要:长尾分布会让模型偏向多数类。用过采样、类别加权或合成数据补齐少数类。
  • 保留标注元数据:每条标注记录标注者 ID、时间戳、置信度、版本号,便于回溯和审计。
  • 合成数据要标注”来源”:合成样本混进训练集要单独标记,否则难以分析模型的泛化来源,也影响合规披露。
  • 图像生成模型训练:Stable Diffusion 用 LAION-5B 经美学过滤后的子集;SDXL 进一步提升了 caption 质量和分辨率。
  • 目标检测基准:COCO、Open Images、Objects365 是检测模型的标准训练和评估集,标注了数百万个检测框。
  • VLM 指令微调:LLaVA、Qwen-VL 用大量高质量的”图像-指令-回答”三元组训练,这类数据多为 GPT-4V 自动生成 + 人工过滤。
  • 自动驾驶:Waymo、nuScenes 数据集包含激光雷达点云 + 多相机图像的密集标注,标注成本极高。
  • 医疗影像:MIMIC-CXR、CheXpert 等用放射科医生标注,标注质量直接关系生命安全,对一致率要求极高。
类库 / 工具类型说明
Label Studio标注平台开源多模态标注工具,支持图像、文本、音频、视频、关键点、分割
CVAT标注平台开源计算机视觉标注工具,支持检测、分割、跟踪,企业级可部署
FiftyOnePythonVoxel 的数据集可视化与质量分析库,发现标注错误和边界 case
snscrape / Common Crawl采集社交媒体和全网爬取工具,原始数据来源
imagededupPythonFacebook 的图像去重库,支持 pHash 等多种方法
CLIPPythonOpenAI 视觉语言模型,常用于零样本自动标注和质量过滤
术语英文解释
数据集Dataset用于训练或评估模型的样本集合,通常含输入和标签
标注Annotation / Labeling为数据样本人工或自动添加标签的过程
自动标注Auto-labeling用已有模型批量生成标签草稿,再由人工校验
标注者间一致率IAA多个标注者独立标注的一致程度,衡量任务清晰度
黄金集Gold Set预先准备的标准答案集,用于抽查标注质量
近似去重Near-dedup找内容高度相似但不完全相同的重复样本
数据卡片Data Card记录数据集来源、构成、标注流程、已知偏差的文档
合成数据Synthetic Data用已有模型或仿真生成带完美标注的训练数据
  • Schuhmann et al., “LAION-5B: An open large-scale dataset for training next generation image-text models” (NeurIPS 2022):Stable Diffusion 等模型背后的 50 亿图文对数据集论文,展示超大规模网络爬取数据的构建流程。
  • Lin et al., “Microsoft COCO: Common Objects in Context” (ECCV 2014):目标检测领域最经典的标注数据集,定义了检测与分割的评估范式。
  • Pushkarna, Raji et al., “Data Cards: Purposeful and Transparent Dataset Documentation for Responsible AI” (FAccT 2022):Google 提出的数据卡片标准,是数据治理和透明度的参考框架。
  • Gebru et al., “Datasheets for Datasets” (CACM 2021):为数据集建立”说明书”的奠基性提案,强调记录数据来源与潜在风险。
  • Northcutt, Athalye & Mueller, “Pervasive Label Errors in Test Sets” (NeurIPS 2021):发现十个主流测试集中有平均 3.4% 的标签错误,提醒我们标注质量评估至关重要。