合成数据
由AI模型(通常是LLM)自动生成的训练数据,用于补充或替代人工标注数据,具有效率高但存在”近亲繁殖退化”风险的特点
简介
合成数据(Synthetic Data)是指由AI模型自动生成的训练数据,而非由人类标注员手工创建。在大语言模型训练中,合成数据已经成为基础设施级别的存在——批量面试题、基础代码练习题、通用问答对等场景用LLM生成,一条指令能顶一个标注员一天的产出。
然而,合成数据正在制造一批”太标准”的数据,带来严重的”近亲繁殖退化”问题。LLM生成数据本质上是在已有概率分布上重采样,产出的每一条数据都在”模型已知范围”内打转,导致模型输出越来越平滑、越来越安全、越来越没有惊喜。
关键信息
核心特性
1. 合成数据的效率优势
合成数据在以下场景效率极高:
- 批量生成:一条指令能顶一个标注员一天的产出
- 标准化任务:面试题、代码练习题、通用问答对
- 规模扩展:快速扩充训练数据量
2. “近亲繁殖退化”问题
合成数据最大的问题不是质量,而是”缺少意外”:
根本原因:
- LLM生成数据本质是在已有概率分布上重采样
- 产出的每一条数据都在”模型已知范围”内打转
- 喂多了合成数据,模型输出越来越平滑、越来越安全、越来越没有惊喜
真实案例: 团队接了一个垂直领域的对话优化项目,制定了极其严格的清洗SOP(格式统一、标点全角、每段回答必须包含”首先其次最后”的逻辑结构)。几万条SFT数据交回来,毫无语法瑕疵。结果模型一上线评测直接崩了——AI变得极度刻板,所有对话套用同一个模板,字里行间全是机器感。
根因分析: 清洗规则把人类说话时所有的”真实瑕疵”全部当成噪音洗掉了。语气词(“嗯……”、“那个……“)、口语化省略(“你看能不能……“)、语序颠倒(“不是,我是说那个……“),这些在传统数据工程中被视为脏数据的东西,恰恰是模型学到”人味儿”的关键素材。
3. 合成数据的正确使用姿势
“毛边”策略:
- 不再是”越干净越好”
- 给每条数据的清洗留一个”毛边”余量
- 不会影响语义理解的口语化表达 → 保留
- 可能引入歧义的模糊表达 → 标记但不直接删除
- 调整后模型对话自然度提升近15个百分点
定位为效率工具而非答案:
- 擅长解决通用场景的规模问题
- 真正能让模型从”及格”走向”优秀”的,是合成数据生成不了的坏数据、极端个案、以及人对”主次”、“氛围”、“重点”的判断力
4. 合成数据在视觉理解中的局限
模型识别一张复古胶片街拍照片的案例:
- 画面:一条老巷子、一个骑自行车的人、旁边有几家小店
- 特点:角度奇怪、画面失焦、光影关系微妙
- 模型输出:“一条街道,两侧有建筑物,有一个人在骑自行车”
- 问题:模型说对了所有元素,但不理解什么叫”主体”,不知道怎么区分”主要信息”和”背景信息”
这个能力不是靠加参数能补的,需要大量经过人工判断、标注了”主次关系”的训练数据——恰恰是LLM自己生成不了的。
不同素材中的观点
- 2026-06-22-ai-trainer-3-truths:@L.NaN 从一线踩坑经验出发,揭示合成数据的核心矛盾——效率极高但”太标准”。真实案例:严格清洗SOP导致模型变成复读机,调整”毛边”策略后自然度提升15个百分点。核心判断:合成数据是效率工具但不是答案本身,真正能让模型从”及格”走向”优秀”的是坏数据、极端个案和人的判断力。人工训练没有消失,只是从体力活变成了手艺活。
- 2026-07-15-woshipm-embodied-ai-data-industry:这篇素材把合成数据的概念延伸到具身智能领域——机器人训练数据金字塔的中层就是”仿真数据”(在虚拟环境中批量生成机器人交互数据,成本低、可规模化)。它与合成数据同源,用于弥补真机数据的不足;但和大模型场景一样,顶层”真机数据”(人工用 VR/外骨骼操控真实机器人,含力反馈)才是落地的关键,仿真数据无法完全替代真实世界的三维动作数据。参见 具身智能数据。
实用信息
合成数据适用场景
| 场景 | 适用性 | 原因 |
|---|---|---|
| 批量面试题 | ✅ 高度适用 | 标准化、格式固定 |
| 基础代码练习 | ✅ 高度适用 | 逻辑清晰、可验证 |
| 通用问答对 | ✅ 适用 | 规模需求大、容错率高 |
| 对话自然度训练 | ❌ 不适用 | 需要”人味儿”和真实瑕疵 |
| 垂直领域判断 | ❌ 不适用 | 需要领域敏感度和主次判断 |
| 视觉理解标注 | ❌ 不适用 | 需要人工标注主次关系 |
避免”近亲繁殖”的策略
- 混合数据源:合成数据 + 人工标注真实数据,比例根据任务调整
- 保留”毛边”:清洗时保留不影响语义的口语化表达
- 极端个案补充:专门收集坏数据、边界case、非典型表达
- 定期评测:监控模型输出的多样性和自然度指标
- 人工审核:对合成数据进行抽样人工审核,识别”太标准”的批次
相关页面
- AI训练师
- SFT 监督微调
- 数据审美
- 具身智能数据 — 具身智能的”仿真数据”是合成数据在机器人领域的对应形态
- 2026-07-15-woshipm-embodied-ai-data-industry — 仿真数据在具身智能数据金字塔中的定位