合成数据生成器
用途
为大模型训练/评估自动化生成高质量合成样本,弥补真实数据稀缺、隐私敏感场景的数据缺口。
何时使用
- 需要冷启动 SFT 数据集且无标注人力
- 真实数据涉及 PII/隐私无法直用
- 需要覆盖长尾场景与边界 case
输入要求
- 目标 schema / 字段定义
- 种子样例 5-20 条
- 生成规模与分布约束
执行步骤
- 澄清任务类型(分类/抽取/生成/对话)与评估口径
- 按 schema 构造 prompt 模板,先跑 20 条抽样人工核验
- 设置生成参数(temperature、多样性、种子轮换)扩量到目标规模
- 去重(MinHash/embedding)+ 偏差校验(类别分布、长度分布)
- 输出 train/dev/test 拆分与数据卡片
常见陷阱
- 模板过窄导致同质化
- 忽略负样本/难例
- 未对齐真实分布做 A/B 校验
验收标准
在下游任务上 vs 真实数据对齐比较 AUC/F1,差距 <5% 视为可用。