数据工厂是独立的语料生产产品,不是大模型开发方案。把合同、报告、扫描件、现场照片等原材料交给 AI 处理,快速得到可用于模型微调和模型训练的结构化语料。自动加工正确率 70%+,其余进复核队列,避免脏数据直接进训练。
企业手里通常是制度 PDF、合同扫描件、培训 PPT、现场照片,而不是现成的 JSONL。数据工厂的工作就是接住这些原材料。
不是「把 OCR 结果丢进文件夹」,而是按训练任务把内容做成可学习的样本,并给每条打上置信度。
文档解析与图片 OCR、表格还原、页码与标题层级,尽量保住原文顺序。
页眉页脚、水印、重复页、乱码与无关广告剔除;敏感信息可按策略脱敏。
切段、问答对、指令—回答、多轮对话草稿,按微调或预训练目标分别出仓。
格式、事实一致性、空答与幻觉风险打分。达标入库,不达标进复核,不混装。
微调要的是「问得像业务、答得有口径」的样本;预训练要的是干净、可配比的长文本。数据工厂按任务拆仓,避免一套 JSON 硬套两种训练。
指令微调(SFT)对话样本、FAQ 对、带约束的回答稿。可导出 JSONL / ShareGPT 等常见格式,直接对接大模型微调。
清洗后的长文档、领域纯文本与配比统计,供持续预训练或从头训练使用,并可与大模型开发方案衔接。
抽检报告、低置信清单、来源血缘(哪份文件、哪一页)。验收看样本,不看口号。
我们不把「全部免人工」写成承诺。正确率按抽检口径统计:格式可训练、内容与原文一致、无明显编造。达到阈值的自动入库,其余必须复核后才能进训练集。
AI 自动加工样本抽检合格率 · 其余进入复核队列
| 路径 | 速度 | 人工投入 | 训练风险 |
|---|---|---|---|
| 全量人工标注 | 慢 | 高 | 质量稳,但难以及时跟上材料更新 |
| 原文直接喂模型 | 快 | 几乎为零 | 页眉、错字、扫描噪声会污染权重 |
| 数据工厂 | 快 | 抽检 + 难例 | 70%+ 自动达标,脏数据隔离出仓 |