先把通用模型「教会业务」
当已有较好开源/商用基座,只需贴合话术、口径与任务格式时,微调是成本最低、周期最短的路径;数据工厂保证「喂进去的是对的数据」
场景定义
任务类型 · 指标 · 边界
数据工厂
清洗 · 标注 · 版本
微调训练
LoRA · QLoRA · SFT
评测迭代
对比 · 抽检 · 回滚
发布调用
API · 私有端点
多源采集与导入
对接文档、表格、对话日志、工单与知识库导出,统一进入可追踪的语料仓。
- JSONL / CSV / Markdown / PDF / Word
- 客服会话、工单、FAQ、制度文档批量导入
- 来源标签与采集批次可追溯
清洗去重与质量评分
自动过滤脏数据、近重复与低信息样本,按质量分级决定是否进入训练集。
- 格式校验、乱码与空样本剔除
- 语义近重复检测与抽样复核
- 质量分档:训练 / 评测 / 待人工
指令样本与偏好数据
按任务构造 SFT 指令集,必要时补充偏好对(chosen / rejected),支撑对齐与风格固化。
- 问答对 / 指令-输出 / 多轮对话样本
- 分类、抽取、改写、摘要等任务模板
- 人工标注规范与抽检工作流
脱敏、权限与版本
敏感信息脱敏、分区权限与数据集版本锁定,保证合规可复现。
- 手机号、证件号、客户标识等脱敏规则
- 训练/评测集隔离,防泄漏
- 数据版本、血缘与实验记录绑定
按目标选技术路径,而不是堆参数
默认推荐轻量微调快速验证;对效果要求极高的关键任务,再评估全参数微调或与智能体 / RAG 组合
LoRA 微调
只训练低秩适配器,显存占用低、训练快,适合多数业务话术与任务贴合场景。
QLoRA 量化微调
4-bit 量化 + LoRA,在更小卡上微调更大基座,进一步压低试点成本。
全参数 / 深度优化
对领域术语、复杂生成质量要求极高时,可升级全参微调或分阶段训练策略。
训练可视化与管控
推荐参数模板 + 高级自定义;实时查看 Loss、评估指标与资源占用,异常可早停。
- 学习率、批次、轮数与早停策略可配
- 检查点自动保存与断点续训
- 训练日志可导出,便于复盘
效果对比与发布
基座 vs 微调模型同题对比;通过后一键发布 API 或私有推理端点,支持版本回滚。
- 自动指标 + 人工抽检双轨验收
- 多版本并存,灰度切换
- 可对接智能体、助手与业务系统
四步完成业务定制
从盘点到上线一条龙;也可只购买数据工厂或只使用自助微调平台,按阶段拆分交付
场景与数据盘点
明确任务类型、成功指标、基座选型与可用语料来源,划定脱敏与合规边界。
数据工厂加工
清洗标注、构造指令/偏好集,冻结可训练版本,并同步划出评测集。
微调与评测
启动训练任务,自动指标 + 人工抽检对比基座,不合格则迭代数据或参数。
上线与持续优化
发布 API / 私有端点,难例与线上日志回流数据工厂,形成下一轮版本。
数据交付物
训练集与评测集版本、标注规范、脱敏说明、质量报告与数据血缘记录。
模型交付物
微调权重 / LoRA 适配器、训练配置、评测报告、对比样例与回滚说明。
上线交付物
推理 API 或私有端点、调用示例、监控告警建议与后续迭代节奏建议。
微调、智能体还是预训练?
多数业务先用微调验证价值;需要工具办事时叠加智能体;需要自有基座与长期演进时再进入大模型开发
| 维度 | 大模型微调 | AI 智能体定制 | 大模型开发(预训练) |
|---|---|---|---|
| 核心目标 | 让模型更懂话术、口径与任务格式 | 让系统能查知识、调工具、按流程办事 | 构建自有行业基座与长期模型资产 |
| 数据量级 | 中等高质量指令/对话数据 | 知识库 + 工具接口为主 | 大规模预训练语料 |
| 周期与成本 | 相对低,适合快速试点 | 中等,取决于系统对接深度 | 高,需算力与工程投入 |
| 典型起点 | 客服口径、公文、分类抽取 | 客服办单、内部助手、业务办理 | 行业基座、持续预训练 |