从「会用模型」到「拥有基座」
微调解决话术与任务贴合;预训练 / 持续预训练解决领域表征、长期自主可控与模型资产沉淀。适合语料充足、需要自有底座的团队
目标与选型
规模 · 领域 · 预算
语料工厂
过滤 · 配比 · 版本
预训练训练
0.5B–70B 分布式
评测体系
通用 · 行业 · 安全
对齐与上线
SFT · 部署 · 运维
可从开源基座做持续预训练(CPT)注入行业知识,也可在充足语料与算力下从零或近零构建领域基座;两种路径均可衔接到指令微调与产品化推理。
0.5B–70B 预训练规格怎么选
按落地形态、并发与领域深度选型;先小规模跑通数据与评测闭环,再扩到更大参数量
适合嵌入设备、本地助手、高 QPS 轻量推理,或作为行业小模型原型验证数据配方。
- 训练成本低,迭代快
- 可私有化部署到有限算力环境
- 常见:智能硬件、一线岗位助手
效果与成本平衡点:多数行业基座、知识问答与公文生成从此档起步,后续可平滑扩到更大规格。
- 单机多卡到小集群即可训
- 推理成本可控,易产品化
- 常见:行业问答、客服基座、办公助手
面向更深领域知识、长文档理解与更强生成质量,适合科研、医疗、法律、金融等专业场景。
- 需更完整语料配比与评测
- 多机多卡分布式训练
- 常见:专业助手、研判与写作基座
追求接近通用大模型能力并沉淀自有资产时选用;对语料规模、训练稳定性与算力预算要求最高。
- 大规模集群与容错工程
- 阶段评测与检查点策略完备
- 常见:集团级基座、持续预训练旗舰
多源语料管道
覆盖网页、文档、代码、对话与垂直行业专有语料,统一进入可追踪的预训练语料仓。
- 通用语料 + 行业专有语料分层管理
- 采集批次、来源与授权策略可审计
- 支持持续增量注入(持续预训练)
过滤、去重与安全
质量分级、近重复去除、毒性与隐私过滤,降低脏数据对基座的长期污染。
- 启发式 + 模型辅助质量打分
- 文档级 / 段落级去重
- 有害内容、PII 与版权策略
Token 统计与配比实验
按领域、语言、难度与格式做混合配比实验,避免某一类语料主导或灾难性遗忘。
- Token 级统计看板
- 多配方 A/B 与小规模预跑
- 配方版本与训练 run 绑定
版本、血缘与可复现
每次预训练对应锁定的数据版本与处理脚本快照,保证实验可复现、问题可回溯。
- 数据版本 + 处理流水线版本
- 样本血缘查询
- 合规留存与权限隔离
面向 0.5B–70B 的训练与稳定性
从小规格单机到 70B 多机多卡,提供作业编排、分布式并行、检查点与故障恢复能力
分布式训练
按模型规模选择数据并行、张量并行与流水线并行组合,打通多机多卡通信与调度。
检查点与容错
周期性保存检查点,支持故障恢复与断点续训,降低长周期训练的失败成本。
监控与稳定性
Loss、吞吐、显存与通信瓶颈可视化;异常波动告警,便于及时调整超参或数据配方。
训练路径可选
按目标选择从零预训练、基于开源基座的持续预训练,或「通用语料预热 → 行业语料注入」分阶段策略。
- 持续预训练(CPT):更快注入领域知识
- 全量预训练:长期自主可控的旗舰路径
- 与后续 SFT / 对齐无缝衔接
评测体系
通用能力、行业任务与安全红线三套评测并行,阶段检查点决定是否继续训或回滚配方。
- 通用基准 + 自建行业评测集
- 人工抽检样例库
- 安全与拒答策略基线
谁更适合做预训练开发
行业基座与自主可控
需要数据不出域、模型可沉淀为组织资产;从 7B–14B 起步,逐步扩展到更大规格。
高校与科研院所
开展领域持续预训练、配方实验与评测研究,可与产学研课题、验证实验联合推进。
垂直产业平台
农业、医疗、教育、文旅等垂直平台需要更强领域表征时,在微调之上建设行业基座。
端侧与私有化产品
0.5B–3B 小模型预训练 / 蒸馏路径,服务嵌入式、一体机与高并发私有化场景。
从目标定义到基座交付
端到端陪跑;也可按「只建语料工厂 / 只租集群代训 / 完整基座交钥匙」拆分采购
目标与底座选型
明确参数规模(0.5B–70B)、领域边界、合规要求、语料现状与算力预算。
语料工厂建设
搭建采集清洗管道,完成质量分级、配比实验与可训练语料版本冻结。
预训练与评测
作业编排、分布式训练、阶段评测与检查点管理,必要时回滚配方重训。
对齐与产品化
指令微调、安全对齐、推理部署与运维交接,并可继续接入智能体与业务系统。
数据交付物
预训练语料版本、过滤与配比报告、处理流水线说明、血缘与合规材料。
模型交付物
基座权重与关键检查点、训练配置、评测报告、已知局限与后续迭代建议。
上线交付物
对齐后的可用模型、推理部署方案、监控基线,以及与微调 / 智能体的衔接手册。
预训练还是先做微调?
大多数业务可先用微调验证价值;当需要更强领域表征、长期自主演进或端侧自有小模型时,再进入预训练
| 维度 | 大模型开发(预训练) | 大模型微调 |
|---|---|---|
| 目标 | 自有基座 / 持续预训练,沉淀模型资产 | 贴合话术、口径与任务格式 |
| 参数规模 | 0.5B–70B,按场景选型 | 通常基于现成 7B–70B 基座做轻量适配 |
| 数据 | 大规模预训练语料 + 配比工程 | 中等规模高质量指令 / 对话数据 |
| 周期与成本 | 高,需集群与工程投入 | 相对低,适合快速试点 |
| 后续衔接 | 对齐 → 微调 → 智能体 / 产品化 | 可直接发布;效果不够再升级预训练 |
从合适的规格开始建基座
告诉我们目标参数量(0.5B–70B)、领域边界、现有语料规模与算力预算,我们将给出选型建议、语料工厂范围、训练周期与验收指标方案。
预约预训练方案咨询 查看 GPU 训练算力