Appearance
LLM 训练机制
本页解决什么:把 Token、Embedding、预训练、后训练、微调、RAG 和 Agent 放到同一条能力链里,帮助 PM 判断大模型擅长什么、不擅长什么,以及什么时候需要额外组件。
如果还不清楚 Token、Embedding、多头自注意力、前馈网络、Encoder 与 Decoder 的关系,先看模型核心架构。本页在 Transformer 架构基础上继续解释 LLM 的训练与应用链路。
训练流水线
数据收集网页、书籍、代码、论文、问答、领域文档、多模态数据。
清洗去重过滤重复、低质、隐私、恶意和版权风险数据。
Tokenization把文本切成 token,影响多语言效率和上下文成本。
预训练自监督学习 next-token prediction,形成通用能力。
预训练之后还需要后训练、评估和部署优化。否则模型可能会续写文本,但不一定会遵循指令、拒绝危险请求或输出稳定格式。
预训练
decoder-only LLM 通常通过 next-token prediction 学习:给定前面的 token,预测下一个 token。这个过程让模型压缩大量语言、知识、代码和推理模式,但它不等于可靠数据库。参数中的知识会过期,也可能出现幻觉。
预训练最关键的工程问题是数据质量、数据配比、模型规模、训练稳定性和算力成本。中文、代码、数学、领域语料的比例会显著影响模型能力分布。
后训练
| 阶段 | 做什么 | 解决的问题 | 局限 |
|---|---|---|---|
| SFT | 用高质量指令-回答样本训练 | 指令遵循、格式和任务习惯 | 依赖数据质量 |
| RLHF | 用人类偏好训练奖励模型,再优化策略 | 有用、无害、符合偏好 | 流程复杂、成本高 |
| DPO | 直接用偏好对优化模型 | 简化偏好对齐 | 仍依赖偏好数据 |
| 领域继续预训练 | 用领域语料继续训练 | 适配专业语言分布 | 可能遗忘通用能力 |
PM 判别边界
| 概念 | 产品上解决什么 | 不解决什么 |
|---|---|---|
| Token | 控制文本切分、上下文长度和成本 | 不等于语义单位,中文和代码成本不同 |
| Embedding | 把文本变成可检索的向量 | 不保证答案正确,只提高相似内容召回 |
| 预训练 | 形成通用语言、知识和推理样式能力 | 不保证知道企业私有知识,也不保证最新事实 |
| 微调/SFT | 固化任务格式、风格、领域表达 | 不适合频繁更新事实库 |
| RAG | 从外部知识库检索证据再回答 | 不自动消除幻觉,依赖切片、召回和引用质量 |
| Agent | 把模型、工具、记忆和流程组合成行动系统 | 不等于完全自主,仍要权限、状态和兜底 |
AI PM 判断 LLM 方案时,可以先问:问题是语言生成、知识检索、格式遵循、工具执行还是流程自动化?如果事实经常变化,优先 RAG 或工具查询;如果只是输出风格和格式稳定,才考虑微调;如果需要跨系统行动,才进入 Agent 和工作流设计。
评估
LLM 评估应分为通用能力、领域能力、安全能力和业务指标。企业不应只看通用榜单,还要构建自己的黄金集:真实问题、标准答案、引用来源、失败样本、成本和延迟。
Python 入口
| 库 | 用途 |
|---|---|
transformers | 加载预训练模型、Tokenizer、推理 |
datasets | 训练数据集读取和处理 |
accelerate | 分布式和混合精度训练辅助 |
peft | LoRA/QLoRA 等参数高效微调 |
trl | SFT、奖励模型、偏好优化相关训练 |
python
from transformers import AutoModelForCausalLM, AutoTokenizer
model_id = "Qwen/Qwen2.5-0.5B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)
prompt = "用一句话解释什么是预训练。"
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=80)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))示例用于说明 LLM 推理入口。实际部署时还要考虑显存、量化、批处理和安全过滤。
下一步
- 需要先理解 Transformer 的核心积木:看模型核心架构。
- 需要私有知识或引用来源:看 RAG、微调与部署。
- 需要多步执行或工具调用:看 Agent 架构模式。
- 准备上线验收:看 评估与风险。
