Skip to content

LLM 训练机制

本页解决什么:把 Token、Embedding、预训练、后训练、微调、RAG 和 Agent 放到同一条能力链里,帮助 PM 判断大模型擅长什么、不擅长什么,以及什么时候需要额外组件。
LLM 从数据、清洗、Tokenization、预训练、后训练到评估和应用的流水线图
LLM 能力来自训练链路,但产品落地往往还要叠加 RAG、微调、Agent、工具调用和评估闭环。
大模型擅长、需要增强、需要约束和需要验证的能力边界图
LLM 是语言推理核心,不是数据库、流程引擎或权限系统;私有知识、稳定执行和风险控制需要额外组件。

如果还不清楚 Token、Embedding、多头自注意力、前馈网络、Encoder 与 Decoder 的关系,先看模型核心架构。本页在 Transformer 架构基础上继续解释 LLM 的训练与应用链路。

训练流水线

数据收集网页、书籍、代码、论文、问答、领域文档、多模态数据。
清洗去重过滤重复、低质、隐私、恶意和版权风险数据。
Tokenization把文本切成 token,影响多语言效率和上下文成本。
预训练自监督学习 next-token prediction,形成通用能力。

预训练之后还需要后训练、评估和部署优化。否则模型可能会续写文本,但不一定会遵循指令、拒绝危险请求或输出稳定格式。

预训练

decoder-only LLM 通常通过 next-token prediction 学习:给定前面的 token,预测下一个 token。这个过程让模型压缩大量语言、知识、代码和推理模式,但它不等于可靠数据库。参数中的知识会过期,也可能出现幻觉。

预训练最关键的工程问题是数据质量、数据配比、模型规模、训练稳定性和算力成本。中文、代码、数学、领域语料的比例会显著影响模型能力分布。

后训练

阶段做什么解决的问题局限
SFT用高质量指令-回答样本训练指令遵循、格式和任务习惯依赖数据质量
RLHF用人类偏好训练奖励模型,再优化策略有用、无害、符合偏好流程复杂、成本高
DPO直接用偏好对优化模型简化偏好对齐仍依赖偏好数据
领域继续预训练用领域语料继续训练适配专业语言分布可能遗忘通用能力

PM 判别边界

概念产品上解决什么不解决什么
Token控制文本切分、上下文长度和成本不等于语义单位,中文和代码成本不同
Embedding把文本变成可检索的向量不保证答案正确,只提高相似内容召回
预训练形成通用语言、知识和推理样式能力不保证知道企业私有知识,也不保证最新事实
微调/SFT固化任务格式、风格、领域表达不适合频繁更新事实库
RAG从外部知识库检索证据再回答不自动消除幻觉,依赖切片、召回和引用质量
Agent把模型、工具、记忆和流程组合成行动系统不等于完全自主,仍要权限、状态和兜底

AI PM 判断 LLM 方案时,可以先问:问题是语言生成、知识检索、格式遵循、工具执行还是流程自动化?如果事实经常变化,优先 RAG 或工具查询;如果只是输出风格和格式稳定,才考虑微调;如果需要跨系统行动,才进入 Agent 和工作流设计。

评估

LLM 评估应分为通用能力、领域能力、安全能力和业务指标。企业不应只看通用榜单,还要构建自己的黄金集:真实问题、标准答案、引用来源、失败样本、成本和延迟。

Python 入口

用途
transformers加载预训练模型、Tokenizer、推理
datasets训练数据集读取和处理
accelerate分布式和混合精度训练辅助
peftLoRA/QLoRA 等参数高效微调
trlSFT、奖励模型、偏好优化相关训练
python
from transformers import AutoModelForCausalLM, AutoTokenizer

model_id = "Qwen/Qwen2.5-0.5B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_id)
model = AutoModelForCausalLM.from_pretrained(model_id)

prompt = "用一句话解释什么是预训练。"
inputs = tokenizer(prompt, return_tensors="pt")
outputs = model.generate(**inputs, max_new_tokens=80)
print(tokenizer.decode(outputs[0], skip_special_tokens=True))

示例用于说明 LLM 推理入口。实际部署时还要考虑显存、量化、批处理和安全过滤。

下一步

维知 Wiki · 面向应用工程的 AI 知识与训练系统