附录 C 大模型工程术语表¶
术语表给出本书语境中的简明定义。它不是替代正文的“标准答案”,同一术语在论文和框架中可能有更具体含义。
- Agent:由模型参与运行时决策、可使用工具并维护状态的系统;自主程度应受权限、预算与验证约束。
- Alignment(对齐):让模型行为更符合人类或产品目标的训练与系统过程,包括 SFT、偏好优化、安全策略和评估。
- All-Gather:让所有 rank 收集到各 rank 的分片。
- All-Reduce:对各 rank 张量做求和等归约,并把结果发送给所有 rank。
- Attention Mask:在注意力分数上屏蔽不应被读取的位置,常见因果 mask 与 padding mask。
- AWQ:利用激活信息保护重要权重的权重量化方法族。
- Batch:一次并行处理的一组样本;在语言模型训练中应同时关注样本数与有效 token 数。
- BF16:具有接近 FP32 指数范围、较短尾数的 16 位浮点格式。
- BM25:基于词频、逆文档频率和长度归一化的经典稀疏检索函数。
- BPE:通过迭代合并频繁符号对学习子词词表的 tokenization 方法。
- Checkpoint:可保存并恢复训练或推理状态的快照;完整续训还需优化器、调度器、随机状态和数据位置。
- Chunk:RAG 索引与检索使用的文档片段,应保留来源、层级、页码、权限和版本。
- CLIP:通过图文对比学习建立共享表示空间的视觉语言模型。
- Continuous Batching:在生成过程中动态向执行批次插入新请求、移除已完成请求的调度方式。
- Cross-Attention:查询来自一个序列、键和值来自另一个序列的注意力。
- Cross-Encoder:把查询与候选文本联合编码并评分,常用于重排。
- CUDA OOM:GPU 显存分配失败;要区分权重、激活、缓存、临时 buffer 与碎片来源。
- Data Parallel:不同设备处理不同数据分片并同步梯度的并行方式。
- DDP:PyTorch 分布式数据并行,每个进程持有模型副本并通过集合通信同步梯度。
- Decode:自回归推理中逐 token 生成的阶段,常受内存带宽与 KV Cache 影响。
- Dense Retrieval:使用 embedding 向量进行语义近邻检索。
- DPO:使用偏好对直接优化策略相对参考模型概率差的离线偏好方法。
- Embedding:把离散对象或文本映射为连续向量的表示。
- EOS:序列结束特殊 token;训练标签、生成停止与 padding 需正确区分。
- Expert Parallel:将 MoE 专家分布到不同设备的并行方式。
- FlashAttention:通过 IO-aware 分块和在线 Softmax 减少高带宽内存读写的精确注意力实现。
- FP16:16 位浮点格式,训练时常需动态或静态 loss scaling。
- FSDP:PyTorch 全分片数据并行,可分片参数、梯度与优化器状态。
- Function Calling:模型按工具 Schema 提议函数与参数,由程序验证并决定是否执行。
- GQA:多个查询头按组共享较少的键和值头,降低 KV Cache。
- Gradient Accumulation:多次反向累积梯度后再更新,用于扩大有效 batch;不能解决单样本本身 OOM。
- GRPO:对同一 prompt 的一组回答使用组内相对奖励估计优势的策略优化方法。
- Grounding:让输出与可指认的输入、图像区域或外部证据建立对应关系。
- Hallucination:模型生成与事实、输入或证据不一致的内容;应进一步细分错误类型。
- Hybrid Retrieval:组合稀疏与稠密检索,并用 RRF 等方法融合排名。
- Inference:模型在固定权重下根据输入产生预测或生成结果的过程。
- Instruction Tuning:使用指令—回答或多轮消息数据训练模型遵循任务。
- KV Cache:生成时缓存历史 token 在各层的 K/V,避免重复计算。
- KL Divergence:衡量一个概率分布相对另一个分布差异的非对称量。
- Label Mask:用
-100等忽略值让某些 token 不参与语言建模损失。 - LayerNorm:通常在最后一维做中心化与方差归一化,再施加可学习仿射变换。
- LoRA:用低秩矩阵表示权重增量的参数高效微调方法。
- LRU Cache:淘汰最久未使用条目的缓存策略。
- MCP:模型上下文协议,用统一 client/host/server 架构连接工具、资源等能力。
- MHA:每个查询头具有独立 K/V 头的多头注意力。
- MLA:多头潜在注意力,通过低维潜变量等设计压缩表示与缓存;具体含义依模型实现。
- MoE:混合专家网络,用路由器让 token 稀疏激活少数专家。
- MQA:所有查询头共享一组 K/V 的注意力变体。
- nDCG:考虑相关性等级和排名位置的检索指标。
- P50/P95/P99:延迟分布的分位数,比单一平均值更能反映长尾。
- PagedAttention:用分页式物理块管理逻辑 KV Cache 的机制。
- Parameter Efficient Fine-Tuning:只训练少量参数或适配器的微调方法族。
- Perplexity:交叉熵的指数形式;跨 tokenizer 比较需要谨慎。
- Pipeline Parallel:把不同模型层放在不同设备并用 microbatch 流水执行。
- PPO:使用概率比裁剪等机制限制策略更新幅度的在线强化学习算法。
- Prefill:对完整提示并行计算、建立 KV Cache 并产生首 token 的阶段。
- Prompt:提供给模型的文本或多模态输入;系统可靠性不能只依赖提示约束。
- QLoRA:在量化冻结基础权重上训练 LoRA 适配器的高效微调路线。
- Quantization:用较少比特表示权重或激活,并配合尺度与低比特 kernel。
- RAG:先检索外部证据,再将证据作为上下文用于生成的系统范式。
- Recall@K:前 K 个结果是否覆盖相关文档的召回指标。
- Reduce-Scatter:先归约,再把结果分片给不同 rank。
- Reranker:对召回候选进行更精细相关性排序的模型或规则。
- Reward Hacking:策略利用奖励函数漏洞取得高分,却没有实现真实目标。
- RMSNorm:不减均值、按均方根控制隐藏向量尺度的归一化。
- RoPE:把位置相关旋转作用于 Q/K,使点积包含相对位置信息。
- RRF:只利用名次、无需统一原始分数尺度的倒数排名融合。
- SFT:有监督微调,使用目标输出 token 的交叉熵训练模型行为。
- Softmax:把 logits 归一化为概率;实现时通常先减最大值保证稳定。
- Speculative Decoding:小模型提议多个 token,由目标模型并行验证以减少串行解码步数。
- SwiGLU:使用 SiLU 门控分支的前馈网络结构。
- Tensor Parallel:把单层矩阵运算切分到多个设备。
- Token:tokenizer 输出的基本离散单位,不一定等于字符或单词。
- Tokenizer:把文本与 token id 相互转换的规则、词表和特殊 token 集合。
- TPOT:Time Per Output Token,持续生成阶段每个输出 token 的时间。
- TTFT:Time To First Token,从请求开始到首 token 返回的时间。
- Vector Database:提供向量索引、近邻搜索和元数据过滤的存储系统。
- ViT:把图像切成 patch token 并使用 Transformer 编码的视觉架构。
- Workflow:由程序预定义执行路径的流程,与运行时自主选择步骤的 Agent 区分。
- ZeRO:通过分片优化器、梯度和参数降低数据并行冗余的技术族。