术语表
本页汇集全书使用的中文术语。每个条目都列出英文原文、简明定义,以及该术语在书中首次出现的位置。术语在每章第一次使用时也会链接回对应条目,便于随时查阅。
- 混合专家 mixture-of-experts (MoE)
一种架构,用多个专家层替代稠密前馈层,并只把每个词元路由到少数专家,使模型容量增加时所需计算量不必同比增长。
- 多头潜在注意力 multi-head latent attention (MLA)
DeepSeek-V2 提出的一种注意力设计,将键和值压缩为低秩潜在表示,以减小 KV 缓存。
- 中段训练 mid-training
一个类似预训练的阶段,位于通用预训练和后训练之间,通常会在继续进行下一词元训练时混入专业领域或更高质量的数据。
- KV 缓存 key-value cache
一种存储结构,保存此前词元的注意力键和值,使每个解码步骤都能复用先前的计算结果。
- 扩展律 scaling law
一种经验幂律,描述模型损失与算力、参数量和数据量之间的关系,用于预测质量并分配训练预算。
- 算术编码 arithmetic coding
一种熵编码方法,将整条消息表示为单位区间内的一个子区间,使码率接近信息源的理论最优值。
- 最小描述长度 minimum description length (MDL)
一种模型选择原则,倾向于选择能让模型自身与数据的合计描述最短的模型。
- 两部分编码 two-part code
一种最小描述长度编码,先记录模型,再使用该模型记录数据。
- 时序差分 temporal-difference
一种强化学习更新,不等待最终回报,而是利用下一步的估计自举当前的价值估计。
- 下一词元预测 next-token prediction
一种预训练目标,要求模型根据此前的词元预测当前词元。
- 交叉熵 cross-entropy
一种损失函数,根据模型完整预测分布中分配给正确答案的概率来衡量预测误差。
- 困惑度 perplexity
交叉熵的指数,常解释为模型在每一步平均考虑的合理词元选项数量。
- 训练词元 training tokens
预训练期间处理的词元实例总数,包括重复样本和对数据的额外遍历。
- 计算最优 compute-optimal
在固定算力预算下,能够取得最低预期损失的模型规模与训练数据之间的平衡。
- AdamW 优化器 AdamW
Adam 优化器的一种变体,将权重衰减与基于梯度的参数更新分开处理。
- 预热-稳定-衰减调度 warmup-stable-decay (WSD)
一种学习率调度,先逐步升高学习率,在大部分训练期间保持不变,并在接近结束时降低。
- z-loss 正则 z-loss
一个较小的辅助惩罚项,作用于 softmax 归一化因子的对数,可抑制 logit 漂移并稳定大模型训练。
- 查询-键归一化 query-key normalization (QK-norm)
一种稳定训练的技术,在查询向量与键向量做点积前将二者归一化,以限制注意力 logit 的增长。
- 梯度裁剪 gradient clipping
一种稳定训练的技术,在更新前限制梯度大小,避免异常大的梯度扰乱训练。
- 去污染 decontamination
从训练数据中移除与评测数据重叠的样本,避免模型因记忆样本而抬高基准分数。
- 最小哈希 MinHash
一种能够低成本估算集合相似度的哈希方案,用于在训练语料中发现并删除近重复文档。
- 局部敏感哈希 locality-sensitive hashing (LSH)
一种哈希方法,使相似项以较高概率进入同一个桶,可用于近似搜索和去重。
- 分词器 tokenizer
一种组件,将原始文本转换为模型使用的整数词元标识符,并把模型输出还原为文本。
- SentencePiece 分词器 SentencePiece
一种不依赖特定语言的分词器,无需预分词即可直接在原始文本上训练,并将包括空格在内的输入视为连续字符流。
- 字节对编码 byte-pair encoding (BPE)
一种分词器训练算法,从字节开始,反复将最常见的相邻项合并为新词元,逐步构建子词词表。
- 无分词器方案 tokenizer-free
一种不使用固定词表、直接对字节或字符建模的方法,以更长的序列为代价减少分词器带来的偏差。
- 残差流 residual stream
贯穿 Transformer 的共享向量,每个块都会读取它,并把自己的更新加回其中。
- 均方根层归一化 root mean square layer normalization (RMSNorm)
一种归一化方法,按激活值的均方根重新缩放激活值,但不减去均值。
- Swish 门控线性单元 Swish-gated linear unit (SwiGLU)
一种门控前馈层,将经过 Swish 激活的投影与另一个投影结合后生成输出。
- 旋转位置嵌入 rotary position embedding (RoPE)
一种位置编码方法,按位置相关的角度旋转查询向量和键向量,使二者的点积能够反映相对位置。
- 预填充 prefill
初始推理阶段,处理完整提示,并计算后续生成词元所需的键和值。
- 解码 decode
预填充之后的推理阶段,复用已缓存的键和值,每次生成一个词元。
- FlashAttention 注意力内核 FlashAttention
一种精确注意力算法,无需在主存中保存完整的分数矩阵,因此可减少内存数据传输并加快注意力计算。
- 零冗余优化器 Zero Redundancy Optimizer (ZeRO)
一种数据并行方法,把优化器状态、梯度和参数分片到各设备而非各自复制,从而降低单设备显存。
- 全分片数据并行 fully sharded data parallel (FSDP)
PyTorch 提供的一种分布式训练方法,将参数、梯度和优化器状态分片,并只在需要时收集当前层的参数。
- 继续预训练 continued pretraining
一个训练阶段,在已有预训练模型上继续优化下一词元目标,通常使用特定领域的数据。
- 监督微调 supervised fine-tuning (SFT)
后训练的一个阶段,通过精选的输入输出示例,让预训练模型学会遵循指令。
- 直接偏好优化 direct preference optimization (DPO)
一种后训练方法,直接从入选和落选的响应对中学习,无需单独训练奖励模型或运行强化学习循环。
- 可验证奖励的强化学习 reinforcement learning with verifiable rewards (RLVR)
一种强化学习方法,由单元测试或精确答案规则等自动校验器提供奖励。
- 扩散 diffusion
一种生成过程,学习逆转对数据逐步加噪的过程,把纯噪声一步步变成样本。
- 流匹配 flow matching
一种生成模型训练方法,学习把样本从噪声分布输运到数据分布的速度场。
- 去噪扩散概率模型 denoising diffusion probabilistic models (DDPM)
一种离散时间扩散表述,训练网络逆转一个逐步向数据添加噪声的固定过程。
- 随机微分方程 stochastic differential equation (SDE)
一种包含随机过程的微分方程,可描述连续时间中的确定性变化和噪声。
- 常微分方程 ordinary differential equation (ODE)
一种方程,描述单个自变量的函数与该函数一个或多个导数之间的关系。
- 扩散 Transformer diffusion transformer (DiT)
一种扩散模型,使用处理图块的 Transformer 而不是 U-Net 作为去噪器,是现代图像和视频生成器中可扩展的主干架构。
- 无分类器引导 classifier-free guidance (CFG)
一种采样技巧,让条件生成器的结果远离无条件输出,以降低多样性为代价提高对提示的贴合度。
- 修正流 rectified flow
一种流匹配变体,把噪声与数据之间的输运路径拉直,使更少的求解步即可达到高质量。
- 非自回归生成 non-autoregressive generation (NAR)
一种生成方法,并行预测多个输出元素,而不是让每个元素都以前面的输出为条件。
- 自回归 autoregression
一种生成方法,每次生成一个序列元素,并让新元素以此前已生成的元素为条件。
- 自动语音识别 automatic speech recognition (ASR)
一种将语音音频转换为书面文本的系统。
- 连接主义时序分类 connectionist temporal classification (CTC)
一种损失函数,无需将每个输入位置与目标标签对齐即可训练序列模型。
- 文本到语音 text-to-speech (TTS)
一种将书面文本转换为语音音频的系统。
- 对比语言-图像预训练 contrastive language-image pretraining (CLIP)
一种训练方法,让匹配的图像和文本在共享嵌入空间中彼此接近,并将不匹配的图文对分开。
- 视觉 Transformer vision transformer (ViT)
一种将图像视为图块序列的 Transformer,把该架构及其扩展方式应用到视觉任务。
- 视觉-语言-动作模型 vision-language-action model (VLA)
一种模型,将视觉和语言输入直接映射为机器人或智能体动作,把视觉语言模型的能力扩展到控制。
- 参数高效微调 parameter-efficient fine-tuning (PEFT)
一类模型适配方法,只训练少量新增或选定参数,并冻结大部分预训练权重。
- 过度拒绝 over-refusal
一种安全失效,模型因为无害请求与有害请求相似而错误地拒绝前者。
- 低秩适配 low-rank adaptation (LoRA)
一种参数高效微调方法,冻结基座权重,并为每层学习一个小型低秩更新,使多个任务适配器能够共享同一个基座模型。
- 量化低秩适配 quantized low-rank adaptation (QLoRA)
一种微调方法,在量化后的基座模型上应用 LoRA 适配器,以降低训练所需的内存。
- 近端策略优化 proximal policy optimization (PPO)
一种策略梯度强化学习算法,限制每次更新的幅度,避免新策略偏离上一策略过远。
- 基于 AI 反馈的强化学习 reinforcement learning from AI feedback (RLAIF)
一种后训练方法,将模型生成的偏好或批评作为强化学习反馈,而不只依赖人工标注。
- Kullback-Leibler 散度 Kullback-Leibler divergence (KL)
一种非对称度量,用于表示一个概率分布与另一个概率分布之间的差异,在对齐中常用于限制策略漂移。
- 恒等偏好优化 identity preference optimization (IPO)
一种 DPO 变体,用平方目标替换 log-sigmoid 损失,以抑制对偏好对的过拟合。
- Kahneman-Tversky 优化 Kahneman-Tversky optimization (KTO)
一种偏好学习方法,使用受前景理论启发的损失从未配对的正面或负面标签中学习,无需偏好对。
- 优势比偏好优化 odds-ratio preference optimization (ORPO)
一种使用优势比惩罚将偏好对齐并入监督微调的方法,无需单独的参考模型。
- 简单偏好优化 simple preference optimization (SimPO)
一种无参考模型的 DPO 变体,用平均对数概率作隐式奖励并设目标间隔,更简单且省显存。
- 思维链 chain of thought (CoT)
模型在给出最终答案之前生成的一系列中间推理步骤。
- 由简入繁 least-to-most
一种提示策略,将难题分解为依次求解的较简单子问题,并让每一步建立在上一步的结果之上。
- 自一致性 self-consistency
一种解码方法,采样多条推理路径,并返回其中出现次数最多的答案。
- 组相对策略优化 group relative policy optimization (GRPO)
一种强化学习方法,从一组采样答案中估计相对优势,无需另外训练价值模型。
- REINFORCE 留一法 REINFORCE leave-one-out (RLOO)
一种轻量策略梯度方法,用其余样本的平均奖励作为每个样本的基线,无需学习价值网络。
- 有效吞吐量 goodput
满足服务延迟或其他验收目标的已完成请求速率。
- 连续批处理 continuous batching
一种服务调度方式,在解码步骤之间加入和移除请求,使已完成请求能够立即释放容量。
- PagedAttention 分页注意力 PagedAttention
一种 KV 缓存分配器,像虚拟内存一样以固定大小的页存储缓存,避免为每个序列预留连续空间造成的碎片。
- 前缀缓存 prefix caching
一种服务优化方法,复用多个请求共享提示前缀的 KV 缓存,避免重复执行预填充。
- 动态随机存取存储器 dynamic random-access memory (DRAM)
DRAM 使用需要定期刷新的电容存储比特,并提供大部分片外工作内存。
- 推测解码 speculative decoding
一种解码方法,由较快的模型起草多个词元,再由目标模型一次完成验证。
- 静态随机存取存储器 static random-access memory (SRAM)
SRAM 使用稳定电路存储每个比特,无需定期刷新,常用于高速片上缓存。
- 约束解码 constrained decoding
一种解码方法,每一步只允许生成符合语法或模式的词元,从而保证输出结构有效。
- 有限状态机 finite-state machine (FSM)
一种计算模型,包含有限个状态,以及根据输入在这些状态之间转换的规则。
- 注意力汇 attention sink
一个位于序列开头的词元,即使内容并不重要也会获得大量注意力,可帮助部分模型在长上下文中维持原有行为。
- 检索增强生成 retrieval-augmented generation (RAG)
一种方法,在查询时检索相关文档并将其加入提示,使模型能够依据这些证据作答。
- BM25 稀疏检索 BM25
一种词法排序函数,根据查询词频、文档长度以及各词在文档集合中的稀有程度为文档评分。
- 双编码器 dual-encoder
一种检索模型,分别对查询和文档生成嵌入,因此可以在搜索开始前预先计算文档向量。
- 分层可导航小世界图 hierarchical navigable small-world (HNSW)
一种用于向量近似最近邻搜索的图索引,通过分层链接快速找到相近的嵌入。
- 混合搜索 hybrid search
一种检索方法,将词法分数与向量相似度结合,使结果同时反映精确词项和语义含义。
- 交叉编码器 cross-encoder
一种模型,在一次前向传播中联合为查询和文档评分,通常比双编码器更准确,但计算成本过高,无法遍历整个语料库,因此用于重排。
- 留出集 held-out set
留出集包含未参与训练的样本,专门用于衡量模型对未见数据的泛化能力。
- 成员推断 membership inference
一种攻击,测试某个具体样本是否在模型的训练集中,是基本的隐私威胁。
- HELM Holistic Evaluation of Language Models
一套基准,在众多场景与指标上整体评估模型,而非压缩为单一排行榜数字。
- 模型评判 model-as-judge
一种评测方法,让模型在人工审查之前或代替人工审查,对输出评分或进行比较。
- 成对比较 pairwise comparison
一种评测方式,同时呈现两个输出,并要求评判者根据既定标准选出较好的一个。
- 私有测试集 private test set
一种不向模型开发者公开的评测集,用于降低直接针对其中样本优化或训练的风险。
- 至少一次成功率 pass@k
k 次采样尝试中至少一次通过的概率,是代码等可验证任务的标准指标。
- 机械可解释性 mechanistic interpretability
一个研究领域,通过识别神经网络内部可理解的特征、电路和计算,分析网络如何实现特定行为。
- 叠加 superposition
一种表示策略,网络利用激活空间中相互重叠的方向,存储数量多于空间维度的特征。
- 弱到强 weak-to-strong
一种研究设置,用于检验较弱模型提供的监督能否引出较强模型的有用行为。
- 欺骗性对齐 deceptive alignment
一种假设中的失效,模型在受到监控时看似遵循训练目标,却在不受观察时追求另一个目标。
- 提示注入 prompt injection
一种攻击,模型输入中的不可信内容覆盖原有指令,并借智能体读取的数据将其劫持。
- 指令层级 instruction hierarchy
一种按信任度排列指令来源的规则,通常依次为系统、开发者、用户和工具输出,使模型在指令冲突时知道应当遵循哪一项。
- 红队 red-teaming
一种有组织的对抗性测试活动,用于在部署前发现系统失效、滥用途径和潜在危害。
- 对抗鲁棒性 adversarial robustness
模型面对攻击者为诱发失效而刻意构造的输入时,仍能保持预期行为的能力。
- 越狱 jailbreak
一种经过刻意构造的提示,用于绕过模型的安全训练,诱导模型生成原本经过调优应当拒绝的内容。
- 机器遗忘 machine unlearning
一种处理过程,无需重复完整的原始训练,即可从已训练模型中移除指定训练数据的影响。
- 布鲁塞尔效应 Brussels effect
欧盟监管成为事实上全球标准的倾向,因为企业宁愿处处适用、也不愿维护两条产品线。
- 高带宽内存 high-bandwidth memory (HBM)
靠近加速器放置的多层 DRAM 裸片,可提供高于传统片外存储器的数据传输带宽。
- 远程直接内存访问 remote direct memory access (RDMA)
一种网络能力,允许一台机器在不经对方 CPU 的情况下读写其内存,是快速集合通信的关键。
- 张量处理器 tensor processing unit (TPU)
谷歌设计的一种加速器,以矩阵乘法硬件为核心,用于机器学习训练和推理。
- 芯片间互连 inter-chip interconnect (ICI)
直接连接加速器的高速链路(如 NVLink 或 TPU 的 ICI),承载张量并行与流水线并行的集合通信。
- 图形处理器 graphics processing unit (GPU)
一种最初为图形处理开发的高度并行处理器,现广泛用于训练和服务神经网络。
- 自动微分 automatic differentiation
一种计算导数的方法,对程序执行的基本运算逐项应用链式法则。
- 静默数据损坏 silent data corruption (SDC)
静默数据损坏是指硬件产生错误结果,却没有报告故障。
- CoWoS chip-on-wafer-on-substrate
台积电的一种封装技术,通过共享的硅中介层连接计算裸片和高带宽内存堆叠。
- 电源使用效率 power usage effectiveness (PUE)
数据中心总功耗与计算设备功耗之比,数值越接近 1,说明设施自身的额外能耗越少。
- 小型模块化反应堆 small modular reactor (SMR)
工厂化建造、出力适中的核反应堆,被提议作为 AI 数据中心专用的稳定电源。
- 平均无故障时间 mean time between failures (MTBF)
一次硬件故障与下一次硬件故障之间的预期平均运行时间。
- 奖励欺骗 reward hacking
一种失效,模型利用度量中的漏洞获得较高奖励,却没有实现预期目标。
- 模型上下文协议 Model Context Protocol (MCP)
一种开放协议,标准化智能体连接外部工具与数据源的方式,使宿主能以统一方式对接众多服务器。
- 资本性支出 capital expense (CapEx)
资本性支出用于购买加速器、网络设备和数据中心等长期资产,这些资产会随时间计提折旧。
- 运营性支出 operating expense (OpEx)
运营性支出是运行服务时反复发生的成本,包括电力、带宽、维护和租用的云容量。
- 网关 gateway
一种位于模型提供商之前的代理,集中处理多个后端的路由、身份验证、速率限制、成本跟踪和回退。
- 沙箱 sandbox
一个隔离环境,约束不可信代码或智能体动作,使其无法影响宿主系统。
- 虚拟密钥 virtual key
网关签发并映射到上游提供商密钥的凭证,使运营方无需共享真实密钥,即可按团队设置预算和限额,或单独吊销凭证。
- 光学字符识别 optical character recognition (OCR)
一种处理过程,将扫描文档、照片或其他图像中的文字转换为机器可读的字符。
- 视觉语言模型 vision-language model (VLM)
一种同时处理图像和文本的模型,可用于回答问题、描述视觉内容或执行其他多模态任务。
- 可观测性 observability
根据日志、指标、追踪、提示、词元用量和质量测量等信号推断系统内部状态的能力。
- 服务水平指标 service level indicator (SLI)
一项对服务行为的测量指标,例如延迟或错误率,服务等级目标会以此为依据设定。
- 服务等级目标 service-level objective (SLO)
服务系统承诺达到的指标阈值,例如要求 p99 延迟不超过某个上限。
- 人在回路中 human-in-the-loop (HITL)
一种系统设计,在预先确定的环节引入人工判断,用于批准、纠正、标注、升级或停止模型行为。
- 校准后的依赖 calibrated reliance
一种使用自动化的方式,在证据支持时依赖自动化,在不确定性或风险较高时复核结果或改由人工决定。
- 自动化偏差 automation bias
过度依赖自动化建议的倾向,在系统显得权威或用户有时间压力时尤其明显。
- 基于人类反馈的强化学习 reinforcement learning from human feedback (RLHF)
一种后训练方法,先从人类偏好中学习奖励模型,再根据该奖励优化策略。
评论
登录后评论