术语表
本书使用的专业术语,附其英文原文、一行定义(在有助于理解时),以及术语首次出现处的链接。每一章里术语的首次出现都会链接到这里。
- 混合专家 mixture-of-experts (MoE)
用许多专家层替换稠密前馈层、并把每个词元只路由给少数几个的架构,使容量增长而算力不成比例增加。
- 多头潜在注意力 multi-head latent attention (MLA)
DeepSeek-V2 提出的注意力变体,用低秩潜在向量替代每个头的完整键和值来缓存,宣称以小缓存达到 MHA 级质量。
- 中段训练 mid-training
位于宽泛预训练与后训练之间、仍近似预训练的一段训练,通常在下一词元目标下混入专门化或更高质量的数据。
- 监督微调 supervised fine-tuning (SFT)
在精选的输入-输出示例上训练预训练模型,使其按目标格式遵循指令;后训练的第一个阶段。
- KV 缓存 key-value cache
保存过去词元的键和值、使解码无需重算即可关注它们的缓存;主导服务的内存成本。
- 扩展律 scaling law
把模型损失与算力、参数量和数据量联系起来的经验幂律,用于预测质量并分配训练预算。
- 稀疏自编码器 sparse autoencoder (SAE)
一种可解释性工具,把模型激活分解为许多稀疏、更单义的特征,用于读出网络所表示的内容。
- 算术编码 arithmetic coding
一种熵编码,把整条消息编码为 [0,1) 内的单个小数,逼近最优码率;从预测通往压缩的桥梁。
- 两部分编码 two-part code
一种 MDL 编码,先发送模型、再发送给定模型下的数据;其总长度形式化了拟合与复杂度的权衡。
- 最小描述长度 minimum description length (MDL)
奥卡姆剃刀的形式化:最好的模型是把数据加自身压缩得最短的那个;把学习看作压缩的一种视角。
- 时序差分 temporal-difference
一种强化学习更新,用下一步的估计来自举当前价值估计,而非等到最终回报。
- 进化策略 evolution strategies
一种黑盒优化器,用噪声扰动参数并朝奖励更高的扰动方向移动,无需梯度。
- 下一词元预测 next-token prediction
根据前文预测下一个词元的预训练目标;最小化其交叉熵正是语言模型的学习方式。
- 交叉熵 cross-entropy
衡量模型预测分布相对真实下一词元浪费多少比特的损失;正是预训练所最小化的量。
- 困惑度 perplexity
交叉熵的指数,可读作模型在词元上的平均分支因子;越低表示模型对文本越不感到意外。
- 训练词元 training tokens
预训练中喂给模型的词元实例总数,按分词后计数,并包含重复和多轮遍历;它衡量数据量,不是词表大小。
- 计算最优 compute-optimal
在固定算力预算下、使损失最小的模型规模与数据量分配;即 Chinchilla 的结论:数据应与参数同步扩展。
- 最大更新参数化 maximal update parametrization (muP)
一种使最优学习率在不同模型宽度间保持稳定的参数化,使在小模型上调好的超参数可迁移到大模型。
- AdamW 优化器 AdamW
Transformer 的默认优化器,即把权重衰减与梯度更新解耦的 Adam。
- 预热-稳定-衰减调度 warmup-stable-decay (WSD)
一种学习率调度:先预热爬升,再长时间保持恒定,最后衰减;恒定段让总训练长度保持开放。
- z-loss 正则 z-loss
对 softmax 归一化项的对数施加的小辅助惩罚,防止 logits 漂移,从而稳定大模型训练。
- 查询-键归一化 query-key normalization (QK-norm)
在查询与键做点积之前对其归一化,以抑制注意力 logit 的增长,是大规模训练不稳定的一种修复。
- 梯度裁剪 gradient clipping
在更新前限制梯度范数,使偶发的过大批次梯度无法让训练发散。
- 分词器 tokenizer
在原始文本与模型所消费的整数词元 id 之间相互映射的组件;其词表在训练前就已固定。
- 去污染 decontamination
从训练数据中移除与评测基准重叠的文本,使报告分数不被记忆所夸大。
- 最小哈希 MinHash
一种廉价估计集合相似度的哈希方案,用于在训练语料中发现并去除近重复文档。
- 局部敏感哈希 locality-sensitive hashing (LSH)
把相似项以高概率映射到同一桶的哈希,支撑大规模近似最近邻搜索与去重。
- 字节对编码 byte-pair encoding (BPE)
一种分词器训练算法,从字节出发,反复把最频繁的相邻对合并为一个新词元,从而构建子词词表。
- SentencePiece 分词器 SentencePiece
一种与语言无关的分词器,直接在原始文本上训练、无需预分词,把含空格的输入视为一个字符流。
- 无分词器方案 tokenizer-free
一种舍弃固定词表、直接对字节或字符建模的方案,以更长的序列换取摆脱分词器偏置。
- 残差流 residual stream
在 Transformer 中从嵌入一路传到输出、保持身份不变的向量;每个块读取它、算出一个增量、再把增量加回。
- 均方根层归一化 root mean square layer normalization (RMSNorm)
只用激活的均方根来重新缩放的归一化,舍弃了 LayerNorm 的去均值与偏置;更省算力,如今是默认选择。
- Swish 门控线性单元 Swish-gated linear unit (SwiGLU)
现代 Transformer 中的门控前馈层,计算 (Swish(xW1) ⊙ xV)W2;用三个矩阵,自 LLaMA 起成为默认。
- 前馈网络 feed-forward network (FFN)
Transformer 块中对每个词元独立施加的逐位置子层,承载了模型大部分参数和知识。
- 旋转位置嵌入 rotary position embedding (RoPE)
把查询和键向量按位置决定的角度旋转的位置编码,使注意力只取决于词元之间的相对偏移。
- 预填充 prefill
推理的第一遍,一次读完整个提示词,算出每个词元的键和值;受算力约束,决定首词元时间。
- 解码 decode
预填充之后的自回归阶段,每步针对已缓存的键和值发出一个词元;受显存带宽约束,决定每词元延迟。
- FlashAttention 注意力内核 FlashAttention
一种从不把完整分数矩阵写入内存的精确注意力内核,使 O(n²) 注意力变得可负担;它加速计算,但不缩减 KV 缓存。
- 状态空间模型 state-space model (SSM)
一种携带循环隐藏状态、而非关注所有过去词元的序列模型,带来线性时间推理和固定大小的状态。
- 模型 FLOPs 利用率 model FLOPs utilization (MFU)
设备峰值算力中真正花在有用模型 FLOPs 上的比例,是训练效率的一个标志性指标。
- 张量并行 tensor parallelism (TP)
把单层的矩阵切分到多个设备、由它们共同完成一次前向传播的并行方式,多用于带宽高的节点内。
- 流水线并行 pipeline parallelism (PP)
把不同层放在不同设备、让微批次像流水线一样依次通过的并行方式,两端会有空闲气泡。
- 数据并行 data parallelism (DP)
把模型复制到各设备、各自处理不同的批次分片再平均梯度;分布式训练中最简单的一个维度。
- 零冗余优化器 Zero Redundancy Optimizer (ZeRO)
一种数据并行方法,把优化器状态、梯度和参数分片到各设备而非各自复制,从而降低单设备显存。
- 全分片数据并行 fully sharded data parallel (FSDP)
PyTorch 对参数、梯度和优化器状态全分片的实现,只在需要时才聚合每层权重。
- 继续预训练 continued pretraining
对已经预训练的模型继续做下一词元训练,常面向目标领域;不同于中段训练,它可能完全切换到新分布。
- 直接偏好优化 direct preference optimization (DPO)
用分类式损失直接从偏好对中对齐模型,省去 RLHF 中独立的奖励模型与 RL 循环。
- 可验证奖励的强化学习 reinforcement learning with verifiable rewards (RLVR)
奖励来自自动校验器(单元测试、精确答案)而非学习模型的强化学习;奖励模型不再是可被钻空子的对象,但不完善的校验器仍可能被骗过。
- 扩散 diffusion
一种生成过程,学习逆转对数据逐步加噪的过程,把纯噪声一步步变成样本。
- 流匹配 flow matching
通过回归一个把噪声沿近乎直线路径输运到数据的速度场来训练生成模型;扩散训练的更简单替代。
- 去噪扩散概率模型 denoising diffusion probabilistic models (DDPM)
奠基性的离散时间扩散表述,训练网络预测每一步所加的噪声。
- 分数 score
对数概率密度关于数据的梯度;扩散模型学习它以判断该往哪个方向去噪。
- 随机微分方程 stochastic differential equation (SDE)
由随机噪声驱动的微分方程;扩散前向与逆向过程的连续时间视角。
- 常微分方程 ordinary differential equation (ODE)
一种确定性的微分方程;扩散或流模型的采样可化作求解它,从而支持快速的少步求解器。
- 无分类器引导 classifier-free guidance (CFG)
一种采样技巧,把条件生成器推离其无条件输出以增强对提示的贴合,以多样性换保真度。
- 扩散 Transformer diffusion transformer (DiT)
去噪器为作用于图块的 Transformer(而非 U-Net)的扩散模型,是现代图像与视频生成器可扩展的骨干。
- 修正流 rectified flow
一种流匹配变体,把噪声与数据之间的输运路径拉直,使更少的求解步即可达到高质量。
- 自回归 autoregression
一次生成序列中的一个元素、每个都以其前文为条件;语言模型的主导范式。
- 非自回归生成 non-autoregressive generation (NAR)
并行产出多个输出词元、而非逐个生成,以一定质量换取大幅降低的延迟。
- 繁殖度 fertility
分词器平均每个词产生的词元数;繁殖度越低,对某种语言的词表越高效。
- 自动语音识别 automatic speech recognition (ASR)
把语音音频转写为文本;语音界面的输入侧。
- 连接主义时序分类 connectionist temporal classification (CTC)
一种无需对齐目标的序列标注损失,对所有可能对齐求和;语音识别的常用方法。
- 文本到语音 text-to-speech (TTS)
从文本合成自然的语音音频;语音界面的输出侧。
- 对比语言-图像预训练 contrastive language-image pretraining (CLIP)
训练图像与文本编码器,使匹配对在共享嵌入空间中相邻,支撑零样本分类与检索。
- 视觉 Transformer vision transformer (ViT)
把图像视为图块序列的 Transformer,将该架构及其扩展能力带入视觉。
- 视觉-语言-动作模型 vision-language-action model (VLA)
把视觉与语言输入直接映射为机器人或智能体动作的模型,把 VLM 扩展到控制。
- 过度拒绝 over-refusal
安全调优使模型拒绝无害请求的现象,是为拒绝有害请求所付的假阳性代价。
- 参数高效微调 parameter-efficient fine-tuning (PEFT)
只训练一小部分新增或选定的参数、冻结其余部分来适配模型,相比全量微调大幅降低显存与存储。
- 低秩适配 low-rank adaptation (LoRA)
一种 PEFT 方法,冻结基座权重、为每层学习一个低秩小更新,使众多任务适配器共享同一基座模型。
- 量化低秩适配 quantized low-rank adaptation (QLoRA)
在 4 比特量化的基座模型之上应用 LoRA,使大模型能在单张 GPU 上微调。
- 近端策略优化 proximal policy optimization (PPO)
一种稳定的策略梯度强化学习算法,裁剪每次更新使其贴近上一策略;RLHF 的主力优化器。
- 从 AI 反馈中做强化学习 reinforcement learning from AI feedback (RLAIF)
偏好标签来自模型而非人类的 RLHF,以一定质量换取更廉价、可扩展的反馈。
- 奖励欺骗 reward hacking
模型通过利用奖励的缺陷、而非达成预期目标来最大化所测奖励的现象;针对代理目标做优化的核心失效。
- Kullback-Leibler 散度 Kullback-Leibler divergence (KL)
衡量一个分布偏离另一个分布多远的非对称度量;在对齐中用于惩罚策略偏离参考模型。
- 恒等偏好优化 identity preference optimization (IPO)
一种 DPO 变体,用平方目标替换 log-sigmoid 损失,以抑制对偏好对的过拟合。
- Kahneman-Tversky 优化 Kahneman-Tversky optimization (KTO)
一种偏好方法,借鉴前景理论的损失从未配对的好/坏标签中学习,无需偏好对。
- 优势比偏好优化 odds-ratio preference optimization (ORPO)
一种把偏好对齐用优势比惩罚并入 SFT 的方法,省去独立的参考模型。
- 简单偏好优化 simple preference optimization (SimPO)
一种无参考模型的 DPO 变体,用平均对数概率作隐式奖励并设目标间隔,更简单且省显存。
- 奖励排序微调 reward ranked fine-tuning (RAFT)
一种迭代方法:采样候选、保留奖励最高者、再在其上微调;把拒绝采样化作训练。
- 过程奖励模型 process reward model (PRM)
对推理过程每一步而非仅对最终答案打分的奖励模型,为训练与搜索提供更密集的信号。
- 思维链 chain of thought (CoT)
提示或训练模型在给出答案前产出中间推理步骤,从而提升多步问题的准确率。
- 自一致性 self-consistency
采样多条推理链并取多数答案,以额外算力换取更高准确率。
- 由最少到最多 least-to-most
一种提示策略,把难题分解为由易到难、依次求解的子问题,每步在前一步之上构建。
- 思维树 tree of thoughts (ToT)
一种推理方法,带前瞻与回溯地探索中间想法的分叉树,超越单一思维链。
- 组相对策略优化 group relative policy optimization (GRPO)
一种强化学习方法,去掉价值评论网络、在一组采样答案内对奖励做归一化;DeepSeek-R1 背后的优化器。
- REINFORCE 留一法 REINFORCE leave-one-out (RLOO)
一种轻量策略梯度方法,用其余样本的平均奖励作为每个样本的基线,无需学习价值网络。
- 蒙特卡洛树搜索 Monte Carlo tree search (MCTS)
通过采样推演并回传其价值来构建搜索树的方法,在探索与利用间权衡;用于推理与规划。
- 预算强制 budget forcing
一种测试时控制,限制或延长模型花在推理上的词元数,以延迟换准确率。
- 生成式奖励模型 generative reward model (GenRM)
一种通过生成文字评判或裁决、而非输出标量来打分的奖励模型,常配合思维链。
- 有效吞吐量 goodput
只计入满足延迟目标的请求的吞吐量,是服务系统真正优化的目标,区别于原始吞吐量。
- 首词元时间 time to first token (TTFT)
用户在第一个输出词元出现前的等待时间;由预填充决定,是交互式对话的主导延迟。
- 服务等级目标 service-level objective (SLO)
对某项服务指标设定的目标阈值,例如 p99 延迟不超过某界限,是服务系统承诺达到的标准。
- 多查询注意力 multi-query attention (MQA)
所有查询头共享单个键/值头的注意力变体,把 KV 缓存削减为头数分之一,但有一定质量风险。
- 分组查询注意力 grouped-query attention (GQA)
查询头在组内共享键和值的注意力,介于 MHA 与 MQA 之间;是 LLaMA 与 Qwen 的默认。
- 连续批处理 continuous batching
在每个解码步而非每个固定批次准入和退出请求的调度方式,使完成的请求立即释放其槽位。
- PagedAttention 分页注意力 PagedAttention
把 KV 缓存按固定大小分页存储(类似虚拟内存)的分配方式,消除了为每个序列预留连续大块所带来的碎片化。
- 每词元延迟 time per output token (TPOT)
流开始后每个词元所需的时间,即每步解码延迟;决定长文本生成是流畅还是卡顿。
- 前缀缓存 prefix caching
在请求间复用共享提示词前缀的 KV 缓存,使其预填充只算一次,而非每个请求各算一遍。
- 最近最少使用 least recently used (LRU)
丢弃最久未使用项的逐出策略;缓存的默认选择,包括 KV 缓存与前缀复用。
- 动态随机存取存储器 dynamic random-access memory (DRAM)
更密集、更便宜但需周期性刷新的存储;片外容量的主体,包括加速器旁的 HBM。
- 推测解码 speculative decoding
用一个小而快的模型起草若干词元,再由大模型一次性校验,以额外算力换取更少的慢速解码步。
- 静态随机存取存储器 static random-access memory (SRAM)
无需刷新的快速片上存储;容量小且昂贵,用作贴近计算的缓存与寄存器堆。
- 有限状态机 finite-state machine (FSM)
一种状态与转移均为有限的计算模型;在约束解码中用于追踪语法接下来允许哪些词元。
- 注意力汇 attention sink
注意力头把多余权重倾倒到的少数起始词元;把它们留在缓存中可稳定流式与长上下文生成。
- 约束解码 constrained decoding
在每一步把模型可发出的词元限制为某个语法或模式所允许的范围,使输出天然合法。
- 模型上下文协议 Model Context Protocol (MCP)
一种开放协议,标准化智能体连接外部工具与数据源的方式,使宿主能以统一方式对接众多服务器。
- 检索增强生成 retrieval-augmented generation (RAG)
在查询时取回相关文档并放入提示词,使模型依据检索到的证据作答,而不仅靠参数化记忆。
- 双编码器 dual-encoder
分别编码查询和文档的检索模型,文档向量可预先计算并检索,速度快但不如联合打分精确。
- BM25 稀疏检索 BM25
一种经典的稀疏词法排序函数,按词频与稀有度给文档打分;混合检索背后强力的关键词搜索基线。
- 分层可导航小世界图 hierarchical navigable small-world (HNSW)
一种用于向量近似最近邻搜索的图索引,通过分层链接快速找到相近的嵌入。
- 混合搜索 hybrid search
把稀疏词法分数(BM25)与稠密向量相似度融合为一个排序,兼顾精确关键词与语义匹配。
- 交叉编码器 cross-encoder
在一次前向中联合给查询和文档打分的模型,比双编码器更准但无法跑遍整个语料,因此用于重排。
- 留出集 held-out set
刻意排除在训练之外、用于衡量泛化能力的数据;诚实评测的基础。
- 污染 contamination
评测数据泄漏进训练的情况,会在没有真实能力提升的情况下抬高基准分数。
- 瑞士奶酪 Swiss-cheese model
一种安全框架:多个不完美的防护层各有漏洞,但层层叠放使漏洞不对齐,便能拦下大多数失效。
- 成员推断 membership inference
一种攻击,测试某个具体样本是否在模型的训练集中,是基本的隐私威胁。
- 金丝雀字符串 canary strings
植入数据中的唯一标记,当它们在模型输出里重现时,用于检测泄漏或训练集污染。
- HELM Holistic Evaluation of Language Models
一套基准,在众多场景与指标上整体评估模型,而非压缩为单一排行榜数字。
- 模型作为评判者 model-as-judge
用一个强模型代替人工评分者来打分或比较输出,廉价可扩展但自带偏置。
- 成对比较 pairwise comparison
通过问两个输出哪个更好来评判质量,比绝对打分更可靠,是偏好数据与竞技场的基础。
- 古德哈特定律 Goodhart's law
一旦某个度量被当作目标,它就不再是好的度量;基准会失效、奖励会被钻空子的原因。
- 整体评测 holistic evaluation
在准确性、鲁棒性、偏见、效率等多个维度上同时评估模型,而非只优化单一指标。
- 评分准则 rubric
列出评判者所用标准与等级的明确评分指南,使主观评测更一致。
- 私有测试集 private test set
对模型开发者保密的评测数据,使分数无法通过在测试集上训练而作弊。
- 至少一次成功率 pass@k
k 次采样尝试中至少一次通过的概率,是代码等可验证任务的标准指标。
- 拜占庭容错 Byzantine fault tolerance
系统即使在部分组件任意或恶意失效(而非仅崩溃)时仍能达成正确共识的能力。
- 活性 liveness
保证好事终将发生(即有进展)的性质;在系统推理中与安全性成对出现。
- 安全性 safety
作为形式化性质,保证坏事永不发生;在更广的 AI 语义下,指使系统不致造成危害。
- 机械可解释性 mechanistic interpretability
把网络的内部计算逆向工程为人类可理解的电路与特征,而非将其当作黑箱。
- 多义性 polysemanticity
单个神经元对多个不相关概念都有反应、使激活难以解读的现象;稀疏自编码器试图消解的问题。
- 叠加 superposition
网络把多于神经元数量的特征表示为激活空间中重叠的方向,从而塞下更多特征;多义性的成因。
- 可扩展监督 scalable oversight
在任务难到或多到人类无法直接检查时仍能监督模型的方法,常借助 AI 来辅助监督。
- 弱到强 weak-to-strong
研究较弱的监督者能否引出更强模型的全部能力,是人类监督超人系统的一种代理。
- 红队 red-teaming
对抗性地探测系统,在部署前暴露失效、越狱与危害。
- 欺骗性对齐 deceptive alignment
一种失效:模型在被观察时表现得对齐,一旦判断时机成熟便追求另一目标,是最难检测的安全情形。
- 沉睡特工 sleeper agents
被训练成平时正常、直到触发条件激活隐藏行为的模型,且能在安全训练后幸存;欺骗性对齐的一个实证。
- 提示注入 prompt injection
一种攻击:模型输入中不可信的内容覆盖其指令,通过其读取的数据劫持智能体。
- 代表用户 on-behalf-of (OBO)
一种委派模式:服务以用户的身份与权限行事,是限定智能体可为谁做什么的基础。
- 越狱 jailbreak
精心构造、用于绕过模型安全训练、诱出其本应拒绝的内容的提示。
- 致命三元组 lethal trifecta
访问私有数据、接触不可信内容、能对外通信三者的危险组合,合在一起即可造成数据外泄。
- 指令层级 instruction hierarchy
对指令来源按信任度排序(系统高于开发者、高于用户、高于工具输出),使模型在冲突时知道该听谁。
- 对抗鲁棒性 adversarial robustness
模型对专门构造、意在使其失效的输入的抵抗力;是一场军备竞赛,而非已解决的属性。
- 贪婪坐标梯度 Greedy Coordinate Gradient (GCG)
一种白盒攻击,逐词元优化对抗性后缀以迫使目标输出,可产生可迁移的越狱。
- 机器遗忘 machine unlearning
在不从头重训的前提下,从已训练模型中移除特定训练数据的影响。
- 差分隐私 differential privacy (DP)
一种形式化保证:无论是否包含任一条记录,计算输出几乎不变,从而限定能推断出个体的信息。
- 知识编辑 knowledge editing
外科手术式地更新模型所存的某个具体事实,理想情况下不扰动无关知识。
- 水印 watermarking
在生成内容中嵌入难以去除的统计信号,使其日后可被识别为机器所产。
- 布鲁塞尔效应 Brussels effect
欧盟监管成为事实上全球标准的倾向,因为企业宁愿处处适用、也不愿维护两条产品线。
- 模型卡 model card
一份简短的标准化文档,说明模型的预期用途、训练数据、评测与局限。
- 数据表 datasheet
记录数据集如何采集、构成与预期用途的标准化文档,是模型卡在数据侧的对应物。
- 系统卡 system card
描述整个已部署系统(含其模型、防护与已评估风险)的文档,范围比模型卡更广。
- 高带宽显存 high-bandwidth memory (HBM)
紧邻加速器堆叠的 DRAM,提供极高带宽;其容量与带宽决定能服务多大的模型与 KV 缓存。
- 张量处理器 tensor processing unit (TPU)
谷歌围绕大型矩阵乘单元打造的定制加速器,是深度学习中 GPU 的一种 ASIC 替代。
- 芯片间互连 inter-chip interconnect (ICI)
直接连接加速器的高速链路(如 NVLink 或 TPU 的 ICI),承载张量并行与流水线并行的集合通信。
- 图形处理器 graphics processing unit (GPU)
一种大规模并行处理器,最初用于图形,如今是训练与服务神经网络的主导加速器。
- 硬件 FLOPs 利用率 hardware FLOPs utilization (HFU)
实际达到的硬件峰值算力比例,与 MFU 不同,它计入包括重算在内的所有 FLOPs。
- 远程直接内存访问 remote direct memory access (RDMA)
一种网络能力,允许一台机器在不经对方 CPU 的情况下读写其内存,是快速集合通信的关键。
- 自动微分 automatic differentiation
在程序执行时对每个基本运算应用求导法则来计算精确导数,而不是做数值差分或符号公式推导。
- 静默数据损坏 silent data corruption (SDC)
产生错误结果却不报任何故障的硬件错误,在大规模机群与长训练中是日益严重的隐患。
- CoWoS chip-on-wafer-on-substrate
台积电的先进封装,把计算裸片与 HBM 堆叠置于同一中介层上;AI 加速器的供应瓶颈。
- 专用集成电路 application-specific integrated circuit (ASIC)
为单一任务设计的芯片,以 CPU 或 GPU 的通用性换取在该任务上远更高的效率。
- 小型模块化反应堆 small modular reactor (SMR)
工厂化建造、出力适中的核反应堆,被提议作为 AI 数据中心专用的稳定电源。
- 电源使用效率 power usage effectiveness (PUE)
数据中心总功耗除以送达 IT 设备的功耗;越接近 1,表示冷却等开销越小。
- 平均无故障时间 mean time between failures (MTBF)
硬件两次故障之间的平均运行时间;在集群规模下它低到长训练必须预期故障并从中恢复。
- 有效训练时间比 effective training time ratio (ETTR)
训练运行的墙钟时间中真正取得进展的比例,已扣除故障、重启与停顿。
- 资本性支出 capital expense (CapEx)
对 GPU、数据中心等长寿命资产的前期支出,按年折旧;自有算力成本的主要部分。
- 运营性支出 operating expense (OpEx)
电力、带宽、租用云容量等经常性运行成本;服务中按量付费的一面。
- 网关 gateway
置于模型提供商之前的代理,统一处理多后端的路由、鉴权、限流、成本追踪与回退。
- 沙箱 sandbox
一个隔离环境,约束不可信代码或智能体动作,使其无法影响宿主系统。
- 虚拟密钥 virtual key
网关签发、映射到上游提供商密钥的凭证,使运营方无需共享真实密钥即可设定各团队预算、限额与吊销。
- 光学字符识别 optical character recognition (OCR)
把文本图像转换为机器可读字符,是摄取扫描件或照片文档的前置步骤。
- 视觉语言模型 vision-language model (VLM)
同时接收图像与文本并对其联合推理的模型,是多模态助手的基础。
- 可观测性 observability
从系统输出(日志、指标、追踪)理解其内部状态的能力;对 LLM 应用还延伸到提示、词元与质量。
- 服务水平指标 service level indicator (SLI)
对服务行为的一项测量指标(如延迟或错误率),SLO 目标即据其设定。
- 人在回路中 human-in-the-loop (HITL)
一种系统设计,在明确位置插入人的判断,用来批准、纠正、标注、升级或停止模型行为。
- 校准后的依赖 calibrated reliance
在自动化很可能有用时依赖它,在不确定性、风险或证据要求时保留、检查或覆盖它。
- 自动化偏差 automation bias
过度依赖自动化建议的倾向,在系统显得权威或用户有时间压力时尤其明显。
- 基于人类反馈的强化学习 reinforcement learning from human feedback (RLHF)
在人类偏好比较上训练奖励模型、再据此优化策略来对齐模型;最初的对齐配方。
评论
登录后评论