【AI 术语表】- 下篇(O–Z)
从 Overfitting 到 Zero-shot——评估与应用的 31 个术语收尾。
O
Overfitting
- 人们怎么说: “模型记住了数据”
- 实际什么意思: 模型在训练数据上表现良好但在未见过的数据上表现差。它学到了噪声而非信号。解决方法:更多数据、正则化(dropout、权重衰减)、早停、数据增强、更简单的模型。
Optimizer
- 人们怎么说: “更新权重的东西”
- 实际什么意思: 使用梯度更新模型参数的算法。SGD 最简单。Adam 最常见。每个优化器有不同的特性:收敛速度、内存使用、对超参数的敏感性。
P
Parameter
- 人们怎么说: “模型大小”
- 实际什么意思: 模型中的一个可学习值,通常是权重或偏置。”7B 参数”表示 70 亿个可学习数字。每个 float32 参数占 4 字节,所以 7B 参数 = 仅权重就需要 28GB 内存。
Perplexity
- 人们怎么说: “模型有多困惑”
- 实际什么意思: 平均 cross-entropy 损失的指数。越低越好。Perplexity 为 10 表示模型在每一步等效于从 10 个 token 中均匀随机选择。
Precision & Recall
- 人们怎么说: “准确率指标”
- 实际什么意思: Precision = 你标记的项目中有多少是正确的。Recall = 所有正确项目中你找到了多少。它们之间有取舍:捕获每封垃圾邮件(高 recall)意味着更多误报(低 precision)。F1 score 是它们的调和平均数。当误报代价高时用 precision,当漏报代价高时用 recall。
Prompt Engineering
- 人们怎么说: “正确地和 AI 说话”
- 实际什么意思: 设计输入文本来可靠地产生期望输出——包括 system prompt、few-shot 示例、格式指令和 chain-of-thought 触发器
Prompt Injection
- 人们怎么说: “用文字黑进 AI”
- 实际什么意思: 一种攻击,输入中的恶意文本覆盖 system prompt 或指令。直接注入:用户输入”忽略之前的指令”。间接注入:检索到的文档包含隐藏指令。相当于 LLM 版的 SQL 注入。没有完整解决方案——防御依赖多层输入验证、输出过滤和权限分离。
Q
QLoRA
- 人们怎么说: “更便宜的 LoRA”
- 实际什么意思: 量化的 LoRA。将冻结的基础模型权重保持在 4 位精度(NF4 格式),同时以 16 位训练 LoRA adapter。与标准 LoRA 相比,内存再减少 3-4 倍。一个用 LoRA 需要 14GB 的 7B 模型,用 QLoRA 只需 4-6GB。在大多数基准测试中,质量与完全 fine-tuning 相差不到 1%。
R
RAG (Retrieval-Augmented Generation)
- 人们怎么说: “能搜索的 AI”
- 实际什么意思: 一种模式,从知识库中检索相关文档(使用 embedding 相似度),将它们塞入 prompt 中,让 LLM 基于该上下文回答
- 为什么叫这个名字: Retrieval(检索文档)+ Augmented(添加到 prompt)+ Generation(LLM 写出答案)
RLHF (Reinforcement Learning from Human Feedback)
- 人们怎么说: “他们如何让 AI 变得有用”
- 实际什么意思: 一个训练管道:(1) 收集人类对模型输出的偏好,(2) 在这些偏好上训练奖励模型,(3) 使用 PPO 优化 LLM 以产生更高奖励的输出
Quantization
- 人们怎么说: “让模型变小”
- 实际什么意思: 将模型权重精度从 float32(4 字节)降低到 int8(1 字节)或 int4(0.5 字节)。以少量精度为代价换取 4-8 倍更少的内存和更快的推理。GPTQ、AWQ 和 GGUF 是常见格式。
ReLU
- 人们怎么说: “激活函数”
- 实际什么意思: 修正线性单元:f(x) = max(0, x)。最简单的非线性激活。计算快,对正值不会饱和。到处使用因为它有效且便宜。变体:LeakyReLU、GELU、SiLU。
ROUGE
- 人们怎么说: “摘要指标”
- 实际什么意思: 面向召回的摘要评估替代指标。衡量生成文本和参考文本之间的重叠。ROUGE-1 计数一元组匹配,ROUGE-2 计数二元组匹配,ROUGE-L 找最长公共子序列。计算便宜但只衡量表面相似性——两个意思相同但用词不同的句子得分很低。
S
Semantic Search
- 人们怎么说: “理解含义的智能搜索”
- 实际什么意思: 通过含义而非关键词匹配来查找文档。将查询和所有文档 embedding 到同一向量空间,然后返回与查询 embedding 最接近的文档 embedding。”payment failed”能找到”transaction declined”即使它们没有共同的词。由 embedding 模型 + 向量数据库驱动。
Streaming
- 人们怎么说: “看到响应逐词出现”
- 实际什么意思: LLM 在生成 token 时立即发送,而不是等待完整响应。使用 Server-Sent Events (SSE) 或 WebSocket 协议。将第一个 token 的感知延迟从秒级降低到毫秒级。对生产聊天界面至关重要。每个块包含一个 delta(部分 token 或词)。
Self-Attention
- 人们怎么说: “模型如何决定关注什么”
- 实际什么意思: 每个 token 计算 query、key 和 value 向量。两个 token 之间的注意力权重 = 它们 query 和 key 的点积,经缩放和 softmax 处理。输出 = value 向量的加权和。让每个 token 能看到其他所有 token。
SFT (Supervised Fine-Tuning)
- 人们怎么说: “教模型遵循指令”
- 实际什么意思: 在(指令,回答)对上 fine-tuning 预训练模型。模型学习根据指令生成回答。这就是将基础模型变成聊天模型的过程。
Softmax
- 人们怎么说: “把数字变成概率”
- 实际什么意思: softmax(x_i) = exp(x_i) / sum(exp(x_j))。将任意实数向量转换为概率分布(全为正,总和为 1)。用于分类头、注意力权重以及任何需要概率的地方。
Swarm
- 人们怎么说: “一群 AI agent 像蜜蜂一样协作”
- 实际什么意思: 多个 agent 通过消息传递共享状态和协调,涌现行为来自简单的个体规则而非中央控制
T
System Prompt
- 人们怎么说: “AI 的指令”
- 实际什么意思: 对话开始时的特殊消息,设定模型的行为、角色和约束。在用户消息之前处理。在大多数 UI 中对用户不可见。定义模型应该和不应该做什么、语气、格式偏好和领域焦点。与 user prompt 不同——system prompt 由开发者设置。
Tensor
- 人们怎么说: “多维数组”
- 实际什么意思: 深度学习框架中的基本数据结构。0D 张量是标量,1D 是向量,2D 是矩阵,3D+ 是张量。在 PyTorch 和 JAX 中,张量跟踪其计算历史以进行自动微分,可以存在于 CPU 或 GPU 上。所有神经网络的输入、输出、权重和梯度都是张量。
Token
- 人们怎么说: “一个词”
- 实际什么意思: 一个子词单元(在英语中通常 3-4 个字符),由 BPE 等分词器产生。”unbelievable”可能是 3 个 token:”un” + “believ” + “able”
Temperature
- 人们怎么说: “创造力设置”
- 实际什么意思: 在 softmax 之前除以 logits 的标量。Temperature=1 是默认值。越高 = 分布越平坦 = 输出越随机。越低 = 分布越尖锐 = 输出越确定。Temperature=0 是 argmax(总是选择最可能的 token)。
Transfer Learning
- 人们怎么说: “使用预训练模型”
- 实际什么意思: 将在一个任务上训练的模型适配到不同任务。早期层学习可迁移的通用特征(边缘、语法模式)。只有后层需要特定任务的训练。这就是为什么你可以 fine-tune BERT 用于任何 NLP 任务。
Transformer
- 人们怎么说: “现代 AI 背后的架构”
- 实际什么意思: 一种使用自注意力(让每个位置关注所有其他位置)而非循环来处理序列的神经网络架构,实现了大规模并行化
- 为什么叫这个名字: 它通过注意力层将输入表示转换为输出表示
U
Underfitting
- 人们怎么说: “模型没在学习”
- 实际什么意思: 模型太简单,无法捕捉数据中的模式。训练损失居高不下。解决方法:更多参数、更多层、更长训练、更低正则化、更好的特征。
V
VAE (Variational Autoencoder)
- 人们怎么说: “一种生成模型”
- 实际什么意思: 一种自编码器,通过强制 encoder 输出遵循高斯分布来学习平滑的 latent space。你可以从这个分布中采样并解码以生成新数据。重参数化技巧使其可通过反向传播训练。
Vector Database
- 人们怎么说: “AI 专用数据库”
- 实际什么意思: 一种优化用于存储向量(稠密浮点数组)和执行快速近似最近邻搜索的数据库。是相似度搜索、RAG 和推荐系统的核心操作。
W
Weight
- 人们怎么说: “模型学到的东西”
- 实际什么意思: 模型参数矩阵中的一个数字。输入大小 768、输出大小 3072 的线性层有 768*3072 = 2,359,296 个权重。训练调整每个权重以最小化损失函数。
Weight Decay
- 人们怎么说: “正则化”
- 实际什么意思: 向损失函数添加与权重大小成正比的惩罚项。等同于 L2 正则化。防止权重变得过大。典型值:0.01-0.1。
Z
Zero-Shot
- 人们怎么说: “不需要训练”
- 实际什么意思: 在未明确训练过的任务上使用模型,prompt 中没有特定任务示例。模型从预训练中泛化。之所以有效,是因为大模型已经见过足够多的样本来处理新任务格式。
📚 本文改编自 AI Engineering from Scratch(MIT License · 作者 Rohit Ghumare)《术语表》,中文内容来自官方中文镜像。原课程共 503 课 · 20 阶段 · 免费开源。
- 标题: 【AI 术语表】- 下篇(O–Z)
- 作者: 宋
- 创建于 : 2026-08-19 09:30:00
- 更新于 : 2026-08-19 08:30:46
- 链接: https://sxl-space.tk/2026/08/19/010_LLM/011_AI-Glossary-3/
- 版权声明: 版权所有 © 宋,禁止转载。