【AI 术语表】- 中篇(G–N)
从 Gradient Descent 到 Neural Network——训练与网络的 21 个核心词。
G
Guardrails
- 人们怎么说: “AI 的安全过滤器”
- 实际什么意思: LLM 周围的输入/输出验证层,检测和阻止有害内容、prompt injection 攻击、PII 泄露或离题回答。通常是一个管道:输入过滤器 -> LLM -> 输出过滤器。可以基于规则(正则、关键词列表)或基于模型(对安全性评分的分类器)。
GPT
- 人们怎么说: “ChatGPT”或”那个 AI”
- 实际什么意思: 生成式预训练 Transformer——一种特定架构,使用在大型文本语料库上训练的纯 decoder transformer 来预测下一个 token
- 为什么叫这个名字: 生成式(产生文本)、预训练(在大量数据上训练一次,然后适配)、Transformer(架构)
GAN (Generative Adversarial Network)
- 人们怎么说: “两个 AI 互相打架”
- 实际什么意思: 生成器网络试图创建逼真的数据,而判别器网络试图区分真假。它们一起训练:生成器越来越擅长欺骗判别器,判别器越来越擅长检测伪造品。
Gradient
- 人们怎么说: “斜率”
- 实际什么意思: 指向最陡增加方向的偏导数向量。在 ML 中,你沿着梯度的反方向(梯度下降)来最小化损失。
Gradient Descent
- 人们怎么说: “AI 如何改进”
- 实际什么意思: 一种优化算法,沿着最陡降低损失函数的方向调整参数,就像在高维景观中下山
H
Hyperparameter
- 人们怎么说: “你调的设置”
- 实际什么意思: 训练前设置的、控制训练过程本身的值:学习率、batch size、层数、dropout 率。与模型参数(权重)不同,这些不是从数据中学到的。
Hallucination
- 人们怎么说: “AI 在撒谎”或”编造东西”
- 实际什么意思: 模型生成听起来合理但没有基于训练数据或给定上下文的文本——它是在模式补全,而非事实检索
I
Inference
- 人们怎么说: “运行 AI”
- 实际什么意思: 使用训练好的模型对新数据进行预测。不发生权重更新。这是你在生产环境中做的事:发送输入,获取输出。
Inductive Bias
- 人们怎么说: “没听说过”
- 实际什么意思: 内置于模型架构中的假设。CNN 假设局部模式很重要(卷积)。RNN 假设顺序很重要(顺序处理)。Transformer 假设一切可能与一切相关(注意力)。正确的偏置帮助模型从更少的数据中更快学习。
JAX
- 人们怎么说: “Google 的 ML 框架”
- 实际什么意思: 一个 NumPy 兼容的库,添加了自动微分(grad)、JIT 编译(jit)、自动向量化(vmap)和多设备并行(pmap)。与 PyTorch 的面向对象风格不同,JAX 是纯函数式的——没有隐藏状态,没有原地修改。被 Google DeepMind 用于 AlphaFold、Gemini 和大规模研究。
K
KV Cache
- 人们怎么说: “让推理更快”
- 实际什么意思: 在自回归生成过程中,缓存之前 token 的 key 和 value 矩阵,这样你就不用在每一步重新计算它们。以内存换速度。对快速 LLM 推理至关重要。
L
Latent Space
- 人们怎么说: “隐藏表示”
- 实际什么意思: 一个压缩的、学习到的表示空间,相似的输入映射到附近的点。自编码器、VAE 和 diffusion model 都在 latent space 中工作。它比输入维度更低但捕捉了重要结构。
Learning Rate
- 人们怎么说: “AI 学习的速度”
- 实际什么意思: 控制梯度下降步长的标量。太高:越过最小值并发散。太低:收敛太慢或卡住。最重要的超参数。
LLM (Large Language Model)
- 人们怎么说: “AI”或”大脑”
- 实际什么意思: 一种基于 transformer 的神经网络,经过训练来预测序列中的下一个 token,拥有数十亿参数,在互联网规模的文本数据上训练
LoRA (Low-Rank Adaptation)
- 人们怎么说: “高效微调”
- 实际什么意思: 不更新所有权重,而是在原始权重旁边插入小型低秩矩阵。只训练这些小型矩阵,内存减少 10-100 倍
Loss Function
- 人们怎么说: “AI 有多错”
- 实际什么意思: 衡量预测输出和实际输出之间差距的函数。训练最小化这个函数。MSE 用于回归,cross-entropy 用于分类,contrastive loss 用于 embedding。损失函数的选择定义了模型中”好”的含义。
M
Mixed Precision
- 人们怎么说: “加速训练的技巧”
- 实际什么意思: 对前向传播和大多数操作使用 float16(更快、更少内存),但对梯度累积和权重更新保留 float32(更精确)。获得 2 倍加速,精度损失可忽略。
MoE (Mixture of Experts)
- 人们怎么说: “只有部分模型运行”
- 实际什么意思: 一个有许多”专家”子网络的模型,路由机制将每个输入只发送给少数几个专家。完整模型很大但每次前向传播很便宜,因为大多数专家被跳过。Mixtral 和 GPT-4 使用这种方式。
MCP (Model Context Protocol)
- 人们怎么说: “AI 使用工具的方式”
- 实际什么意思: 一个开放协议(基于 stdio/HTTP 的 JSON-RPC),标准化 AI 应用如何连接到外部数据源和工具,带有工具、resources 和 prompts 的类型化模式
N
NaN (Not a Number)
- 人们怎么说: “训练崩溃了”
- 实际什么意思: 一个浮点值,表示未定义的结果(0/0, inf-inf)。在训练中,NaN 损失通常意味着:学习率太高、梯度爆炸、对零取对数或除以零。训练失败时首先检查这个。
Normalization
- 人们怎么说: “缩放数据”
- 实际什么意思: 将值调整到标准范围。Batch normalization 跨 batch 归一化。Layer normalization 跨特征归一化。两者都稳定训练并允许更高的学习率。
📚 本文改编自 AI Engineering from Scratch(MIT License · 作者 Rohit Ghumare)《术语表》,中文内容来自官方中文镜像。原课程共 503 课 · 20 阶段 · 免费开源。
- 标题: 【AI 术语表】- 中篇(G–N)
- 作者: 宋
- 创建于 : 2026-08-19 09:30:00
- 更新于 : 2026-08-19 08:30:46
- 链接: https://sxl-space.tk/2026/08/19/010_LLM/011_AI-Glossary-2/
- 版权声明: 版权所有 © 宋,禁止转载。