【AI 术语表】- 中篇(G–N)

算法

从 Gradient Descent 到 Neural Network——训练与网络的 21 个核心词。

G

Guardrails

  • 人们怎么说: “AI 的安全过滤器”
  • 实际什么意思: LLM 周围的输入/输出验证层,检测和阻止有害内容、prompt injection 攻击、PII 泄露或离题回答。通常是一个管道:输入过滤器 -> LLM -> 输出过滤器。可以基于规则(正则、关键词列表)或基于模型(对安全性评分的分类器)。

GPT

  • 人们怎么说: “ChatGPT”或”那个 AI”
  • 实际什么意思: 生成式预训练 Transformer——一种特定架构,使用在大型文本语料库上训练的纯 decoder transformer 来预测下一个 token
  • 为什么叫这个名字: 生成式(产生文本)、预训练(在大量数据上训练一次,然后适配)、Transformer(架构)

GAN (Generative Adversarial Network)

  • 人们怎么说: “两个 AI 互相打架”
  • 实际什么意思: 生成器网络试图创建逼真的数据,而判别器网络试图区分真假。它们一起训练:生成器越来越擅长欺骗判别器,判别器越来越擅长检测伪造品。

Gradient

  • 人们怎么说: “斜率”
  • 实际什么意思: 指向最陡增加方向的偏导数向量。在 ML 中,你沿着梯度的反方向(梯度下降)来最小化损失。

Gradient Descent

  • 人们怎么说: “AI 如何改进”
  • 实际什么意思: 一种优化算法,沿着最陡降低损失函数的方向调整参数,就像在高维景观中下山

H

Hyperparameter

  • 人们怎么说: “你调的设置”
  • 实际什么意思: 训练前设置的、控制训练过程本身的值:学习率、batch size、层数、dropout 率。与模型参数(权重)不同,这些不是从数据中学到的。

Hallucination

  • 人们怎么说: “AI 在撒谎”或”编造东西”
  • 实际什么意思: 模型生成听起来合理但没有基于训练数据或给定上下文的文本——它是在模式补全,而非事实检索

I

Inference

  • 人们怎么说: “运行 AI”
  • 实际什么意思: 使用训练好的模型对新数据进行预测。不发生权重更新。这是你在生产环境中做的事:发送输入,获取输出。

Inductive Bias

  • 人们怎么说: “没听说过”
  • 实际什么意思: 内置于模型架构中的假设。CNN 假设局部模式很重要(卷积)。RNN 假设顺序很重要(顺序处理)。Transformer 假设一切可能与一切相关(注意力)。正确的偏置帮助模型从更少的数据中更快学习。

JAX

  • 人们怎么说: “Google 的 ML 框架”
  • 实际什么意思: 一个 NumPy 兼容的库,添加了自动微分(grad)、JIT 编译(jit)、自动向量化(vmap)和多设备并行(pmap)。与 PyTorch 的面向对象风格不同,JAX 是纯函数式的——没有隐藏状态,没有原地修改。被 Google DeepMind 用于 AlphaFold、Gemini 和大规模研究。

K

KV Cache

  • 人们怎么说: “让推理更快”
  • 实际什么意思: 在自回归生成过程中,缓存之前 token 的 key 和 value 矩阵,这样你就不用在每一步重新计算它们。以内存换速度。对快速 LLM 推理至关重要。

L

Latent Space

  • 人们怎么说: “隐藏表示”
  • 实际什么意思: 一个压缩的、学习到的表示空间,相似的输入映射到附近的点。自编码器、VAE 和 diffusion model 都在 latent space 中工作。它比输入维度更低但捕捉了重要结构。

Learning Rate

  • 人们怎么说: “AI 学习的速度”
  • 实际什么意思: 控制梯度下降步长的标量。太高:越过最小值并发散。太低:收敛太慢或卡住。最重要的超参数。

LLM (Large Language Model)

  • 人们怎么说: “AI”或”大脑”
  • 实际什么意思: 一种基于 transformer 的神经网络,经过训练来预测序列中的下一个 token,拥有数十亿参数,在互联网规模的文本数据上训练

LoRA (Low-Rank Adaptation)

  • 人们怎么说: “高效微调”
  • 实际什么意思: 不更新所有权重,而是在原始权重旁边插入小型低秩矩阵。只训练这些小型矩阵,内存减少 10-100 倍

Loss Function

  • 人们怎么说: “AI 有多错”
  • 实际什么意思: 衡量预测输出和实际输出之间差距的函数。训练最小化这个函数。MSE 用于回归,cross-entropy 用于分类,contrastive loss 用于 embedding。损失函数的选择定义了模型中”好”的含义。

M

Mixed Precision

  • 人们怎么说: “加速训练的技巧”
  • 实际什么意思: 对前向传播和大多数操作使用 float16(更快、更少内存),但对梯度累积和权重更新保留 float32(更精确)。获得 2 倍加速,精度损失可忽略。

MoE (Mixture of Experts)

  • 人们怎么说: “只有部分模型运行”
  • 实际什么意思: 一个有许多”专家”子网络的模型,路由机制将每个输入只发送给少数几个专家。完整模型很大但每次前向传播很便宜,因为大多数专家被跳过。Mixtral 和 GPT-4 使用这种方式。

MCP (Model Context Protocol)

  • 人们怎么说: “AI 使用工具的方式”
  • 实际什么意思: 一个开放协议(基于 stdio/HTTP 的 JSON-RPC),标准化 AI 应用如何连接到外部数据源和工具,带有工具、resources 和 prompts 的类型化模式

N

NaN (Not a Number)

  • 人们怎么说: “训练崩溃了”
  • 实际什么意思: 一个浮点值,表示未定义的结果(0/0, inf-inf)。在训练中,NaN 损失通常意味着:学习率太高、梯度爆炸、对零取对数或除以零。训练失败时首先检查这个。

Normalization

  • 人们怎么说: “缩放数据”
  • 实际什么意思: 将值调整到标准范围。Batch normalization 跨 batch 归一化。Layer normalization 跨特征归一化。两者都稳定训练并允许更高的学习率。

📚 本文改编自 AI Engineering from Scratch(MIT License · 作者 Rohit Ghumare)《术语表》,中文内容来自官方中文镜像。原课程共 503 课 · 20 阶段 · 免费开源。

  • 标题: 【AI 术语表】- 中篇(G–N)
  • 作者:
  • 创建于 : 2026-08-19 09:30:00
  • 更新于 : 2026-08-19 08:30:46
  • 链接: https://sxl-space.tk/2026/08/19/010_LLM/011_AI-Glossary-2/
  • 版权声明: 版权所有 © 宋,禁止转载。