【AI 误解】- 下篇:对齐、训练与工程

算法

关于 AI、ML 和深度学习的常见误解,每条都给出现实为什么重要

“Transformer 通过位置编码理解顺序”

现实: Transformer 没有固有的顺序感。自注意力将输入视为集合而非序列。位置编码是一种通过向输入添加位置相关向量来注入顺序信息的变通方法。不同方法(正弦、学习、RoPE、ALiBi)处理方式不同。没有一个能真正给模型像 RNN 那样的顺序理解。

为什么重要: 这就是为什么位置编码研究仍然活跃。对大多数用途来说这是一个足够解决的问题,但它本质上是一个变通方案。

“预训练就是阅读互联网”

现实: 预训练是在大型语料库上的 next-token prediction。模型学习根据之前的内容预测接下来是什么。通过这个简单目标,它学习了语法、事实、推理模式、代码结构等。但它也学到了互联网的废话、偏见和错误信息。数据的策划、过滤和去重极其重要。

为什么重要: 垃圾进,垃圾出。预训练数据的质量是模型之间最大的差异化因素之一。

“RLHF 让 AI 与人类价值观对齐”

现实: RLHF 让 AI 与提供反馈的特定人类的偏好对齐。那些人类彼此之间有分歧,有偏见,无法覆盖所有情况。RLHF 让模型在评分者定义的方式上有帮助和无害,而非与某种普遍的人类价值体系对齐。

为什么重要: RLHF 是一种训练技术,不是对齐的解决方案。它是更大工具箱中的一个工具。

“Embedding 捕捉含义”

现实: Embedding 捕捉统计共现模式。出现在相似上下文中的词获得相似的向量。这与含义的相关性足够好以至于有用,但这不是语义理解。”King - Man + Woman = Queen”有效是因为分布模式,而非模型理解了君主制或性别。

为什么重要: Embedding 在相似度搜索、聚类和检索中很强大。但不要过度解读”相似”的含义。

“Zero-shot 意味着不需要训练”

现实: Zero-shot 意味着推理时没有特定任务的示例。模型仍然在数十亿 token 上训练过。它只是没见过这种特定任务格式的示例。它从预训练模式中泛化。Few-shot 意味着在提示中给出几个示例。两者都不意味着模型在没有训练的情况下学习了。

“AI 模型像人类一样学习”

现实: 人类从少量示例中学习,跨领域泛化,并持续更新信念。神经网络需要数百万个示例,在训练分布内泛化,训练后权重固定。学习类比充其量是松散的。反向传播与生物神经元的学习方式完全不同。

为什么重要: 不要将模型拟人化。这会导致对它们能做什么和不能做什么产生错误预期。

“Scaling law 意味着越大总是越好”

现实: Scaling law 描述了计算、数据和模型大小之间的可预测关系。它们显示收益递减:参数翻倍不会让性能翻倍。它们还假设你按比例缩放数据。许多实际改进来自更好的架构、训练技术和数据质量,而非仅仅规模。

为什么重要: 一个有良好工程的 7B 模型可以解决你的问题。不要默认选 70B。

“开源 AI 和开放权重是一样的”

现实: 大多数”开源”模型是开放权重。你获得模型文件但没有训练数据、训练代码或数据管道。真正的开源(如 OLMo)发布所有内容:数据、代码、中间检查点、评估。开放权重很有用但与开源的承诺不同。

为什么重要: 知道你得到的是什么。开放权重让你运行和 fine-tune。真正的开源让你复现和理解。

“Prompt engineering 不是真正的工程”

现实: Prompt engineering 是系统设计。你在设计人类意图和模型行为之间的接口。好的 prompt engineering 需要理解 tokenization、注意力模式、context window 限制和输出解析。它更接近 API 设计而非”好好和 AI 说话”。

为什么重要: 本课程在第 11 阶段将 prompt engineering 作为真正的工程学科来教授。

“CNN 过时了,现在全是 transformer”

现实: Vision Transformer (ViT) 在许多基准测试中击败了 CNN,但 CNN 仍然被广泛使用。它们推理更快,在移动/边缘设备上表现良好,需要更少的数据,并且有有用的归纳偏置(平移不变性、局部模式)。许多生产视觉系统仍然使用 CNN。最好的架构通常结合两者。

为什么重要: 两者都学(第 4 和第 7 阶段)。根据你的约束使用有效的方案。

“训练有用的模型需要大量算力”

现实: 预训练基础模型需要大量算力。但 fine-tuning、LoRA 和 transfer learning 让你可以在单个 GPU 上适配模型。许多有用的 AI 应用根本不需要训练,只需要好的提示和 RAG。”算力障碍”是针对构建基础模型的,而非使用它们。

为什么重要: 你可以用笔记本电脑构建真正的 AI 应用。本课程证明了这一点。


📚 本文改编自 AI Engineering from Scratch(MIT License · 作者 Rohit Ghumare)《误解清单》,中文内容来自官方中文镜像。原课程共 503 课 · 20 阶段 · 免费开源。

  • 标题: 【AI 误解】- 下篇:对齐、训练与工程
  • 作者:
  • 创建于 : 2026-08-19 09:31:00
  • 更新于 : 2026-08-19 08:30:46
  • 链接: https://sxl-space.tk/2026/08/19/010_LLM/012_AI-Myths-2/
  • 版权声明: 版权所有 © 宋,禁止转载。