← Knowledge Notes
AI Engineering / Knowledge note · Chinese

Foundation Models for NLP(Springer 教科书精读)

Gerhard Paaß + Sven Giesselbach 2023 Springer 开放教材完整精读。436 页 / arXiv:2302.08575。8 章覆盖:Ch1 经典 NLP 基础(token / embedding / RNN / CNN) / Ch2 PLM 三大架构(BERT autoencoder + GPT autoregressive + Transformer seq2seq) + 训练/正则/不确定性/可解释性 / Ch3 改进 PLM 6 大方向(预训练任务变体 + 长距离稀疏注意力 + 多语言 + 知识注入 + 模型规模 + 微调 / few-shot / CoT) / Ch4 PLM 知识评测(GLUE / SuperGLUE / BIG-bench + Probing) / Ch5 信息抽取(分类 / NER / 关系抽取) / Ch6 文本生成(检索 / QA / 翻译 / 摘要 / 故事 / 代码 / 对话) / Ch7 多模态(语音 / 图像 ViT / 视频 / 控制 Decision Transformer + GATO / DNA / Protein) / Ch8 总结展望(Foundation Models 新范式 / 经济应用 / 5 类危害 / Grounding / Fast & Slow Thinking / Planning)。是 [[newtype-agent-architecture-research-2025]] 和 [[newtype-agent-research-papers]] 的"学术基础"补充

Source collection:Newtype · Published here:2026-09-26 · Note updated:2026-05-17

自然语言处理基础模型Transformer

何时打开:你想给"大模型"建一个 学术基础(不是产业新闻,不是产品评测)。本 wiki 是 Springer 开放教材的精读,作者 Gerhard Paaß(Fraunhofer IAIS 资深科学家) + Sven Giesselbach(IAIS NLU 团队负责人),2023-02 完成,436 页 / 8 章 / 全量精读。

跟其他 wiki 的区别:

三份合读 = 学术 + 论文 + 产业 = 完整知识栈。


一、书的定位 & 作者

1.1 作者背景

  • Gerhard Paaß:Fraunhofer IAIS 首席科学家,数学 + 计算机博士(波恩大学),AI 教育核心人物
  • Sven Giesselbach:IAIS NLU 团队负责人,Informed Machine Learning 研究员
  • 机构:Fraunhofer IAIS(德国国家实验室级别)
  • 资金:德国联邦教育和研究部 ML2R 资助
  • 特色:Open Access 出版,免费分享给全球 NLP 研究者和工程师

1.2 本书核心论点

软件经历了 70 年沿用至今的范式:Software 1.0(写代码)。最近 5 年发生了"语言革命":通过 embedding + self-attention,模型可以从无标注文本中学习。GPT-3 等模型展示了"emergent"行为 —— 同一个架构既能处理文本,也能处理图片、音频、视频、DNA、控制信号等任何"序列"。

因此,"Pre-trained Language Model(PLM)"这个术语已经太窄,Bommasani et al.(2021)创造了 "Foundation Model" 这个词,强调单一模型可以为多种下游任务提供基础。本书是这个 paradigm shift 的完整学术呈现。

1.3 书的结构(8 章)

章 主题 关键模型
Ch 1 经典 NLP 基础(对照参考) RNN, CNN, Word2Vec, GloVe, ELMo
Ch 2 三大 PLM 架构 + 训练 BERT, GPT-2, Transformer
Ch 3 改进 PLM 6 大方向 RoBERTa, ELECTRA, XLNet, T5, GPT-3, PaLM, MoE, distillation
Ch 4 知识评估 + 推理 GLUE, SuperGLUE, BIG-bench
Ch 5 信息抽取应用 XLNet, DeBERTa, BART for IE
Ch 6 文本生成应用 WebGPT, Retro, LaMDA, BlenderBot 3
Ch 7 多模态(语音/图像/视频/控制/DNA) ViT, DALL-E 2, GLIDE, NÜWA, Flamingo, GATO, DNABERT
Ch 8 总结 + 经济影响 + 危害 + 未来 —

二、Ch 1:经典 NLP 基础(对照参考)

2.1 Text Preprocessing

  • 分词:Byte-Pair Encoding (BPE)(GPT 用)/ WordPiece(BERT 用)/ SentencePiece(多语言、亚洲语言)
  • 关键判断:子词分词避免 OOV,常见词整词,罕见词拆分
  • 现代 PLM 不再需要 stemming / stop word removal / lemmatization —— LLM 自动学到这些特征

2.2 Vector Space Models

  • bag-of-words + tf-idf → logistic classifier(古典基准)
  • 损失函数:Maximum Entropy / Cross Entropy L_MC(w) = -Σ log p(y_i | x_i; w)
  • 训练 3 种范式:
    • Supervised(有标签)
    • Unsupervised(无标签,聚类)
    • Self-supervised(从数据自身派生监督信号,如预测 next token)— PLM 的根基

2.3 Static Word Embeddings(Word2Vec / GloVe / FastText)

  • 核心思想(Firth):"a word is characterized by the company it keeps" — 词的意义由邻居决定
  • Word2Vec:用中心词 embedding 预测邻近词(logistic classifier + noise contrastive estimation 加速)
  • 类比关系:vec(Germany) - vec(Berlin) + vec(Paris) ≈ vec(France)
  • 静态 embedding 的根本局限:"bank"只有一个向量,无法区分 financial / river 含义 → 引出 contextual embedding

2.4 RNN(GRU / LSTM)

  • 递归神经网络处理序列:h_{t+1} = RNN(h_t, x_t)
  • LSTM / GRU 解决"梯度消失/爆炸",但 序列长度长时仍力不从心
  • bidirectional RNN(biLSTM):同时 forward + backward
  • ELMo(2018):用 biLSTM 生成 contextual embedding —— PLM 时代的预兆

2.5 CNN

  • AlexNet(2012):图像 1000 类分类,Deep Learning 的引爆点
  • ResNet:残差连接(residual)训练几百层网络
  • NLP 中的 CNN:Kim(2014)用 CNN 做句子分类;Wavenet 用 dilated causal convolutions 做 text-to-speech

三、Ch 2:PLM 三大架构

最核心的一章。所有现代 LLM 都是这三种架构的变体。

3.1 BERT(Autoencoder)— 2.1

Bidirectional Encoder Representations from Transformers(Devlin et al., 2018)

3.1.1 Self-Attention 核心数学

Q = X·W^Q   K = X·W^K   V = X·W^V
Attention(Q,K,V) = softmax(Q·K^T / √d_k) · V
  • Query / Key / Value 是输入 embedding 经 3 个矩阵投影的结果
  • Scaled dot-product attention:(q^T · k) / √d_k(避免 softmax 饱和)
  • 非对称(因 W^Q ≠ W^K),适合表达"Fred gave roses to Mary"中不对称语义角色

3.1.2 Multi-Head Attention

  • BERT_BASE:12 个 head,每个 head 用不同的 W^Q / W^K / W^V 矩阵
  • 不同 head 捕获不同语义关系(语法、语义、指代等)
  • 输出 concat 后过 FCL 得到下一层 embedding

3.1.3 Encoder Block

input embedding(token + position + segment)
   ↓
multi-head self-attention
   ↓  (residual + layer norm)
position-wise FCL (2 层,中间维度 4*D,ReLU)
   ↓  (residual + layer norm)
output embedding

BERT_BASE:12 encoder blocks × 12 heads = 110M 参数。

3.1.4 训练:Masked Language Model (MLM)

  • 随机 mask 15% tokens
  • 其中 80% 替换成 [MASK],10% 随机 token,10% 不变(避免 fine-tune 时无 mask 的不匹配)
  • 用 logistic classifier 预测被 mask 的 token
  • 额外任务:Next Sentence Prediction(后来证明帮助不大)
  • 训练数据:Wikipedia + book corpus = 3.3B 单词
  • 训练时间:4 天 × 64 TPU

3.1.5 Fine-tuning 5 种下游任务

任务类型 输入 输出方式
Text Classification 文本 [CLS] embedding → logistic
Text Pair Classification 文本 A + [SEP] + 文本 B [CLS] embedding → logistic
Word Annotation(NER) 文本 每个 token embedding → logistic
Span Prediction(QA) Question + [SEP] + Context 2 个 logistic 预测 span 起止

3.1.6 计算复杂度(对比)

Layer Type Complexity / Layer Sequential Ops Max Path Length
Self-attention O(T²·D) O(1) O(1)
Recurrent O(T·D²) O(T) O(T)
Fully Connected O(T²·D²) O(1) O(1)
Convolutional O(K·T·D²) O(1) O(log_K(T))

Self-attention 的最大路径长度 O(1) 是关键 — 远距离 token 直接关联,RNN 需要 O(T) 步传递。

3.1.7 BERT 的成就

  • GLUE 平均分:75.2 → 82.1(人类 87.1)
  • SQuAD 1.0:91.7 → 93.2(人类 91.2)
  • 成为 NLP 通用骨干模型,被 RoBERTa / DeBERTa / ALBERT / DistilBERT 大量继承

3.2 GPT(Autoregressive)— 2.2

Generative Pre-trained Transformer(Radford et al., 2018)

3.2.1 核心差异(vs BERT)

  • BERT:双向(看左右)
  • GPT:单向(只看左侧,causal/masked self-attention)
  • 训练:预测下一个 token,而非填空
  • 直接来源于 Transformer decoder

3.2.2 概率分解

p(v_1, ..., v_T) = p(v_T|v_1,...,v_{T-1}) · ... · p(v_2|v_1) · p(v_1)
  • 自回归 → 按顺序预测每个 token
  • 损失:negative log-likelihood = -Σ log p(v_t | v_1, ..., v_{t-1})

3.2.3 Perplexity 评估

perplexity = p(v_1, ..., v_T)^(-1/T)

GPT-2 在 Penn Treebank perplexity:46.5 → 35.8(大幅降低 = 模型更"懂"语言)

3.2.4 文本生成的采样策略

方法 描述 适用
Random sampling 按概率分布完全随机 经常选超低概率词,质量差
Top-k sampling 只看 top-k tokens,重新归一化 实际生成的标准
Top-p (nucleus) sampling 累积概率超过 p 的 tokens 实际生成的标准
Entmax softmax 的稀疏版本 实验性

3.2.5 GPT-2 详情

  • 1.5B 参数(largest),48 层,1600 tokens 上下文
  • 训练:40GB Reddit 文本
  • 首次 zero-shot 生成连贯文章(几乎与人类无法区分)
  • 演示了 zero-shot learning(没有专门训练的任务也能解决)

3.3 Transformer(Encoder-Decoder)— 2.3

Vaswani et al.(2017)的原始论文 "Attention Is All You Need"

3.3.1 架构

Source: "The mouse likes cheese"          Target: "Die Maus mag Käse"
   ↓                                                 ↑
[Encoder: 6 blocks]                          [Decoder: 6 blocks]
                                                     ↑
   contextual embeddings ──── cross-attention ───────┘
  • Encoder:跟 BERT 一样,生成源语言的 contextual embedding
  • Decoder:跟 GPT 一样自回归,但加 cross-attention 关注 encoder 输出
  • 用于:翻译 / 摘要 / QA 等 seq2seq 任务

3.3.2 Cross-Attention

Decoder layer 自己的 embedding → Query
Encoder 最后层 embedding → Key + Value

注意:这是 Decoder 用来"看"输入文本的关键机制。

3.3.3 Decoding 策略

方法 描述
Greedy decoding 每步选概率最高 token,简单但易陷入次优
Beam search(beam=4) 保留 k 个候选,平衡质量和成本(实际翻译用)

3.3.4 翻译评估指标

指标 性质 描述
Bleu precision 1-gram 到 4-gram 与参考翻译对比
Rouge recall unigram / bigram / 最长公共子序列
Meteor F-mean word-to-word 对齐,含 stemming + 同义
BERTscore embedding similarity 用 BERT embedding 算 cosine 相似度

3.3.5 三种架构对比

模型 类型 训练任务 适用
BERT Autoencoder 预测被 mask 的 token NLU(理解类)
GPT-2 Autoregressive 预测下一个 token NLG(生成类)
Transformer Encoder-Decoder 输入 → 输出 seq2seq 翻译 / 摘要 / QA

关键洞察:这 3 种 + 集合统称为 Pre-trained Language Models(PLM);参数 >= 1B 时常称为 Foundation Models。

3.4 训练 & 评估 — 2.4

3.4.1 SGD 优化器演进

SGD → Momentum → AdaGrad → AdaDelta → RMSProp → Adam → LAMB
  • Adam:大部分 PLM 默认(结合 AdaGrad 和 RMSProp)
  • LAMB:让 BERT 训练时间从 3 天 → 76 分钟(batch size 32868)

3.4.2 并行化(GPT-3 级别必备)

  • Data parallelism:同模型不同数据
  • Pipeline parallelism:不同层在不同 GPU
  • Within-layer parallelism:同一层权重分布到多 GPU
  • DeepSpeed / GSPMD:工具

3.4.3 正则化

方法 用途
Dropout 随机 mask 隐变量
Layer Norm 替代 BatchNorm,PLM 默认
RMSNorm Layer Norm 简化版,只除根均方
Label Smoothing 标签从 one-hot 改为 soft
Residual connections(ResNet 引入) 训练几百层

3.4.4 不确定性估计 3 种方法

  • Bayesian Neural Networks:posterior 难算,用 MCMC / 变分推断 / Laplace 近似
  • Single Deterministic(Dirichlet, SNGP):单网络出不确定性
  • Ensemble:训练多个网络取平均(实际最可靠,但贵)

3.4.5 可解释性 5 种方法

  • Feature importance:输入 token 对输出的梯度
  • Counterfactual:改输入看输出怎么变
  • Surrogate models(LIME):用简单线性模型近似
  • Example-driven:展示相似训练样本
  • Source citation:WebGPT 风格 — 答案附加文档引用
  • Chain of Thought(CoT):让模型生成推理步骤(PaLM 演示)

四、Ch 3:改进 PLM 6 大方向

4.1 修改预训练任务(3.1)

类别 代表模型 创新点
类 BERT autoencoder RoBERTa 更大数据 + 去 NSP + 更长训练
ELECTRA replaced token detection(更高效)
DeBERTa / DeBERTaV3 disentangled attention
ALBERT parameter sharing
XLNet permutation-based
类 GPT autoregressive GPT-3(175B) few-shot prompting 涌现
PaLM(540B) Pathway scaling, BIG-bench 超人类平均
Gopher / Chinchilla scaling laws
MT-NLG(530B) DeepSpeed 训练
Wu Dao(1.75T MoE) 中国大模型
Encoder-Decoder T5 text-to-text unified
BART denoising autoencoder
mT5 / mBART multilingual

4.2 处理更长输入(3.2)

self-attention 复杂度 O(T²),输入太长爆炸。解法:

  • Sparse attention:Longformer / BigBird / Sparse Transformer(只看部分位置)
  • Hashing / Low-rank:Reformer(LSH) / Linformer / Performer
  • 实测:可以处理 4K-16K 上下文(本书 2023 年时代)

4.3 多语言(3.3)

  • mBERT / XLM-R:autoencoder 多语言
  • mT5 / mBART:seq2seq 多语言
  • XGLM:autoregressive 多语言
  • 高资源语言 → 低资源语言迁移能力强
  • PaLM 覆盖 100+ 语言,但 78% English / 3.5% German

4.4 知识注入(3.4)

方法 描述
Knowledge Base embeddings(KGE) 把 KB 实体当作"虚拟 token"
Graph Learning 图结构 + PLM
Textual encoding of tables TAPAS / TaBERT
KB relations textually encoded KEPLER
Retrieval-augmented(关键!) REALM / RAG / Retro — 用检索补充知识

4.5 改变模型大小(3.5)

  • 越大越好:Scaling Laws(Kaplan, Hoffmann)
  • Mixture-of-Experts(MoE):激活稀疏,1.6T 参数但每次只用 ~10B
    • Switch Transformer / GShard / GLaM
  • 压缩 / 蒸馏:DistilBERT(66M 参数,90% 性能)
  • 低秩分解:ALBERT 的 factorized embedding

4.6 微调(3.6)

变体 描述
Full fine-tuning 更新所有参数(原始方式)
Adapter 加小模块,只训这些
Prompt tuning 只调 prompt embedding
LoRA(Low-Rank Adaptation) 低秩矩阵微调(高效流行)
P-tuning v2 prompt + adapter 混合

4.6.1 Few-shot Prompts(GPT-3 涌现的关键)

  • In-context learning:在 prompt 里给几个示例,模型从中学
  • Chain-of-Thought(CoT):提示模型分步推理(PaLM)
  • Instruction tuning:用指令式数据 fine-tune(InstructGPT / FLAN)
  • RLHF(本书出版后流行):后续大量论文

4.6.2 用 Foundation Model 生成标注数据(3.6.6)

  • GPT-3 few-shot 生成训练数据 → 小模型学
  • 数据增广 + 蒸馏的新范式

五、Ch 4:PLM 知识评估

5.1 主要 Benchmark

Benchmark 任务数 性质
GLUE 9 NLU 经典
SuperGLUE 8 更难的 NLU
LAMBADA 1 预测段落最后一词(测长距离理解)
BIG-bench 200+ 类人类多面测试(PaLM 平均超人类)
HELM 多个 系统性评估
MMLU 57 学科 多领域知识

5.2 Probing Classifiers

  • 不修改 PLM,只用其 embedding 训简单分类器
  • 测句法知识(POS / 依存) / 常识知识(WSC) / 逻辑一致性
  • 发现:BERT 句法很强,但常识和逻辑还差

5.3 可转移性 & 可复现

  • 不同 benchmark 的结果不一定能跨任务转移
  • NLP 论文 复现率不高(随机种子 / 超参敏感)

六、Ch 5:信息抽取

6.1 Text Classification

  • Multiclass(互斥类):多数情况用 BERT + [CLS]
  • Multilabel(多标签):每个标签独立 sigmoid
  • Few/Zero-shot:Prompt-based,基于 PLM 已有知识

6.2 Word Sense Disambiguation(WSD)

  • 任务:"bank"是 sloping land 还是 financial institution?
  • 经典任务,模型在 SemCor 上做评估
  • BERT 系列把 WSD 准确率提到 83%

6.3 Named Entity Recognition(NER)

子任务 描述
Flat NER 平铺标记
Nested NER 嵌套实体(如"NYU School of Law"中的 NYU)
Entity Linking 链接到 Wikipedia / Wikidata 等 KB

CoNLL-2003 NER:BERT 把 F1 从 92.6 提到 92.8(逐步进步)

6.4 Relation Extraction(关系抽取)

子任务 难度
Coreference Resolution(指代消解) 中
Sentence-level RE 中
Document-level RE 高
Joint Entity + Relation 高
Distant Supervision(KB 自动标注) 中
Layout-aware RE(LayoutLM 等) 表格 / 票据

七、Ch 6:文本生成

7.1 Document Retrieval(6.1)

  • 从 BM25 / TF-IDF → Dense Retrieval(用 embedding)
  • DPR(Dense Passage Retrieval):双 encoder + dot product
  • ColBERT:token-level interaction
  • FAISS:大规模近邻搜索
  • MS-MARCO benchmark 上 dense retrieval 显著超 keyword

7.2 Question Answering(6.2)

类型 描述
Closed-book(训练数据知识) T5 fine-tune,GPT-3 prompt
Open-domain(检索+读) DPR + reader, FB Hybrid(67.4% 接近专家)
Long-form QA(检索+生成段落) RAG / Retro / WebGPT

7.3 Neural Machine Translation(6.3)

  • 单语种对 vs 多语种(100+) mT5 / NLLB-200
  • Back-translation:用单语数据增强训练
  • Document-level(整篇文章而非单句)
  • 某些语言对达到/超越人类参考翻译

7.4 Text Summarization(6.4)

类型 模型
短文档摘要 BART / Pegasus
长文档(>4K) BigBird / LongT5
多文档 Hierarchical / FiD
  • RLHF on summarization:OpenAI 实验中,70% 用户偏好 RL-tuned 输出超过参考摘要

7.5 Text Generation(6.5)

7.5.1 控制生成的 3 种方式

  • Style 标签(CTRL)
  • Storyline 控制(Plot 关键词)
  • Few-shot prompting(GPT-3 风格,推荐)

7.5.2 Fake News & Code

  • GPT-2 可生成 几乎不可区分 的 fake news → 滥用风险
  • Code generation:Codex / GitHub Copilot / AlphaCode(2022 年水平)

7.6 Dialog Systems(6.6)

  • 老式:Pipeline 模块(意图识别 + 槽填充 + 回答生成)
  • 新式 PLM 端到端:BlenderBot 3 / LaMDA / Sparrow
  • LaMDA(137B):增加 safety + quality + groundedness fine-tuning,接近人类水平
  • 局限:hallucination + bias + toxicity

八、Ch 7:多模态(本书最有趣的一章)

8.1 Speech(7.1)

  • HuBERT / wav2vec 2.0 / Whisper:自监督语音 + transcribe
  • LibriSpeech WER 1.4%(超人类)
  • WaveNet:第一个能合成 16kHz 真实语音
  • AudioLM:语音模型(类比文本模型)

8.2 Image(7.2)

8.2.1 Vision Transformer (ViT)

  • 把图像切成 16×16 patch → 每个 patch 当 "token"
  • 用 BERT 风格 self-attention 处理
  • 超越 ResNet 在 ImageNet 上(且训练快)

8.2.2 Image Generation 模型时间线

模型 类型 关键
DALL-E(2021) autoregressive 第一个 text-to-image 大模型
GLIDE(2021) diffusion OpenAI
DALL-E 2(2022) CLIP + diffusion 1024×1024 高分辨率
Imagen(2022) diffusion + T5 Google
Stable Diffusion(2022) latent diffusion 开源,改变游戏规则

8.2.3 多用途(OFA / Flamingo)

  • OFA:统一文本和图像 token,做 captioning / VQA / image generation
  • Flamingo:视频 + 文本基础模型

8.3 Video(7.3)

  • Tubelet 输入(图像 patch 跨多帧)
  • NÜWA:统一处理 text/image/sketch/video,做 9 种生成任务
  • Imagen Video / Make-A-Video:文生视频高清

8.4 Control(7.4)

8.4.1 Decision Transformer

  • 把控制问题看作"sequence modeling"
  • 输入:(reward_t, state_t, action_t) 三元组
  • 训练:预测下一个 action(给定 desired future reward)
  • 应用:Atari 游戏 / 棋类 / 机器人

8.4.2 GATO(DeepMind)

  • 单一 Foundation Model,同时做:
    • 文本 QA
    • 图像 captioning
    • Atari 游戏(同样架构 + 不同 token)
    • 机器人控制
  • 1.2B 参数,多模态通用智能的 PoC

8.5 DNA / Protein(7.5)

  • DNABERT:DNA 当"语言",预测启动子区域、motif
  • AminoBERT:从蛋白序列直接预测 3D 结构(某些任务超 AlphaFold2)
  • 生物医药新范式

九、Ch 8:总结 & 未来

9.1 Foundation Models 是新范式(8.1)

AI 模型 4 代演化

代 描述 例子
1980s Expert Systems rule-based
~2000s Machine Learning SVM, random forest, feature engineering
2010s Deep Learning CNN, RNN
2020s Foundation Models BERT, GPT, PaLM, DALL-E

Fei-Fei Li 的判断:Foundation Models = "phase change in AI"

9.2 经济应用(8.1.4)— 8 大领域

  1. Search & Retrieval:embedding-based 搜索取代 keyword
  2. Writing:自动起草、检查、补充信息
  3. Translation:跨 100+ 语言,低资源语言受益最大
  4. Chatbots:LaMDA / BlenderBot,客服 / 售前
  5. Healthcare:$4T 市场 — 病历分析、影像、药物发现、心理咨询(Woebot)
  6. Genomics / Proteomics:DNABERT / AminoBERT,加速药物开发
  7. Legal:1.3M 美国律师,合同 / 案例 / 法律研究自动化
  8. Education:个性化教学,降低学生贷款负担

9.3 5 大潜在危害(8.2)

危害 机制 例子
1. Bias / Toxic Language 训练数据反映社会偏见 GPT-3:83% 职业被关联男性;Islam → terrorist 60% 频率
2. Intentional Harm 故意训练 fake news / 攻击代码 微调 GPT-2 做极端右翼宣传
3. Overreliance / Anthropomorphism 用户把对话模型当真人 XiaoIce 6.6 亿用户,平均 23 轮对话(比人际多)
4. Privacy Leakage 模型背诵训练数据 PaLM 复刻 2.4% 训练样本
5. Societal Harm 能耗 / 不平等 / 文化同质化 PaLM 训练 271 吨 CO₂(=1架 SFO-JFK 飞机)

9.4 法律监管(8.2.5 末尾)

  • EU AI Act:4 级风险(minimal / limited / high / unacceptable)
  • US:FTC + Commerce Department(自愿框架)

9.5 Advanced AI(8.3)— 未来 5 个方向

9.5.1 Foundation Models 能创新吗?

  • 反方(Marcus, Bender):stochastic parrots(随机鹦鹉,只复述)
  • 正方:contextual embedding 空间内的新组合 = 创新(如 "corgi playing a flame-throwing trumpet")

9.5.2 Grounding 语言到世界

"language modeling task, because it only uses linguistic forms as training data, cannot in principle lead to learning of meaning" — Bender et al. 2020

  • 婴儿是边看边学的(self-supervised perception)
  • LeCun 提议:从 视频 自监督学习物理世界(NÜWA 已开始)
  • 5 个 grounding scope(Bisk 2020):
    1. Curated corpora(BERT)
    2. Web-scale text(GPT-3, PaLM)
    3. Mix with other modalities(OFA, NÜWA)— 已部分实现
    4. Embodiment(传感器 + 运动)— 未来
    5. Social interaction — 更远未来

9.5.3 Kahneman Fast & Slow Thinking

System 速度 描述
System 1 快 直觉,本能,自动 — 现在的 PLM 接近
System 2 慢 推理,反思,逻辑 — 当前模型还差

LeCun:System 2 需要 planning + 内部世界模型 + model predictive control。

9.5.4 Planning Strategies

  • Decision Transformer / GATO 是早期 Planning 尝试
  • LeCun 设想:高级配置器 + 多个世界模型 + 动态调度
  • SayCan:把 PLM + 机器人技能"verbally express"(2022 早期 PoC)
  • 多数研究者认为 Symbol + Neural 不一定矛盾 — Hinton:"symbols just exist out there in the external world, and we do internal operations on big vectors"

9.6 LeCun 的判断

"The ability to construct models of the world is basically the essence of intelligence."

AI 未来 10 年挑战:学习世界模型,处理不确定性。


十、本书的限制 & 我的判断

10.1 本书出版时点(2023-02)

本书写于 2022 年下半年,2023-02 完稿。所以:

  • ✅ 充分覆盖 BERT(2018)→ GPT-3(2020)→ PaLM(2022)→ DALL-E 2(2022)
  • ✅ 提到 LaMDA、BlenderBot 3、Retro、WebGPT
  • ❌ 不覆盖:GPT-4(2023-03)、ChatGPT 现象级流行、Claude、Llama 系列、Stable Diffusion 现象级火爆、RLHF 深度方法论、InstructGPT、Constitutional AI
  • ❌ 不覆盖:Agent 工程化、MCP、Multi-Agent Orchestration、tool use 工程化

10.2 跟其他 wiki 的连接

Wiki 关注
AI Agent 技术架构演进 2025(深度研究报告) 2026-01 产业图景(填补本书 2023 后空白)
Agent 研究论文 3 篇精读(2024-2025) 3 篇关键论文精读
Karpathy · Software in the era of AI(Software 3.0) Karpathy Software 1.0/2.0/3.0 范式(本书的"哲学化"表达)
newtype · MCP 协议与生态实战 MCP 协议生态
newtype · RAG 实战与知识库演化 RAG 实战(本书第 3.4.5 + 6.1-6.2 节是其学术基础)
Claude Code 最佳实践(Cal Rueb · Anthropic 内部讲座) Cal 内部讲座 — Agentic Search vs RAG 的判断,本书是 RAG 学术根基
王凯 Claude Code 终端工作流方法论(完整版) 王凯 Claude Code 综述

10.3 给独立开发者的应用建议

  1. 不必读全本 —— 你不需要从头懂 self-attention 数学。但 Ch 2 至少过一遍,知道 BERT vs GPT 差异
  2. 跳到 Ch 6 选择应用方向 —— QA / 翻译 / 摘要 / 对话 / 代码,看哪个跟你产品对得上
  3. Ch 7 多模态部分 —— 看哪个媒体 + 文本结合是你的机会(电商图像、视频教育、医疗影像、DNA)
  4. Ch 8 经济应用 + 危害 —— 给老板讲 / 写 PRD / 写 BD 提案用得到
  5. 重要 reference:Bommasani et al. 2021("On the Opportunities and Risks of Foundation Models"arXiv:2108.07258)— 整个 Stanford CRFM 的"圣经",本书反复引用

History

  • 2026-05-17:Phase 4 ingest 从 06_Foundation_Models_NLP.pdf(arXiv:2302.08575,Springer 开放教材,436 页)完整精读。8 章全部覆盖:Ch1 经典基础 + Ch2 三大 PLM + Ch3 改进方向 + Ch4 评估 + Ch5 IE + Ch6 文本生成 + Ch7 多模态 + Ch8 总结。是 newtype 知识库的"Foundation Models 学术基础"层。

来源与关联资料