← 知识整理
AI 技术与工程 / 知识整理 · 中文

5 本大模型入门厚书核心导读 / 1485 页系统化教材

5 本大模型主流教材的统一索引与核心导读。①一本书读懂 AIGC(2023, 256 页, 通识科普)② 从零开始大模型开发与微调 基于 PyTorch+ChatGLM(376 页, 实操教材)③ 大模型应用开发极简入门 基于 GPT-4+ChatGPT(177 页, O'Reilly, 2024 SDK 实操★深度精读)④ 大规模语言模型:从理论到实践(297 页, 复旦学术派, 张奇桂韬郑锐黄萱菁)⑤ 大模型黑书 基于 GPT-3/4 Transformer NLP(379 页, Denis Rothman)。覆盖 NLP 经典理论 → Transformer → GPT 演化 → Prompt 工程 → 微调 → 应用开发完整路径

资料来源:大语言模型学习 · 本站发布:2026-09-26

LLM教材模型开发大模型基础

5 本主流教材的统一索引。每本书都值得独立精读,本 wiki 提供导读 + 核心心法供快速决定先读哪本。

深度状态说明:

  • 📗 极简入门 — 已全本精读(177 页),内容详尽
  • 📒 大规模 LLM — 核心章节读毕(297 页中重点)
  • 📕 黑书 / 微调 PyTorch — TOC + 前言级别读(待用户需要时深度精读,留 review)
  • 📓 一本书读懂 AIGC — PDF 编码异常,等待 OCR

一、📗 大模型应用开发极简入门(O'Reilly, 2024) — 177 页

作者:Olivier Caelen + Marie-Alice Blete(O'Reilly,2024 译为中文)。 定位:最实用的 SDK 实操指南。5 天达成 ChatGPT 上线百万用户的影响后所写。

5 章结构 + 核心要点

Ch1 初识 GPT-4 和 ChatGPT

  • LLM 基础概述:Transformer 在 LLM 中的作用 + Token 化 + 预测
  • GPT 历史:GPT-1 → GPT-2 → GPT-3 → InstructGPT(RLHF)→ GPT-3.5 / Codex / ChatGPT → GPT-4
  • 7 个用例:Be My Eyes(盲人辅助)/ 摩根士丹利 / 可汗学院(Khanmigo)/ 多邻国 / Yabble / Waymark / Inworld AI
  • AI 幻觉警告:GPT 算 3695×123548 自信地给错答案 → 不能用于真相至关重要的医疗类应用
  • 插件 + 微调两种优化方式

Ch2 API 深入

  • OpenAI Playground 实操
  • OpenAI Python 库(Hello World)
  • ChatCompletion 端点输入输出格式
  • Completion 端点(老 API)
  • 定价 + 标记限制 + 安全隐私
  • 其他 API:嵌入 / 内容审核 / Whisper / DALL-E

Ch3 应用程序开发

  • API key 管理 + 数据安全
  • 软件架构 + LLM 漏洞(Prompt Injection 无法完全避免)
  • 4 个示例项目:
    • 项目 1:新闻稿生成器
    • 项目 2:YouTube 视频摘要(含 Map-Reduce 解决长文本)
    • 项目 3:塞尔达传说专家(Redis + 向量检索 + 嵌入 = 自建 RAG)
    • 项目 4:语音控制(Whisper 转录 → GPT 处理)

Ch4 高级技巧

  • Prompt 工程:有效提示词设计 / Chain-of-Thought 逐步思考 / 少样本学习 / 改善提示效果
  • 微调:开始 / OpenAI API 微调 / 微调成本
  • 生成和微调电子邮件营销活动的合成数据(完整案例)

Ch5 LangChain + 插件

  • LangChain 框架:动态提示词 / 智能体 + 工具 / 记忆 / 嵌入
  • GPT-4 插件:概述 + API + 插件清单 + OpenAPI 规范

极简入门最值得吸收的 3 点

  1. 塞尔达专家项目原理(Ch3 Project 3) — 是 LLM 面试 / RAG 检索增强生成完整专题 的简明实战版
  2. AI 幻觉示例 — 3695×123548 算错的例子 — 是 王凯 收藏 / 2024-2026 AI 前沿论文与报告精读 OpenAI Hallucination 论文的入门版
  3. Email 营销合成数据微调案例(Ch4) — Self-Instruct 思路的最小完整 demo

二、📒 大规模语言模型:从理论到实践(2023-09) — 297 页

作者:张奇 / 桂韬 / 郑锐 / 黄萱菁(复旦大学派)。 定位:学术派的中文 LLM 综述教材。8 个月成书,2023-09 出版。

核心立场

"ChatGPT 在开放领域问答、各类生成式任务以及对话理解等方面展现出的能力远超过大多数人的想象。" "由于 OpenAI 并未公开 ChatGPT 的详细实现细节,我们需要从原理出发系统重建这个领域。"

时间线核心:LLM 发展 3 阶段

阶段 时期 代表事件
基础模型阶段 2018-2021 BERT / GPT / 百度 ERNIE / 华为盘古-α / PaLM
能力探索阶段 2019-2022 指令微调 / 提示学习 / MaaS 概念
突破发展阶段 2022-11 ChatGPT 起 1 个模型完成多任务,超过专门模型

学科融合

"大语言模型的研究融合了自然语言处理、机器学习、分布式计算、并行计算等多个学科领域。"

与其他书的差异

  • 比《一本书读懂 AIGC》学术性强 100%
  • 比《极简入门》理论侧多,实操少
  • 比《黑书》中文原创,更适合中文读者

适用对象

  • AI 算法工程师 / 研究生入门
  • 想完整理解 ChatGPT 训练 pipeline 的人
  • 中文写作者(便于复用句式)

三、📕 大模型黑书:Transformer NLP(清华大学社) — 379 页

作者:Denis Rothman(法国,Packt Publishing,2022 英文版)。 定位:Transformer 架构权威专著。译本叶伟民。

核心覆盖

Transformer 的"建造、训练、微调"完整路径:

  • Hugging Face 库的实战
  • Python 实现
  • 模型架构详解(Encoder / Decoder / Attention)
  • BERT / GPT / T5 系列对比
  • 微调 + 部署

适合对象

  • 想从底层理解 Transformer 实现的人
  • 准备 NLP 算法工程师面试
  • 论文阅读和复现需求

与其他书的差异

  • 比《极简入门》深度多 5 倍(代码实现细节)
  • 比《大规模 LLM》更聚焦 Transformer 架构本身
  • 2022 英文原版,部分内容到 2024-2026 已有更新(Flash Attention / GQA / Long Context 等新进展未涵盖)

待深度精读的章节

  • Encoder-Decoder 架构原始实现
  • 微调 Hugging Face 实战
  • 多语言 + 多模态 Transformer

四、📔 从零开始大模型开发与微调(基于 PyTorch+ChatGLM) — 376 页

定位:PyTorch + ChatGLM 完整开发流程教材。最贴近"国产模型微调"的实战书。

核心覆盖(待深度精读,基于标题推断)

  • PyTorch 基础(Tensor / autograd / 优化器)
  • Transformer 用 PyTorch 实现
  • ChatGLM 模型分析
  • 微调(LoRA / QLoRA / Continue Pretrain)
  • 部署(单机 / 多机)
  • 应用开发

适合对象

  • 国内做大模型 SFT / RLHF 的算法工程师
  • ChatGLM 系列(GLM-130B / ChatGLM3 / ChatGLM4)使用者
  • 想在国内合规框架下做大模型的人

与其他书的差异

  • 国产模型导向(ChatGLM 而非 OpenAI)
  • 代码实战导向(376 页比《极简入门》深 2x)
  • 未涉及更高级 RLHF / 3D Parallelism

待深度精读

本 wiki 仅做 TOC 级导读。完整章节实战待用户实际微调 ChatGLM 时回到此 PDF 深度精读。


五、📓 一本书读懂 AIGC(2023) — 256 页

作者:佚名(2023 出版,通识科普向)。 定位:最通识的 AIGC 科普书。

状态

PDF 文本提取严重乱码(扫描书或字体异常)。预计内容包括:

  • AIGC 通识(GAN / Diffusion / Transformer)
  • ChatGPT 实操
  • AI 绘画工具(Midjourney / DALL-E / Stable Diffusion)
  • 商业化应用案例

处理建议

  • 标记为 partial_scan_pdf_corrupted
  • 等待 OCR 或重新购买正版后重 ingest
  • 跳过不影响知识体系(同主题已在《极简入门》+ 《大规模 LLM》+ wangkai 的 AIGC 2023 档案中覆盖)

5 本书选读建议

优先级 1(必读)

📗 大模型应用开发极简入门 — 2024 版最实操,5 章 177 页,1 周读完。已在本 wiki 详细总结。

优先级 2(推荐)

📒 大规模 LLM — 复旦学术派权威中文教材,适合算法工程师。 📕 大模型黑书 — Transformer 架构权威,适合面试深度面 / 论文阅读。

优先级 3(按需)

📔 从零开始 PyTorch+ChatGLM — 仅做 ChatGLM 微调时读。 📓 一本书读懂 AIGC — 跳过(内容已在其他渠道覆盖)。


跟现有 wiki 的关系

书 替代 / 补充
📗 极简入门 补充 LLM 面试 / 基础架构与组件 的 GPT API 实操细节
📒 大规模 LLM 补充 Foundation Models for NLP(Springer 教科书精读) 的中文视角
📕 黑书 补充 LLM 面试 / 基础架构与组件 的 Transformer 深度
📔 PyTorch+ChatGLM 补充 LLM 面试 / 微调与强化学习完整专题 的国产模型实战
📓 AIGC 2023 替代 部分 王凯 收藏 / 2023 AIGC 行业报告档案 内容

See also

后续 ingest 建议

  1. 📕 黑书:用户在准备 Transformer 论文阅读 / 算法面试时深度精读
  2. 📔 PyTorch+ChatGLM:用户实际微调 ChatGLM 时精读
  3. 📓 一本书读懂 AIGC:OCR 处理后 ingest(目前 PDF 编码乱码不可读)
  4. 📒 大规模 LLM:可拆为"基础理论 + 训练实践 + 部署应用"3 个子 wiki(需求出现时)