跳到主要内容

学习资源清单与使用方法

下面整理 Alisa Liu 原文列出的资源,并补充每个资源适合解决什么问题、该怎么用。不要把它当成收藏夹,真正有效的方式是:每看一个资源,都产出笔记、代码或问答卡片。

Stanford CS336: Language Modeling from Scratch

CS336 是这条路线的主干。它适合把语言模型从数据、tokenization、Transformer、训练、推理、评估、scaling 等环节串起来。Alisa 把完整看完 lectures 作为准备起点。

使用建议:

  • 先完整过一遍 lecture,不要一开始就深陷每个细节。
  • 用作业 1 训练 Transformer 基本实现。
  • 把课程 schedule 当成 LLM 知识地图,标出自己不会的主题。

Self-Attention & Transformers

这份材料适合把 self-attention、multi-head attention、Transformer block 的数学和直觉补扎实。它比很多短博客更系统,也比原论文更适合作为复习材料。

使用建议:

  • 读完后自己画一遍 Q/K/V 到 attention output 的 shape 图。
  • 准备 5 个口头解释:为什么要 scale、为什么多头、mask 做什么、position 怎么进模型、attention 的复杂度是什么。

The Illustrated GPT-2

  • 链接:The Illustrated GPT-2
  • 作者:Jay Alammar
  • 适合阶段:建立 GPT-style decoder-only LM 的视觉直觉。

这篇文章适合快速建立 GPT-2 内部机制直觉,尤其是 token 输入、Transformer block 堆叠、next-token prediction 和生成过程。

使用建议:

  • 第一次读时只看图,建立整体过程。
  • 第二次读时把每张图对应到 PyTorch tensor shape。
  • 对照自己的 Transformer 实现,确认每个图里的组件在代码里在哪里。

Backpropagation

Alisa 提到有些面试会要求只用 NumPy 写 backward pass。你不一定需要背 NumPy API,但要真正理解反向传播、局部梯度和计算图。

使用建议:

  • 手推 sigmoid、softmax、cross entropy、linear layer 的梯度。
  • 用 NumPy 写一个两层 MLP 的 forward / backward。
  • 用 finite difference 做 gradient check。

Introduction to Policy Gradient for LMs

这篇文章适合作为语言模型策略梯度入门。准备 OpenAI 类岗位时,RLHF / preference optimization / reasoning 训练往往是高频背景知识。

使用建议:

  • 先把语言模型看成 policy:token 是 action,prompt / prefix 是 state。
  • 弄清 reward、advantage、baseline、KL penalty 分别解决什么问题。
  • 对比 SFT、DPO、PPO、GRPO:目标函数、是否需要 reward model、是否在线采样。

Lightweight Guide to GRPO and RL Principles

GRPO 在近期 LLM reasoning / RL 讨论里出现频率很高。面试不一定要求推完整公式,但经常会问“PPO 和 GRPO 有什么区别”“为什么要 group relative”。

使用建议:

  • 先理解 policy gradient,再看 GRPO。
  • 重点记住:它如何构造相对优势、为什么可能减少 value model 依赖。
  • 准备一个 60 秒版本回答 PPO vs GRPO。

How to Scale Your Model

  • 链接:JAX Scaling Book
  • 适合阶段:理解 LLM scaling、硬件、并行和推理成本。

这本在线书从系统视角解释 Transformer 如何在 TPU / GPU 上训练和推理,覆盖 roofline、TPU、sharding、Transformer math、training、inference、profiling 等内容。Alisa 原文把它列为学习资源之一。

使用建议:

  • 先看 introduction 和 Transformer math。
  • 面试前重点看 parallelism、training、inference、KV cache、serving trade-off。
  • 练习口算参数量、FLOPs、KV cache 显存。

LeetCode 75 / NeetCode Blind 75

这些不是 AI 专用资源,但对面试很实际。很多 AI lab 仍然会安排 general coding,基础算法也会渗透进 ML coding。

使用建议:

  • 先刷 pattern,不要随机刷题。
  • 每类题保留 2 到 3 道代表题反复重写。
  • 训练解释能力:边写边讲状态变量、边界条件、复杂度。

Alisa 的公开笔记

Alisa 在原文中链接了自己的 LLM notesmath notes。Notion 页面有时需要浏览器完整加载或分享权限状态正常才能访问,但入口来自她的原文,建议作为学习笔记组织方式参考。

你可以学习的是笔记形态,而不是逐字照抄:

  • 按主题组织,不按资料来源组织。
  • 每个概念包含定义、直觉、公式、代码、常见问答。
  • 面试前能快速检索,而不是只做长期收藏。

资源使用顺序

顺序资源目标
1CS336建立语言模型全景
2Illustrated GPT-2 + CS224n PDF建立 Transformer 直觉和数学
3assignment1-basics从零实现核心模块
4CS231n Backprop补梯度和 backward
5Policy Gradient + GRPO补 post-training / RLHF
6Scaling Book补系统、并行、推理成本
7LeetCode / NeetCode补 general coding

一份笔记模板

每学一个概念,可以按这个模板写:

## 概念名

一句话定义:

解决什么问题:

核心公式 / shape:

最小代码:

常见面试问法:

容易出错的点:

相关论文 / 博客:

面试前最有用的不是厚笔记,而是你能快速重读、快速召回、快速转成口头回答的笔记。