🧱
递进式学习
48 课从向量点积到完整推理引擎,每课在前一课基础上构建,环环相扣
Inference School 是一个基于问题的课程,每一道练习都为构建一个面向 Apple Silicon 的小型语言模型推理引擎贡献一块拼图。这些练习并非孤立的面试题——点积变成 GEMV,GEMV 变成 Q/K/V 投影,这些投影又构成注意力机制,沿着同一条路径最终加载模型、生成 token。
本中文版在保留英文原版完整技术内容的基础上,提供:
| 模块 | 范围 | 主题 |
|---|---|---|
| Module 0 | 000–006 | 基础运算 · 向量 / 矩阵 / Roofline |
| Module 2 | 007–012 | 激活与归一化 · SwiGLU / Softmax / RMSNorm |
| Module 3 | 013–021 | 注意力机制 · RoPE / 因果注意力 / MHA / GQA |
| Module 4 | 022–028 | KV 缓存 · 分页分配 / 量化 / 滑动窗口 |
| Module 5 | 029–034 | 量化 · INT8 / INT4 / 误差传播 |
| Module 6 | 035–042 | 推理引擎 · Transformer / 分词 / 采样 / Decode |
| Module 7 | 043–047 | 优化与收尾 · 融合 / 批调度 / 投机解码 |
开始学习
点击上方「开始学习」按钮,从第 000 课开始你的旅程。