光屿云霞科技
分享大模型2026-06-10·2 分钟阅读

分享栏:更高阶的 AI 学习路线,从会用到会造

这是一条给已经走完主系列的人准备的更高阶路线,重点放在后训练、分布式训练、推理优化、Agent 协议和前沿研究。

大模型

分享栏:更高阶的 AI 学习路线,从会用到会造

如果你已经把前面的主系列走完了,那接下来就不是“再多看几个教程”,而是进入更高一层的学习:

  • 你要开始看模型是怎么被真正训练出来的
  • 你要开始看系统是怎么被真正跑稳的
  • 你要开始看协议、评估和工具是怎么把 Agent 变成产品能力的
  • 你要开始看论文、课程和源码,去理解前沿是怎么推进的

这篇依然放在分享栏,不挤进主系列。
因为主系列的目标是“打通认知和工程路径”,而这一篇更像是“往上爬的阶梯”。

第一层:后训练和模型定制

如果你想继续往模型开发方向走,先从 Hugging Face 这一套开始最稳:

  • Transformers:模型定义、训练和推理的基础框架。
  • Datasets:数据集管理、切分和处理。
  • Accelerate:把同一套 PyTorch 代码跑到单卡、多卡和分布式环境里。
  • PEFT:参数高效微调,理解 LoRA、Adapter 等方法。
  • TRL:SFT、DPO、GRPO、Reward Modeling 这一类后训练方法。

如果你想按顺序学,建议是:

  1. 先看 Transformers
  2. 再看 PEFT
  3. 再看 TRL
  4. 最后再看 Accelerate,把训练规模真正放大

这一步的关键,不是“会调一个参数”,而是理解:

  • 哪些能力来自预训练
  • 哪些能力来自后训练
  • 哪些能力来自数据和偏好对齐
  • 哪些能力来自训练系统本身

第二层:分布式训练和底层优化

如果你想更深一层,就要看训练是怎么在大规模 GPU 集群里跑起来的。

最值得看的官方资料有:

这一层你要搞懂的,不只是“名字”,而是这些问题:

  • 为什么要切分参数、梯度和优化器状态
  • 为什么显存会卡住训练
  • 为什么长上下文训练会越来越贵
  • 为什么注意力优化会直接影响吞吐

如果你是嵌入式工程师,这一层和你很像,因为你本来就习惯做资源切分、预算约束和性能优化。

第三层:推理系统和性能工程

模型训练完,还要跑得快、跑得稳、跑得省。

这一层重点看:

如果你关心本地推理、边缘推理、离线推理,这一层特别重要。
因为很多真实产品并不是“必须用最强模型”,而是“要在成本、延迟、隐私和体验之间找到平衡”。

你可以把这一层理解成:

  • 训练是做能力
  • 推理是交能力
  • serving 是把能力变成系统

第四层:Agent 协议、评估和工具链

如果你要把模型接进复杂系统,协议和评估就变得特别重要。

先看官方协议和工具:

这一层你要重点理解三件事:

  1. 工具怎么接
  2. 评估怎么做
  3. 安全怎么兜底

如果没有协议,Agent 很容易变成一堆散乱的调用。
如果没有评估,系统很容易变成“演示很好看,线上很难用”。
如果没有安全边界,系统很容易把风险一起放大。

第五层:研究级课程和论文阅读

如果你想继续往研究和前沿方向走,课程和论文会比碎片化视频更有帮助。

可以重点看这些官方课程:

论文阅读上,建议按这个顺序:

  1. Attention Is All You Need
  2. RAG 相关论文
  3. LoRA / QLoRA / DPO 相关论文
  4. FlashAttention 相关论文
  5. ReAct、Toolformer、Chain-of-Thought 这一类 agent 和 reasoning 论文
  6. Scaling laws、long-context、multimodal 相关论文

你不需要一口气把所有论文都啃完。
更高阶的学习,关键不是“读得多”,而是“每一类问题都知道该去查哪类材料”。

给嵌入式工程师的高阶建议

如果你是嵌入式工程师,我更建议你按这个优先级往上爬:

  1. 先把推理和部署看深
  2. 再把评估和协议看深
  3. 再把后训练和微调看深
  4. 最后再进入分布式训练和论文阅读

因为你最容易先产生价值的地方,不是从头训练一个基础模型,而是把一个可用模型系统做稳、做快、做省、做安全。

一句话总结

主系列解决的是“入门后的主路径”,
这篇解决的是“如果你还想继续往上爬,该往哪里爬”。

评论功能需要配置 Giscus 环境变量

请访问 giscus.app 获取配置信息