如何学习基模源码

self.model: 一般都是继承 Transformer 主干(LlavaLlamaModel(config)、Qwen3Model(config))

self.lm_head: nn.Linear(config.hidden_size, config.vocab_size, bias=False),线性层将每个位置的 hidden_states 映射为词表上的 logits

现在遇到的问题,不是“源码看不懂”,而是缺少从源码阅读进入模型研发的桥梁。

培养科研直觉:

看到论文里的 Method,能够迅速判断:它到底改了模型哪一层?forward 是否变化?参数是否新增?loss 是否变化?数据格式是否变化?训练器是否变化?推理路径是否变化?

读 Paper,要先问:Innovation 到底发生在哪?

固定把所有 LLM / MLLM 论文分成下面 6 层:

Level 典型创新
L0 Prompt / inference policy
L1 Data / SFT
L2 RL / reward
L3 Module
L4 Transformer architecture
L5 Kernel / runtime

如何学习基模源码
http://example.com/2026/08/25/如何学习基模源码/
作者
Munger Yang
发布于
2026年8月25日
许可协议