如何学习基模源码
self.model: 一般都是继承 Transformer 主干(LlavaLlamaModel(config)、Qwen3Model(config))
self.lm_head: nn.Linear(config.hidden_size, config.vocab_size, bias=False),线性层将每个位置的 hidden_states 映射为词表上的 logits
现在遇到的问题,不是“源码看不懂”,而是缺少从源码阅读进入模型研发的桥梁。
培养科研直觉:
看到论文里的 Method,能够迅速判断:它到底改了模型哪一层?forward 是否变化?参数是否新增?loss 是否变化?数据格式是否变化?训练器是否变化?推理路径是否变化?
读 Paper,要先问:Innovation 到底发生在哪?
固定把所有 LLM / MLLM 论文分成下面 6 层:
| Level | 典型创新 |
|---|---|
| L0 | Prompt / inference policy |
| L1 | Data / SFT |
| L2 | RL / reward |
| L3 | Module |
| L4 | Transformer architecture |
| L5 | Kernel / runtime |
如何学习基模源码
http://example.com/2026/08/25/如何学习基模源码/