所在组:进阶(桥接) | 上一组出口:能用发布门与版本化纪律长期运行 | 本页出口:知道该主题影响哪个工程决策、何时去 Learn LLM
MoE 与前沿架构(桥接)
桥接页:MoE 路由、负载均衡、MLA 的注意力推导、长上下文的位置编码在 Learn LLM(第 9 章 · 推理与量化;第 20 章 · DeepSeek 模型专题)。本仓只保留应用侧的位置感:这些架构解释了你选型表里价格、速度、上下文上限的「为什么」。
1. 概述
解决什么问题:三个前沿架构方向各自打破一条旧的等式:
- MoE(Mixture-of-Experts)打破「参数多 = 每次计算多」:总参数可以巨大,但每个 token 只激活一小部分专家——容量与单次成本解耦。
- MLA(Multi-head Latent Attention)打破「长上下文 = KV cache 线性爆炸」:把 KV 压缩到低维潜在空间,长上下文的推理成本曲线变平缓。
- 长上下文打破「模型一次只能看一小段」:但「能放进」不等于「用得好」——长输入中间段的信息利用率有已知的下降形态。
为什么应用工程师要有位置感:你不需要会推 MLA,但选型表上「为什么这家便宜」「为什么那个快」「上下文该塞多满」的答案都来自这三条。不理解它们,选型就退化为背价格表。
2. 使用
| 决策 | 架构给的位置感 |
|---|---|
| API 选型(价格/速度) | MoE 模型的单 token 成本由激活参数而非总参数决定——「总参数巨大」不是贵的理由,「激活参数大」才是;托管 API 已把这层消化进定价 |
| 托管 vs 自托管 | MoE 省计算不省显存:全部专家权重都要驻留内存。自托管 MoE 的门槛在显存与通信,不在算力——这是「托管便宜、自托管贵」悖论的来源之一 |
| 上下文策略 | 长上下文 ≠ 免费的 RAG 替代:塞满窗口的成本与中间段利用率下降都是真实代价。纲领不变——「检索该做的事交给检索」(→04-grounding),长窗口用来放必须整段在场的东西(合同全文、长代码文件) |
| KV cache 相关成本 | 缓存命中与上下文前缀复用(prompt caching)的价值随架构不同;对长上下文+多轮场景,前缀稳定是省钱的工程手段(→成本与性能) |
3. 原理
(本段刻意极简:推导归 Learn LLM。)
- MoE 一句话:路由器为每个 token 挑少量专家计算,容量涨、单次计算不涨;代价是负载均衡与路由稳定性。
- MLA 一句话:把 KV 压进低维潜在表示再按需还原,是 MQA/GQA 压缩路线的延伸。
- 长上下文 一句话:窗口能放大,但中间段利用率下降(lost-in-the-middle 现象)——位置在上下文里放哪仍是工程变量。
深水区:Learn LLM 第 9 章(KV cache、MQA/GQA)、第 20 章(DeepSeek 专题:MLA/MoE/GRPO)。
4. 开发
症状 → 去哪:
- 「换了号称更强的模型,账单反而变了」→ 用激活参数视角重算单位成本(→成本与性能)。
- 「百万上下文模型还需要 RAG 吗」→ 需要。私有/新鲜事实的 grounding 问题不因窗口变大消失(→04-grounding);长窗口改变的是「整段在场」类场景的可行性。
- 「长文档中间的关键信息总被漏掉」→ 位置策略:关键信息放头尾、或结构化分块再检索,不要指望满窗口均匀注意力。
- 想懂路由/MLA 推导 → Learn LLM 第 9、20 章。
5. 资料库
一手源(只引编号,不复述内容):
| 名称 | 来源 | 标识 |
|---|---|---|
| Outrageously Large Neural Networks(稀疏 MoE 起点) | Shazeer et al. | arXiv:1701.06538 |
| Switch Transformers(Top-1 路由) | Fedus / Zoph / Shazeer | arXiv:2101.03961 |
| Mixtral of Experts(开源 MoE 代表) | Mistral AI | arXiv:2401.04088 |
| DeepSeek-V2(MLA 提出) | DeepSeek-AI | arXiv:2405.04434 |
| DeepSeek-V3 Technical Report | DeepSeek-AI | arXiv:2412.19437 |
| Lost in the Middle(长上下文位置效应) | Liu et al. | arXiv:2307.03172 |
(retrievedAt 2026-09-01;各模型的当前架构细节以其技术报告与官方文档为准。)
learn-ai 到此为止 / 继续去哪
- MoE/MLA/GRPO 的推导与 toy 复现:Learn LLM 第 20 章(DeepSeek 模型专题),先修第 9 章(推理与量化)。
- 上下文工程的落点:03-context;成本收口:08-production。