Skip to content

所在组:进阶(桥接) | 上一组出口:能用发布门与版本化纪律长期运行 | 本页出口:知道该主题影响哪个工程决策、何时去 Learn LLM

MoE 与前沿架构(桥接) ​

桥接页:MoE 路由、负载均衡、MLA 的注意力推导、长上下文的位置编码在 Learn LLM(第 9 章 · 推理与量化;第 20 章 · DeepSeek 模型专题)。本仓只保留应用侧的位置感:这些架构解释了你选型表里价格、速度、上下文上限的「为什么」。

1. 概述 ​

解决什么问题:三个前沿架构方向各自打破一条旧的等式:

  • MoE(Mixture-of-Experts)打破「参数多 = 每次计算多」:总参数可以巨大,但每个 token 只激活一小部分专家——容量与单次成本解耦。
  • MLA(Multi-head Latent Attention)打破「长上下文 = KV cache 线性爆炸」:把 KV 压缩到低维潜在空间,长上下文的推理成本曲线变平缓。
  • 长上下文打破「模型一次只能看一小段」:但「能放进」不等于「用得好」——长输入中间段的信息利用率有已知的下降形态。

为什么应用工程师要有位置感:你不需要会推 MLA,但选型表上「为什么这家便宜」「为什么那个快」「上下文该塞多满」的答案都来自这三条。不理解它们,选型就退化为背价格表。

2. 使用 ​

决策架构给的位置感
API 选型(价格/速度)MoE 模型的单 token 成本由激活参数而非总参数决定——「总参数巨大」不是贵的理由,「激活参数大」才是;托管 API 已把这层消化进定价
托管 vs 自托管MoE 省计算不省显存:全部专家权重都要驻留内存。自托管 MoE 的门槛在显存与通信,不在算力——这是「托管便宜、自托管贵」悖论的来源之一
上下文策略长上下文 ≠ 免费的 RAG 替代:塞满窗口的成本与中间段利用率下降都是真实代价。纲领不变——「检索该做的事交给检索」(→04-grounding),长窗口用来放必须整段在场的东西(合同全文、长代码文件)
KV cache 相关成本缓存命中与上下文前缀复用(prompt caching)的价值随架构不同;对长上下文+多轮场景,前缀稳定是省钱的工程手段(→成本与性能)

3. 原理 ​

(本段刻意极简:推导归 Learn LLM。)

  • MoE 一句话:路由器为每个 token 挑少量专家计算,容量涨、单次计算不涨;代价是负载均衡与路由稳定性。
  • MLA 一句话:把 KV 压进低维潜在表示再按需还原,是 MQA/GQA 压缩路线的延伸。
  • 长上下文 一句话:窗口能放大,但中间段利用率下降(lost-in-the-middle 现象)——位置在上下文里放哪仍是工程变量。

深水区:Learn LLM 第 9 章(KV cache、MQA/GQA)、第 20 章(DeepSeek 专题:MLA/MoE/GRPO)。

4. 开发 ​

症状 → 去哪:

  • 「换了号称更强的模型,账单反而变了」→ 用激活参数视角重算单位成本(→成本与性能)。
  • 「百万上下文模型还需要 RAG 吗」→ 需要。私有/新鲜事实的 grounding 问题不因窗口变大消失(→04-grounding);长窗口改变的是「整段在场」类场景的可行性。
  • 「长文档中间的关键信息总被漏掉」→ 位置策略:关键信息放头尾、或结构化分块再检索,不要指望满窗口均匀注意力。
  • 想懂路由/MLA 推导 → Learn LLM 第 9、20 章。

5. 资料库 ​

一手源(只引编号,不复述内容):

名称来源标识
Outrageously Large Neural Networks(稀疏 MoE 起点)Shazeer et al.arXiv:1701.06538
Switch Transformers(Top-1 路由)Fedus / Zoph / ShazeerarXiv:2101.03961
Mixtral of Experts(开源 MoE 代表)Mistral AIarXiv:2401.04088
DeepSeek-V2(MLA 提出)DeepSeek-AIarXiv:2405.04434
DeepSeek-V3 Technical ReportDeepSeek-AIarXiv:2412.19437
Lost in the Middle(长上下文位置效应)Liu et al.arXiv:2307.03172

(retrievedAt 2026-09-01;各模型的当前架构细节以其技术报告与官方文档为准。)

learn-ai 到此为止 / 继续去哪 ​

  • MoE/MLA/GRPO 的推导与 toy 复现:Learn LLM 第 20 章(DeepSeek 模型专题),先修第 9 章(推理与量化)。
  • 上下文工程的落点:03-context;成本收口:08-production。

为前端工程师打造 · 基于 VitePress 构建