Skip to content

在哪一组:组 01 · 模型生命周期(桥接组)| 上一组出口:能判断知识归属、并为需求选出最低复杂度方案(00-map 组) | 本页出口:能解释 knowledge cutoff 的根源,并用「能力上限冻结于预训练」约束模型选型、时效知识方案与版本升级回归 前置:模型架构(桥接) | 下一步:后训练(组内子组);深层原理去 Learn LLM

1. 概述 ​

结论先讲:base model 的能力上限在预训练结束那一刻冻结。数据配比、规模与算力的权衡(scaling law)决定「这个模型会什么、不会什么」。这条链解释三件应用层的事:knowledge cutoff 的根源、厂商模型档位与定价的结构、以及为什么某个模型在你的任务上不可靠。本页只讲这条链的工程含义;预训练全流程的从零实现归 Learn LLM 第 8 章。

链条 ​

三个工程后果 ​

  1. Knowledge cutoff 的根源在这条链。模型的事实知识来自预训练语料的收集截止点;后训练与产品包装改变行为,不更新权重里的世界知识。时间敏感的事实必须走检索(RAG);cutoff 是要核对的接口属性,不是缺陷。
  2. Scaling law 是厂商档位的结构。Kaplan 与 Chinchilla 两篇工作确立了「损失随参数、数据、算力按可预测规律下降,且参数与数据存在算力最优配比」(本页不复述具体指数)。工程翻译:能力档位是可购买的算力决策,厂商把这条曲线切成分层定价——你的选型就是在这条曲线上选点。
  3. 数据质量决定任务可靠性。你的领域在预训练语料中的占比与清洗质量决定模型「开箱」的表现;评测集数据若混入预训练语料(contamination),榜单分数会被抬高。单一排行榜不可作为选型依据——用你自己的评估集(evals、评估)。

2. 何时跳转 ​

本页无可运行产物;按下表路由:

症状 / 问题该读哪为什么
想看预训练从零跑通(TinyGPT、checkpoint、loss 曲线)Learn LLM 第 8 章预训练全流程的 canonical
训练为什么 / 何时会不稳定Learn LLM 第 6 章训练稳定性工程
scaling law 的原始论述Kaplan / Chinchilla 论文(见资料表)一手来源,本页只留结论
时间敏感的知识怎么办本仓 RAG时效知识走检索不走权重
怎么可靠地选模型本仓 评估 + evals 站榜单可能被污染,自建评估集
新知识要不要微调进权重组内 SFT(桥接)动权重的决策门

3. 原理 ​

一段定位:预训练是把「下一 token 预测」目标在海量语料上跑足够多步;scaling law 是这条流水线的经验规律而非物理定律——它指导厂商的训练预算分配,并以模型档位与定价的形式被你消费。数据工程的细节(去重、配比、过滤)与训练稳定性归 Learn LLM 第 6、8 章(retrievedAt 2026-09-01)。本仓的停止点在「能力上限冻结于预训练」:这不是价值判断,而是改不动已发布权重的工程事实。

4. 工程决策影响 ​

工程决策由这条链推出的判断错误预期会付出的代价
模型选型上限冻结于预训练;榜单分数可能被 contamination 抬高按 leaderboard 选型,上线后任务表现不符
知识时效方案cutoff 是硬属性,不会因为提示而消失指望新模型「应该知道」最近发生的事
版本升级新版本 = 新数据 + 新预训练,工程假设可能全部变化直接切 latest 版本,未跑回归评估
成本结构理解档位定价是 scaling 曲线的切片混淆「更贵」与「更适合我的任务」
领域可靠性验证语料占比决定开箱表现假设专业领域零样本可靠,不做样本测试

维护规则(替代 runbook):Learn LLM 第 6/8 章结构调整时重验本页 deep-link 并更新 lastVerified;主流模型的具体 cutoff 日期与语料构成是厂商披露信息,本页不维护清单——使用时以各厂商模型卡为准。

5. 资料库 ​

四级阅读路线:

级读什么为什么是这个顺序
Beginner本页 + 组导览建立「链条 → 三个工程后果」的映射
BuilderRAG + 评估把 cutoff 与可靠性问题接到主线方案
Operator评估 的版本回归视角每次模型升级先跑回归
ResearcherLearn LLM 第 6、8 章 + 两篇 scaling 论文下沉到预训练与规模规律的一手论述

资源表 ​

名称层级canonical URL支持的断言下一步
Learn LLM 第 8 章 · TinyGPTEhttps://llm.zenheart.site/chapters/08-tinygpt预训练、过拟合、checkpoint 与恢复的从零实现跑通一次预训练
Learn LLM 第 6 章 · 训练稳定性Ehttps://llm.zenheart.site/chapters/06-training-stability训练稳定性是工程问题理解训练诊断
Scaling Laws for Neural Language Models(Kaplan et al., 2020)L4https://arxiv.org/abs/2001.08361损失随参数/数据/算力的幂律关系的系统量化读 loss-vs-scale 图
Training Compute-Optimal LLMs(Chinchilla,Hoffmann et al., 2022)L4https://arxiv.org/abs/2203.15556参数与数据存在算力最优配比对照 Kaplan 结论
evals 站Ehttps://evals.zenheart.site/评估方法与发布证据的 canonical sibling建自己的评估集

(Learn LLM 章节经其章节目录核验、arXiv 链接为稳定 abs 地址,retrievedAt 均为 2026-09-01。)

主动证伪与未决问题 ​

  • 证伪入口:需要具体训练预算、数据量或语料配比估算的决策(如自训模型的算力规划)属于 Learn LLM 或 ML 团队,不是本页——请下沉断言,不要在此扩写。
  • 未决:contamination 的公开检测方法与各模型卡披露口径不统一,本页未逐模型核验;选型时以自建评估集结果为准。

learn-ai 到此为止 / 继续去哪 ​

  • 训练数据工程与实验方法:Learn LLM 第 6、8 章——本仓到此为止。
  • 给模型补充时效知识:本仓 04-grounding 组。
  • 组内下一站:后训练(SFT / RLHF / PEFT 的工程决策桥)。

为前端工程师打造 · 基于 VitePress 构建