Skip to content

LLM:大语言模型

摘要: 大语言模型(LLM)是当前 AI 产业的核心基础设施,其本质为基于 Transformer 架构、以自回归方式建模文本概率分布的超大规模神经网络。本文从定义与特征出发,溯源 2018 至 2026 年的关键发展节点——从 GPT-1 的迁移学习范式到 DeepSeek-R1 的开源推理突破——并系统对比了开源与闭源模型在性能、可定制性、数据隐私与推理成本等维度的取舍。在此基础上,进一步辨析通用模型与领域模型的定位差异,阐释 Foundation Model 作为产业链分工基石的逻辑,最终深入讨论了涌现能力与幻觉这两种相伴而生的关键现象。全文构建了理解 LLM 全景的完整概念框架,为后续的模型选型与技术决策提供基础认知。

📄
图集速览:LLM 大语言模型——概率引擎与智能的边界如果你对大语言模型(LLM)的核心概念还比较陌生,建议先读这篇图集速览。用可视化图片集合和要点摘要,帮你快速理清 LLM 的定义、发展、选型与关键现象。
LLM大语言模型涌现幻觉

1. 定义、特征与发展简史

1.1 定义与特征

定义

大语言模型(LLM)是通过预测下一个词的监督学习方式进行训练的,模型会根据当前输入 Context 预测下一个词的概率分布。这种以预测下一个词为训练目标的方法使得语言模型获得强大的语言生成能力。

LLM(Large Language Model,大语言模型) 是一类基于 Transformer 架构、参数量达到数十亿至数万亿的神经网络模型,其核心能力是通过 自回归生成(Autoregressive Generation)逐 token 预测下一个词,来完成文本生成、翻译、推理、代码编写等各类语言任务。

figure

从用户视角看,LLM 就是一个"什么都会的对话机器人"。但从技术视角看,LLM 的本质是:

LLM = 一个巨大的概率分布函数 P(tokenₙ | token₁, token₂, ..., tokenₙ₋₁)

即:给定前文,推理出下一个最可能出现的词元。

LLM 之所以被称为"大",有四个维度的"大":

维度典型数值(以 GPT-3 为例)意义
参数量1750 亿愈多参数,愈强的表达能力
训练数据量~570 GB 文本(过滤后)数据规模决定知识覆盖广度

1.2 发展简史(2018-2026)

LLM 的发展可以用"能力三跳"来概括:从只能补全句子,到能听懂指令,再到能自主执行任务。

2018 ─── GPT-1 (1.17 亿参数)
         ↑ 第一次证明:大模型 + 无监督预训练 + 微调 = 极强的迁移能力

2019 ─── GPT-2 (15 亿参数)
         ↑ 引发争议:模型太大,太危险?OpenAI 一度拒绝开源

2020 ─── GPT-3 (1750 亿参数)
         ↑ 涌现能力首次被观测!上下文学习(不用训练,给几个例子就能做新任务)

2022 ─── ChatGPT (GPT-3.5,基于 GPT-3 + RLHF)
         ↑ 两个月破亿用户,世界第一次感受到"AI 真的来了"

2023 ─── GPT-4 / Llama 系列开源 / Claude 2
         ↑ GPT-4 引入多模态(图像输入);Meta 开源 Llama 2,生态爆发

2024 ─── Claude 3 / Llama 3 / Qwen 2.5 / DeepSeek-V2
         ↑ 开源卷到追赶 GPT-4;DeepSeek 用 MoE + MLA 压低成本

2024.12 ─── DeepSeek-V3 (671B MoE, 37B activated)
         ↑ 训练成本仅 ~557 万美元(GPT-4 估算约 1 亿+),"性价比之王"

2025 ─── DeepSeek-R1 (推理能力对齐 OpenAI o1)
         ↑ 第一个开源推理模型,用纯 RL(GRPO)训练出 CoT 推理能力

2025 ─── Llama 4 / Claude 4 / Qwen 3 / Gemini 2.5
         ↑ 全系支持超长上下文(1M+ tokens)、多模态、工具使用、Agent 能力

关键脉络

  • 2018-2022 是参数量的军备竞赛;
  • 2023 至今是"性价比 + 开源 + 推理能力 + Agent 能力"的竞逐。

规模不再是唯一指标,数据质量、推理成本、对齐质量同等重要。

2. 开源 vs 闭源模型

这是用户和开发者面临的第一个实际选择:

对比维度闭源模型开源模型
代表GPT、Claude、GeminiLlama、Qwen、DeepSeek、Mistral、Yi
获取方式API 调用,按量付费下载权重,自己部署
性能最强通常是(GPT-5.5、Claude 4)快速追赶,差距持续缩小
可定制性有限(仅为微调 API)可全量微调、修改架构、私有化部署
数据隐私数据经过第三方服务器全本地部署,数据不出域
推理成本按 token 计费,高频调用昂贵前期硬件投入大,边际成本低
生态集成开箱即用,集成简单需要运维能力(vLLM/Ollama 等)

2025-2026 年趋势:开源模型的推理能力已对齐闭源旗舰(如 DeepSeek-R1 对齐 OpenAI o1),选型越来越取决于部署场景而非性能差异。

  • 敏感数据(如企业内部知识库)倾向于本地部署开源模型。
  • 对外提供服务的产品倾向于调用顶级闭源模型。

3. 通用模型 vs 领域模型

通用模型(如 GPT-5、Claude)在广泛领域训练,什么都能聊,但有"博而不精"的问题。

领域模型(如 Med-PaLM 医疗、CodeGemma 编程)专门针对垂直场景训练,在特定领域表现更优,但能力面窄。

通用模型的知识广度 vs 领域模型的深度:

通用模型:████████████████████████████████████████
         法律 ▏ 医疗 ▏ 代码 ▏ 金融 ▏ 教育 ▏ 文学 ▏ ... (广度优先)

领域模型(医疗):
         法律       医疗                   代码        ...
         ─         ████████████████████     ─
                (医疗知识深度远超通用模型)

2025-2026 年新范式:与其从头训练领域模型,更常见的做法是 通用基础模型 + RAG(检索增强) + 领域 System Prompt

例如:用通用 DeepSeek-V4,挂载企业内部文档库,通过 System Prompt 限定角色——这样既保留了通用模型的推理能力,又获得了领域知识的时新性和准确性。

4. Foundation Model(基础模型)概念

Foundation Model(基础模型) 是 2021 年由 Stanford HAI(Human-Centered AI Institute)正式提出的术语,指代一类特征:在广泛、多样的数据上大规模预训练,可适配(Adapt)大量下游任务的基础模型。

它与"大语言模型"的区别在于范围更大——Foundation Model 包括语言模型、视觉模型、多模态模型等。但 GPT、Claude、Llama、Qwen 等 LLM 是当前最重要的 Foundation Model。

Foundation Model 的核心逻辑:

     ┌──────────────────────────────────────┐
     │        海量通用数据预训练              │
     │  ("读遍互联网、书籍、代码、论文")      │
     │          成本极高,仅一次               │
     └──────────────────┬───────────────────┘


     ┌──────────────────────────────────────┐
     │          Foundation Model             │
     │   (GPT-4 / Claude / Llama / Qwen)     │
     │   一个模型,包含广泛的世界知识          │
     └──────────────────┬───────────────────┘

          ┌─────────────┼─────────────┐
          ▼             ▼             ▼
     ┌─────────┐  ┌─────────┐  ┌─────────┐
     │ SFT微调  │  │   RAG   │  │ Agent   │
     │ → 客服   │  │ → 搜索  │  │ → 自主   │
     │   机器人  │  │   助手  │  │   编程   │
     └─────────┘  └─────────┘  └─────────┘
     (下游适配成本极低,复用同一个 Foundation Model)

为什么这个概念重要? 它解释了当前 AI 产业的核心分工:

  • 少数几家做 Foundation Model 的公司在承担巨额预训练成本,而绝大多数应用层团队在"如何用好 Foundation Model"上创造价值——通过 Prompt Engineering、RAG、Agent、微调等方式。
  • 理解"基础模型"的位置,你就理解了整个 AI 产业链的骨架。

5. 涌现能力

关键理解

理解涌现能力,是理解当代 AI 的核心钥匙。 它意味着我们不再是简单地给机器「编程」,而是在培育一种从前不可预期的智能形态。

这也正是为什么 AI 安全(对齐、可控性)和模型评估成为前沿方向——我们需要的不仅是更强大的模型,更是能理解其能力边界的管理手段。

涌现能力(Emergent Abilities) 是指:当模型规模(参数量、训练数据量、计算量)越过某个临界点后,某些能力会呈现非线性的突变式增长——小模型上的表现接近随机水平,一旦规模达标则显著跃升。这些能力并非针对特定任务显式编程或微调得到的,而是模型在更大参数空间和更丰富训练数据的驱动下,被迫学会的抽象通用模式

换言之,涌现能力并非事先设计好的功能清单,而是规模到达一定量级后,模型自发获得的更深层的智能表现——这也是为什么"做大模型"本身就有价值:更大的规模不仅带来更低的困惑度(数学上可预测的收益),还可能解锁小模型永远无法企及的全新能力。

涌现能力的典型表现:

能力描述代表例子
上下文学习
In-Context Learning
无需微调,仅靠提示中的几个示例就能学会新任务给两个翻译示例,模型就能自动对新句子做同类翻译
思维链推理
CoT
加一句「让我们一步步思考」,模型自动拆解多步推理数学应用题、逻辑谜题、复杂决策分析
代码生成与理解根据自然语言描述生成可运行的代码,或解释一段代码的逻辑从零写一个完整的 Web API、定位 Bug 并给出修复
工具使用理解外部工具的调用方式,自主决定何时以及如何使用工具调用搜索引擎查资料、调用计算器做精确计算
多语言迁移用英语训练为主的模型,居然能理解和生成高质量中文LLaMA 英文预训练,却能做中文问答
校准与自我评估模型知道「自己不知道」,能评估自己回答的置信度主动说「这个我不确定」「建议你再确认一下」

为什么会涌现?——几种主流解释

  1. 规模假说(Scaling Hypothesis):足够大的参数空间包含了各种潜在的能力模式,只是小模型没有足够的容量去「激活」它们。参数量每翻 10 倍,可表达的复杂度就上升一个台阶
  2. 数据多样性驱动:当训练数据覆盖了足够多类型的文本(论文、代码、对话、百科、小说),模型被迫学会更抽象的通用能力来统一处理所有这些任务
  3. 复合任务分解:大模型在内部可能把复杂任务自动拆解为多层简单子任务,每层承担一部分计算——这种层次化处理只有足够深的网络才能实现
  4. 梯度相变(Grokking):有些能力需要训练得非常「过火」才会显现——训练损失早已不降,但验证集上的某种能力突然在某个时刻从随机水平跳到接近完美

关于涌现的争议与开放问题

  • 涌现是否真实存在? 有研究者认为「涌现」只是评估指标造成的错觉——如果用更连续的指标(如 token 级别的概率校准)而非粗糙的正确/错误二分类,能力的增长曲线可能一直是平滑的,只是非线性而已
  • 缩放何时停止? Scaling Law 显示模型越大损失越低,但推理成本也指数级增长。有没有一个最优规模?还是「更大永远更好」?
  • 能力 vs 幻觉:更大的模型善于推理,但也会更自信地输出错误的答案(幻觉)。涌现能力带来的不仅是更聪明,还有更难被察觉的错误

6. 幻觉

幻觉(Hallucination) 是指 LLM 生成的内容看似合理、语句流畅,但与事实不符或无法被验证。它是 LLM 最核心的缺陷之一,与涌现能力相伴而生——更大的模型虽然推理更强,但也会更自信地输出错误信息。

幻觉的典型表现:

类型描述例子
事实性幻觉编造不存在的人、事、物「根据 2024 年《自然》杂志的一项研究……」——实际这篇论文不存在
忠实性幻觉回答偏离了用户提供的上下文给模型一篇关于苹果的文章,它却开始谈梨子的营养价值
逻辑性幻觉推理过程看似合理,但结论与前提矛盾计算过程每一步都对,但最后给出的答案完全错误
来源捏造编造引用、链接、论文标题「这篇论文发表于 2023 年 NeurIPS……」——论文和年份都是编的

为什么会产生幻觉?

幻觉不是 bug,而是 LLM 工作原理的必然产物。根本原因在于:LLM 本质上是一个概率生成器,而不是一个知识库
  1. 训练目标决定它"不追求真相":LLM 被训练来预测下一个 token 的概率,目标是让输出看起来像人写的文本,而非确保事实正确。模型没有「这是真的吗?」的判断能力
  2. 知识边界不明确:模型不知道「自己不知道什么」。当被问到超出知识范围的问题时,它不会说「我不知道」,而是凭概率生成一个「看起来合理」的回答
  3. 训练数据的噪声:互联网训练语料本身就包含大量错误信息、过时知识、偏见观点。模型不加区分地学到了这些
  4. 概率采样引入随机性:Temperature > 0 时,模型会从概率分布中采样而非永远选最高分词,这为创造性也打开了幻觉的窗口

缓解幻觉的常见手段:

方法原理适用场景
RAG(检索增强生成)先检索外部知识库,再用检索到的文档约束生成需要事实准确性的场景
Grounding(事实校准)要求模型引用来验证其输出企业知识问答、研究辅助
思维链提示(CoT)让模型展示推理步骤,降低跳跃性幻觉数学、逻辑任务
事实性微调(RLHF/DPO)用人类偏好数据训练模型偏好真实的回答对话类产品
置信度校准让模型输出概率 + 不确定度评估高风险决策场景

幻觉与涌现是一枚硬币的两面

涌现能力让 LLM 变得强大——它能推理、创造、跨领域迁移。但幻觉提醒我们:LLM 对事实没有内在的忠诚度。它不是在回答你的问题,而是在给你一段「听起来像正确答案」的文本。理解这一点,就理解了一眼使用 LLM 的基本原则——永远不要不加验证地信任它的输出