神经网络介绍:从一颗神经元到大语言模型
摘要: 本文面向希望理解大语言模型技术本质的读者,从神经网络的最小计算单元——人工神经元出发,系统阐述了深度学习的技术演进脉络。文章以加权求和与激活函数为起点,通过生活化决策案例建立直觉,继而引出多层网络结构与「前向传播→损失计算→反向传播→梯度下降」的核心训练循环。在此基础上,深入分析了深层网络逐层抽象的本质优势,并横向对比了前馈网络、卷积网络、循环网络及 Transformer 四种架构的数据流向与适用场景。最终,文章串联起从单一神经元到千亿参数大语言模型的完整技术链路,论证了 LLM 并非神秘黑箱,而是同一套方法论借助 Transformer 架构在数据与算力维度上的极致放大。
1. 引言
在上一篇文章中,我们画出了 AI 的版图:AI → 机器学习 → 神经网络 → 深度学习 → 大语言模型,现在我们要钻进第三层和第四层——神经网络和深度学习,看看它们到底是怎么运转的。
如果你只能带走一句话,记住这句:LLM 本质上就是把「神经元 → 层 → 网络 → 深度学习」这套方法论,用 Transformer 架构做到了史无前例的规模。
神经网络(Neural Network)是模仿人脑神经元结构设计的数学模型。它的本质是一个巨大的复合函数 f(x) = ...,通过调整内部参数让输出逼近期望值。这个函数不是人手工设计的,而是从数据中自动学习出来的,数以亿计的参数共同构成了模型的"知识"。
理解了神经网络,你就掌握了 LLM 的核心本质,神经网络的基本原理,是通往理解 LLM 的必经之路。
2. 神经元:计算的最小单元
关键理解
神经元 = 加权求和 + 激活函数。
三个核心参数:权重控制重要性,偏置控制门槛,激活函数引入非线性。

每个人工神经元做三件简单的事:
单个神经元的计算过程:
输入 加权求和 激活
──── ────────── ──────────
x₁ ──→ × w₁ ──┐
x₂ ──→ × w₂ ──┼──→ Σ (+ bias) ──→ 激活函数 ──→ 输出 y
x₃ ──→ × w₃ ──┘ ↑ ↑
│ │
偏置 b(调节阈值) 引入非线性三个核心概念各自承担不同的角色:
- 权重 w决定了每个输入有多重要。买手机的时候,价格在你心里的权重可能远大于颜色——权重就是这个东西。
- 偏置 b决定了神经元被激活的门槛。有些人的笑点低,随便一个梗就笑出声,有些人的笑点高,要特别好笑才动嘴角——偏置就是这种「默认倾向」。
- 激活函数把无界的加权和压缩到一个有界区间,同时引入非线性——让神经元能表达的不只是「是或否」,而是连续的概率光谱。100 分的卷子和 60 分的卷子最终都变成「及格」,但 100 分的底气显然不一样。
3. 一个生活决策例子:要不要去看漫展?
理论总是干巴巴的。我们来看一个具体的例子,这是理解神经元工作原理的最佳切入点。
问题:这周末要不要去一年一度的动漫展览?
基于天气好不好、有没有同伴、票价贵不贵三个要素,可以把决策过程抽象为一个神经元的计算:
决策神经元
┌─────────────────────────────────────┐
│ │
天气好不好? ───→ │ w₁=8 ──┐ │
(x₁: 晴=1, 雨=0) │ │ │
│ ├──→ Σ = 8×1 + 4×1 + 2×0 │
有没有同伴? ───→ │ w₂=4 ──┤ + (-5) │
(x₂: 有=1, 无=0) │ │ = 7 │
│ │ │
票价贵不贵? ───→ │ w₃=2 ──┘ ↓ │
(x₃: 贵=0, 便宜=1) │ 偏置 b = -5 激活函数 │
│ ↓ ↓ │
│ 加权和 = 7 → sigmoid(7) │
│ ≈ 0.999 │
│ → 去! │
└─────────────────────────────────────┘权重设置说明:
| 参数 | 设置 | 说明 |
|---|---|---|
| 天气权重 | 8 | 主要因素,下雨就不想出门 |
| 同伴权重 | 4 | 次要因素,一个人也能逛但没意思 |
| 票价权重 | 2 | 不太在意,毕竟一年就一次 |
| 偏置 | -5 | 本人比较宅,默认倾向"不去" |
关键理解
不同的人,同样的公式,不同的权重 → 不同的决策。神经网络"学习"的本质:找到合适的权重和偏置**。想象另一个人用同样的公式,但把天气权重从 8 改成 2,把票价权重从 2 改成 8。同样的晴天、有同伴、票价便宜,他的计算结果就会完全不同。
- 同样的公式 + 不同的权重 = 不同的人做不同的决策。
- 学习 = 找到合适的权重和偏置。
4. 从神经元到网络,神经网络学习的核心循环
关键理解
神经网络 = 多层神经元堆叠 + 循环学习
前向传播猜答案,损失函数算差距,反向传播追责任,梯度下降调参数——重复数百万次。
4.1 神经网络的结构
单个神经元只能做一个简单判断,多层网络能提取越来越抽象的特征,这是整个深度学习的根基。把成千上万个神经元按层堆叠起来,就形成了一个神经网络:输入层接收原始数据,隐藏层(可以有很多层)逐级提取特征,输出层给出最终判断。信息从输入层进入,一层一层往深处流,每经过一层就变得更抽象。

4.2 神经网络学习的核心循环
神经网络的学习遵循一个比较简洁的循环:

① 前向传播:把数据喂进网络,一层一层算过去,得到预测值。「我猜这张图是猫的概率是 0.3」
② 损失函数:拿预测值和真实答案比较,算出差距。「实际答案是 1(确实是猫),我错了 0.7」,损失函数就是这个误差的数学表达——它告诉你模型离正确答案有多远。
③ 反向传播:从输出层倒着往回走,逐层计算每个权重对最终误差「贡献」了多少——哪个权重该负主要责任,哪个只是从犯。这是整个学习过程中最精巧的环节。
④ 梯度下降:顺着减小损失的方向,微调所有权重。「把 w₁ 调大一点,w₂ 调小一点……」然后回到第①步,再来一轮。
这个循环重复数百万次,神经网络的预测会越来越准。它不是一次学会的,是在海量的「猜→纠错→微调→再猜」中慢慢逼近最优解的。
直观类比:投篮学习
有一个类比能让这个过程变得极其直觉:小孩学投篮。

一个小孩学投篮:
① 前向传播 = 投出球
→ "我用了这么多力气、这个角度"
② 损失 = 球离篮筐的距离
→ "偏左了 30 厘米"
③ 反向传播 = 分析哪个动作导致了偏差
→ "手腕角度不对,膝盖没弯曲到位"
④ 梯度下降 = 调整动作
→ "下次手腕往右一点,膝盖多弯一点"
重复 1000 次 → 投得越来越准
神经网络做的是完全一样的事,只不过它调整的不是肌肉记忆,
而是数百万个数学参数(权重和偏置)。小孩投篮的四步和神经网络完全同构:投出球就是前向传播,球离篮筐的距离就是损失,分析手腕角度和膝盖弯曲的偏差就是反向传播,下次调整动作就是梯度下降。重复一千次之后,球进得越来越准。
神经网络做的是完全一样的事。区别只在于:小孩调整的是肌肉记忆,神经网络调整的是数百万个数学参数。载体不同,逻辑一模一样。
5. 为什么"深度"很重要?
概念理解
深度 = 逐层抽象
浅层看边缘,中层看形状,深层看语义。不是理解更深,是结构更深。
搞懂了学习循环,你可能会问一个很自然的问题:为什么要堆那么多层?一层两层不够吗?

浅层网络(1–2 层)只能做简单判断。输入直接映射到输出,一步到位。认一张脸靠的是「有眼睛有嘴巴就行」——这种粗粒度判别在简单任务里够用,但碰到复杂场景就露馅了。
深层网络(10 层以上)每一层在前一层的基础上构建更高级的特征。以人脸识别为例:第一层只认得像素级别的边缘,第三层能认出眼睛和鼻子的轮廓,第六层开始拼出完整的脸型,第十层已经能分辨表情——喜悦还是愤怒,自然还是僵硬。
这就是深度学习的由来。 它不是「深刻的理解」,而是「很深的层级结构」。每一层都不是从零开始,而是站在前面所有层的肩膀上,提取更抽象、更语义化的特征。Transformer 能堆到 100 层以上还稳定训练,靠的正是这种逐层抽象的机制。
6. 四种神经网络架构
神经网络不是只有一种形态。根据数据流向和处理方式的不同,主要有四类架构。

| 架构 | 数据流向 | 擅长 | 代表模型 |
|---|---|---|---|
| FNN 前馈神经网络 | 单向(输入 → 输出) | 分类、回归 | 多层感知机 MLP |
| CNN 卷积神经网络 | 局部感知 + 池化 | 图像识别、目标检测 | ResNet、YOLO |
| RNN/LSTM 循环神经网络 | 有循环连接(串行) | 文本、时间序列 | LSTM、GRU |
| Transformer | 自注意力(并行) | 语言、图像、多模态 | GPT、LLaMA、BERT |
FNN 是最朴素的形式——数据从输入走到输出,没有回头路,也没有记忆。CNN 加上了空间感知能力,用卷积核在图像上滑动,一层层从边缘提取到形状。RNN 引入了循环连接,让前一时刻的输出影响后一时刻的计算,适合处理有先后顺序的序列数据,但串行的天性让它训练慢、长序列容易「遗忘」。
Transformer 是革命性的:它用自注意力机制让每个 token 能直接和序列中的所有其他 token 交互,一次性并行计算,彻底摆脱了 RNN 的串行瓶颈。这就是为什么 GPT 能在数秒内读完一整篇文章并做出推理——它不是逐字逐句啃,而是一眼看全局。
7. 从小神经元到大模型
概念理解
LLM = Transformer 架构 × 海量数据 × 深层网络
把同样的方法论做到史无前例的规模
现在我们站到一个更高的视角,看整条技术链路是怎么从一颗神经元一步步生长到千亿参数的大语言模型的。

- 单一神经元只能回答「要不要去漫展」这种三个输入一个输出的简单问题。
- 多层网络(MLP)已经能处理「784 个像素输入,判断是猫还是狗」——几百个神经元协同工作,能力跃升了一个量级。
- 深层 Transformer 把这个方法论推向了新高度:Attention 机制让每个 token 都能看到全篇,N 层堆叠让每一层提取不同粒度的语义,喂进万亿 token 的数据训练数月,它就能翻译、总结、写作、推理。
到了 LLM 阶段,参数规模达到千亿乃至万亿级别,能力发生质变:写代码、数学推理、多轮对话、创意写作——这些看起来互不相关的任务,背后是同一套「神经元 → 层 → 网络 → 深度学习」的方法论,只是规模不同。
理解了这个演进过程,我们就不会再把大语言模型当作什么神秘的黑箱。它是从最简单的数学单元开始,一层一层堆叠、一轮一轮训练、一步一步放大出来的。