DAY 10 · NEURAL NETWORKS

从误差到能力

神经网络如何“学会”一件事?从数据输入、前向传播、误差计算,到反向传播与参数更新——把抽象数学拆成一个可以看见、可以操作、可以解释的学习闭环。

ThemeLearning → Inference
FocusBackpropagation
FormatInteractive HTML
Prepared by何臻琳 · HE ZHENLIN
LEARNING
CORE
INPUT · DATA FORWARD · SIGNAL BACKPROP · GRADIENT UPDATE · WEIGHT
MOVE CURSOR TO BEND THE FIELDLIVE NETWORK
01 · THE CORE IDEA

AI 并不是突然“学会”的。

所谓学习,是把一次次预测产生的错误,转化成可以修改参数的信号。真正被训练出来的,不是一张答案表,而是一套更适合解决任务的参数结构。

“输入数据 → 做出预测 → 计算误差 → 找到责任 → 调整参数 → 再预测一次。”

一次调整很小;无数次有效调整,才逐渐形成能力。
01
看见数据把图片、文字、数字变成可计算表示
→
02
先做预测用当前参数完成一次前向传播
→
03
判断错多少Loss 把预测偏差量化成一个数
→
04
找到该改哪里Backprop 计算参数对误差的影响
→
05
调整参数Gradient × Learning Rate 决定更新
↺
02 · NEURAL NETWORK PANORAMA

一张图看懂神经网络:
从学习,到推理。

点击上方模式切换,观察训练时的双向信息流:Forward 负责得到答案,Backprop 负责把误差转成参数更新方向;推理阶段则只保留前向路径。

蓝色 = Forward · 紫色 = Backprop · 鼠标悬停卡片查看解释
▦
Step 01Data Input

图片、文本或特征值先变成可计算的数据表示。

⇢
Step 02Forward Propagation

信号经过权重、偏置和激活函数逐层向前流动。

◎
Step 03Prediction

模型使用当前参数给出一次答案。

∆
Step 04Loss

把预测和目标之间的差距量化成一个数。

↶
Step 05Backpropagation

从误差出发,计算每个参数应承担多少“责任”。

↻
Step 06Parameter Update

按梯度方向与学习率更新权重,再进入下一轮。

TRAINING LOOP · DATA → FORWARD → LOSS → BACKPROP → UPDATE → REPEAT
WEIGHT

权重 · 谁更重要

控制某个输入对下一层结果的影响强弱。训练的核心,就是不断调整这些连接参数。

BIAS

偏置 · 门槛在哪里

让神经元不必从固定的零点开始判断,使网络拥有更灵活的响应边界。

ACTIVATION

激活 · 引入非线性

如果没有激活函数,多层线性变换仍等价于一次线性变换,难以表达复杂模式。

HIDDEN LAYERS

隐藏层 · 重组特征

从简单局部模式逐层组合为复杂结构,让模型形成更抽象的内部表示。

LOSS

损失 · 错了多少

Loss 不是简单判断“对/错”,而是为优化提供连续、可计算的误差信号。

GRADIENT

梯度 · 往哪边改

描述参数轻微变化会怎样影响 Loss,为优化器提供局部最值得走的方向。

LEARNING RATE

学习率 · 一步走多远

过大会震荡或越过低点;过小则训练缓慢。方向正确,不代表步长可以随意。

GENERALIZATION

泛化 · 新题还能会

真正有价值的学习,不是记住训练集,而是面对从未见过的数据仍能做对。

03 · INTERACTIVE LAB

把“训练”从抽象名词,
变成可以操作的过程。

两个实验分别展示 Loss 如何随迭代下降,以及学习率如何改变优化轨迹。它们不追求复杂数学,而是把“为什么要这么训练”变成直觉。

Loss Curve · 误差如何下降

重新播放训练过程,观察模型从高误差逐渐进入稳定区间。

LOSS 1.000

Learning Rate · 步长实验

拖动滑块,观察“太慢 / 合适 / 震荡”三种不同优化行为。

学习率 η0.080
太小:移动缓慢当前:稳定收敛太大:来回震荡
TRAINING VS INFERENCE

学习和使用,是两件不同的事。

训练阶段会计算误差并修改参数;推理阶段通常只用已经学到的参数处理新输入。

训练阶段:参数正在变化

DATA → FORWARD → PREDICTION → LOSS → BACKPROP → UPDATE → REPEAT

PARAMETERS UPDATING
04 · DEEP THINKING

AI 到底是怎么
“学会”一件事的?

真正值得追问的,不是公式本身,而是“学习”这个词在 AI 和人类身上到底意味着什么。

“学习”是真正理解,还是高维统计拟合?

如果只看表面过程,AI 学习和人类学习确实存在一种相似结构:输入、尝试、犯错、反馈、调整。人做错一道题,会根据反馈改变理解;神经网络预测错误,也会根据损失函数和梯度修改内部参数。

真正的差异出现在一个更具体的问题上:两者究竟在修改什么? 人类会把新知识放进既有经验中,建立因果、目的和意义;神经网络则通过数学优化改变参数,使输入更容易映射到目标输出。

我更倾向于把今天大多数 AI 的“学习”,理解为一种规模巨大、结构复杂、具有泛化能力的高维统计拟合。

但把它简化成“死记硬背”同样不准确。一个训练得当的模型可以处理未见样本,这说明它并非只存储训练样本本身,而是在参数结构中压缩了某些可迁移的模式。

STATISTICAL FITTINGGENERALIZATIONREPRESENTATION

人类拥有世界经验,AI 拥有数据经验。

人类认识“火”,不只是因为读过大量关于火的文本。我们可能见过火焰、感受过温度,知道它可以烹饪,也知道它可能造成危险。这个概念与视觉、身体、因果和社会经验连接在一起。

模型拥有的则是训练数据中大量关于“火”的统计关联。这些关联可以非常丰富,甚至足以生成复杂解释,但知识来源与人类不同。

两者可能给出相同答案,却不一定以相同方式到达答案。

为什么 AI 已经“学会”很多规律,却仍然会幻觉?

模型幻觉不只是“记错了”。许多生成式 AI 的核心机制,是根据当前上下文生成概率上更合适的后续内容,而不是天然执行一次事实数据库查询。

当信息不足、问题含有错误前提,或任务超出模型可靠能力边界时,它依然可能继续生成。由于语言本身高度结构化,一个错误答案也可能完整、自然、专业,甚至非常有说服力。

幻觉不是偶尔“坏掉”,而是概率生成机制与有限知识边界共同带来的风险。

幻觉能被彻底消除吗?

我的判断是:很难彻底消失,但可以被显著降低。更高质量的数据、更严格的对齐、RAG、实时工具调用、外部数据库、事实验证、多模型交叉检查和人工审核,都能把系统从“只依赖参数”转向“参数 + 外部事实”。

因此更成熟的问题不是“怎样让 AI 永远不犯错”,而是:怎样建立一个即使 AI 可能犯错,也能够发现、限制和修正错误的系统?

如果智能来自数据与参数,这对人类意味着什么?

生成式 AI 提醒我们:一些过去看起来必须依赖“理解”的复杂行为,也可能从数据、模型结构和参数优化中逐渐涌现。这迫使我们重新拆解“智能”本身。

能够生成答案,不等于拥有价值判断;能够识别模式,不等于理解现实后果;能够完成任务,也不意味着拥有自己的目标。人类仍然承担目标设定、价值判断、责任、现实经验、伦理选择与意义建构。

AI 的出现不是让“人类智能”失去价值,而是迫使我们更精确地理解:智能究竟由哪些不同能力组成。
05 · TOOL EXPLORATION

把最抽象的 Backprop,
变成一场“做题—批改—订正”。

本次选择“类比创作类”:用学生做题解释反向传播与参数更新,并明确类比成立的地方与失效边界。

×
先别急着看答案,先找到错在第几步。
STEP 01 · INPUT DATA

学生拿到一道题。

题目就是输入。神经网络面对的图片、文字或数值,也会先被转换成可以计算的数据表示。

学生拿到题目↔INPUT DATA
01

题目 ↔ 输入数据

系统需要一个可处理的起点。

02

现有知识作答 ↔ 前向传播

使用当前能力先做一次预测。

03

提交答案 ↔ Prediction

这是当前参数下得到的结果。

04

老师批改 ↔ Loss

判断结果和目标之间差了多少。

05

定位错误 ↔ Backprop

把最终错误分配到产生它的路径上。

06

调整方法 ↔ Update

根据反馈修改内部参数或策略。

07

再练一道 ↔ Next Iteration

新的反馈带来新的调整。

08

新题也会 ↔ Generalization

最终目标不是背题,而是迁移规律。

类比成立的地方

  • 都依赖多轮尝试、反馈与修正。
  • 没有反馈,就无法知道应该怎样改进。
  • 错误可以成为下一次优化的信息。
  • 学习质量高度依赖反馈质量。
  • 真正目标都是把经验迁移到新问题。

类比不成立的地方

  • 人类可以理解错误的语义,模型接收的主要是数值梯度。
  • 人类能主动改变学习策略,基础训练过程没有自主学习动机。
  • 人类拥有身体与现实经验,模型受训练数据与工具边界约束。
  • 一次参数更新不是“突然理解”,而是大量极小数值变化。
  • 类比解释的是结构相似,不代表机制完全相同。
INSIGHT 01

模型学习的不是单个答案,而是参数关系。

一个样本只是一条反馈,参数结构需要在整个数据分布上持续有效。

INSIGHT 02

Loss 只是问题起点。

知道“错很多”还不够;真正关键的是知道“怎样改才能少错”。

INSIGHT 03

Backprop 本质是责任分配。

把一个最终误差拆成每个参数都能使用的更新信号。

INSIGHT 04

复杂能力来自无数微小变化的累积。

一次更新几乎看不出来,长期结构才逐渐形成可用能力。

INSIGHT 05

泛化比训练集高分更重要。

真正优秀的学习,必须离开训练数据仍然有效。

06 · FINAL SYNTHESIS

错误不是训练的反面。
错误本身,就是学习发生的入口。

神经网络真正强大的地方,不是它从来不犯错,而是它拥有一种把错误转换为参数调整信号的机制:训练让模型发生改变,推理使用已经形成的能力,而泛化决定这种“学习”是否真的有价值。

TRAINING · 训练让模型发生改变
INFERENCE · 推理使用已经形成的能力
GENERALIZATION · 泛化检验学习能否迁移到新问题
FROM ERROR
TO PATTERN
TO GENERALIZATION.
从误差,到模式,再到真正可迁移的能力。