权重 · 谁更重要
控制某个输入对下一层结果的影响强弱。训练的核心,就是不断调整这些连接参数。
神经网络如何“学会”一件事?从数据输入、前向传播、误差计算,到反向传播与参数更新——把抽象数学拆成一个可以看见、可以操作、可以解释的学习闭环。
所谓学习,是把一次次预测产生的错误,转化成可以修改参数的信号。真正被训练出来的,不是一张答案表,而是一套更适合解决任务的参数结构。
“输入数据 → 做出预测 → 计算误差 → 找到责任 → 调整参数 → 再预测一次。”
点击上方模式切换,观察训练时的双向信息流:Forward 负责得到答案,Backprop 负责把误差转成参数更新方向;推理阶段则只保留前向路径。
图片、文本或特征值先变成可计算的数据表示。
信号经过权重、偏置和激活函数逐层向前流动。
模型使用当前参数给出一次答案。
把预测和目标之间的差距量化成一个数。
从误差出发,计算每个参数应承担多少“责任”。
按梯度方向与学习率更新权重,再进入下一轮。
控制某个输入对下一层结果的影响强弱。训练的核心,就是不断调整这些连接参数。
让神经元不必从固定的零点开始判断,使网络拥有更灵活的响应边界。
如果没有激活函数,多层线性变换仍等价于一次线性变换,难以表达复杂模式。
从简单局部模式逐层组合为复杂结构,让模型形成更抽象的内部表示。
Loss 不是简单判断“对/错”,而是为优化提供连续、可计算的误差信号。
描述参数轻微变化会怎样影响 Loss,为优化器提供局部最值得走的方向。
过大会震荡或越过低点;过小则训练缓慢。方向正确,不代表步长可以随意。
真正有价值的学习,不是记住训练集,而是面对从未见过的数据仍能做对。
两个实验分别展示 Loss 如何随迭代下降,以及学习率如何改变优化轨迹。它们不追求复杂数学,而是把“为什么要这么训练”变成直觉。
重新播放训练过程,观察模型从高误差逐渐进入稳定区间。
拖动滑块,观察“太慢 / 合适 / 震荡”三种不同优化行为。
训练阶段会计算误差并修改参数;推理阶段通常只用已经学到的参数处理新输入。
DATA → FORWARD → PREDICTION → LOSS → BACKPROP → UPDATE → REPEAT
真正值得追问的,不是公式本身,而是“学习”这个词在 AI 和人类身上到底意味着什么。
如果只看表面过程,AI 学习和人类学习确实存在一种相似结构:输入、尝试、犯错、反馈、调整。人做错一道题,会根据反馈改变理解;神经网络预测错误,也会根据损失函数和梯度修改内部参数。
真正的差异出现在一个更具体的问题上:两者究竟在修改什么? 人类会把新知识放进既有经验中,建立因果、目的和意义;神经网络则通过数学优化改变参数,使输入更容易映射到目标输出。
但把它简化成“死记硬背”同样不准确。一个训练得当的模型可以处理未见样本,这说明它并非只存储训练样本本身,而是在参数结构中压缩了某些可迁移的模式。
人类认识“火”,不只是因为读过大量关于火的文本。我们可能见过火焰、感受过温度,知道它可以烹饪,也知道它可能造成危险。这个概念与视觉、身体、因果和社会经验连接在一起。
模型拥有的则是训练数据中大量关于“火”的统计关联。这些关联可以非常丰富,甚至足以生成复杂解释,但知识来源与人类不同。
模型幻觉不只是“记错了”。许多生成式 AI 的核心机制,是根据当前上下文生成概率上更合适的后续内容,而不是天然执行一次事实数据库查询。
当信息不足、问题含有错误前提,或任务超出模型可靠能力边界时,它依然可能继续生成。由于语言本身高度结构化,一个错误答案也可能完整、自然、专业,甚至非常有说服力。
我的判断是:很难彻底消失,但可以被显著降低。更高质量的数据、更严格的对齐、RAG、实时工具调用、外部数据库、事实验证、多模型交叉检查和人工审核,都能把系统从“只依赖参数”转向“参数 + 外部事实”。
因此更成熟的问题不是“怎样让 AI 永远不犯错”,而是:怎样建立一个即使 AI 可能犯错,也能够发现、限制和修正错误的系统?
生成式 AI 提醒我们:一些过去看起来必须依赖“理解”的复杂行为,也可能从数据、模型结构和参数优化中逐渐涌现。这迫使我们重新拆解“智能”本身。
能够生成答案,不等于拥有价值判断;能够识别模式,不等于理解现实后果;能够完成任务,也不意味着拥有自己的目标。人类仍然承担目标设定、价值判断、责任、现实经验、伦理选择与意义建构。
本次选择“类比创作类”:用学生做题解释反向传播与参数更新,并明确类比成立的地方与失效边界。
题目就是输入。神经网络面对的图片、文字或数值,也会先被转换成可以计算的数据表示。
系统需要一个可处理的起点。
使用当前能力先做一次预测。
这是当前参数下得到的结果。
判断结果和目标之间差了多少。
把最终错误分配到产生它的路径上。
根据反馈修改内部参数或策略。
新的反馈带来新的调整。
最终目标不是背题,而是迁移规律。
一个样本只是一条反馈,参数结构需要在整个数据分布上持续有效。
知道“错很多”还不够;真正关键的是知道“怎样改才能少错”。
把一个最终误差拆成每个参数都能使用的更新信号。
一次更新几乎看不出来,长期结构才逐渐形成可用能力。
真正优秀的学习,必须离开训练数据仍然有效。
神经网络真正强大的地方,不是它从来不犯错,而是它拥有一种把错误转换为参数调整信号的机制:训练让模型发生改变,推理使用已经形成的能力,而泛化决定这种“学习”是否真的有价值。