从函数到神经网络:参数学习、梯度下降与反向传播

从线性函数 y = wx + b 出发,理解激活函数、损失函数、梯度下降和反向传播如何共同训练神经网络,并认识过拟合与泛化能力。

2026/9/7
2 分钟阅读
目录

从函数到神经网络

从符号主义(我要找到宇宙真理的万能公式)到联结主义(找一个近似解猜一下)。

神经网络,本质上就是 y = f(x) = wx + b,一直x和y去猜w和b,很多时候,光是wx + b无法得出想要的结果,就要在wx + b外再套一层函数,这层函数就是激活函数。

神经网络包含:输入层、隐藏层、输出层

![image-20260827155628345](/Users/o_insist/Library/Application Support/typora-user-images/image-20260827155628345.png)

计算神经网络的参数

损失函数:真实值与预测值的误差,我们要将损失函数降到最低

均方误差是用来表示损失函数的一种

损失函数最小时算出的w和b,y = wx + b就是最拟合真实数据的那条直线

梯度下降:让损失函数逐渐减小的过程

总结:为了找到一组w和b来拟合真实数据,我们定义损失函数,并且,通过制定让损失函数最小化的这个目标,来计算w和b,接下来我们通过简单的线性回归问题,发现可以让损失函数的导数等于零,一步就求到w和b,但是 神经网络的复杂性,没有办法照顾忽而得到w和b的解析解,只能通过一点点往偏导数的反方向调整每个参数,来慢慢逼近真实答案,这个方法就叫做梯度下降,由于神经网络的层数较多,直接求偏导非常困难,因此可以逐层求导,间接得到最终的偏导数,通过链式法则求导,并逐层更新参数这个过程就是反向传播、不断的前向传播,反向传播,就构成了神经网络的训练过程。

调教神经网络的方法

过拟合:在训练集上表现很好,但是在未见过的数据上表现很差。

泛化能力:在没见过的数据上的表现能力。