深度学习周报 —— 梯度下降与神经网络训练推导巩固
目录
- 摘要
- Abstract
- 1 深度学习基础系统性巩固
- 1.1 深度学习数学本质再理解
- 1.2 梯度下降原理、变体与推导巩固
- 1.3 激活函数非线性机制复习
- 1.4 前向传播矩阵运算与维度匹配
- 1.5 反向传播链式推导与误差传递巩固
- 1.6 神经网络完整训练流程闭环
- 2 学习总结与反思
摘要
本周重点巩固深度学习核心基础,围绕梯度下降原理、激活函数非线性作用、前向传播矩阵运算、反向传播链式推导、神经网络完整训练流程展开系统性学习与推导练习。通过对两层网络的反复梳理,理清了参数更新逻辑、矩阵维度匹配规律和误差传递路径,强化了理论理解与计算逻辑,为后续模型实现与进阶学习打下扎实基础。
Abstract
This week focuses on consolidating core foundations of deep learning, centering on systematic learning and derivation practice of gradient descent principles, nonlinear effects of activation functions, matrix operations for forward propagation, chain derivation of backpropagation, and the complete training process of neural networks. Through repeated review of a two-layer network, I clarified parameter update logic, matrix dimension matching rules and error propagation paths, strengthened theoretical understanding and computational logic, and laid a solid foundation for subsequent model implementation and advanced learning.
1 深度学习基础系统性巩固
1.1 深度学习数学本质再理解
深度学习本质是线性变换叠加非线性激活的多层组合。简单线性模型只能处理线性关系,表达能力有限,多层线性叠加依然是线性,无法拟合复杂数据规律。引入非线性激活函数后,网络突破线性限制,具备拟合复杂问题的能力。整个训练过程,就是通过数据不断调整网络参数,让模型逐步学习数据背后的真实规律。
1.2 梯度下降原理、变体与推导巩固
梯度下降是神经网络训练最核心的优化方法,作用是不断调整参数,让模型预测误差越来越小。
1.2.1 核心逻辑
梯度代表误差变化最快的方向,梯度下降就是沿着误差减小的方向,一点点调整权重和偏置。调整的幅度由学习率控制,学习率太大容易跳过最优状态,太小则训练速度过慢,需要合理选择。
1.2.2 梯度下降常见变体
本周巩固了三种常用梯度下降方式:
- 批量梯度下降:用全部数据计算误差,调整稳定,但数据量大时速度慢;
- 随机梯度下降:每次用单个样本更新参数,速度快,但调整波动大;
- 小批量梯度下降:每次用部分样本更新,兼顾速度和稳定性,是实际训练中最常用的方式。
通过反复理解,明确了梯度下降的核心是误差驱动参数更新,每一次调整都在让模型变得更准确。
1.3 激活函数非线性机制复习
激活函数的核心作用是给网络引入非线性,让多层网络具备拟合复杂数据的能力。本周重点复习了 Sigmoid 激活函数,它能把输出控制在 0 到 1 之间,适合处理概率相关的输出,同时计算简单,能简化后续反向传播的误差计算,是早期神经网络常用的激活函数。
1.4 前向传播矩阵运算与维度匹配
前向传播是数据从输入到输出的正向传递过程,实际任务中数据多为多特征形式,通过矩阵运算可以高效完成计算。
本周重点梳理了两层网络的前向传播流程:输入数据先和权重计算加权和,再经过激活函数处理,得到隐藏层结果;隐藏层结果再和输出层权重计算,最终得到模型预测值。
过程中特别注意矩阵维度匹配,前一层的输出维度必须和后一层的输入维度一致,否则无法正常计算。矩阵运算让多层网络的计算更简洁、清晰,也为后续代码实现提供了清晰逻辑。
1.5 反向传播链式推导与误差传递巩固
反向传播是神经网络训练的关键,核心是从输出层反向传递误差,逐层调整各层参数,本周通过反复梳理,完整掌握了两层网络的反向传播逻辑。
1.5.1 误差传递逻辑
模型预测后,先计算预测结果和真实结果的误差;误差从输出层开始,反向传递到隐藏层,再传递到输入层;每一层根据传递来的误差,计算自身参数需要调整的方向和幅度。
1.5.2 各层参数调整
输出层根据最终误差,直接调整自身权重和偏置;隐藏层的误差由输出层误差反向推导得到,再根据这个误差调整隐藏层的权重和偏置。整个过程遵循链式推导逻辑,后一层的误差直接影响前一层的参数调整。
本周多次梳理推导过程,明确了反向传播的核心是误差反向分配,每一层参数的调整都和最终预测误差直接相关,也解决了多层误差传递容易混淆的问题。
1.6 神经网络完整训练流程闭环
整合本周所学,梳理出神经网络训练的完整流程,形成逻辑闭环:
- 前向传播:输入数据经过加权、激活,逐层传递,得到预测结果;
- 误差计算:对比预测结果和真实结果,衡量模型当前的误差大小;
- 反向传播:从输出层反向传递误差,逐层计算各层参数的调整方向;
- 参数更新:按照梯度下降的方式,调整所有权重和偏置,减小误差;
- 迭代循环:重复以上步骤,不断优化模型,直到误差稳定、模型效果达标。
2 学习总结与反思
本周围绕梯度下降、前向传播、反向传播和训练流程进行了全面巩固,把零散的知识点串联成完整的训练逻辑,收获明显:
- 深入理解了梯度下降的核心逻辑和不同变体的特点,明白参数调整和误差的关系;
- 掌握了激活函数引入非线性的作用,清楚其对模型能力的影响;
- 熟练梳理了前向传播的矩阵运算流程,重视矩阵维度匹配的重要性;
- 完整理清了反向传播的链式推导和误差传递路径,能独立梳理两层网络的反向过程;
- 建立了神经网络训练的完整思维,理解每一个环节的作用和关联。
学习中难点:反向传播时容易混淆误差传递的顺序,矩阵维度匹配需要反复核对才能避免出错。后续会通过多梳理推导过程、总结易错点,进一步巩固理解。
更多推荐




所有评论(0)