吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念
吴恩达深度学习课程一:神经网络和深度学习 第四周:深度神经网络的关键概念
大家好,我是你们的技术博主小深。今天我们来聊聊吴恩达老师的深度学习课程第一部分的第四周内容——深度神经网络的关键概念。如果你已经学完了前三周(从线性回归到浅层神经网络),那么第四周就是带你从“浅水区”游向“深水区”的关键一步。别怕,我会用大白话讲清楚,并配上可运行的代码示例,让你看得懂、跑得动。## 什么是深度神经网络?深度神经网络(Deep Neural Network,简称DNN)说白了就是有很多层(隐藏层)的神经网络。浅层神经网络(比如只有一个隐藏层)能解决的问题有限,比如简单的分类任务。但现实中很多问题(比如图像识别、语音识别)非常复杂,需要多层神经网络来提取更抽象的特征。举个例子:识别一张图片里有没有猫。浅层网络可能只能看到像素点(边缘、颜色),而深层网络可以逐步组合出“眼睛”、“耳朵”、“胡须”这些更高级的特征,最后判断是不是猫。这就是“深层”的价值——层次越深,特征越抽象。## 关键概念一:前向传播和反向传播在深度神经网络中,训练过程分为两步:前向传播(Forward Propagation)和反向传播(Backward Propagation)。简单来说:- 前向传播:从输入层开始,一层一层向前计算,直到输出层。每层会计算线性部分(z = w * a_prev + b)和激活部分(a = activation(z))。- 反向传播:从输出层开始,向后计算每一层的梯度(即损失函数对参数的导数),然后用这些梯度更新参数。这两个过程是“对偶”的:前向传播时的中间值(比如z和a)会被缓存下来,供反向传播使用。这就是为什么代码里要“缓存”中间结果。下面是前向传播的通用公式:- 对于第l层:Z[l] = W[l] * A[l-1] + b[l]- A[l] = gl,其中g[l]是激活函数(ReLU、sigmoid等)反向传播的梯度计算公式(以sigmoid为例):- dZ[l] = dA[l] * g[l]'(Z[l])- dW[l] = (1/m) * dZ[l] * A[l-1]T- db[l] = (1/m) * np.sum(dZ[l], axis=1, keepdims=True)## 关键概念二:参数初始化深度神经网络对参数初始化非常敏感。如果W初始化为0,那么所有隐藏单元会对称,导致所有神经元学到相同的东西(即“对称性问题”)。因此,我们通常使用随机初始化,并且根据激活函数选择不同的缩放因子。对于ReLU激活函数,推荐使用“He初始化”:W[l] = np.random.randn(shape) * np.sqrt(2 / n[l-1])对于tanh或sigmoid,推荐使用“Xavier初始化”:W[l] = np.random.randn(shape) * np.sqrt(1 / n[l-1])## 代码示例一:实现深度神经网络的前向传播下面是一个简单的深度神经网络前向传播代码,包含两层隐藏层(使用ReLU)和输出层(使用sigmoid)。注意看缓存机制。pythonimport numpy as npdef initialize_parameters(layer_dims): """ 初始化深度神经网络的参数 layer_dims: 包含每层神经元数量的列表,例如 [2, 4, 3, 1] 表示输入层2个,隐藏层1有4个,隐藏层2有3个,输出层1个 """ np.random.seed(1) # 固定随机种子,方便复现 parameters = {} L = len(layer_dims) # 层数(包括输入层) for l in range(1, L): # He初始化:适用于ReLU parameters['W' + str(l)] = np.random.randn(layer_dims[l], layer_dims[l-1]) * np.sqrt(2 / layer_dims[l-1]) parameters['b' + str(l)] = np.zeros((layer_dims[l], 1)) return parametersdef linear_forward(A_prev, W, b): """ 线性前向传播:Z = W * A_prev + b """ Z = np.dot(W, A_prev) + b cache = (A_prev, W, b) # 缓存,供反向传播使用 return Z, cachedef activation_forward(Z, activation_type): """ 激活函数前向传播 """ if activation_type == 'sigmoid': A = 1 / (1 + np.exp(-Z)) cache = Z elif activation_type == 'relu': A = np.maximum(0, Z) cache = Z else: raise ValueError("Unsupported activation type") return A, cachedef forward_propagation(X, parameters): """ 完整的前向传播 """ caches = [] A = X L = len(parameters) // 2 # 层数(不包括输入层) # 隐藏层使用ReLU for l in range(1, L): A_prev = A W = parameters['W' + str(l)] b = parameters['b' + str(l)] Z, linear_cache = linear_forward(A_prev, W, b) A, activation_cache = activation_forward(Z, 'relu') caches.append((linear_cache, activation_cache)) # 输出层使用sigmoid W = parameters['W' + str(L)] b = parameters['b' + str(L)] Z, linear_cache = linear_forward(A, W, b) A, activation_cache = activation_forward(Z, 'sigmoid') caches.append((linear_cache, activation_cache)) return A, caches# 测试:输入层2个特征,两个隐藏层(4个和3个神经元),输出层1个layer_dims = [2, 4, 3, 1]parameters = initialize_parameters(layer_dims)X = np.array([[0.5, 0.2], [0.1, 0.8]]) # 两个样本A_final, caches = forward_propagation(X, parameters)print("输出层结果:", A_final)运行这段代码,你会看到输出层的结果(概率值),它表示每个样本属于正类的概率。注意,这里参数是随机初始化的,所以结果不是训练后的预测。## 关键概念三:为什么深度神经网络有效?深度神经网络之所以强大,有两个主要原因:1. 层次化特征提取:浅层网络只能学习简单特征(如边缘),深层网络可以组合这些特征形成更复杂的模式。在图像识别中,第一层学边缘,第二层学形状,第三层学物体部件,第四层学整个物体。2. 参数共享和效率:深度神经网络通过分层结构,可以用更少的参数模拟更复杂的函数。理论上,一个足够深的网络可以用指数级少的参数,达到与浅层网络相同的表示能力。## 关键概念四:深度神经网络的训练技巧训练深度神经网络时,有几个常见问题需要留意:- 梯度消失/爆炸:当网络很深时,梯度在反向传播中可能指数级缩小(消失)或增大(爆炸)。解决方法包括:使用ReLU等非饱和激活函数、批量归一化、梯度裁剪。- 过拟合:深度网络参数多,容易过拟合。可以用L2正则化、dropout、数据增强来缓解。- 学习率调整:深度网络训练需要合适的学习率。可以使用学习率衰减(learning rate decay)或自适应优化器(如Adam)。## 代码示例二:实现深度神经网络的损失函数和反向传播下面我们实现一个完整的反向传播示例,包括损失函数计算和梯度更新。pythondef compute_loss(A_final, Y): """ 计算交叉熵损失 A_final: 输出层激活值(预测概率) Y: 真实标签(0或1) """ m = Y.shape[1] loss = -1/m * np.sum(Y * np.log(A_final) + (1 - Y) * np.log(1 - A_final)) return np.squeeze(loss)def linear_backward(dZ, cache): """ 线性反向传播:计算dW, db, dA_prev """ A_prev, W, b = cache m = A_prev.shape[1] dW = 1/m * np.dot(dZ, A_prev.T) db = 1/m * np.sum(dZ, axis=1, keepdims=True) dA_prev = np.dot(W.T, dZ) return dA_prev, dW, dbdef activation_backward(dA, cache, activation_type): """ 激活函数反向传播:计算dZ """ Z = cache if activation_type == 'sigmoid': s = 1 / (1 + np.exp(-Z)) dZ = dA * s * (1 - s) # sigmoid导数 elif activation_type == 'relu': dZ = dA * (Z > 0) # ReLU导数:大于0时为1,否则为0 else: raise ValueError("Unsupported activation type") return dZdef backward_propagation(Y, caches): """ 完整的反向传播,返回所有参数的梯度 """ grads = {} L = len(caches) m = Y.shape[1] # 初始化输出层的dA(cross-entropy loss对sigmoid输出的导数) A_final, _ = caches[-1] # caches中最后一组是输出层 dA = - (np.divide(Y, A_final) - np.divide(1 - Y, 1 - A_final)) # 反向传播从输出层开始 for l in reversed(range(L)): linear_cache, activation_cache = caches[l] if l == L-1: # 输出层使用sigmoid dZ = activation_backward(dA, activation_cache, 'sigmoid') else: # 隐藏层使用ReLU dZ = activation_backward(dA, activation_cache, 'relu') dA_prev, dW, db = linear_backward(dZ, linear_cache) grads['dW' + str(l+1)] = dW grads['db' + str(l+1)] = db dA = dA_prev return gradsdef update_parameters(parameters, grads, learning_rate): """ 使用梯度下降更新参数 """ L = len(parameters) // 2 for l in range(L): parameters['W' + str(l+1)] -= learning_rate * grads['dW' + str(l+1)] parameters['b' + str(l+1)] -= learning_rate * grads['db' + str(l+1)] return parameters# 测试反向传播:使用上面的前向传播结果Y = np.array([[1, 0]]) # 两个样本的真实标签loss = compute_loss(A_final, Y)print("损失值:", loss)grads = backward_propagation(Y, caches)print("dW3的形状:", grads['dW3'].shape) # 输出层权重梯度# 更新参数parameters = update_parameters(parameters, grads, learning_rate=0.01)print("更新后的W3:", parameters['W3'][:2]) # 只看前两行运行这段代码,你会看到损失值和梯度更新的结果。这就是深度神经网络训练的核心循环:前向传播 -> 计算损失 -> 反向传播 -> 更新参数。## 总结深度神经网络是深度学习的基础。第四周课程主要教会我们三件事:1. 深层网络的结构:通过堆叠多个隐藏层,网络可以学习更抽象的特征。2. 前向传播和反向传播:这是训练的核心,需要理解每层的计算和缓存机制。3. 参数初始化与训练技巧:好的初始化能加速收敛,梯度消失/爆炸需要警惕。从代码实现来看,深度神经网络的代码虽然比浅层网络复杂,但核心思想是一致的:线性变换 + 激活函数,然后反复堆叠。只要你掌握了浅层网络(第三周内容),深层网络只是“重复”和“缓存”的升级版。吴恩达老师在这周的课程中还强调了向量化实现的重要性——用矩阵运算替代for循环,能让代码跑得飞快。上面我的代码例子已经用了向量化,你可以试试跑一下,感受一下矩阵运算的魅力。最后,记住一句话:深度不是魔法,而是层次化抽象。希望这篇文章能帮你更好地理解深度神经网络!如果你有任何疑问,欢迎在评论区留言讨论。
更多推荐



所有评论(0)