
深度学习入门初识深度学习前言本文是“深度学习入门”系列的第一篇。从本章开始我们将正式进入深度学习的领域。如果说机器学习是让计算机从数据中学习规律那么深度学习就是让计算机自己发现数据中的规律。它通过模拟人脑神经网络的结构让机器能够自动提取特征在图像识别、语音识别、自然语言处理等领域取得了革命性的突破。目录一、从人工智能到深度学习二、神经网络核心构造三、激活函数四、损失函数五、正则化惩罚六、梯度下降七、BP 反向传播八、总结一、从人工智能到深度学习1.1 人工智能、机器学习、深度学习的关系三者是包含关系概念说明人工智能AI让机器具备人类智能的宏大目标机器学习ML实现 AI 的一种方法让机器从数据中学习深度学习DL机器学习的一个分支使用多层神经网络通俗理解人工智能是“让电脑变聪明”这个目标机器学习是“让电脑自己看书学习”这个方法深度学习是“让电脑模仿人脑结构”这种更高级的学习方式。1.2 深度学习是什么深度学习Deep Learning是一种基于人工神经网络的机器学习方法。它的核心特点是用多层神经网络自动从数据中提取特征并通过反向传播算法不断优化网络参数最终实现对复杂数据的建模与分类。1.3 深度学习的应用场景领域应用图像识别人脸识别、自动驾驶、医学影像诊断语音识别智能助手、语音输入、语音翻译自然语言处理机器翻译、文本生成、情感分析推荐系统短视频推荐、商品推荐、广告投放二、神经网络核心构造2.1 神经元模型神经网络的基本单元是神经元Neuron它模拟了生物神经元的信号传递方式。一个神经元接收多个输入信号x₁, x₂, ..., xₙ每个输入带有不同的权重w₁, w₂, ..., wₙ经过线性加权求和后再通过一个激活函数输出结果。2.2 权重的作用权重Weight决定了输入信号对神经元的影响程度。可以类比为外界信号在传入神经元的过程中会有损耗实际传入的信号是wx。权重越大该输入对神经元的影响越大权重越小该输入对神经元的影响越小训练神经网络的核心任务就是找到最优的权重值2.3 感知器感知器Perceptron是最简单的神经网络——只有输入层和输出层两层结构。感知器可以用矩阵运算表示z g ( W ⋅ x ) z g(W \cdot x)zg(W⋅x)其中 ( W ) 是权重矩阵( x ) 是输入向量( g ) 是激活函数。局限性感知器只能处理线性可分的问题无法解决异或XOR等非线性问题。2.4 多层感知器为了解决非线性问题需要在输入层和输出层之间加入隐藏层Hidden Layer。多层感知器的关键能力隐藏层使神经网络能够处理非线性分类问题。隐藏层越多网络的表达能力越强。2.5 偏置节点在神经网络的每一层中除了正常的神经元外还存在一个偏置节点Bias。它的值是固定的1。偏置节点没有前一层输入它本质上是一个存储值为 1 的单元2.6 设计神经网络的要点设计要点说明输入层节点数等于特征的维度输出层节点数等于目标的维度隐藏层节点数没有固定规则通常通过实验确定最佳值权重每个连接线对应一个权重训练的目标就是找到最优权重三、激活函数3.1 什么是激活函数激活函数的作用是引入非线性。如果没有激活函数无论多少层网络都只是线性变换无法解决非线性问题。3.2 常用激活函数激活函数表达式特点Sigmoidf ( x ) 1 1 e − x f(x) \frac{1}{1 e^{-x}}f(x)1e−x1输出 0~1适合二分类输出层Tanhf ( x ) e x − e − x e x e − x f(x) \frac{e^x - e^{-x}}{e^x e^{-x}}f(x)exe−xex−e−x输出 -1~1零中心化ReLUf ( x ) max ( 0 , x ) f(x) \max(0, x)f(x)max(0,x)计算简单常用在隐藏层Softmaxf ( x i ) e x i ∑ j e x j f(x_i) \frac{e^{x_i}}{\sum_j e^{x_j}}f(xi)∑jexjexi多分类输出层输出概率分布3.3 Softmax 详解Softmax 的作用是将一组数值转换为概率分布所有值在 0~1 之间且和为 1。输入: [5, 4.9, -2] 取指数: [148.4, 134.3, 0.135] 归一化: [0.4748, 0.5247, 0.0005]在多分类任务中Softmax 输出每个类别的概率选择概率最大的类别作为预测结果。四、损失函数4.1 什么是损失函数损失函数衡量预测值与真实值之间的差距。模型训练的目标就是让损失值尽可能小。通俗理解损失函数就像考试分数——分数越低损失越小说明模型预测得越准。4.2 常见损失函数损失函数适用场景均方差损失回归问题平均绝对差损失回归问题对离群点更鲁棒交叉熵损失分类问题最常用合页损失SVM 分类0-1 损失理论分析4.3 交叉熵损失交叉熵是分类问题中最常用的损失函数。以三分类为例某次训练的真实标签是“猫”第 1 类预测结果为类别预测概率真实标签猫0.52471狗0.47480鸟0.00050交叉熵损失为Loss − log ( 0.5247 ) ≈ 0.28 \text{Loss} -\log(0.5247) \approx 0.28Loss−log(0.5247)≈0.28取-log的原因预测概率越接近 1 →-log(p)越接近 0损失小预测正确预测概率越接近 0 →-log(p)越大损失大预测错误这就是为什么分类时“分对了损失小分错了损失大”。五、正则化惩罚5.1 为什么需要正则化训练神经网络时模型可能过拟合——在训练集上表现很好但在测试集上表现差。正则化的作用是防止过拟合让模型更关注所有特征而不是过度依赖某几个特征。5.2 L1 和 L2 正则化正则化表达式特点L1 正则化∑ i ∣ w i ∣ \sum_i |w_i|∑i∣wi∣产生稀疏权重可做特征选择L2 正则化∑ i w i 2 \sum_i w_i^2∑iwi2权重更均匀整体效果更好5.3 直观理解假设输入x [1, 1, 1, 1]两种权重方案权重方案与 x 的乘积特点w₁ [1, 0, 0, 0]1只学习第一个特征容易过拟合w₂ [0.25, 0.25, 0.25, 0.25]1每个特征都学到泛化能力更强L2 正则化倾向于第二种方案——让权重“雨露均沾”从每个输入特征中都学习信息从而提升泛化能力。六、梯度下降6.1 梯度与偏导数对于一个多元函数偏导数是函数关于某个变量的导数其他变量保持不变。梯度是所有偏导数构成的向量。梯度向量的方向是函数值增长最快的方向。6.2 梯度下降法梯度下降法Gradient Descent的核心思想是沿着梯度相反的方向更新参数使损失函数值逐步减小。w new w old − η ⋅ ∂ Loss ∂ w w_{\text{new}} w_{\text{old}} - \eta \cdot \frac{\partial \text{Loss}}{\partial w}wnewwold−η⋅∂w∂Loss其中η \etaη是学习率。6.3 学习率的选择学习率效果太大步子太大容易越过最低点无法收敛太小步子太小训练速度极慢容易陷入局部最优适中稳定收敛到最优解6.4 如何避免局部最优梯度下降可能陷入局部最优而非全局最优。常用的解决方案多次随机初始化从不同位置开始搜索使用动量优化器如 Adam、SGD with Momentum七、BP 反向传播7.1 什么是 BPBPBack Propagation反向传播是训练神经网络的核心算法。它通过前向传播计算预测结果再通过反向传播将误差逐层传回更新每一层的权重。7.2 算法流程步骤说明1. 前向传播输入数据从输入层进入逐层计算最终得到输出预测结果2. 计算损失将预测结果与真实标签对比通过损失函数计算损失值3. 反向传播从输出层开始逐层向前计算每个权重的偏导数梯度4. 更新权重根据偏导数和学习率沿梯度反方向更新所有连接权重5. 循环迭代重复 1-4 步直到损失值小于设定阈值或达到最大迭代次数7.3 前向传播数据从输入层进入经过每层的加权求和 激活函数最终得到输出结果。这个过程就是“前向传播”。7.4 反向传播从输出层开始计算每个权重的偏导数将误差逐步“传回”到前面的层。核心思想通过链式求导法则将最终的损失反向分配到每一个权重上从而指导权重的更新方向。八、总结核心知识点速查知识点关键概念AI → ML → DL包含关系人工智能 机器学习 深度学习神经元加权求和 激活函数权重决定输入信号的影响程度训练目标就是找最优权重激活函数引入非线性Sigmoid、Tanh、ReLU、Softmax损失函数衡量预测与真实值的差距交叉熵最常用正则化防止过拟合L1稀疏/ L2均匀梯度下降沿梯度反方向更新参数学习率是关键BP 反向传播前向计算损失 反向传播误差 更新权重注意事项要点说明隐藏层设计没有固定规则通过实验确定最佳节点数学习率选择过大不收敛过小训练慢需要调参偏置节点每层默认存在值为 1结构图中通常不画权重初始化一般使用随机初始化避免对称性Softmax 与交叉熵常搭配使用是多分类的标准配置系列直达本篇深度学习入门初识深度学习本文下篇深度学习入门初识深度学习