
前向传播、反向传播与梯度下降:从计算图直观理解神经网络训练
目标读者:不需要任何深度学习背景,只要求会一点点导数(知道 $\frac{d}{dx}x^2=2x$ 就够了)。全文用同一组例子贯穿始终,并在最后给出一个真实可运行、能"解决问题"的应用案例。
2026-07-21 · 45 min read · shen-du-xue-xi
Tag View
2 published posts

目标读者:不需要任何深度学习背景,只要求会一点点导数(知道 $\frac{d}{dx}x^2=2x$ 就够了)。全文用同一组例子贯穿始终,并在最后给出一个真实可运行、能"解决问题"的应用案例。
2026-07-21 · 45 min read · shen-du-xue-xi

> 本文对回归、自回归、二分类、多分类、度量学习/对比学习、GAN、VAE、扩散模型八大类模型的损失函数给出**完整推导过程**并逐项解释。 > 核心结论提前说:**绝大多数监督学习损失,本质上都是"负对数似然"(NLL)**——最小化 NLL 等价于最大化"模型分配给真实结果的概率"。但并非所有损失都来自干净的概率假设:Hinge/对比学习类损失是基于间隔或距离的几何启发式目标;GAN、VAE、扩散模型则通过对抗博弈或变分下界,用不同方式逼近数据分布。
2026-07-21 · 60 min read · shen-du-xue-xi