
前向传播、反向传播与梯度下降:从计算图直观理解神经网络训练
目标读者:不需要任何深度学习背景,只要求会一点点导数(知道 $\frac{d}{dx}x^2=2x$ 就够了)。全文用同一组例子贯穿始终,并在最后给出一个真实可运行、能"解决问题"的应用案例。
2026-07-21 · 45 min read
Series & Tag View on the left, newest posts on the right.

目标读者:不需要任何深度学习背景,只要求会一点点导数(知道 $\frac{d}{dx}x^2=2x$ 就够了)。全文用同一组例子贯穿始终,并在最后给出一个真实可运行、能"解决问题"的应用案例。
2026-07-21 · 45 min read

> 本文对回归、自回归、二分类、多分类、度量学习/对比学习、GAN、VAE、扩散模型八大类模型的损失函数给出**完整推导过程**并逐项解释。 > 核心结论提前说:**绝大多数监督学习损失,本质上都是"负对数似然"(NLL)**——最小化 NLL 等价于最大化"模型分配给真实结果的概率"。但并非所有损失都来自干净的概率假设:Hinge/对比学习类损失是基于间隔或距离的几何启发式目标;GAN、VAE、扩散模型则通过对抗博弈或变分下界,用不同方式逼近数据分布。
2026-07-21 · 60 min read

机器学习的大厦,究竟建立在哪些地基之上? 本文是对 Christopher Bishop 经典著作《Pattern Recognition and Machine Learning》第一章的系统性精读笔记。Bishop 在这一章并非只是走马观花地介绍概念,而是以**多项式曲线拟合**这一极简模型为线索,将概率论、统计推断、决策理论与信息论串联成一个严密的整体,揭示出贯穿全书的核心思想。 文章从**过拟合问题**切入——一个 $M=9$ 的多项式为何能完美拟合训练点却在测试集上一塌糊涂?沿着这个问题,我们推导最小二乘的正规方程,发现正则化背后藏着**高斯先验**,最小二乘背后藏着**高斯噪声假设下的最大似然**。这一系列发现将频率派与贝叶斯派的核心分歧具体化:参数到底是未知的常数,还是有自己概率分布的随机变量? 在概率论部分,文章从加法规则和乘法规则出发严格推导贝叶斯定理,并给出均值/方差 MLE 的完整推导与**方差有偏性的数学证明**(贝塞尔校正的来源)。在决策论部分,将最优分类规则与损失矩阵统一在期望损失最小化的框架下,并讨论了三种推断范式(生成模型 / 判别模型 / 判别函数)各自的适用场景。最后,信息论部分揭示了一个深刻的等价关系:**最大似然估计 ≡ 最小化模型分布与数据经验分布之间的 KL 散度**,交叉熵损失函数因此获得了坚实的理论依据。 全文包含完整的数学推导过程和可运行的 Python 代码示例,覆盖第一章全部 6 个小节(含 1.5 决策论与 1.6 信息论),适合有一定线性代数和概率基础、希望深入理解机器学习理论根基的读者。 **关键词**:PRML · 最大似然估计 · 贝叶斯推断 · 过拟合与正则化 · 决策论 · KL 散度 · 信息熵
2026-05-15 · 59 min read

一篇把 CSAPP 第 1 章讲透的系统入门:从位和上下文、编译链路、CPU 执行模型、缓存与存储层次,到操作系统抽象、网络、并发并行和 Amdahl 定律,用 hello.c 串起现代计算机系统的全景图。
2026-04-24 · 20 min read

*最好的学习方式是亲自动手。第二好的方式是从别人的经验中学习。*
2026-04-09 · 20 min read

大语言模型出来以后,研究里很快出现了两条路线。 原文链接:https://arxiv.org/abs/2210.03629
2026-04-01 · 20 min read

在 LLM 应用里,Streaming 从来不只是“把字一个一个吐出来”。对真实项目来说,它解决的是另外几个更硬的问题:首字延迟太长、Agent 调工具时用户以为系统卡死、长链路任务没有过程反馈、线上排障时看不见中间状态。LangChain 在官方文档里把 Streaming 能力拆成了 updates、messages、custom 三类,而且支持同时开启多种模式;LangChain Agent 本身又是构建在 LangGraph 之上的,所以这些能力本质上是“把 Agent 执行过程变成事件流”。
2026-03-31 · 20 min read

做 Agent 时,大家经常说“给模型加记忆”。但在工程里,短期记忆的本质不是抽象的 memory,而是线程级状态管理:同一个会话里,前几轮用户说过什么、工具查到了什么、中间结果是否要保留、下一步提示词要不要动态改,这些都需要被可靠保存,并在后续步骤继续读取。LangChain 在这件事上的官方实现,核心不是往 prompt 里拼字符串,而是把短期记忆纳入 agent state,并通过 checkpointer 做持久化。([LangChain Docs](https://docs.langchain.com/oss/python/langchain/short-term-memory))
2026-03-23 · 20 min read

如果你要做一个可上线的 AI 助手,LangChain 的 Tools 到底应该怎么设计?
2026-03-19 · 30 min read

做 LLM 应用时,很多人第一次接触 LangChain Messages,会把它理解成“聊天记录的一个封装”。这个理解不算错,但太浅了。
2026-03-18 · 30 min read