Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

4.4 逻辑回归中的学习

模型参数——权重 w\mathbf w 和偏置 bb——是如何学到的?二元逻辑回归是一种监督分类(supervised classification):对于每个观测 xx,我们都知道正确标签 yy(0 或 1)。系统通过式 4.5 输出 y^\hat y,即系统认为 y=1y=1 的概率,可以把它看作对真实 yy 的估计。

我们的目标是学习参数 w\mathbf wbb,使每个训练观测的概率 y^\hat y 尽可能接近真实 yy。也就是说,若 y=1y=1,便希望系统的估计 y^=P(y=1)\hat y=P(y=1) 尽量高、尽量接近 1;若 y=0y=0,则希望 y^=P(y=1)\hat y=P(y=1) 尽量低、尽量接近 0。

为此需要本章引言中预先提到的两个组成部分。第一,需要一个度量来表示 y^\hat y(系统估计该观测属于正类的概率)与真实金标准标签 yy 有多接近。实践中通常不直接度量相似度,而是讨论系统输出与金标准输出之间的距离,并将其称为损失函数(loss function)或代价函数(cost function)。下一节将介绍逻辑回归和神经网络中常用的交叉熵损失(cross-entropy loss)。

第二,需要一个优化算法,反复更新权重以最小化损失函数。标准算法是梯度下降(gradient descent);后文将介绍随机梯度下降(stochastic gradient descent)。

接下来两节先针对较简单的二元逻辑回归介绍这些算法,然后在第 4.8 节转向多项逻辑回归。