4.4 逻辑回归中的学习
模型参数——权重 和偏置 ——是如何学到的?二元逻辑回归是一种监督分类(supervised classification):对于每个观测 ,我们都知道正确标签 (0 或 1)。系统通过式 4.5 输出 ,即系统认为 的概率,可以把它看作对真实 的估计。
我们的目标是学习参数 和 ,使每个训练观测的概率 尽可能接近真实 。也就是说,若 ,便希望系统的估计 尽量高、尽量接近 1;若 ,则希望 尽量低、尽量接近 0。
为此需要本章引言中预先提到的两个组成部分。第一,需要一个度量来表示 (系统估计该观测属于正类的概率)与真实金标准标签 有多接近。实践中通常不直接度量相似度,而是讨论系统输出与金标准输出之间的距离,并将其称为损失函数(loss function)或代价函数(cost function)。下一节将介绍逻辑回归和神经网络中常用的交叉熵损失(cross-entropy loss)。
第二,需要一个优化算法,反复更新权重以最小化损失函数。标准算法是梯度下降(gradient descent);后文将介绍随机梯度下降(stochastic gradient descent)。
接下来两节先针对较简单的二元逻辑回归介绍这些算法,然后在第 4.8 节转向多项逻辑回归。