14.6 小结:常见的 RNN NLP 架构
我们已经介绍了 RNN,了解了堆叠多层、使用 LSTM 版本等高级组件,也看到了如何将 RNN 应用于各种任务。现在总结这些应用所使用的架构。
图 14.15 展示了目前讨论过的三种架构:序列标注、序列分类和语言建模。在序列标注中(例如词性标注),我们训练模型为每个输入词或词元生成一个标签。在序列分类中(例如情感分析),我们忽略每个词元的输出,只取序列末尾的值(相应地,模型的训练信号也来自最后一个词元的反向传播)。在语言建模中,我们训练模型在每个词元位置预测下一个词。下一节将介绍第四种架构,即编码器—解码器。

图 14.15 NLP 任务的四种架构。在序列标注中(POS 或命名实体标注),我们把每个输入词元 映射为输出词元 。在序列分类中,我们把整个输入序列映射为单个类别。在语言建模中,我们根据前面的词元输出下一个词元。在编码器模型中,有两个独立的 RNN 模型:其中一个把输入序列 映射为称为上下文的中间表示,第二个把上下文映射为输出序列 。