Skip to article frontmatterSkip to article content
Site not loading correctly?

This may be due to an incorrect BASE_URL configuration. See the MyST Documentation for reference.

练习

7.1 一个 Transformer 有 LL 层,模型维度为 dd,包含 AA 个注意力头,其中 dk=dv=d/Ad _ { k } = d _ { v } = d / A,前馈维度为 dff=4dd _ { f f } = 4 d

a. 计算一个注意力层中 WQW ^ { Q }WKW ^ { K }WVW ^ { V }WOW ^ { O } 的参数数量。你的答案是否取决于 A?

b. 计算一个前馈层的参数数量。

c. 忽略偏置项和层归一化,证明由 LL 个块组成的完整堆栈约有 12Ld212Ld^2 个参数。

7.2 为什么图 7.10 中的注意力掩码使用 -\infty 而不是 0?如果使用 0,会发生什么?

7.3 假设字符串 It was a dream 中各词对应的条件概率分别为 .0001、.0002、.000005 和 .0000001,计算语言模型在该字符串上的困惑度。

7.4 证明一段文本的困惑度等于该文本平均交叉熵损失的指数。

7.5 使用图 7.17 中的 logits,计算 τ=0.2\tau = 0 . 2τ=2\tau = 2 时的概率,并验证二者的概率总和都为 1。当 τ0\tau \to 0 时会怎样?当 τ\tau \to \infty 时又会怎样?