--- created: 2025-08-03 21:19:11 tags: - "Research" - "基础" - "Transformer" - "多头注意力" - "Self-Attention" --- Multi-head Attention其实就是多个[[Self-Attention]]结构的结合,**每个head学习到在不同表示空间中的特征**,两个head学习到的Attention侧重点可能略有不同,这样**给了模型更大的容量**。 多头注意力的两个好处: 1. 它扩展了模型**专注于不同位置的能力**。 在上面例子里只计算一个自注意力的的例子中,编码“Thinking”的时候,虽然最后$Z_1$或多或少包含了其他位置单词的信息,但是它实际编码中还是被“Thinking”单词本身所支配。 如果我们翻译一个句子,比如“The animal didn’t cross the street because it was too tired”,我们会想知道“it”指的是哪个词,这时模型的“多头”注意力机制会起到作用。 >也许大概就是一词多义, 多头就可以给多义留出余量 2. 它给了注意层多个“**表示子空间**”。 就是在多头注意力中同时用多个不同的$W^Q, W^K, W^V$权重矩阵(Transformer使用8个头部,因此我们最终会得到8个计算结果),每个权重都是随机初始化的。经过训练每个$W^Q, W^K, W^V$都能将输入的矩阵投影到不同的表示子空间。