全部文章0

科学空间苏剑林··访问 1

将Softmax Attention线性化为Gated DeltaNet

原网页

在文章《LogSumExp和Softmax的泰勒展开》中,我们介绍了LogSumExp和Softmax的近似展开,并由此得到了一种线性化Softmax Attention的简单方案。但在那篇文章中,所得的线性注意力仅仅是Vanilla Linear Attention的形式。

这篇文章我们则更进一步,试图将Softmax Attention线性化成具有Delta Rule的线性注意力变体。令人意外的是,最终得到的结果并不是基本的DeltaNet,而是直接得到了Gated DeltaNet(GDN)。

问题背景

考虑给定Query $\boldsymbol{q}$的前提下,Attention输出随Key、Value的变化规律。引入记号
\begin{equation}\boldsymbol{o}_t = \sum_{i=1}^t \alpha_{t, i} \boldsymbol{v}_i, \qquad \alpha_{t,i} = \frac{e^{\boldsymbol{q}\cdot \boldsymbol{k}_i}}{Z_t},\qquad Z_t = \sum_{i=1}^t e^{\boldsymbol{q}\cdot \boldsymbol{k}_i}\end{equation}

[...]