回想一下在Seq2seq模型中,如何使用Attention。这里简要回顾一下【1】介绍的方法2(并以此为基础展开对Transformer的讨论)。
下图中包含一个encoder(左)和一个decoder(右)。对于decoder来说,给定一个输入,得到输出,如何进一步得到context vector 呢?
我们需要根据和 的相关性来计算权重
上一篇:【Maven】(二)使用 Maven 创建并运行项目、聊聊 POM 中的坐标与版本号的规则
下一篇:【Linux】如何将ntfs硬盘挂载到home目录下并具有读写权限