如何提高 Transformer 的效率 (2) [LLM]
冗余现象使得多数模型参数冗余度过高,训练与推理效率随之降低。降低冗余的常用思路是删减多余模块以简化模型,例如对复杂模型进行剪枝,或是在模型不同模块间共享子结构,从而得到更精简的模型。本节将介绍 Transformer 模型中的参数与中间状态共享方法。
如何提高 Transformer 的效率 (1) [LLM]
效率是 Transformer 模型在各类实际应用中需要重点考量的要素。效率相关问题的分析可从时间效率与空间效率,可扩展性这两个维度展开。
绘制第一幅 TikZ 图像 [LaTeX]
本节开始我们来学习如何在 \LaTeX 中通过 TikZ 包来绘图,所参考的教材是 Packt 出版的《<i>LATEX Graphics with TikZ</i>》。
向 Transformer 中引入先验知识 [LLM]
Transformer 作为深度学习模型,并未显式利用语言学结构或相关先验假设,但我们仍有必要将先验知识融入这类模型。究其原因,NLP 领域的研究者一直认为,想要构建理想的自然语言处理系统,需要对数据进行更高层级的抽象表示,目前也已有大量模型引入了结构先验。本节主要讨论如何将语言学结构融入 Transformer 模型,对 encoder 进行改进。
PyTorch 中的 Transformer 源码 [LLM]
上节我们自己实现了一个 Transformer,这节我们通过源码来看一下 PyTorch 官方是如何实现 Transformer 的。内容按以下顺序进行:从最简单的注意力组件开始向上直到顶层的 Transformer 类。