DeBERTa: Decoding-enhanced BERT with Disentangled Attention
Transformer 现已成为神经语言建模领域效果最优的神经网络架构。2018 年以来一大批基于 Transformer 的大规模预训练语言模型(PLM)相继问世,包括 GPT,BERT,RoBERTa,XLNet,UniLM,ELECTRA,T5 等。研究者使用各下游任务专属标注数据对这些预训练语言模型进行微调,在大量 NLP 任务上刷新了当前最优性能指标。
GAN 原理 [生成模型]
在 GAN (Generative Adversarial Nets) 中,生成模型要与一个对手博弈:即判别模型,该模型学习判断样本是来自模型分布还是真实数据分布。可以将生成模型类比为一伙造假者,试图制造假币并在不被察觉的情况下流通;而判别模型则类比为警察,负责识别假币。这场博弈中的竞争会促使双方不断改进自身方法,直到伪造品与真品无法区分。