Transformer-XL

E701503

Transformer-XL is a neural network architecture for language modeling that extends the Transformer with segment-level recurrence and relative positional encodings to better capture long-range dependencies.

All labels observed (2)

How this entity was disambiguated

Statements (48)

Predicate Object
instanceOf Transformer variant
language model architecture
neural network architecture
addressesLimitationOf standard Transformer context length
aimsTo capture long-range dependencies
appliedTo character-level language modeling
word-level language modeling
benchmarkedOn Enwik8
One Billion Word Benchmark
WikiText-103
describedInPaper Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context
linked to: Transformer-XL
designedFor language modeling
developedAt Carnegie Mellon University
linked to: CMU

Google Brain
evaluationSpeedupReason reuse of cached hidden states
extends Transformer
hasFullName Transformer eXtra Long
hasKeyConcept decoupling positional encoding from absolute positions
reusing hidden states from previous segments
improves evaluation efficiency
modeling of long-term dependencies
training efficiency for long sequences
improvesMetric perplexity on language modeling benchmarks
influenced later long-context Transformer architectures
introducedFeature relative positional encodings
segment-level recurrence
memoryMechanismType segment-level recurrence over hidden states
outperforms standard Transformer on long-context language modeling benchmarks
paperPublishedAt ACL 2019
positionalEncodingType relative positional encoding
proposedBy Jaime Carbonell
Quoc V. Le
Ruslan Salakhutdinov
William W. Cohen
Yiming Yang
Zhilin Yang
Zihang Dai
proposedIn 2019
reduces context fragmentation
supports longer effective context than vanilla Transformer
trainingObjective autoregressive language modeling
uses layer normalization
memory mechanism
multi-head attention
position-wise feed-forward networks
relative positional embeddings
residual connections
self-attention

How these facts were elicited

Referenced by (4)

Full triples — surface form annotated when it differs from this entity's canonical label.

Layer Normalization usedIn Transformer-XL
XLNet relatedTo Transformer-XL
XLNet extends Transformer-XL
Transformer-XL describedInPaper Transformer-XL: Attentive Language Models Beyond a Fixed-Length Context
linked to: Transformer-XL