Unicode normalization

E564765

Unicode normalization is a set of standardized processes that convert equivalent Unicode text sequences into a consistent canonical form to ensure reliable comparison, searching, and processing of text across systems.

All labels observed (10)

How this entity was disambiguated

Statements (51)

Predicate Object
instanceOf Unicode standard feature
text processing standard
addresses multiple representations of the same abstract text
precomposed and decomposed character sequences
alsoKnownAs UAX #15
appliesTo Unicode text
definedBy Unicode Consortium
definesForm NFC
NFD
NFKC
NFKD
ensures canonically equivalent strings have identical binary representation
example é can be U+00E9 or 'e' + U+0301
hasFullName Normalization Form C
Normalization Form D
linked to: NFD

Normalization Form KC
Normalization Form KD
hasProperty closed under normalization (idempotent)
stable across Unicode versions for assigned characters
hasPurpose to convert equivalent Unicode text sequences into a consistent form
to enable consistent text processing across systems
to enable reliable text comparison
to enable reliable text searching
hasSpecification Unicode Standard Annex #15
idempotent applying the same normalization form twice yields the same result
isImportantFor collation
search indexing
security-sensitive string comparison
string equality
text rendering consistency
NFC canonical composition form
NFCPreferredFor data interchange
NFD canonical decomposition form
NFDPreferredFor internal text processing in some systems
NFKC compatibility composition form
NFKCPreferredFor identifier comparison in some contexts
NFKD compatibility decomposition form
NFKDPreferredFor text analysis and searching in some contexts
partOf Unicode Standard
reliesOn Unicode character decomposition mappings
canonical combining class
composition exclusions
usedBy databases
programming languages
search engines
text editors
usesConcept canonical equivalence
compatibility equivalence
usesOperation canonical composition
canonical decomposition
compatibility decomposition

How these facts were elicited

Referenced by (20)

Full triples — surface form annotated when it differs from this entity's canonical label.

Mark Davis contributedTo Unicode normalization
Unicode Standard Annexes includesTopic Unicode normalization
Unicode Technical Committee standardDeveloped Unicode Normalization Forms
linked to: Unicode normalization
East_Asian_Width relatedTo Unicode normalization
Normalization_Quick_Check relatedTo Unicode Normalization Forms
linked to: Unicode normalization
Unicode 4.1 refinesNormalization Unicode Normalization Forms
linked to: Unicode normalization
Vunisea Airport ICAOcode NFKD
linked to: Unicode normalization
Unicode Technical Reports includesExample Unicode Normalization Forms
linked to: Unicode normalization
Unicode 5.0 defines Unicode normalization forms
linked to: Unicode normalization
Unicode normalization hasFullName Normalization Form KC
linked to: Unicode normalization
Unicode bidirectional algorithm relatedTo Unicode normalization algorithm
linked to: Unicode normalization
Unicode text processing algorithms includesAlgorithm Unicode Normalization Algorithm
linked to: Unicode normalization
The Unicode Standard defines Unicode normalization forms
linked to: Unicode normalization
Unicode Line Breaking Algorithm relatedTo Unicode Normalization Algorithm
linked to: Unicode normalization
UAX #15 alsoKnownAs Unicode Normalization Forms
linked to: Unicode normalization
UAX #15 defines Unicode Normalization Forms
linked to: Unicode normalization
UAX #15 defines Normalization Form C
linked to: Unicode normalization
Unicode Standard defines Unicode normalization forms
linked to: Unicode normalization
Unicode 13.0 definesUnicodeVersionFor Unicode Normalization Forms 13.0.0
linked to: Unicode normalization
Unicode 11.0 definesUnicodeVersionFor Unicode Normalization Forms 11.0.0
linked to: Unicode normalization