Aller au contenu

$string.normalize

Description

Retourne une version normalisée de la valeur reçue en paramètre. En clair, la méthode se charge de retraiter les caractères Unicode pour les normaliser.

Syntaxe

$string.unaccent( string [ , options ] )

Paramètres

string string
String à traiter
options string / map

Options de normalisation. Les options reconnues sont:

form _string{: .ewt-type}

Format de normalisation. Les valeurs reconnues sont:

NFC : Forme canonique composée NFD : Forme canonique décomposée NFKC : Normalisation de compatibilité composée NFKD : Normalisation de compatibilité décomposée

Le format par défaut est NFC

Format de normalisation

Le format NFC est généralement la forme la plus adaptée pour normaliser du texte Unicode. Par exemple, é peut être représenté de deux manières Unicode :

  • un seul caractère : U+00E9 (é)
  • deux caractères : U+0065 (e) + U+0301 (accent aigu combinant)

Ces deux chaînes sont visuellement identiques, mais leurs séquences de caractères sont différentes. NFC décompose la séquence, puis recombine autant que possible les caractères décomposés en leur forme canonique composée.

Le format NFD fait l'inverse : elle décompose les caractères composés. Ainsi, le é sera convertit en e + accent aigu combinant.

Le format NFKC fait comme NFC, mais va plus loin et considère également certains caractères Unicode qui sont des variantes de compatibilité. Ainsi, certains caractères typographiques ou certaines formes particulières peuvent être ramenées à une représentation plus standard.

Le format NFDK est l'équivalent décomposé de NFKC. C'est notamment ce format de normalisation qui est utilisé en interne de la méthode $string.unaccent, ce qui explique au passage pourquoi certains caractères ligature sont décomposés lors du traitement.

Si le paramètre est une chaîne de caractère, elle est interprétée comme la propriété form.

Retour

Version normalisée de la chaîne d'entrée

Exemple

Non disponible