$string.normalize¶
Description¶
Retourne une version normalisée de la valeur reçue en paramètre. En clair, la méthode se charge de retraiter les caractères Unicode pour les normaliser.
Syntaxe¶
$string.unaccent( string [ , options ] )
Paramètres¶
stringstring- String à traiter
optionsstring / map-
Options de normalisation. Les options reconnues sont:
form_string{: .ewt-type}-
Format de normalisation. Les valeurs reconnues sont:
NFC: Forme canonique composéeNFD: Forme canonique décomposéeNFKC: Normalisation de compatibilité composéeNFKD: Normalisation de compatibilité décomposéeLe format par défaut est
NFCFormat de normalisation
Le format
NFCest généralement la forme la plus adaptée pour normaliser du texte Unicode. Par exemple,épeut être représenté de deux manières Unicode :- un seul caractère :
U+00E9(é) - deux caractères :
U+0065(e) +U+0301(accent aigu combinant)
Ces deux chaînes sont visuellement identiques, mais leurs séquences de caractères sont différentes.
NFCdécompose la séquence, puis recombine autant que possible les caractères décomposés en leur forme canonique composée.Le format
NFDfait l'inverse : elle décompose les caractères composés. Ainsi, leésera convertit ene+ accent aigu combinant.Le format
NFKCfait commeNFC, mais va plus loin et considère également certains caractères Unicode qui sont des variantes de compatibilité. Ainsi, certains caractères typographiques ou certaines formes particulières peuvent être ramenées à une représentation plus standard.Le format
NFDKest l'équivalent décomposé deNFKC. C'est notamment ce format de normalisation qui est utilisé en interne de la méthode$string.unaccent, ce qui explique au passage pourquoi certains caractères ligature sont décomposés lors du traitement. - un seul caractère :
Si le paramètre est une chaîne de caractère, elle est interprétée comme la propriété
form.
Retour¶
Version normalisée de la chaîne d'entrée
Exemple¶
Non disponible