Qu’est-ce que l’encodage de texte ?
Le codage de texte est le processus de conversion de caractères en séquences d'octets que les ordinateurs peuvent stocker et transmettre. Unicode attribue un point de code unique à chaque caractère de chaque script. UTF-8 et UTF-16 sont les deux formats d'encodage les plus utilisés : UTF-8 utilise 1 à 4 octets par caractère et est l'encodage dominant sur le Web, tandis que UTF-16 utilise 2 ou 4 octets et est utilisé en interne par JavaScript, Java et Windows. Cet outil vous permet d'inspecter exactement comment chaque caractère de votre texte est représenté dans ces encodages, en affichant les points de code, les séquences d'octets et une vue de vidage hexadécimal.
Comment utiliser l'explorateur d'encodeur de texte
- 1Saisissez ou collez du texte dans le champ de saisie. Un exemple par défaut avec les caractères ASCII, CJK et emoji est fourni.
- 2Consultez la table des caractères pour voir le point de code Unicode, les octets UTF-8, les octets UTF-16 et la valeur décimale de chaque caractère.
- 3Consultez les statistiques récapitulatives pour le nombre total de caractères, le nombre d’octets UTF-8 et le nombre d’octets UTF-16.
- 4Basculez vers l'onglet Hex Dump pour voir les octets UTF-8 bruts dans un format de vidage hexadécimal traditionnel similaire à xxd.
Cas d'utilisation courants
Débogage des problèmes d'encodage
Inspectez les séquences d'octets pour diagnostiquer le mojibake, l'affichage incorrect des caractères ou les incompatibilités d'encodage entre les systèmes.
Comprendre les caractères multi-octets
Découvrez exactement comment les caractères CJK, les emoji et les lettres accentuées sont codés en UTF-8 par rapport à UTF-16.
Estimation du stockage et de la bande passante
Comparez les tailles d'octets UTF-8 et UTF-16 pour choisir l'encodage le plus efficace pour vos données.
Apprendre l'Unicode et les principes fondamentaux de l'encodage
Une référence pratique pour les étudiants et les développeurs qui apprennent comment fonctionne l'encodage de texte au niveau des octets.
Questions fréquentes
Quelle est la différence entre UTF-8 et UTF-16 ?
UTF-8 code les caractères sur 1 à 4 octets, les caractères ASCII ne prenant que 1 octet. UTF-16 utilise 2 octets pour les caractères les plus courants et 4 octets pour les caractères supplémentaires (comme certains emoji). UTF-8 est plus efficace pour le texte à forte teneur en latin, tandis que UTF-16 peut être plus compact pour le texte à forte teneur en CJK.
Pourquoi certains caractères affichent-ils plusieurs octets ?
Les caractères en dehors de la plage ASCII (points de code supérieurs à U+007F) nécessitent plusieurs octets en UTF-8. Par exemple, les caractères chinois utilisent généralement 3 octets en UTF-8, et les emoji avec des points de code supérieurs à U+FFFF utilisent 4 octets en UTF-8 et UTF-16 (en tant que paires de substitution).
Mon texte est-il envoyé à un serveur ?
Non. Toutes les analyses d'encodage s'effectuent entièrement dans votre navigateur à l'aide de l'API JavaScript TextEncoder. Aucune donnée n'est transmise à un serveur.