¿Qué es la codificación de texto?
La codificación de texto es el proceso de convertir caracteres en secuencias de bytes que las computadoras pueden almacenar y transmitir. El Unicode atribuye un code point exclusivo a cada carácter de todos los sistemas de escritura. UTF-8 y UTF-16 son los dos formatos de codificación más usados: UTF-8 utiliza de 1 a 4 bytes por carácter y predomina en la web, mientras que UTF-16 utiliza 2 o 4 bytes y es empleado internamente por JavaScript, Java y Windows. Esta herramienta permite inspeccionar exactamente como cada caractere del texto está representado en esas codificaciones, exhibindo code points, secuencias de bytes y un dump hexadecimal.
Cómo usar el explorador de codificación de texto
- 1Escriba o recoge el texto en el campo de entrada. La herramienta proporciona una muestra estándar con caracteres ASCII, CJK y emoticonos.
- 2Consulte la tabla de caracteres para ver el code point Unicode, los bytes UTF-8, los bytes UTF-16 y el valor decimal de cada carácter.
- 3Consulte las estadísticas resumidas el total de caracteres y las cantidades de bytes UTF-8 y UTF-16.
- 4Visita a pestaña Hex Dump para ver bytes UTF-8 brutos en un formato tradicional de hexdump similar a xxd.
Casos de uso comunes
Explorador de codificación de texto — inspector de bytes Unicode, UTF-8 y UTF-16
Inspeccione secuencias de bytes para diagnosticar mojibake, exhibición incorrecta de caracteres o incompatibilidades de codificación entre sistemas.
Explorador de codificación de texto — inspector de bytes Unicode, UTF-8 y UTF-16
Vea exactamente como caracteres CJK, emojadas y letras acentuadas se codifican en UTF-8 y UTF-16.
Explorador de codificación de texto — inspector de bytes Unicode, UTF-8 y UTF-16
Compara los tamaños en bytes de UTF-8 y UTF-16 para elegir la codificación más eficiente para sus datos.
Explorador de codificación de texto — inspector de bytes Unicode, UTF-8 y UTF-16
Una referencia práctica para estudiantes y desarrolladores aprender cómo la codificación de texto funciona en el nivel de bytes.
Preguntas frecuentes
¿Cuál es la diferencia entre UTF-8 y UTF-16?
UTF-8 codifica caracteres usando 1 a 4 bytes, y caracteres ASCII ocupan solo 1 byte. UTF-16 usa 2 bytes para la mayoría de los caracteres comunes y 4 bytes para caracteres adicionales, como algunos emoct. UTF-8 es más eficiente para textos predominantemente latinos, mientras que UTF-16 puede ser más compacto para textos con muchos caracteres CJK.
¿Por qué algunos caracteres aparecen con varios bytes?
Caracteres fuera del intervalo ASCII, con code points por encima de U+007F, exigen varios bytes en UTF-8. Por ejemplo, los caracteres chinos normalmente usan 3 bytes en UTF-8, mientras que los emotes con code points por encima de U+FFFF usan 4 bytes tanto en UTF-8 como en UTF-16, en este último caso como pares sustitutos.
¿Mi texto se envía a algún servidor?
No. Toda el análisis de codificación ocurre localmente en el navegador a través de la API JavaScript TextEncoder. Ningún dato se transmite a servidores.