O que é codificação de texto?
Codificação de texto é o processo de converter caracteres em sequências de bytes que computadores podem armazenar e transmitir. O Unicode atribui um code point exclusivo a cada caractere de todos os sistemas de escrita. UTF-8 e UTF-16 são os dois formatos de codificação mais usados: UTF-8 utiliza de 1 a 4 bytes por caractere e predomina na web, enquanto UTF-16 utiliza 2 ou 4 bytes e é empregado internamente por JavaScript, Java e Windows. Esta ferramenta permite inspecionar exatamente como cada caractere do texto é representado nessas codificações, exibindo code points, sequências de bytes e um dump hexadecimal.
Como usar o explorador de codificação de texto
- 1Digite ou cole o texto no campo de entrada. A ferramenta fornece uma amostra padrão com caracteres ASCII, CJK e emojis.
- 2Consulte a tabela de caracteres para ver o code point Unicode, os bytes UTF-8, os bytes UTF-16 e o valor decimal de cada caractere.
- 3Confira nas estatísticas resumidas o total de caracteres e as quantidades de bytes UTF-8 e UTF-16.
- 4Acesse a aba Hex Dump para ver os bytes UTF-8 brutos em um formato tradicional de hexdump semelhante ao xxd.
Casos de uso comuns
Depuração de problemas de codificação
Inspecione sequências de bytes para diagnosticar mojibake, exibição incorreta de caracteres ou incompatibilidades de codificação entre sistemas.
Compreensão de caracteres multibyte
Veja exatamente como caracteres CJK, emojis e letras acentuadas são codificados em UTF-8 e UTF-16.
Estimativa de armazenamento e largura de banda
Compare os tamanhos em bytes de UTF-8 e UTF-16 para escolher a codificação mais eficiente para seus dados.
Aprendizado dos fundamentos de Unicode e codificação
Uma referência prática para estudantes e desenvolvedores aprenderem como a codificação de texto funciona no nível dos bytes.
Perguntas frequentes
Qual é a diferença entre UTF-8 e UTF-16?
UTF-8 codifica caracteres usando de 1 a 4 bytes, e caracteres ASCII ocupam apenas 1 byte. UTF-16 usa 2 bytes para a maioria dos caracteres comuns e 4 bytes para caracteres suplementares, como alguns emojis. UTF-8 é mais eficiente para textos predominantemente latinos, enquanto UTF-16 pode ser mais compacto para textos com muitos caracteres CJK.
Por que alguns caracteres aparecem com vários bytes?
Caracteres fora do intervalo ASCII, com code points acima de U+007F, exigem vários bytes em UTF-8. Por exemplo, caracteres chineses normalmente usam 3 bytes em UTF-8, enquanto emojis com code points acima de U+FFFF usam 4 bytes tanto em UTF-8 quanto em UTF-16, neste último caso como pares substitutos.
Meu texto é enviado para algum servidor?
Não. Toda a análise de codificação acontece localmente no navegador por meio da API JavaScript TextEncoder. Nenhum dado é transmitido a servidores.