Codificadores & Conversores

Explorador de Codificação de Texto — Inspetor de Bytes Unicode, UTF-8 e UTF-16

Explore como textos são codificados em UTF-8, UTF-16 e code points Unicode. Veja os bytes de cada caractere, dumps hexadecimais e estatísticas de codificação. Ferramenta online gratuita que funciona inteiramente no navegador.

Uso gratuito Sem cadastro Funciona no navegador

Área da ferramenta

12
Caracteres
19
Bytes UTF-8
26
Bytes UTF-16
CharCode PointUTF-8UTF-16DecimalName
HU+00484800 4872ASCII printable
eU+00656500 65101ASCII printable
lU+006C6C00 6C108ASCII printable
lU+006C6C00 6C108ASCII printable
oU+006F6F00 6F111ASCII printable
,U+002C2C00 2C44ASCII printable
U+00202000 2032Space
U+4E16E4 B8 964E 1619990U+4E16
U+754CE7 95 8C75 4C30028U+754C
!U+00212100 2133ASCII printable
U+00202000 2032Space
🌍U+1F30DF0 9F 8C 8DD8 3C DF 0D127757U+1F30D

O que é codificação de texto?

Codificação de texto é o processo de converter caracteres em sequências de bytes que computadores podem armazenar e transmitir. O Unicode atribui um code point exclusivo a cada caractere de todos os sistemas de escrita. UTF-8 e UTF-16 são os dois formatos de codificação mais usados: UTF-8 utiliza de 1 a 4 bytes por caractere e predomina na web, enquanto UTF-16 utiliza 2 ou 4 bytes e é empregado internamente por JavaScript, Java e Windows. Esta ferramenta permite inspecionar exatamente como cada caractere do texto é representado nessas codificações, exibindo code points, sequências de bytes e um dump hexadecimal.

Como usar o explorador de codificação de texto

  1. 1Digite ou cole o texto no campo de entrada. A ferramenta fornece uma amostra padrão com caracteres ASCII, CJK e emojis.
  2. 2Consulte a tabela de caracteres para ver o code point Unicode, os bytes UTF-8, os bytes UTF-16 e o valor decimal de cada caractere.
  3. 3Confira nas estatísticas resumidas o total de caracteres e as quantidades de bytes UTF-8 e UTF-16.
  4. 4Acesse a aba Hex Dump para ver os bytes UTF-8 brutos em um formato tradicional de hexdump semelhante ao xxd.

Casos de uso comuns

Depuração de problemas de codificação

Inspecione sequências de bytes para diagnosticar mojibake, exibição incorreta de caracteres ou incompatibilidades de codificação entre sistemas.

Compreensão de caracteres multibyte

Veja exatamente como caracteres CJK, emojis e letras acentuadas são codificados em UTF-8 e UTF-16.

Estimativa de armazenamento e largura de banda

Compare os tamanhos em bytes de UTF-8 e UTF-16 para escolher a codificação mais eficiente para seus dados.

Aprendizado dos fundamentos de Unicode e codificação

Uma referência prática para estudantes e desenvolvedores aprenderem como a codificação de texto funciona no nível dos bytes.

Perguntas frequentes

Qual é a diferença entre UTF-8 e UTF-16?

UTF-8 codifica caracteres usando de 1 a 4 bytes, e caracteres ASCII ocupam apenas 1 byte. UTF-16 usa 2 bytes para a maioria dos caracteres comuns e 4 bytes para caracteres suplementares, como alguns emojis. UTF-8 é mais eficiente para textos predominantemente latinos, enquanto UTF-16 pode ser mais compacto para textos com muitos caracteres CJK.

Por que alguns caracteres aparecem com vários bytes?

Caracteres fora do intervalo ASCII, com code points acima de U+007F, exigem vários bytes em UTF-8. Por exemplo, caracteres chineses normalmente usam 3 bytes em UTF-8, enquanto emojis com code points acima de U+FFFF usam 4 bytes tanto em UTF-8 quanto em UTF-16, neste último caso como pares substitutos.

Meu texto é enviado para algum servidor?

Não. Toda a análise de codificação acontece localmente no navegador por meio da API JavaScript TextEncoder. Nenhum dado é transmitido a servidores.