Was ist Text Encoding?
Textcodierung ist der Prozess der Umwandlung von Zeichen in Folge von Bytes, die Computer speichern und übertragen können. Unicode weist jedem Zeichen in jedem Skript einen eindeutigen Codepunkt zu. UTF-8 und UTF-16 sind die beiden am häufigsten verwendeten Kodierungsformate: UTF-8 verwendet 1-4 Bytes pro Zeichen und ist die dominierende Kodierung im Web, während UTF-16 2 oder 4 Bytes verwendet und intern von JavaScript, Java und Windows verwendet wird. Mit diesem Tool können Sie genau untersuchen, wie jedes Zeichen in Ihrem Text in diesen Codierungen dargestellt wird, wobei Codepunkte, Bytesequenzen und eine Hex-Dump-Ansicht angezeigt werden.
So verwenden Sie den Text-Encoder-Explorer
- 1Geben Sie Text ein oder fügen Sie ihn in das Eingabefeld ein. Ein Standardbeispiel mit ASCII-, CJK- und Emoji-Zeichen wird bereitgestellt.
- 2Sehen Sie sich die Zeichentabelle an, um den Unicode-Codepunkt jedes Zeichens, UTF-8-Bytes, UTF-16-Bytes und den Dezimalwert zu sehen.
- 3Überprüfen Sie die Zusammenfassungsstatistiken für die Gesamtzahl der Zeichen, die Anzahl der UTF-8-Byte und die Anzahl der UTF-16-Byte.
- 4Wechseln Sie zur Registerkarte Hex Dump, um die rohen UTF-8-Bytes in einem traditionellen Hexdump-Format ähnlich wie xxd zu sehen.
Häufige Anwendungsfälle
Debugging-Codierungsprobleme
Überprüfen Sie Byte-Sequenzen, um Mojibake, falsche Zeichendarstellung oder Kodierungsfehler zwischen Systemen zu diagnostizieren.
Multibytezeichen verstehen
Sehen Sie genau, wie CJK-Zeichen, Emoji und akzentuierte Buchstaben in UTF-8 vs UTF-16 codiert sind.
Schätzung von Speicher und Bandbreite
Vergleichen Sie die Bytegrößen UTF-8 und UTF-16, um die effizienteste Kodierung für Ihre Daten auszuwählen.
Lernen Unicode und Kodierung Grundlagen
Eine praktische Referenz für Studenten und Entwickler, die lernen, wie Textcodierung auf Byte-Ebene funktioniert.
Häufig gestellte Fragen
Was ist der Unterschied zwischen UTF-8 und UTF-16?
UTF-8 codiert Zeichen mit 1 bis 4 Bytes, wobei ASCII-Zeichen nur 1 Byte einnehmen. UTF-16 verwendet 2 Bytes für die häufigsten Zeichen und 4 Bytes für ergänzende Zeichen (wie einige Emoji). UTF-8 ist effizienter für Latein-schweren Text, während UTF-16 kompakter für CJK-schweren Text sein kann.
Warum zeigen einige Zeichen mehrere Bytes?
Zeichen außerhalb des ASCII-Bereichs (Codepunkte über U+007F) erfordern mehrere Bytes in UTF-8. Zum Beispiel verwenden chinesische Zeichen typischerweise 3 Bytes in UTF-8, und Emoji mit Codepunkten über U+FFFF verwenden 4 Bytes in UTF-8 und UTF-16 (als Ersatzpaare).
Wird mein Text an einen Server gesendet?
Nein. Die gesamte Codierungsanalyse erfolgt vollständig in Ihrem Browser mit dem JavaScript TextEncoder API. Es werden keine Daten an einen Server übertragen.