Unicode Escapen & Unescapen

Wandeln Sie Text in Unicode-Escape-Sequenzen wie \u0041 um oder dekodieren Sie Escape-Sequenzen zurück in Zeichen. Nützlich für die Arbeit mit internationalisierten Zeichenketten in Code.

Funktionen

Format \uXXXX
Format \UXXXXXXXX
Format &#xHHHH;
Format &#DDDD;

Anleitung

1. Wählen Sie den Modus Escapen oder Unescapen.

2. Fügen Sie Ihren Text in die Eingabe ein.

3. Das Ergebnis erscheint rechts — klicken Sie auf Kopieren.

Über dieses Werkzeug

Mit Unicode-Escapes lässt sich jedes Zeichen nur mit ASCII schreiben – nützlich in Quellcode, JSON, Konfigurationsdateien und HTML, wo es auf die exakten Bytes ankommt. Dieses Werkzeug wandelt Text in vier Formate und zurück: \uXXXX wie in JavaScript, JSON und Java, wobei Zeichen jenseits von U+FFFF wie Emojis zu Surrogatpaaren werden; \UXXXXXXXX mit acht Hexziffern für den vollständigen Codepoint wie in Python und C; sowie die numerischen HTML-Referenzen &#xHHHH; und &#DDDD;. Nur Nicht-ASCII-Zeichen werden maskiert, gewöhnliche Buchstaben und Ziffern bleiben also lesbar. Beim Zurückwandeln wird das gewählte Format erkannt und die Sequenzen werden wieder zu Zeichen; fügen Sie im Maskierungsmodus bereits maskierten Text ein, wechselt das Werkzeug automatisch die Richtung.

Häufig gestellte Fragen

Was ist der Unterschied zwischen \u- und \U-Escapes?
Auf \u folgen vier Hexziffern, die eine UTF-16-Codeeinheit darstellen; Zeichen oberhalb von U+FFFF brauchen daher zwei Escapes (ein Surrogatpaar). Auf \U folgen acht Hexziffern, die direkt einen vollständigen Codepoint darstellen, wie es Python und C unterstützen.
Warum wird ein Emoji zu zwei \u-Escapes?
Emojis wie 😀 (U+1F600) liegen außerhalb der Basic Multilingual Plane. In UTF-16, das JavaScript und Java verwenden, werden sie als hohes und niedriges Surrogat gespeichert, zum Beispiel \ud83d\ude00.
Wann sollte ich &#x; oder &#; in HTML verwenden?
Auf UTF-8-Seiten können Sie Zeichen meist direkt schreiben. Numerische Referenzen helfen, wenn ein System Nicht-ASCII-Text entfernt, wenn Sie ein unsichtbares Zeichen wie ein geschütztes Leerzeichen brauchen oder in XML-Dateien mit eingeschränkter Kodierung.
Ist Unicode-Maskierung dasselbe wie URL-Kodierung?
Nein. URL-Kodierung wandelt die UTF-8-Bytes eines Zeichens in %XX-Sequenzen um, aus ü wird also %C3%BC. Unicode-Maskierung schreibt den Codepoint, aus ü wird also \u00fc oder ü.
Warum lassen sich manche maskierten Strings nicht zurückwandeln?
Die Sequenzen müssen exakt dem gewählten Format entsprechen. Ein einzelnes Surrogat, fehlende Ziffern oder gemischte Formate wie \u00fc neben ü im selben Text lassen diese Stellen unverändert.

Verwandte Werkzeuge