Konverter für dezimale Zeichenreferenzen

Wandeln Sie Text in dezimale HTML-Zeichenreferenzen um oder lesen Sie numerische Referenzen und unterstützte \uXXXX-Sequenzen innerhalb eines Textes. Es geht um Unicode-Zeichenreferenzen, nicht um ASCII-Bytes oder reine Zahlenlisten.

Läuft lokal in deinem Browser

Text und eingebettete Referenzen umwandeln

Fügen Sie den Inhalt direkt ein. Die Umwandlung läuft im Browser, ohne die Eingabe per Netzwerkanfrage zu senden. Dateiimport und Stapelverarbeitung sind nicht vorgesehen.

  1. Geben Sie Text zum Kodieren oder Text mit Referenzen zum Dekodieren ein und starten Sie die entsprechende Aktion.
  2. Prüfen und kopieren Sie die Textausgabe. Eine Eingabeänderung oder ein Konvertierungsfehler löscht das alte Ergebnis und deaktiviert das Kopieren.
  3. Für eine weitere Umwandlung fügen Sie das Ergebnis selbst in die Eingabe ein. Leeren setzt beide Felder zurück.

Dezimalausgabe und gezielte Erkennung

Vollständige Codepunkte statt Surrogatreferenzen

A你😀 ergibt A你😀. Das Emoji wird als ganzer Codepunkt dargestellt, nicht als zwei Surrogatreferenzen. Auch Buchstaben und Leerzeichen werden kodiert: é als é, ein Leerzeichen als   und LF als 
. Die Ausgabe verwendet keine benannten Referenzen.

Drei Schreibweisen im selben Eingabetext

Erkannt werden dezimale Referenzen wie A, hexadezimale wie A oder A sowie \u mit kleinem u und vier folgenden Hexadezimalziffern, etwa \u0041. Numerische Referenzen benötigen ein Semikolon. Bei Hexadezimalziffern sind Groß- und Kleinschreibung erlaubt; umgebender Klartext bleibt erhalten.

😀, 😀 und das Paar \uD83D\uDE00 ergeben jeweils 😀. Es werden einzelne Sequenzen umgewandelt, keine vollständigen JS/JSON-Zeichenfolgen geparst und kein HTML ausgeführt.

HTML-Regeln und Unicode-Sequenzen

he 1.2.0 prüft beim Kodieren und beim Dekodieren numerischer Referenzen die strikten HTML-Regeln. Referenzen wie �, €, � und � werden abgelehnt. Beim Kodieren gilt das auch für NUL, C1-Steuerzeichen wie U+0080, U+FFFF und ungepaarte Surrogate.

Für den \uXXXX-Zweig gelten diese HTML-Prüfungen nicht: \u0000 und \uFFFF werden zu ihren Codeeinheiten dekodiert. Die abschließende Ausgabeprüfung weist nur ungepaarte Surrogate zurück.

Die alte Schreibweise �� wird abgelehnt, nicht zusammengesetzt. Verwenden Sie für dieses Emoji 😀.

Fragen zu numerischen Zeichenreferenzen

Warum bleibt scheinbar fehlerhafte Syntax manchmal stehen?

Nur die drei erkannten Formen werden verarbeitet. \uZZZZ, \u{41}, \U0041, &#xZZ; und &#65 ohne Semikolon bleiben wörtlicher Text. Das gilt auch für &, Zahlen wie 65 66 und \n. Das Werkzeug validiert nicht jede denkbare Fehlschreibweise und dekodiert keine UTF-8-Bytes.

Werden verschachtelte Referenzen vollständig aufgelöst?

Nicht in einem Durchlauf. Sowohl A als auch \u0026#65; werden zum wörtlichen Text A, nicht zu A. Ersetzungstext wird nicht erneut durchsucht.

Was geschieht mit Leerraum und leerer Eingabe?

Leerraum wird nicht abgeschnitten und Unicode nicht normalisiert; leere Eingaben ergeben leere Ausgaben. Das Textarea-Feld vereinheitlicht tatsächliche CRLF/CR-Zeilenenden zu LF. Der Kern kann CR als 
 kodieren, doch die strikte numerische Dekodierung lehnt 
 ab. Nicht jede Eingabe lässt sich unverändert zurückwandeln.

Zuletzt verwendet: