Gewichteter Zeichenzähler

Dieser Zähler behält die bisherige Regel bei: Eine UTF-16-Codeeinheit von U+0000 bis U+00FF zählt 1, jede andere zählt 2. Sechs Werte werden während der Eingabe aktualisiert. Die gewichtete Summe ist weder Wortzahl noch Dateigröße.

Läuft lokal in deinem Browser

Eine gewichtete Summe prüfen

Füge Text ein oder tippe ihn direkt ein. Die Berechnung erfolgt automatisch im Browser und sendet den Text dafür nicht in Zählanfragen. Leeren entfernt die Eingabe und setzt sämtliche Werte zurück.

  1. Gib A你😀1 ein. Die gewichtete Summe beträgt 8: A und 1 zählen je 1, 你 zählt 2 und die beiden UTF-16-Codeeinheiten von 😀 zusammen 4.
  2. Die sechs Tabellenzeilen zeigen der Reihe nach 1, 2, 3, 2, 1 und 8. Alle Einheiten über U+00FF umfasst bereits den Han-Bereich und die übrigen Einheiten.
  3. Bearbeite den Text für neue Werte oder wähle Leeren. Danach stehen alle sechs Werte einschließlich der Summe auf 0.

Bereiche und Gewichtung

Teilmengen nicht doppelt addieren

Die Han-Zeile zählt jedes Vorkommen im Bereich U+4E00-U+9FA5, auch Wiederholungen. Das ist kein vollständiger Unicode-Han-Bereich. Andere Einheiten über U+00FF schließt diesen Bereich aus; Alle Einheiten über U+00FF fasst beide Gruppen zusammen.

U+0000-U+00FF umfasst unter anderem Latin-1-Buchstaben, ASCII-Satzzeichen, Leerzeichen und Steuerzeichen dieses Bereichs. ASCII-Ziffern zählt nur 0-9 und ist bereits darin enthalten. Die Summe lautet Einheiten U+0000-U+00FF + 2 × Einheiten über U+00FF. Die überlappenden Zeilen dürfen nicht nochmals addiert werden.

Sichtbare Zeichen können mehrere Einheiten haben

😀 hat hier zwei UTF-16-Codeeinheiten und das Gewicht 4. Die Familiensequenz 👨‍👩‍👧‍👦 besteht aus 11 Einheiten und erhält 22. Wörter und sichtbare Zeichen werden nicht segmentiert.

Eine Unicode-Normalisierung findet nicht statt: é zählt 1, e mit anschließendem U+0301 zählt 3. U+9FA6 gehört beispielsweise zu den anderen Einheiten über U+00FF. Diese Regeln erhalten die bisherigen Zählergebnisse.

Fragen zur gewichteten Textlänge

Zählen Leerzeichen und Zeilenumbrüche mit?

Ja. Leerzeichen, Tabulator und LF zählen jeweils 1. Das Eingabefeld wandelt tatsächliche CR- und CRLF-Zeilenenden in LF um. Ein eingefügter Windows-Zeilenumbruch zählt deshalb 1; der direkt aufgerufene Kern zählt unverändertes CRLF als zwei Einheiten.

Eignet sich die Summe für Wortgrenzen oder UTF-8-Bytegrenzen?

Nein. hello world ergibt 11 statt einer Wortzahl von 2. é erhält hier 1, benötigt in UTF-8 aber zwei Bytes. Maßgeblich ist nur die angezeigte Gewichtungsregel.

Wird HTML ausgewertet oder werden Han-Zeichen dedupliziert?

Der Text wird wörtlich gezählt: <b>A</b> ergibt 8, &amp; ergibt 5. Tags werden nicht gerendert und Zeichenreferenzen nicht dekodiert. Wiederholungen zählen mit; bei 你你 beträgt die Han-Zahl 2.

Zuletzt verwendet: