Contador ponderado de caracteres

El texto se mide con la fórmula original de esta página: cada unidad UTF-16 de U+0000 a U+00FF suma 1 y las demás suman 2. Los seis valores se actualizan al escribir. El total no representa palabras ni bytes de un archivo.

Se ejecuta localmente en tu navegador

Comprobar un ejemplo

Escribe o pega texto para obtener las seis estadísticas sin pulsar un botón de cálculo. El recuento se hace en el navegador, sin enviar la entrada en solicitudes de cálculo. Limpiar vacía el texto y pone todos los valores a cero.

  1. Introduce A你😀1. El total ponderado es 8: A y 1 aportan 1 cada uno, 你 aporta 2 y 😀 aporta 4 por sus dos unidades UTF-16.
  2. Las filas muestran 1, 2, 3, 2, 1 y 8, en ese orden. La fila con todas las unidades superiores a U+00FF ya contiene el subtotal Han y el de otras unidades.
  3. Modifica el texto para recalcularlo o pulsa Limpiar. También el total ponderado debe volver a 0.

Qué se cuenta en cada grupo

Los subtotales se solapan

La fila Han cuenta cada aparición entre U+4E00 y U+9FA5, ambos incluidos. No abarca todos los caracteres Han de Unicode. La fila de otras unidades superiores a U+00FF excluye ese rango, y la fila de todas las unidades reúne ambos grupos.

El intervalo U+0000-U+00FF incluye letras Latin-1, signos ASCII, espacios y controles de ese intervalo. Los dígitos ASCII son solo 0-9 y ya están incluidos en él. La fórmula es unidades U+0000-U+00FF + 2 × unidades superiores a U+00FF; sumar todas las filas duplicaría valores.

Una unidad no siempre es un carácter visible

😀 ocupa dos unidades UTF-16 y suma 4. La secuencia 👨‍👩‍👧‍👦 ocupa 11 unidades y suma 22. No se realiza segmentación de palabras ni de caracteres visibles.

No se normaliza Unicode: é suma 1, pero e seguida de U+0301 suma 3. Por ejemplo, U+9FA6 entra en el grupo de otras unidades superiores a U+00FF. Se mantiene así el criterio del contador anterior.

Dudas sobre la longitud ponderada

¿Se incluyen espacios y saltos de línea?

Sí. Espacio, tabulación y LF suman 1 cada uno. El área de texto convierte los saltos CR y CRLF reales en LF; un salto pegado desde Windows suma 1. El núcleo, usado directamente con CRLF, cuenta dos unidades.

¿Sirve para comprobar un límite de palabras o bytes UTF-8?

No. hello world tiene un total de 11, no de 2 palabras. é suma 1 aquí, aunque ocupa dos bytes en UTF-8. Solo se está aplicando la regla ponderada mostrada.

¿Interpreta HTML o elimina los Han repetidos?

No. <b>A</b> suma 8 y &amp; suma 5 porque se cuenta la escritura literal. No se renderizan etiquetas ni se decodifican referencias. En 你你, el recuento Han es 2.

Herramientas recientes: