Estimador de tokens y contexto LLM

Pega el prompt y define el presupuesto de contexto. Los recuentos son estimaciones; el tokenizador y formato del modelo pueden dar otros totales.

Se ejecuta localmente en tu navegador
Es una estimación local y transparente, no un tokenizador exacto del proveedor. El prompt no se transmite.
Texto del prompt o mensaje

Planifica entrada y salida juntas

El límite de contexto suele incluir instrucciones de sistema, historial, mensajes de herramientas, prompt y salida generada. Conserva un margen para el framing y tokenizador del proveedor.

Cómo estimar los tokens y el contexto restante

Pega el prompt o el mensaje que vas a enviar, elige cómo debe contarse el texto y el panel muestra el tamaño estimado de la entrada, el presupuesto total que ocupará la petición y el espacio que queda en la ventana de contexto.

La estimación se recalcula en la página con cada tecla: el texto no sale del navegador y la calculadora sigue funcionando sin conexión.

  1. Pega o escribe el prompt en el cuadro de origen. El panel se actualiza mientras escribes; el botón Estimar uso solo fuerza otro cálculo.
  2. Elige el perfil que corresponda: Texto equilibrado para prosa, Mucho código cuando el prompt es sobre todo código y Multilingüe cuando mezcla alfabetos o es principalmente CJK.
  3. Indica la ventana de contexto del modelo al que apuntas, los tokens reservados para la respuesta y la sobrecarga por mensaje.
  4. Lee Total planificado como el presupuesto que ocupará la petición (entrada + reserva + sobrecarga) y Restantes como lo que queda libre.
  5. Vigila la barra: pasa a ámbar por encima del 85 % de la ventana y a rojo cuando el plan ya no cabe. Limpiar vacía el prompt y el resultado, pero conserva los valores del presupuesto.

Qué cubre la estimación y qué no

Cómo cuentan los tres perfiles

Texto equilibrado trata unas cuatro letras o dígitos latinos como un token, con pesos pequeños para la puntuación y los espacios. Mucho código cuenta las letras de forma más ajustada (unas 3,35 por token) y da más peso a la puntuación. Multilingüe parte de la longitud en bytes UTF-8 (unos 3,15 bytes por token) y suma los caracteres CJK casi uno a uno. Los emoji cuentan como unos dos tokens en todos los perfiles.

Una muestra lo deja claro: «Hello world» estima 3 tokens en Texto equilibrado y 4 en Mucho código o Multilingüe, mientras que «你好,世界» estima 5 tokens con solo 15 bytes. Por eso el perfil importa más que el número de caracteres.

El plan frente a la ventana de contexto

Total planificado = entrada estimada + salida reservada + sobrecarga de mensajes. Con los valores por defecto — ventana de 128.000, 4.096 reservados y 12 de sobrecarga — «Hello world» muestra 3 tokens de entrada y 4.111 planificados, con 123.889 libres: la barra queda en el 3,2 % de la ventana.

La barra se pone ámbar cuando el plan supera el 85 % de la ventana, señal de que una respuesta larga puede no caber, y roja con la etiqueta Exceso cuando los tokens planificados superan la ventana.

Por qué un tokenizador real puede dar otra cifra

Los números salen de una heurística sobre caracteres, alfabeto y bytes, no del vocabulario real del modelo. Cada tokenizador reparte el texto de forma distinta y cada versión tiene su propio vocabulario, así que toma el resultado como cifra de planificación y compara una petición real con el contador del proveedor cuando el presupuesto sea ajustado.

Deja margen para las instrucciones de sistema, el historial de conversación y los mensajes de herramientas que viajan con el prompt, y reserva suficientes tokens de salida para la respuesta que esperas.

Herramientas recientes: