Estimador de tokens e contexto LLM

Cole o prompt e defina o limite de contexto. As contagens são estimativas; o tokenizador e o formato do modelo podem gerar outros totais.

Funciona localmente no seu navegador
Esta é uma estimativa local e transparente, não o tokenizador exato do provedor. O prompt não é transmitido.
Texto do prompt ou mensagem

Planeje entrada e saída em conjunto

O limite de contexto costuma incluir instruções de sistema, histórico, mensagens de ferramentas, prompt e saída. Mantenha margem para o framing e tokenizador do provedor.

Como estimar tokens e o contexto restante

Cole o prompt ou a mensagem que você vai enviar, escolha como o texto deve ser contado e o painel mostra o tamanho estimado da entrada, o orçamento total que a requisição deve ocupar e o espaço que sobra na janela de contexto.

A estimativa é recalculada na página a cada tecla: o texto não sai do navegador e a calculadora continua funcionando sem conexão.

  1. Cole ou digite o prompt na caixa de origem. O painel é atualizado enquanto você digita; o botão Estimar uso apenas força um novo cálculo.
  2. Escolha o perfil que combina com o texto: Texto equilibrado para prosa, Código predominante quando o prompt é quase todo código e Multilíngue quando mistura alfabetos ou é principalmente CJK.
  3. Informe a janela de contexto do modelo desejado, os tokens reservados para a resposta e a sobrecarga por mensagem.
  4. Leia Total planejado como o orçamento que a requisição vai ocupar (entrada + reserva + sobrecarga) e Restantes como o que sobra livre.
  5. Acompanhe a barra: ela fica âmbar acima de 85 % da janela e vermelha quando o plano já não cabe. Limpar esvazia o prompt e o resultado, mas mantém os valores do orçamento.

O que a estimativa cobre e o que ela não cobre

Como os três perfis contam

Texto equilibrado trata cerca de quatro letras ou dígitos latinos como um token, com pesos pequenos para pontuação e espaços. Código predominante conta as letras de forma mais apertada (cerca de 3,35 por token) e dá mais peso à pontuação. Multilíngue parte do comprimento em bytes UTF-8 (cerca de 3,15 bytes por token) e soma os caracteres CJK quase um a um. Emojis contam como cerca de dois tokens em todos os perfis.

Uma amostra mostra a diferença: “Hello world” estima 3 tokens em Texto equilibrado e 4 em Código predominante ou Multilíngue, enquanto “你好,世界” estima 5 tokens com apenas 15 bytes. Por isso o perfil importa mais do que a contagem de caracteres.

O plano diante da janela de contexto

Total planejado = entrada estimada + saída reservada + sobrecarga de mensagens. Com os valores padrão — janela de 128.000, 4.096 reservados e 12 de sobrecarga — “Hello world” mostra 3 tokens de entrada e 4.111 planejados, deixando 123.889 livres: a barra fica em 3,2 % da janela.

A barra fica âmbar quando o plano passa de 85 % da janela, sinal de que uma resposta longa pode não caber, e vermelha com o rótulo Excesso quando os tokens planejados ultrapassam a janela.

Por que um tokenizador real pode discordar

Os números vêm de uma heurística sobre caracteres, escrita e bytes, não do vocabulário que o modelo realmente usa. Cada tokenizador divide o texto de forma diferente e cada versão tem seu próprio vocabulário; trate o resultado como número de planejamento e compare uma requisição real com o contador do provedor quando o orçamento for apertado.

Reserve margem para instruções de sistema, histórico da conversa e mensagens de ferramentas que viajam com o prompt, além de tokens de saída suficientes para a resposta esperada.

Ferramentas recentes: