Divisor de texto para RAG

Cole um documento e veja onde cada bloco começa e termina, quanto texto se sobrepõe e quantos tokens ele deve custar. O cálculo roda no navegador; nada é enviado nem vira embedding.

Funciona localmente no seu navegador
A fragmentação e a estimativa de tokens são locais. O conteúdo não é enviado, vetorizado nem repassado a um modelo.
Documento de origem

Ajuste limites antes de criar embeddings

Tamanho e sobreposição afetam recall, duplicação de contexto e custo. Avalie os fragmentos com perguntas representativas antes da produção.

Como usar o “Divisor de texto para RAG”

O divisor transforma um documento em unidades de recuperação determinísticas: janelas de caracteres, palavras separadas por espaços, frases ou seções de títulos Markdown, com sobreposição opcional entre blocos consecutivos.

Tudo roda na página. Os limites, as estimativas de caracteres e tokens e a exportação JSONL vêm do texto colado; a ferramenta não chama nenhum modelo de embeddings nem serviço remoto.

  1. Cole o documento no painel de origem e escolha uma estratégia: caracteres, palavras, frases ou seções Markdown.
  2. Defina o tamanho do bloco em unidades dessa estratégia e a sobreposição nas mesmas unidades; a sobreposição deve ser menor que o tamanho.
  3. Clique em Dividir documento. O pipeline mostra todos os blocos em ordem e o cartão de detalhes indica o intervalo de caracteres e os tokens estimados do bloco selecionado.
  4. Clique em Copiar JSONL para exportar um objeto JSON por bloco com id, texto, intervalo e tokens estimados.

Contexto e precisão

O que cada estratégia divide

Os caracteres são grupos de grafemas Unicode, então bandeiras emoji, famílias com ZWJ e acentos combinados nunca são cortados no meio. As palavras são tokens separados por espaços; cada caractere CJK conta como uma palavra, então chinês e japonês são divididos dentro de parágrafos sem espaços.

As frases terminam em . ! ? ou nos equivalentes de largura total, e linhas sem pontuação de frase são mantidas como unidades próprias em vez de descartadas. Seções Markdown começam em títulos ATX (# a ######); títulos dentro de blocos de código são ignorados, então um comentário de shell em um bloco ``` não vira limite de seção.

Limites, sobreposição e estimativas

Cada bloco é aparado até o primeiro e o último caractere não branco, e o intervalo informado corresponde exatamente ao texto. Com sobreposição N, cada bloco seguinte repete as últimas N unidades do bloco anterior, o que protege informações próximas a um limite.

A estimativa de tokens é uma heurística, não um tokenizador: caracteres CJK contam cerca de 1,05 token cada e outros alfabetos aproximadamente um token a cada quatro caracteres. Use-a para comparar estratégias e meça os tokens reais com o tokenizador do modelo que você for usar.

Usar a exportação JSONL

Copiar JSONL grava um objeto por bloco — id, text, start, end e estimated_tokens — na ordem de leitura. Os intervalos se referem ao texto original, então blocos sobrepostos podem ser mapeados de volta ao documento.

A exportação está pronta para um pipeline de embeddings, mas esta página não cria embeddings nem envia texto. Mantenha o JSONL local ou envie apenas ao serviço que você pretende usar.

Ferramentas recentes: