Validar datasets de chat

Cole o dataset para analisar a estrutura e estimar tokens de texto. A verificação não garante aceitação pelo provedor de treinamento.

Funciona localmente no seu navegador
Os registros são processados apenas neste navegador. Nada é enviado e não há promessa de aceitação específica de um provedor.
Dataset JSONL

Valide a estrutura antes de enviar dados de treinamento

A verificação cobre sintaxe JSONL, papéis, conteúdo, exemplos assistant, duplicados e tamanho aproximado. Use também o validador atual do provedor final.

Como validar um dataset JSONL de chat ou prompt/completion

Cole JSONL em que cada linha seja um registro de treinamento: um objeto de chat com um array messages, ou um par prompt/completion. O validador aponta as linhas malformadas com o número da linha, marca registros duplicados, estima os tokens de texto do conjunto e devolve apenas as linhas aprovadas.

A verificação roda nesta aba do navegador. O dataset não é enviado a lugar nenhum e a ferramenta continua funcionando offline depois que a página carrega.

  1. Cole o JSONL no editor —um objeto JSON por linha— ou clique em Carregar exemplo para começar com três registros corretos.
  2. Clique em Validar dataset. Se não houver nada escrito, o aviso aparece antes de qualquer análise.
  3. Leia a lista de Achados: cada problema indica o número da linha, e um registro só sai da saída normalizada por erros, não por avisos.
  4. Clique em Copiar JSONL normalizado para levar as linhas válidas, compactadas em um objeto por linha.
  5. Clique em Limpar para esvaziar o editor e zerar os contadores antes do próximo dataset.

O que o validador confere, linha a linha

Formatos de registro aceitos

Um registro com array messages precisa ter pelo menos um item; cada item exige um role system, developer, user, assistant ou tool, e um content que seja uma string não vazia ou um array de partes {type:"text",text} cujo texto se junte em algo não vazio. Um registro com prompt e completion precisa dos dois como strings não vazias. Uma linha que não se encaixe em nenhum formato é reportada como esquema desconhecido.

Registros sem turno de assistant são mantidos na saída, mas marcados com um aviso, e a detecção de duplicatas compara os registros por uma forma canônica com chaves ordenadas: o mesmo conteúdo com chaves reordenadas ainda conta como duplicata. Nos testes, todos os formatos acima validaram como esperado, incluindo content em array e os papéis tool e developer.

Como os tokens são estimados

A contagem de tokens é uma estimativa, não uma execução de tokenizer: a ferramenta divide por quatro os caracteres não CJK, conta os caracteres CJK como cerca de um token cada e arredonda para cima. É a mesma heurística das demais páginas do laboratório de IA; serve para planejar, não para faturar com precisão.

Erros, avisos e duplicatas são contados separadamente na linha de métricas. Uma duplicata é só um aviso, então linhas duplicadas permanecem na saída copiada — cruze a cópia com a lista de Achados quando quiser removê-las.

Limites e notas práticas

A validação é estrutural: ela não conhece o esquema exato de nenhum provedor, então um dataset aprovado aqui ainda pode ser recusado por uma API de fine-tuning específica. Rode sempre a validação e as checagens de política atuais do provedor de destino antes de criar um job.

O arquivo é analisado em uma única passada; nos testes, 2000 registros passaram em algumas centenas de milissegundos, então conjuntos de vários megabytes costumam funcionar, e os muito maiores é melhor tratar em um pipeline local de linha de comando. Finais de linha CRLF e um BOM inicial são aceitos.

Ferramentas recentes: