Validar datasets de chat

Pega el dataset para comprobar su estructura y estimar tokens de texto. La revisión no garantiza la aceptación por un proveedor de entrenamiento.

Se ejecuta localmente en tu navegador
Los registros se procesan solo en este navegador. No se suben datos ni se promete compatibilidad específica con un proveedor.
Dataset JSONL

Valida la estructura antes de subir datos de entrenamiento

La comprobación cubre sintaxis JSONL, roles, contenido, ejemplos de assistant, duplicados y tamaño aproximado. Ejecuta también el validador actual del proveedor final.

Cómo validar un dataset JSONL de chat o prompt/completion

Pega JSONL donde cada línea sea un registro de entrenamiento: un objeto de chat con un array messages, o un par prompt/completion. El validador señala las líneas mal formadas con su número de línea, marca los registros duplicados, estima los tokens de texto del conjunto y devuelve solo las filas que han pasado.

La revisión se ejecuta en esta pestaña. El dataset no se sube a ningún sitio y la herramienta sigue funcionando sin conexión una vez cargada la página.

  1. Pega tu JSONL en el editor —un objeto JSON por línea— o pulsa Cargar ejemplo para empezar con tres registros correctos.
  2. Pulsa Validar dataset. Si no hay nada escrito, se avisa antes de analizar.
  3. Revisa la lista de Hallazgos: cada problema indica su número de línea, y un registro solo queda fuera de la salida normalizada por errores, no por avisos.
  4. Pulsa Copiar JSONL normalizado para llevarte las filas válidas, compactadas a un objeto por línea.
  5. Pulsa Limpiar para vaciar el editor y reiniciar los contadores antes del siguiente dataset.

Qué revisa el validador, línea a línea

Formas de registro aceptadas

Un registro con array messages debe tener al menos una entrada; cada entrada necesita un role system, developer, user, assistant o tool, y un content que sea una cadena no vacía o un array de partes {type:"text",text} cuyo texto se una en algo no vacío. Un registro con prompt y completion debe tener ambos como cadenas no vacías. Una línea que no encaje en ninguna forma se reporta como esquema desconocido.

Los registros sin turno de assistant se conservan en la salida pero se marcan con un aviso, y la detección de duplicados compara los registros por una forma canónica con claves ordenadas: el mismo contenido con las claves reordenadas sigue contando como duplicado. En las pruebas, todas las formas anteriores validaron como se esperaba, incluido el content en array y los roles tool y developer.

Cómo se calculan los tokens

El recuento de tokens es una estimación, no una ejecución de tokenizador: la herramienta divide entre cuatro los caracteres no CJK, cuenta los caracteres CJK a razón de un token cada uno y redondea hacia arriba. Es la misma heurística de las demás páginas del laboratorio de IA; sirve para planificar, no para facturar al céntimo.

Los errores, los avisos y los duplicados se cuentan por separado en la fila de métricas. Un duplicado es solo un aviso, así que las filas duplicadas permanecen en la salida copiada: cruza la copia con la lista de Hallazgos cuando quieras eliminarlas.

Límites y notas prácticas

La validación es estructural: no conoce el esquema exacto de ningún proveedor, así que un dataset que pase aquí todavía puede ser rechazado por una API de fine-tuning concreta. Ejecuta siempre la validación y las comprobaciones de política actuales del proveedor final antes de crear un trabajo.

El archivo se analiza en una sola pasada; en las pruebas se validaron 2000 registros en unos cientos de milisegundos, así que los conjuntos de varios megabytes suelen funcionar, y los mucho más grandes es mejor tratarlos con una tubería local en línea de comandos. Se aceptan finales de línea CRLF y un BOM inicial.

Herramientas recientes: