Chat-Datensatz-Validator

Fügen Sie den Datensatz für Strukturprüfung und grobe Token-Schätzung ein. Die Prüfung garantiert keine Annahme durch einen Trainingsanbieter.

Läuft lokal in deinem Browser
Datensätze werden nur in diesem Browser verarbeitet. Trainingsdaten werden nicht hochgeladen und providerspezifische Annahme wird nicht versprochen.
JSONL-Datensatz

Struktur vor dem Hochladen von Trainingsdaten prüfen

Geprüft werden JSONL-Syntax, Rollen, Inhalte, Assistant-Beispiele, Duplikate und ungefähre Größe. Zusätzlich immer den aktuellen Validator des Zielanbieters ausführen.

So validieren Sie ein JSONL-Dataset mit Chat- oder prompt/completion-Zeilen

Fügen Sie JSONL ein, bei dem jede Zeile ein Trainingsdatensatz ist: entweder ein Chat-Objekt mit messages-Array oder ein prompt/completion-Paar. Der Validator meldet fehlerhafte Zeilen mit Zeilennummer, markiert Duplikate, schätzt die Text-Tokens des Sets und gibt nur die bestandenen Zeilen zurück.

Die Prüfung läuft in diesem Browser-Tab. Der Datensatz wird nicht hochgeladen, und das Werkzeug funktioniert nach dem Laden der Seite auch offline.

  1. Fügen Sie Ihr JSONL in den Editor ein — ein JSON-Objekt pro Zeile — oder klicken Sie auf Beispiel laden, um mit drei geprüften Datensätzen zu starten.
  2. Klicken Sie auf Datensatz prüfen. Leere Eingaben werden gemeldet, bevor die Analyse beginnt.
  3. Lesen Sie die Befunde: Jedes Problem nennt seine Zeilennummer, und ein Datensatz fällt nur bei Fehlern aus der normalisierten Ausgabe, nicht bei Warnungen.
  4. Klicken Sie auf Normalisiertes JSONL kopieren, um die gültigen Zeilen kompakt als ein Objekt pro Zeile zu übernehmen.
  5. Klicken Sie auf Leeren, um Editor und Zähler für den nächsten Datensatz zurückzusetzen.

Was der Validator Zeile für Zeile prüft

Akzeptierte Datensatzformen

Ein Datensatz mit messages-Array braucht mindestens einen Eintrag; jeder Eintrag benötigt eine Rolle system, developer, user, assistant oder tool und einen content, der entweder eine nicht leere Zeichenkette oder ein Array von {type:"text",text}-Teilen ist, deren Text sich zu etwas Nichtleerem verbindet. Ein Datensatz mit prompt und completion muss beide als nicht leere Zeichenketten setzen. Eine Zeile, die keiner Form entspricht, wird als unbekanntes Schema gemeldet.

Datensätze ohne Assistant-Beitrag bleiben in der Ausgabe, werden aber mit einer Warnung markiert, und die Duplikaterkennung vergleicht Datensätze über eine kanonische Form mit sortierten Schlüsseln: derselbe Inhalt mit umsortierten Schlüsseln zählt weiterhin als Duplikat. Im Test validierten alle genannten Formen wie erwartet, einschließlich Array-content sowie der Rollen tool und developer.

Wie die Token-Schätzung funktioniert

Die Token-Zahl ist eine Schätzung, kein Tokenizer-Lauf: Das Werkzeug teilt Nicht-CJK-Zeichen durch vier, zählt CJK-Zeichen mit etwa einem Token und rundet auf. Es ist dieselbe Heuristik wie auf den übrigen AI-Lab-Seiten; sie dient der Planung, nicht der exakten Abrechnung.

Fehler, Warnungen und Duplikate werden in der Metrik-Zeile getrennt gezählt. Ein Duplikat ist nur eine Warnung, daher bleiben doppelte Zeilen in der kopierten Ausgabe — gleichen Sie die Kopie mit der Befundliste ab, wenn Sie sie entfernen wollen.

Grenzen und praktische Hinweise

Die Prüfung ist strukturell: Sie kennt kein exaktes Anbieterschema, ein hier bestandener Datensatz kann also von einer bestimmten Fine-Tuning-API trotzdem abgelehnt werden. Führen Sie vor dem Erstellen eines Jobs immer die aktuellen Prüfungen und Richtlinien-Checks des Zielanbieters aus.

Die Datei wird in einem Durchgang geparst; im Test wurden 2000 Datensätze in wenigen hundert Millisekunden geprüft, mehrere Megabyte funktionieren also meist, und deutlich größere Sets gehören in eine lokale Kommandozeilen-Pipeline. CRLF-Zeilenenden und eine führende Bytereihenfolge-Markierung werden akzeptiert.

Zuletzt verwendet: