RAG-Text-Chunker

Fügen Sie ein Dokument ein und sehen Sie, wo jeder Chunk beginnt und endet, wie viel Text sich überlappt und wie viele Tokens er ungefähr kostet. Die Berechnung läuft im Browser; nichts wird hochgeladen oder eingebettet.

Läuft lokal in deinem Browser
Chunking und Token-Schätzung laufen lokal. Inhalte werden weder hochgeladen noch eingebettet oder an ein Modell gesendet.
Quelldokument

Chunk-Grenzen vor dem Embedding abstimmen

Größe und Überlappung beeinflussen Retrieval-Recall, Kontextduplikate und Kosten. Chunks vor dem Produktiveinsatz mit repräsentativen Fragen evaluieren.

So verwenden Sie den „RAG-Text-Chunker“

Der Chunker zerlegt ein Dokument in deterministische Abrufeinheiten: Zeichenfenster, durch Leerzeichen getrennte Wörter, Sätze oder Markdown-Abschnitte, optional mit Überlappung zwischen aufeinanderfolgenden Chunks.

Alles läuft in der Seite. Chunk-Grenzen, Zeichen- und Token-Schätzungen und der JSONL-Export stammen aus dem eingefügten Text; die Seite ruft kein Embedding-Modell und keinen entfernten Dienst auf.

  1. Fügen Sie das Dokument in das Quellfeld ein und wählen Sie eine Strategie: Zeichen, Wörter, Sätze oder Markdown-Abschnitte.
  2. Legen Sie die Chunk-Größe in Einheiten dieser Strategie und die Überlappung in denselben Einheiten fest; die Überlappung muss kleiner als die Größe bleiben.
  3. Klicken Sie auf Dokument aufteilen. Die Pipeline listet alle Chunks der Reihe nach und die Detailkarte zeigt Zeichenbereich und Token-Schätzung des ausgewählten Chunks.
  4. Klicken Sie auf JSONL kopieren, um pro Chunk ein JSON-Objekt mit id, Text, Bereich und geschätzten Tokens zu exportieren.

Hintergrund und Genauigkeit

Was die einzelnen Strategien trennen

Zeichen sind Unicode-Graphemcluster, daher werden Emoji-Flaggen, ZWJ-Familien und kombinierende Akzente nie zerschnitten. Wörter sind durch Leerzeichen getrennte Einheiten; jedes CJK-Zeichen zählt als ein Wort, sodass chinesischer und japanischer Text auch in Absätzen ohne Leerzeichen aufgeteilt wird.

Sätze enden bei . ! ? oder den Vollbreiten-Entsprechungen, und Zeilen ohne Satzzeichen bleiben eigene Einheiten, statt verloren zu gehen. Markdown-Abschnitte beginnen bei ATX-Überschriften (# bis ######); Überschriften in Codeblöcken werden übersprungen, ein Shell-Kommentar in einem ```-Block gilt also nicht als Abschnittsgrenze.

Grenzen, Überlappung und Schätzwerte

Jeder Chunk wird auf sein erstes und letztes Nicht-Leerzeichen beschnitten, und der angezeigte Bereich entspricht genau dem Text. Bei Überlappung N wiederholt jeder folgende Chunk die letzten N Einheiten des vorherigen, was Fakten nahe einer Grenze absichert.

Die Token-Schätzung ist eine Heuristik, kein Tokenizer: CJK-Zeichen zählen rund 1,05 Tokens, andere Schriften etwa ein Token pro vier Zeichen. Nutzen Sie sie zum Vergleichen der Strategien und messen Sie die echten Tokens mit dem Tokenizer des Zielmodells.

Mit dem JSONL-Export arbeiten

JSONL kopieren schreibt ein Objekt pro Chunk — id, text, start, end und estimated_tokens — in Leserichtung. Die Bereiche beziehen sich auf den eingefügten Text, überlappende Chunks lassen sich also auf das Originaldokument zurückführen.

Der Export passt in eine Embedding-Pipeline, aber diese Seite erzeugt keine Embeddings und lädt keinen Text hoch. Bewahren Sie das JSONL lokal auf oder senden Sie es nur an den vorgesehenen Dienst.

Zuletzt verwendet: