Divisor de texto para RAG

Pega un documento y comprueba dónde empieza y termina cada bloque, cuánto texto se solapa y cuántos tokens costará aproximadamente. El cálculo se ejecuta en el navegador; no se sube ni se genera ningún embedding.

Se ejecuta localmente en tu navegador
La fragmentación y la estimación de tokens son locales. El contenido no se sube, vectoriza ni envía a un modelo.
Documento fuente

Ajusta los límites antes de crear embeddings

El tamaño y el solapamiento afectan al recall, la duplicación de contexto y el coste. Evalúa los fragmentos con preguntas representativas antes de producción.

Cómo usar «Divisor de texto para RAG»

El divisor convierte un documento en unidades de recuperación deterministas: ventanas de caracteres, palabras separadas por espacios, frases o secciones de encabezados Markdown, con un solapamiento opcional entre bloques consecutivos.

Todo se ejecuta en la página. Los límites, las estimaciones de caracteres y tokens y la exportación JSONL salen del texto pegado; la herramienta no llama a ningún modelo de embeddings ni a un servicio remoto.

  1. Pega el documento en el panel de origen y elige una estrategia: caracteres, palabras, frases o secciones Markdown.
  2. Define el tamaño del bloque en unidades de esa estrategia y el solapamiento en las mismas unidades; el solapamiento debe ser menor que el tamaño.
  3. Pulsa Dividir documento. El flujo muestra todos los bloques en orden y la tarjeta de detalles indica el rango de caracteres y los tokens estimados del bloque seleccionado.
  4. Pulsa Copiar JSONL para exportar un objeto JSON por bloque con su id, texto, rango y tokens estimados.

Contexto y precisión

Qué divide cada estrategia

Los caracteres son grupos de grafemas Unicode, así que las banderas emoji, las familias con ZWJ y los acentos combinados nunca se cortan por la mitad. Las palabras son tokens separados por espacios; cada carácter CJK cuenta como una palabra, de modo que el chino y el japonés se dividen dentro de párrafos sin espacios.

Las frases terminan en . ! ? o sus equivalentes de ancho completo, y las líneas sin puntuación de frase se conservan como unidades propias en lugar de perderse. Las secciones Markdown empiezan en encabezados ATX (# a ######); los encabezados dentro de bloques de código se ignoran, así que un comentario de shell en un bloque ``` no se toma como límite de sección.

Límites, solapamiento y estimaciones

Cada bloque se recorta hasta su primer y último carácter no blanco, y el rango indicado coincide exactamente con el texto. Con solapamiento N, cada bloque posterior repite las últimas N unidades del bloque anterior, lo que protege los datos cercanos a un límite.

La estimación de tokens es una heurística, no un tokenizador: los caracteres CJK cuentan unas 1,05 fichas y otros alfabetos aproximadamente una ficha por cada cuatro caracteres. Úsala para comparar estrategias y mide los tokens reales con el tokenizador del modelo que vayas a usar.

Trabajar con la exportación JSONL

Copiar JSONL escribe un objeto por bloque — id, text, start, end y estimated_tokens — en orden de lectura. Los rangos se refieren al texto original, así que los bloques solapados se pueden mapear de vuelta al documento.

La exportación está lista para un flujo de embeddings, pero esta página no crea embeddings ni sube texto. Mantén el JSONL en local o envíalo solo al servicio que vayas a utilizar.

Herramientas recientes: