Skip to main content
The chunk node splits a parsed DocumentIR into smaller pieces, useful for RAG pipelines, embedding generation, and processing documents that exceed context limits.

Basic Usage

Configuration Options

Chunking Strategies

Recursive (Default)

Splits by hierarchical separators, respecting natural boundaries:
Best for: General documents, articles, reports.

Section

Splits by document sections (headers, chapters):
Best for: Structured documents with clear sections.

Page

Splits by page boundaries:
Best for: Maintaining page-level context.

Fixed

Splits at fixed intervals:
Best for: Uniform chunk sizes for embeddings.

Output: ChunkOutput

Use Cases

RAG Pipeline

Chunk for retrieval-augmented generation:

Large Document Processing

Process documents exceeding context limits:

Overlap for Context

Use overlap to maintain context across chunk boundaries:
This ensures that sentences split across chunks are fully contained in at least one chunk.

Preserving Source Information

Chunk metadata includes page numbers and positions for citation mapping:

Next Steps

parse

Parse documents before chunking

combine

Merge results from chunked processing