chunk node splits a parsed DocumentIR into smaller pieces, useful for RAG pipelines, embedding generation, and processing documents that exceed context limits.
Basic Usage
Configuration Options
Chunking Strategies
Recursive (Default)
Splits by hierarchical separators, respecting natural boundaries:
Best for: General documents, articles, reports.
Section
Splits by document sections (headers, chapters):
Best for: Structured documents with clear sections.
Page
Splits by page boundaries:
Best for: Maintaining page-level context.
Fixed
Splits at fixed intervals:
Best for: Uniform chunk sizes for embeddings.
Output: ChunkOutput
Use Cases
RAG Pipeline
Chunk for retrieval-augmented generation:Large Document Processing
Process documents exceeding context limits:Overlap for Context
Use overlap to maintain context across chunk boundaries:Preserving Source Information
Chunk metadata includes page numbers and positions for citation mapping:Next Steps
parse
Parse documents before chunking
combine
Merge results from chunked processing