# ============================================================================= # CHUNKING – zentrale Defaults (pro Quelle in tools.yaml/general.yaml overridebar) # ============================================================================= # Chunking ist ZUSAETZLICH zur Voll-Markdown-Datei: das Voll-Dokument bleibt immer # in output/processed/ erhalten, Chunks landen separat in output/chunks///. # Wir stellen die Vektor-DB NICHT -> wir liefern nur deterministische, embedding-freie # Chunks (Anschliesser kann auch selbst chunken). # # Default ist AUS: nur Quellen mit options.chunk != off werden gechunkt. # # Pro Quelle ueberschreibbar, z.B.: # options: # chunk: headings # off | headings | faq | recursive # chunk_target_tokens: 500 # chunk_max_tokens: 1800 # chunk_min_chars: 200 # chunk_overlap: 0 # chunk_context_header: true # ============================================================================= defaults: chunk: off # global aus (Default = kein Chunking) chunk_level: auto # auto = kleinste vorhandene Heading-Ebene; oder 1..6 chunk_target_tokens: 500 # Zielgroesse je Chunk (~Token, 1 Token ~ 4 Zeichen) chunk_max_tokens: 1800 # harte Obergrenze (unter „Context Cliff" ~2.5k) chunk_min_chars: 200 # kleinere Abschnitte werden mit Nachbarn zusammengefasst chunk_overlap: 0 # 0 = kein Overlap (Default); >0 = Tokens des Vorgaenger-Chunks voranstellen chunk_context_header: true # Contextual-Retrieval-Vorspann je Chunk (s. Doku) chunk_min_doc_chars: 0 # 0 = aus; >0 = Dokumente kleiner N Zeichen bleiben GANZ chunk_kind: "" # "" = alle; "attachment" = nur Anhang-PDFs chunken, # "document" = nur Voll-Seiten, "chunk" wird ignoriert chunk_component: "" # "" = alle; sonst nur Dokumente dieses component_type # (z.B. "faq" = nur FAQ-Seiten). Erlaubt mehrere Configs # je Ort (z.B. attachment via chunk_kind + faq via chunk_component)