Files
Orchestrator/config/chunking.yaml
T
ankn cfaf670100 Squashed 'bahn/wissensdatenbank/' content from commit 07a8196e
git-subtree-dir: bahn/wissensdatenbank
git-subtree-split: 07a8196e5f9e55d027f90485beb95f4006387669
2026-06-30 21:19:25 +02:00

35 lines
2.1 KiB
YAML
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# =============================================================================
# CHUNKING zentrale Defaults (pro Quelle in tools.yaml/general.yaml overridebar)
# =============================================================================
# Chunking ist ZUSAETZLICH zur Voll-Markdown-Datei: das Voll-Dokument bleibt immer
# in output/processed/ erhalten, Chunks landen separat in output/chunks/<scope>/<domaene>/.
# Wir stellen die Vektor-DB NICHT -> wir liefern nur deterministische, embedding-freie
# Chunks (Anschliesser kann auch selbst chunken).
#
# Default ist AUS: nur Quellen mit options.chunk != off werden gechunkt.
#
# Pro Quelle ueberschreibbar, z.B.:
# options:
# chunk: headings # off | headings | faq | recursive
# chunk_target_tokens: 500
# chunk_max_tokens: 1800
# chunk_min_chars: 200
# chunk_overlap: 0
# chunk_context_header: true
# =============================================================================
defaults:
chunk: off # global aus (Default = kein Chunking)
chunk_level: auto # auto = kleinste vorhandene Heading-Ebene; oder 1..6
chunk_target_tokens: 500 # Zielgroesse je Chunk (~Token, 1 Token ~ 4 Zeichen)
chunk_max_tokens: 1800 # harte Obergrenze (unter „Context Cliff" ~2.5k)
chunk_min_chars: 200 # kleinere Abschnitte werden mit Nachbarn zusammengefasst
chunk_overlap: 0 # 0 = kein Overlap (Default); >0 = Tokens des Vorgaenger-Chunks voranstellen
chunk_context_header: true # Contextual-Retrieval-Vorspann je Chunk (s. Doku)
chunk_min_doc_chars: 0 # 0 = aus; >0 = Dokumente kleiner N Zeichen bleiben GANZ
chunk_kind: "" # "" = alle; "attachment" = nur Anhang-PDFs chunken,
# "document" = nur Voll-Seiten, "chunk" wird ignoriert
chunk_component: "" # "" = alle; sonst nur Dokumente dieses component_type
# (z.B. "faq" = nur FAQ-Seiten). Erlaubt mehrere Configs
# je Ort (z.B. attachment via chunk_kind + faq via chunk_component)