- extractor.py: Text-Extraktion für MD/TXT/PDF/DOCX/Bilder inkl. OCR (Tesseract) - normalizer.py: KI-Normalisierung via Claude Haiku (Typ-Erkennung) + Sonnet (Transformation) - ingest.py: Vollpipeline v2 mit watch, delete, dry-run, quality-min Flags - ingest_anythingllm.py: Einfaches Script v1 (nur MD/TXT/PDF, kein OCR) - README.md: Alle drei Tools dokumentiert
17 lines
230 B
Plaintext
17 lines
230 B
Plaintext
# Umgebung
|
|
.env
|
|
.env.job_matching
|
|
venv/
|
|
__pycache__/
|
|
*.pyc
|
|
*.pyo
|
|
|
|
# macOS
|
|
.DS_Store
|
|
|
|
# Embedding-Modell Cache (wird automatisch heruntergeladen)
|
|
.cache/
|
|
|
|
# Ausgefüllte persönliche Dokumente nicht ins Repo
|
|
templates/ausgefuellt/
|