feat: v2 pipeline mit OCR + KI-Normalisierung

- extractor.py: Text-Extraktion für MD/TXT/PDF/DOCX/Bilder inkl. OCR (Tesseract)
- normalizer.py: KI-Normalisierung via Claude Haiku (Typ-Erkennung) + Sonnet (Transformation)
- ingest.py: Vollpipeline v2 mit watch, delete, dry-run, quality-min Flags
- ingest_anythingllm.py: Einfaches Script v1 (nur MD/TXT/PDF, kein OCR)
- README.md: Alle drei Tools dokumentiert
This commit is contained in:
2026-04-28 11:21:53 +02:00
parent e7bb3b60b4
commit 4fea148d61
13 changed files with 1134 additions and 52 deletions
+25
View File
@@ -0,0 +1,25 @@
# Referenzen
## Referenz 1
- **Name:** [Vor- und Nachname]
- **Position:** [z.B. Teamleiter Softwareentwicklung]
- **Unternehmen:** [Name]
- **Verhältnis:** [z.B. Direkter Vorgesetzter, 20212026]
- **Kontakt:** [auf Anfrage / E-Mail / Telefon]
- **Kontext:** [z.B. "Hat meine Arbeit als Fullstack-Entwickler im Banking-Projekt begleitet"]
## Referenz 2
- **Name:** [Vor- und Nachname]
- **Position:** [z.B. Projektmanager]
- **Unternehmen:** [Name]
- **Verhältnis:** [z.B. Projektleiter im gemeinsamen Kundenprojekt]
- **Kontakt:** [auf Anfrage / E-Mail / Telefon]
- **Kontext:** [z.B. "Zusammenarbeit im Bereich Mobile App Entwicklung"]
## Referenz 3
- **Name:** [Vor- und Nachname]
- **Position:** [Position]
- **Unternehmen:** [Name]
- **Verhältnis:** [Beziehung]
- **Kontakt:** [auf Anfrage]
- **Kontext:** [Kurzbeschreibung der Zusammenarbeit]