Files
ai.bewerbung---vectorize-do…/README.md
T
2026-02-27 10:59:36 +01:00

1.2 KiB
Raw Blame History

RAG Ingestion Script

Lokales Python-Script um Dokumente (MD, TXT, PDF) in die pgvector-Datenbank auf dem Hetzner-Server zu importieren.

Setup

cd ~/Projekte/rag-ingestion
python3 -m venv venv
source venv/bin/activate
pip install -r requirements.txt

Umgebungsvariablen konfigurieren:

cp .env.example .env
nano .env

Verwendung

Einzelne Datei importieren

python ingest.py file ~/Dokumente/Lebenslauf.md

Mit --force (bestehende Chunks überschreiben)

python ingest.py file ~/Dokumente/Lebenslauf.md --force

Ganzes Verzeichnis importieren

python ingest.py dir ~/Dokumente/bewerbung/

Alle Dokumente in der DB anzeigen

python ingest.py list

Unterstützte Formate

  • .md Markdown
  • .txt Plaintext
  • .pdf PDF (via pypdf)

Embedding-Modell

Verwendet intfloat/multilingual-e5-small (384 Dimensionen) identisch mit der RAG-API auf dem Server. Das Modell wird beim ersten Aufruf automatisch heruntergeladen (~120MB).

Geplante Erweiterungen

  • Tkinter UI für komfortableres Einpflegen
  • Drag & Drop von Dateien
  • Fortschrittsanzeige
  • Dokument-Verwaltung (löschen, aktualisieren)