Zum Inhalt

Troubleshooting Übersicht

Troubleshooting Übersicht

Allgemeine Vorgehensweise bei Störungen der Inovetra AI Platform. Diese Seite beschreibt die ersten Diagnoseschritte und verweist auf die spezifischen Runbooks für verschiedene Problemkategorien.


Erste Schritte bei jeder Störung

  1. Symptom identifizieren — Was genau funktioniert nicht? Welche Fehlermeldung wird angezeigt?
  2. Pod-Status prüfen:
    kubectl get pods -n inovetra-platform
    
  3. Events prüfen:
    kubectl get events -n inovetra-platform --sort-by='.lastTimestamp' | tail -30
    
  4. Logs des betroffenen Services:
    kubectl logs -f deployment/<name> -n inovetra-platform
    
  5. Passendes Runbook anwenden — siehe Runbook-Übersicht unten.

Diagnosewerkzeuge

Werkzeug Befehl Zweck
Pod-Status kubectl get pods -n inovetra-platform Überblick aller Services
Pod-Details kubectl describe pod <name> -n inovetra-platform Detaillierte Fehlerbeschreibung
Logs kubectl logs -f <pod> -n inovetra-platform Echtzeit-Logs
Logs (vorheriger Container) kubectl logs --previous <pod> -n inovetra-platform Logs vor Crash
Events kubectl get events -n inovetra-platform --sort-by='.lastTimestamp' Cluster-Events
Ressourcen kubectl top pods -n inovetra-platform CPU/Memory Auslastung
Disk df -h Host-Festplatte
PVCs kubectl get pvc -n inovetra-platform Persistenter Speicher
Netzwerk kubectl exec <pod> -- curl -s http://<service>:<port>/health Konnektivitätstest

Runbook-Übersicht

Runbook Typische Symptome
Runbook Pod-Fehler CrashLoopBackOff, OOMKilled, ImagePullBackOff, Pending
Runbook Netzwerk 502/503 Fehler, Timeout, TLS-Fehler, DNS-Probleme
Runbook Datenbank Verbindungsfehler, StatefulSet steckt, Dateninkonsistenz
Runbook Storage Disk voll, PVC Pending, Schreibfehler
Runbook Auth Login fehlgeschlagen, SSO-Fehler, Token abgelaufen

K3s nutzt containerd

Container-Befehle auf dem Host mit sudo k3s crictl statt docker ausführen. Beispiel:

sudo k3s crictl ps        # Container auflisten
sudo k3s crictl images    # Images auflisten


Weiterführende Seiten