LLM-Modelle¶
Modellverwaltung über LiteLLM
Die Plattform nutzt LLMs über den LiteLLM-Proxy. Modelle werden zentral konfiguriert und können pro Instanz verwaltet werden.
Architektur¶
graph LR
LC["LibreChat"] --> LL["LiteLLM (lokal, Port 4000)"]
RAG["RAG API"] --> LL
LL --> ZP["Zentraler LLM-Proxy<br/>(llm.inovetra.ai)"]
ZP --> HUB["Modell-Backend<br/>(Inovetra AI / Qwen, DE)"]
ZP --> MISTRAL["Mistral-Modelle<br/>(EU)"]
ES["Embedding Service<br/>(lokal, ONNX)"] -.->|"Fallback über LiteLLM"| LL
RAG -->|"Embeddings"| ES
KI-Modellanbieter (ab 0.79.7)¶
Die Plattform unterstützt zwei austauschbare KI-Modellanbieter. Die Auswahl erfolgt im Customer Portal unter KI-Einstellungen → Karte KI-Modellanbieter und gilt sowohl für den Wissensassistenten Inovetra RAG (alle Pipeline-Schritte) als auch für den allgemeinen Chat-Assistenten Inovetra AI (Standardmodell + Titelgenerierung in LibreChat).
| Anbieter | Backend | Antwortmodell | Schnelles Modell | Region |
|---|---|---|---|---|
| Inovetra AI (Standard) | Qwen-Modelle | qwen-3.5-397b |
qwen-3.5-9b |
Deutschland |
| Mistral | Mistral-Modelle | mistral-large |
mistral-small |
EU |
Das schnelle Modell wird für Klassifikation, Titelgenerierung und Qualitätsprüfung verwendet, das Antwortmodell für die eigentliche Antwortgenerierung.
Umstellung von Llama auf Qwen
Die bisher eingesetzten Meta-Llama-Modelle wurden abgekündigt. Der Anbieter Inovetra AI nutzt daher die Qwen-Modelle — weiterhin ausschließlich in deutschen Rechenzentren.
Bitte beginnen Sie nach dem Update einen neuen Chat. Konversationen, die vor der Umstellung angelegt wurden, sind an das damals verwendete Modell gebunden und lassen sich nicht fortsetzen. Die bisherigen Verläufe bleiben lesbar.
Am Embedding-Modell (bge-m3) ändert sich nichts, eine Neu-Indizierung Ihrer Dokumente ist nicht erforderlich.
Technische Umsetzung
Der Anbieter wird über die RAG-API-Einstellung LLM_PROVIDER (inovetra | mistral) gesteuert. Der Wert wird in der ConfigMap inovetra-rag-runtime-settings gespeichert (upgrade-persistent) und über den Helm-Value ragApi.llmProvider (Default inovetra) initialisiert.
Automatischer Neustart
Das Umschalten des Anbieters löst automatisch einen Neustart der betroffenen Dienste aus (RAG API + LibreChat-Pods). Eine manuelle Aktion ist nicht erforderlich.
Embeddings bleiben unverändert
Das Embedding-Modell (bge-m3) ist providerunabhängig. Ein Anbieterwechsel erfordert keine Neuindexierung der Dokumente.
Mistral im zentralen LiteLLM voraussetzen
Damit der Anbieter Mistral funktioniert, müssen im zentralen LiteLLM (llm.inovetra.ai, Management-VM) die Modelle mistral-large (mistral/mistral-large-latest) und mistral-small (mistral/mistral-small-latest) konfiguriert sein. Dazu gehört ein gültiger MISTRAL_API_KEY in der .env der Management-VM, der im environment:-Block des Compose-Service litellm durchgereicht wird. Die lokalen K8s-LiteLLM-Configs routen Mistral ausschließlich über den zentralen Proxy (centralLlmProxy.enabled=true).
Endbenutzer-Modelle (LibreChat)¶
Endbenutzer sehen in LibreChat zwei fest konfigurierte Presets — keine Modellauswahl:
| Preset | Modell (fest) | Beschreibung |
|---|---|---|
| Inovetra RAG | rag-inovetra-reasoning |
RAG-basierter Assistent mit Zugriff auf Unternehmensdokumente |
| Inovetra AI | providerabhängig (qwen-3.5-397b / mistral-large) |
Chat-Assistent ohne Dokumentenzugriff |
ModelSpecs
Die Modell-Presets werden durch modelSpecs.enforce: true erzwungen. Endbenutzer können das Modell nicht wechseln.
RAG- und Chat-Antwortgenerierung sind providerabhängig
Die eigentliche Antwortgenerierung — sowohl für Inovetra RAG als auch für das Inovetra-AI-Preset — verwendet das Antwortmodell des aktuell gewählten KI-Modellanbieters: qwen-3.5-397b bei Inovetra AI, mistral-large bei Mistral. Auch die Titelgenerierung in LibreChat folgt dem gewählten Anbieter. Die Modell-ID des RAG-Presets steuert primär die UI-Darstellung (z.B. Reasoning-Anzeige).
LibreChat-UI (ab 0.79.7)
Die LibreChat-Oberfläche wurde aufgeräumt: Die Agents-Funktion ist deaktiviert (ENDPOINTS=custom, interface.agents: false), Prompts-Bibliothek und Erinnerungen sind ausgeblendet (interface.prompts: false, interface.memories: false). Es bleiben nur die zwei Assistenten Inovetra RAG und Inovetra AI.
RAG-interne Modelle¶
Diese Modelle werden intern von der RAG API verwendet und sind nicht vom Endbenutzer wählbar. Antwort- und schnelles Modell hängen vom gewählten KI-Modellanbieter ab (Inovetra AI / Mistral):
| Modell (Inovetra AI / Mistral) | Zweck |
|---|---|
qwen-3.5-397b / mistral-large |
RAG-Antwortgenerierung |
qwen-3.5-9b / mistral-small |
Query-Klassifikation (simple/complex) |
qwen-3.5-9b / mistral-small |
Groundedness-Verifikation (Faktenprüfung) |
qwen-3.5-9b / mistral-small |
Context Overflow Summarization (bei >128K Tokens, ab v0.47.0) |
qwen-3.5-9b / mistral-small |
Titel-Generierung für Konversationen |
qwen-3.5-9b / mistral-small |
Search-Endpoint (RetrievalQA) |
qwen-3.5-9b / mistral-small |
Dokument-Zusammenfassungen (Inventory) |
qwen-3.8-27b |
Contextual Chunking (bei Dokument-Upload, konfigurierbar via ragApi.llmModel) |
Embedding-Modelle¶
| Modell | Betrieb | Zweck |
|---|---|---|
BAAI/bge-m3 |
Lokal via Embedding Service (ONNX) | Vektorisierung — bevorzugt |
bge-m3 |
Über LiteLLM-Proxy | Vektorisierung — Fallback wenn kein lokaler Embedding Service |
Lokaler Embedding Service
Wenn der Embedding Service aktiviert ist (embeddingService.replicas > 0), werden Embeddings lokal berechnet — ohne externe API-Aufrufe. Dies reduziert Latenz und Kosten.
Reranker¶
| Modell | Betrieb | Zweck |
|---|---|---|
cross-encoder/ms-marco-MiniLM-L-6-v2 |
Lokal in RAG API | Re-Ranking der Suchergebnisse nach Relevanz |
Modellverwaltung¶
- Über Customer Portal → Einstellungen → Modelle
- Modelle aktivieren/deaktivieren
- Reihenfolge anpassen
Zentrale Freischaltung erforderlich
Die verfügbaren Modelle werden durch die zentrale LiteLLM-Instanz bestimmt. Neue Modelle müssen zuerst dort freigeschaltet werden.
RAG-Modell-Konfiguration (Helm Values)¶
| Parameter | Standard | Beschreibung |
|---|---|---|
ragApi.embeddingModel |
bge-m3 |
Embedding-Modell für Vektorisierung |
ragApi.llmModel |
qwen-3.8-27b |
Modell für Contextual Chunking bei Dokument-Upload |
ragApi.enableContextualChunks |
true |
Kontextuelles Chunking aktivieren |
Neuindexierung bei Embedding-Modell-Wechsel
Ein Wechsel des Embedding-Modells erfordert eine vollständige Neuindexierung aller Dokumente. Dies kann je nach Dokumentenmenge mehrere Stunden dauern.