Zum Inhalt

LLM-Modelle

Modellverwaltung über LiteLLM

Die Plattform nutzt LLMs über den LiteLLM-Proxy. Modelle werden zentral konfiguriert und können pro Instanz verwaltet werden.


Architektur

graph LR
    LC["LibreChat"] --> LL["LiteLLM (lokal, Port 4000)"]
    RAG["RAG API"] --> LL
    LL --> ZP["Zentraler LLM-Proxy<br/>(llm.inovetra.ai)"]
    ZP --> HUB["Modell-Backend<br/>(Inovetra AI / Qwen, DE)"]
    ZP --> MISTRAL["Mistral-Modelle<br/>(EU)"]
    ES["Embedding Service<br/>(lokal, ONNX)"] -.->|"Fallback über LiteLLM"| LL
    RAG -->|"Embeddings"| ES

KI-Modellanbieter (ab 0.79.7)

Die Plattform unterstützt zwei austauschbare KI-Modellanbieter. Die Auswahl erfolgt im Customer Portal unter KI-Einstellungen → Karte KI-Modellanbieter und gilt sowohl für den Wissensassistenten Inovetra RAG (alle Pipeline-Schritte) als auch für den allgemeinen Chat-Assistenten Inovetra AI (Standardmodell + Titelgenerierung in LibreChat).

Anbieter Backend Antwortmodell Schnelles Modell Region
Inovetra AI (Standard) Qwen-Modelle qwen-3.5-397b qwen-3.5-9b Deutschland
Mistral Mistral-Modelle mistral-large mistral-small EU

Das schnelle Modell wird für Klassifikation, Titelgenerierung und Qualitätsprüfung verwendet, das Antwortmodell für die eigentliche Antwortgenerierung.

Umstellung von Llama auf Qwen

Die bisher eingesetzten Meta-Llama-Modelle wurden abgekündigt. Der Anbieter Inovetra AI nutzt daher die Qwen-Modelle — weiterhin ausschließlich in deutschen Rechenzentren.

Bitte beginnen Sie nach dem Update einen neuen Chat. Konversationen, die vor der Umstellung angelegt wurden, sind an das damals verwendete Modell gebunden und lassen sich nicht fortsetzen. Die bisherigen Verläufe bleiben lesbar.

Am Embedding-Modell (bge-m3) ändert sich nichts, eine Neu-Indizierung Ihrer Dokumente ist nicht erforderlich.

Technische Umsetzung

Der Anbieter wird über die RAG-API-Einstellung LLM_PROVIDER (inovetra | mistral) gesteuert. Der Wert wird in der ConfigMap inovetra-rag-runtime-settings gespeichert (upgrade-persistent) und über den Helm-Value ragApi.llmProvider (Default inovetra) initialisiert.

Automatischer Neustart

Das Umschalten des Anbieters löst automatisch einen Neustart der betroffenen Dienste aus (RAG API + LibreChat-Pods). Eine manuelle Aktion ist nicht erforderlich.

Embeddings bleiben unverändert

Das Embedding-Modell (bge-m3) ist providerunabhängig. Ein Anbieterwechsel erfordert keine Neuindexierung der Dokumente.

Mistral im zentralen LiteLLM voraussetzen

Damit der Anbieter Mistral funktioniert, müssen im zentralen LiteLLM (llm.inovetra.ai, Management-VM) die Modelle mistral-large (mistral/mistral-large-latest) und mistral-small (mistral/mistral-small-latest) konfiguriert sein. Dazu gehört ein gültiger MISTRAL_API_KEY in der .env der Management-VM, der im environment:-Block des Compose-Service litellm durchgereicht wird. Die lokalen K8s-LiteLLM-Configs routen Mistral ausschließlich über den zentralen Proxy (centralLlmProxy.enabled=true).


Endbenutzer-Modelle (LibreChat)

Endbenutzer sehen in LibreChat zwei fest konfigurierte Presets — keine Modellauswahl:

Preset Modell (fest) Beschreibung
Inovetra RAG rag-inovetra-reasoning RAG-basierter Assistent mit Zugriff auf Unternehmensdokumente
Inovetra AI providerabhängig (qwen-3.5-397b / mistral-large) Chat-Assistent ohne Dokumentenzugriff

ModelSpecs

Die Modell-Presets werden durch modelSpecs.enforce: true erzwungen. Endbenutzer können das Modell nicht wechseln.

RAG- und Chat-Antwortgenerierung sind providerabhängig

Die eigentliche Antwortgenerierung — sowohl für Inovetra RAG als auch für das Inovetra-AI-Preset — verwendet das Antwortmodell des aktuell gewählten KI-Modellanbieters: qwen-3.5-397b bei Inovetra AI, mistral-large bei Mistral. Auch die Titelgenerierung in LibreChat folgt dem gewählten Anbieter. Die Modell-ID des RAG-Presets steuert primär die UI-Darstellung (z.B. Reasoning-Anzeige).

LibreChat-UI (ab 0.79.7)

Die LibreChat-Oberfläche wurde aufgeräumt: Die Agents-Funktion ist deaktiviert (ENDPOINTS=custom, interface.agents: false), Prompts-Bibliothek und Erinnerungen sind ausgeblendet (interface.prompts: false, interface.memories: false). Es bleiben nur die zwei Assistenten Inovetra RAG und Inovetra AI.


RAG-interne Modelle

Diese Modelle werden intern von der RAG API verwendet und sind nicht vom Endbenutzer wählbar. Antwort- und schnelles Modell hängen vom gewählten KI-Modellanbieter ab (Inovetra AI / Mistral):

Modell (Inovetra AI / Mistral) Zweck
qwen-3.5-397b / mistral-large RAG-Antwortgenerierung
qwen-3.5-9b / mistral-small Query-Klassifikation (simple/complex)
qwen-3.5-9b / mistral-small Groundedness-Verifikation (Faktenprüfung)
qwen-3.5-9b / mistral-small Context Overflow Summarization (bei >128K Tokens, ab v0.47.0)
qwen-3.5-9b / mistral-small Titel-Generierung für Konversationen
qwen-3.5-9b / mistral-small Search-Endpoint (RetrievalQA)
qwen-3.5-9b / mistral-small Dokument-Zusammenfassungen (Inventory)
qwen-3.8-27b Contextual Chunking (bei Dokument-Upload, konfigurierbar via ragApi.llmModel)

Embedding-Modelle

Modell Betrieb Zweck
BAAI/bge-m3 Lokal via Embedding Service (ONNX) Vektorisierung — bevorzugt
bge-m3 Über LiteLLM-Proxy Vektorisierung — Fallback wenn kein lokaler Embedding Service

Lokaler Embedding Service

Wenn der Embedding Service aktiviert ist (embeddingService.replicas > 0), werden Embeddings lokal berechnet — ohne externe API-Aufrufe. Dies reduziert Latenz und Kosten.


Reranker

Modell Betrieb Zweck
cross-encoder/ms-marco-MiniLM-L-6-v2 Lokal in RAG API Re-Ranking der Suchergebnisse nach Relevanz

Modellverwaltung

  • Über Customer PortalEinstellungenModelle
  • Modelle aktivieren/deaktivieren
  • Reihenfolge anpassen

Zentrale Freischaltung erforderlich

Die verfügbaren Modelle werden durch die zentrale LiteLLM-Instanz bestimmt. Neue Modelle müssen zuerst dort freigeschaltet werden.


RAG-Modell-Konfiguration (Helm Values)

Parameter Standard Beschreibung
ragApi.embeddingModel bge-m3 Embedding-Modell für Vektorisierung
ragApi.llmModel qwen-3.8-27b Modell für Contextual Chunking bei Dokument-Upload
ragApi.enableContextualChunks true Kontextuelles Chunking aktivieren

Neuindexierung bei Embedding-Modell-Wechsel

Ein Wechsel des Embedding-Modells erfordert eine vollständige Neuindexierung aller Dokumente. Dies kann je nach Dokumentenmenge mehrere Stunden dauern.


Siehe auch