Überblick über Private AI
Überblick über VergeOS Private AI, die die Bereitstellung und Ausführung großer Sprachmodelle lokal innerhalb Ihrer Infrastruktur ohne externe API-Aufrufe oder Datenübertragung ermöglicht.
VergeOS Private AI ermöglicht es Ihnen, große Sprachmodelle (LLMs) lokal innerhalb Ihrer VergeOS-Umgebung bereitzustellen und auszuführen. Die Modelle laufen vollständig auf Ihrer Infrastruktur, ohne externe API-Aufrufe oder Datenübertragung.
Architektur
Private AI besteht aus fünf Kernkomponenten:
Modelle
Modelle sind die LLM-Dateien, die KI-Funktionen bereitstellen. VergeOS unterstützt:
Kuratierte Modelle: Vorkonfigurierte Modelle, die per Ein-Klick-Installation verfügbar sind (Llama, Gemma, Phi, Qwen und andere)
Benutzerdefinierte Modelle: Jedes Modell im GGUF-Format von Hugging Face oder anderen Quellen
Modelle definieren Ressourcenanforderungen (CPU-Kerne, RAM, GPU-Zuweisung) und Inferenzparameter (Kontextgröße, parallele Anfragen).
Assistenten
Assistenten sind konfigurierte Instanzen, die festlegen, wie Benutzer und Anwendungen mit einem Modell interagieren. Jeder Assistent legt Folgendes fest:
Welches Modell verwendet werden soll
System-Prompt (Verhaltensanweisungen)
Temperatur und andere Generierungsparameter
Kontextbewertung für RAG-Szenarien
Workspace-Dateien für den Dokumentenkontext
Mehrere Assistenten können dasselbe zugrunde liegende Modell mit unterschiedlichen Konfigurationen verwenden.
Worker
Worker sind die Inferenz-Engines, die Modelle ausführen. Das System verwaltet zwei Typen:
AI-Helper-Worker: Verarbeitet API-Anfragen und Weiterleitung (startet automatisch)
Modell-Worker: Führen die Inferenz für jedes laufende Modell aus (skalieren automatisch basierend auf den Min/Max-Worker-Einstellungen)
Chat-Sitzungen
Chat-Sitzungen behalten den Gesprächsverlauf und Kontext bei. Sitzungen können:
über die VergeOS-Benutzeroberfläche für interaktives Testen erstellt werden
programmgesteuert über die API für die Anwendungsintegration verwaltet werden
OpenAI-kompatible API
Die API stellt standardmäßige OpenAI-Endpunkte bereit unter https://<your-vergeos-url>/v1, was die Integration ermöglicht mit:
Jeder OpenAI-Client-Bibliothek (Python, JavaScript, Go usw.)
IDEs und Entwicklungstools
Bestehenden Anwendungen, die für OpenAI/Ollama erstellt wurden
Siehe OpenAI-kompatible API für die Endpunktdokumentation.
Voraussetzungen
VergeOS 26.0 oder höher
Ausreichend RAM für Modelldateien (variiert je nach Modell, typischerweise 5–50 GB)
Speicherplatz für Modelldownloads
GPU-Unterstützung
GPU-Beschleunigung wird für Produktions-Workloads empfohlen. VergeOS unterstützt GPUs aller Hersteller (NVIDIA, AMD, Intel) über Resource Groups. Modelle können auch auf Systemen nur mit CPU ausgeführt werden, allerdings ist die Inferenz dann langsamer.
Schnellstart
Navigieren Sie zu KI → Modelle
Klicken Sie auf Zum Installieren klicken bei einem kuratierten Modell, oder klicken Sie auf Neues Modell für benutzerdefinierte Modelle
Ressourcenzuweisung konfigurieren (Kerne, RAM, GPU)
Mit dem neuen Modell wird automatisch ein Assistent erstellt
Testen über KI → Assistenten → [Ihr Assistent] → Chat
Detaillierte Einrichtungsanweisungen finden Sie im Konfigurationshandbuch.
Verwandte Dokumentation
Konfiguration - Modell- und Assistenteneinrichtung
OpenAI-kompatible API - API-Endpunkte und Integration
Chat-Sitzungen - Verwendung der interaktiven Benutzeroberfläche
Zuletzt aktualisiert
War das hilfreich?