For the complete documentation index, see llms.txt. This page is also available as Markdown.

Überblick über Private AI

Überblick über VergeOS Private AI, die die Bereitstellung und Ausführung großer Sprachmodelle lokal innerhalb Ihrer Infrastruktur ohne externe API-Aufrufe oder Datenübertragung ermöglicht.

VergeOS Private AI ermöglicht es Ihnen, große Sprachmodelle (LLMs) lokal innerhalb Ihrer VergeOS-Umgebung bereitzustellen und auszuführen. Die Modelle laufen vollständig auf Ihrer Infrastruktur, ohne externe API-Aufrufe oder Datenübertragung.

Architektur

Private AI besteht aus fünf Kernkomponenten:

Modelle

Modelle sind die LLM-Dateien, die KI-Funktionen bereitstellen. VergeOS unterstützt:

  • Kuratierte Modelle: Vorkonfigurierte Modelle, die per Ein-Klick-Installation verfügbar sind (Llama, Gemma, Phi, Qwen und andere)

  • Benutzerdefinierte Modelle: Jedes Modell im GGUF-Format von Hugging Face oder anderen Quellen

Modelle definieren Ressourcenanforderungen (CPU-Kerne, RAM, GPU-Zuweisung) und Inferenzparameter (Kontextgröße, parallele Anfragen).

Assistenten

Assistenten sind konfigurierte Instanzen, die festlegen, wie Benutzer und Anwendungen mit einem Modell interagieren. Jeder Assistent legt Folgendes fest:

  • Welches Modell verwendet werden soll

  • System-Prompt (Verhaltensanweisungen)

  • Temperatur und andere Generierungsparameter

  • Kontextbewertung für RAG-Szenarien

  • Workspace-Dateien für den Dokumentenkontext

Mehrere Assistenten können dasselbe zugrunde liegende Modell mit unterschiedlichen Konfigurationen verwenden.

Worker

Worker sind die Inferenz-Engines, die Modelle ausführen. Das System verwaltet zwei Typen:

  • AI-Helper-Worker: Verarbeitet API-Anfragen und Weiterleitung (startet automatisch)

  • Modell-Worker: Führen die Inferenz für jedes laufende Modell aus (skalieren automatisch basierend auf den Min/Max-Worker-Einstellungen)

Chat-Sitzungen

Chat-Sitzungen behalten den Gesprächsverlauf und Kontext bei. Sitzungen können:

  • über die VergeOS-Benutzeroberfläche für interaktives Testen erstellt werden

  • programmgesteuert über die API für die Anwendungsintegration verwaltet werden

OpenAI-kompatible API

Die API stellt standardmäßige OpenAI-Endpunkte bereit unter https://<your-vergeos-url>/v1, was die Integration ermöglicht mit:

  • Jeder OpenAI-Client-Bibliothek (Python, JavaScript, Go usw.)

  • IDEs und Entwicklungstools

  • Bestehenden Anwendungen, die für OpenAI/Ollama erstellt wurden

Siehe OpenAI-kompatible API für die Endpunktdokumentation.

Voraussetzungen

  • VergeOS 26.0 oder höher

  • Ausreichend RAM für Modelldateien (variiert je nach Modell, typischerweise 5–50 GB)

  • Speicherplatz für Modelldownloads

GPU-Unterstützung

GPU-Beschleunigung wird für Produktions-Workloads empfohlen. VergeOS unterstützt GPUs aller Hersteller (NVIDIA, AMD, Intel) über Resource Groups. Modelle können auch auf Systemen nur mit CPU ausgeführt werden, allerdings ist die Inferenz dann langsamer.

Schnellstart

  1. Navigieren Sie zu KI → Modelle

  2. Klicken Sie auf Zum Installieren klicken bei einem kuratierten Modell, oder klicken Sie auf Neues Modell für benutzerdefinierte Modelle

  3. Ressourcenzuweisung konfigurieren (Kerne, RAM, GPU)

  4. Mit dem neuen Modell wird automatisch ein Assistent erstellt

  5. Testen über KI → Assistenten → [Ihr Assistent] → Chat

Detaillierte Einrichtungsanweisungen finden Sie im Konfigurationshandbuch.

Verwandte Dokumentation

Zuletzt aktualisiert

War das hilfreich?