KI-Konfiguration
Schritt-für-Schritt-Anleitung zur Konfiguration von KI-Modellen, Assistenten und Arbeitsbereichsdateien in VergeOS Private AI, einschließlich Ressourcenzuweisung, System-Prompts und Fehlerbehebung.
KI verwenden – Allgemeine Schritte
Ein Modell definieren durch Auswahl aus der enthaltenen kuratierten Auswahl oder durch Hochladen eines unterstützten Modells im .gguf-Format
Einen Assistenten konfigurieren basierend auf dem definierten Modell, mit angepassten Einstellungen für den jeweiligen Anwendungsfall oder die jeweilige Aufgabe
Inhalte in den Arbeitsbereich hochladen dem Assistenten Dateien mit relevanten Inhalten bereitstellen
Interagieren:
OpenAI Router (gängige Methode): programmgesteuert über die integrierte Engine mit dem Assistenten verbinden
Interaktive Chat-Sitzung: innerhalb der VergeOS-Benutzeroberfläche mit dem Assistenten kommunizieren (hilfreich zum Testen)
VergeOS API: den Assistenten mit standardmäßigen VergeOS-API-Befehlen aufrufen
Allgemeine KI-Einstellungen
Navigieren Sie zu KI im oberen Menü und klicken Sie auf KI-Einstellungen um die standardmäßigen KI-Parameter zu konfigurieren.
Auf der Seite „KI-Einstellungen“ können Sie systemweite Standardwerte für KI-Komponenten konfigurieren:
Standard-KI-Cluster: Gibt den standardmäßigen Rechencluster für KI-Workloads an. Neue KI-Modelle werden standardmäßig in diesem Cluster bereitgestellt.
Aufbewahrungsdauer des Chatverlaufs: Legt fest, wie lange der Verlauf einer Chatsitzung aufbewahrt wird (in Tagen). Standard sind 60 Tage.
KI-Modellverwaltung
KI-Modelle liefern die zugrunde liegende Intelligenz für Ihre KI-Assistenten und Anwendungen. VergeOS unterstützt eine breite Palette von KI-Modellen, indem es das Standardformat *.gguf unterstützt und Benutzern ermöglicht, jede kompatible Datei herunterzuladen und auszuführen. Mehrere kuratierte Modelle werden direkt in der VergeOS-Benutzeroberfläche für eine schnelle Bereitstellung angezeigt.
Ein KI-Modell installieren
Kuratierte Modelle
Das System enthält mehrere vorkonfigurierte Modelle mit Standardeinstellungen, die automatisch heruntergeladen werden können
Navigieren Sie zu KI > Modelle.
Wählen Sie Zum Installieren klicken am gewünschten Modell, um eines der verfügbaren kuratierten Modelle zu installieren. -ODER- klicken Sie Neues Modell im linken Menü.
Konfigurieren Sie alle gewünschten Einstellungen:
Modellauswahl: Wählen Sie aus einer kuratierten Liste von Basismodellen (z. B. Llama-3.2, Phi-4-Instruct) und wählen Sie eine Größe aus Variante (z. B. Klein – 1 GB). -ODER- wählen Sie --Benutzerdefiniert-- und geben Sie einen URL um eine .gguf-Modelldatei herunterzuladen
Namen: Geben Sie einen aussagekräftigen Namen für Ihr Modell ein.
Beschreibung (optional): Fügen Sie Details zum Zweck, zur Konfiguration oder zur beabsichtigten Verwendung des Modells hinzu.
Kerne: maximale Anzahl an Kernen, die jeder Modellinstanz zugewiesen werden können.
GPU-fähige Modelle: Die Kernzuweisung hat nur minimale Auswirkungen.
Nur-CPU- oder Fallback-Modus: Die Kernzuweisung ist entscheidend für Start und Leistung.
Eine Überprovisionierung von Kernen verbessert die Leistung nicht; ungenutzte Kerne bleiben im Leerlauf.
RAM: Pro Modellinstanz zugewiesener Speicher:
Eine Grundmenge an RAM ist erforderlich, um das Modell zu laden und auszuführen. Die tatsächlichen Anforderungen variieren je nach Modelltyp und -größe.
Als allgemeine Richtlinie für die grundlegende RAM-Menge gilt: Weisen Sie etwas mehr RAM zu als der Dateigröße des Modells entspricht (z. B. kann ein 2-GB-Modell 3 GB RAM benötigen).
Zusätzlicher RAM kann erforderlich sein, um gleichzeitige Anfragen (d. h. Paralleleinstellung) und größere Kontextfenster zu unterstützen.
Beginnen Sie mit einer großzügigen Zuweisung und überwachen Sie dann die tatsächliche Nutzung über das Modell-Dashboard. Wenn der beobachtete Verbrauch deutlich unter dem zugewiesenen Betrag liegt, reduzieren Sie ihn, um die Ressourceneffizienz zu optimieren.
Cluster (standardmäßig dem im globalen KI-Setting definierten Cluster): Wählen Sie den VergeOS-Cluster aus, auf dem das Modell ausgeführt wird.
HA-Gruppe: Gibt die Hochverfügbarkeitsgruppe für das Modell an. Mitglieder derselben HA-Gruppe werden nach Möglichkeit auf unterschiedlichen Knoten ausgeführt.
Zuweisung der GPU-Ressourcengruppe: - Wählen Sie eine GPU-Ressourcengruppe aus, um GPU-Geräte zuzuweisen, oder wählen Sie --Nur CPU-- um ausschließlich auf CPUs auszuführen.
CPU-Fallback zulassen, wenn GPU-Ressourcen nicht verfügbar sind: Aktivieren Sie diese Option, um CPU-Ressourcen zu verwenden, wenn GPU-Geräte nicht verfügbar sind. Wenn Sie diese Option verwenden, stellen Sie sicher, dass genügend CPU-Kerne für Fallback-Szenarien zugewiesen sind.
Bevorzugte Speicherebene: Wählen Sie die Speicherebene für das Hosting des Modells aus.
Kontextgröße (Standard 8192): - Maximale Anzahl von Tokens, die das Modell in einer aktiven Sitzung verarbeiten kann. Dazu gehören:
Benutzereingabe
KI-Ausgabe
System-Prompt
Verlauf der Unterhaltung
Tokens
1 Token ≈ 4 Zeichen (Durchschnitt für Englisch)
1 Wort ≈ 1,33 Tokens
8192 Tokens ≈ 2.000–4.000 Wörter oder ~12–20 Seiten Text
Parallel: Anzahl gleichzeitiger Anfragen, die jede Modellinstanz verarbeiten kann
Min. Worker: Mindestanzahl an Modellinstanzen, die beim Start des Modells gestartet werden.
Max. Worker: Maximale Anzahl an Modellinstanzen, die gestartet werden können, um die Nachfrage zu decken.
Die Anzahl der laufenden Modellinstanzen (Worker) für ein Modell wird im Modell-Dashboard angezeigt, wobei jede Instanz als laufender Worker dargestellt wird.
Think-Tag einfügen:- Fügt ein benutzerdefiniertes Tag hinzu, um Chain-of-Thought-Argumentation von der endgültigen Ausgabe zu unterscheiden. Einige Modelle unterdrücken dieses Tag oder behandeln es als Nicht-Ausgabe, um die Latenz zu reduzieren.
Think-Tag aus dem Verlauf entfernen: Aktivieren Sie dies, um Chain-of-Thought-Inhalte aus dem Antwortverlauf auszuschließen und nur die endgültige Antwort zurückzugeben.
Klicken Sie auf Absenden um das angegebene Modell herunterzuladen und zu konfigurieren.
Das Herunterladen des Modells kann mehrere Minuten oder länger dauern. Das Modell-Dashboard (Klicken Sie Modelle im linken Menü und doppelklicken Sie auf das Modell) zeigt während der aktiven Übertragung den Status „Wird heruntergeladen“ sowie den Fortschritt an. Status ändert sich zu „Online“, wenn das Modell vollständig heruntergeladen, initialisiert und einsatzbereit ist.
Neuer Assistent
Wenn Sie ein neues Modell erstellen, wird standardmäßig auch ein neuer Assistent erstellt. Das Neuer Assistent Formular wird angezeigt und ermöglicht die Anpassung der Standard-Einstellungen des neuen Assistenten.
KI-Assistentenverwaltung
Übersicht
KI-Assistenten sind konfigurierte KI-Modelle, die spezifische Fähigkeiten und Verhaltensweisen für Ihre KI-Funktionalität bereitstellen. Sie können mit bestimmten Prompts und Einstellungen angepasst werden, um Leistung und Antworttypen zu optimieren.
Einen Assistenten erstellen
Einen neuen Assistenten initiieren: Bei der Erstellung eines neuen Modells wird automatisch ein neuer Assistent mit Standardeinstellungen oder den im Assistent Tab ausgewählten Einstellungen erstellt. Ein neuer Assistent kann auch über AI > Neuer Assistent erstellt werden.
Namen: Geben Sie einen aussagekräftigen Namen für den Assistenten ein.
Wenn ein neuer Assistent automatisch erstellt wird (zusammen mit der Erstellung eines neuen Modells), entspricht der Name standardmäßig dem Namen des Modells.
Beschreibung (optional): Zusätzliche Details können eingegeben werden, um die Konfiguration, den Zweck usw. des Modells zu beschreiben.
Modell: Wählen Sie aus den verfügbaren Basismodellen (z. B. Llama-3.2, Phi-4-Instruct). Wenn ein Assistent zusammen mit einer neuen Modellerstellung automatisch erstellt wurde, wird dieses Feld automatisch auf das zugehörige Modell gesetzt und kann nicht bearbeitet werden.
Konfiguration der Einstellungen
Chat-Verlauf: Gesprächsaufbewahrung konfigurieren (nur interaktive Chatsitzungen)
Standardmäßig ein - Der Chatverlauf ist zu Beginn einer Sitzung automatisch aktiviert, kann aber deaktiviert werden
Standardmäßig aus - Der Chatverlauf ist zu Beginn einer Sitzung automatisch deaktiviert, kann aber aktiviert werden
Immer ein - Der Chatverlauf ist immer aktiviert; kann nicht deaktiviert werden
Immer aus - Der Chatverlauf ist immer deaktiviert; kann nicht aktiviert werden
Es gibt auch die Option, den Chatverlauf der vorherigen Sitzung jedes Mal zu löschen, wenn Sie eine neue Chatsitzung starten.
Think deaktivieren: Aktiviert oder deaktiviert schrittweises Schlussfolgern. Wenn aktiv, „zeigt die KI ihre Arbeit“, um die Genauigkeit zu verbessern; das ist besonders nützlich für komplexe Logik, Mathematik, Debugging oder strategische Planung. Das Deaktivieren von Think führt zu schnelleren Antworten und geringerem Ressourcenverbrauch, kann jedoch die Präzision verringern.
System-Prompt: Legt grundlegende Anweisungen für das Verhalten, den Ton und die Aufgabenorientierung der KI fest. Dieser Prompt beeinflusst, wie das Modell den Kontext interpretiert und Antworten generiert. Präzision ist wichtig; unklare oder überladene Prompts können die Ausgabequalität verschlechtern. Die System-Prompt-Anweisung wird dem Modell bei jeder Chat-Interaktion gegeben.
Temperatur: Steuert Kreativität und Zufälligkeit der generierten Antworten. (0,0 = deterministisch, 1,0 = kreativ), z. B. 0,2 prägnante, konsistente Formulierungen; 0,75 Metapher, Humor, unerwartete Blickwinkel Allgemeine Hinweise:
Niedrige Temperaturen (z. B. 0,0–0,3) – deterministische, fokussierte und reproduzierbare Antworten; ideal für Anwendungsfälle wie technische Dokumentation, Compliance-Richtlinien, Kundensupport
Hohe Temperaturen (z. B. 0,7–1,0) – kreative, explorative, weniger vorhersehbare Antworten; ideal für Brainstorming, Design-Ideenfindung und zielgruppenspezifische Formulierungen
Mittlere Temperaturen (z. B. 0,4–0,6) – Antworten balancieren Struktur mit etwas Variation, sind weniger formell und roboterhaft als niedrigere Temperaturen; großartig für Szenarioplanung, UI/UX-Analysen oder Infrastrukturabwägungen
Kontext-Score: (Standard 65) Stufe zur Bestimmung, wie das Modell bewertet, wie relevant, nützlich oder hervorstechend ein Informationsteil innerhalb eines gegebenen Kontextfensters ist. Dieser Wert legt die Mindestpunktzahl fest, die ein bestimmter Kontextteil erreichen muss, um als anwendbar zu gelten. Er hilft dabei zu entscheiden, worauf man sich konzentriert, was man ignoriert oder komprimiert, was man über mehrere Turns hinweg behält usw.
0 betrachtet alles als Übereinstimmung, während 100 eine strikte exakte Übereinstimmung erfordert
Der optimale Kontext-Score hängt vom verwendeten Modell, den Kontextinformationen (z. B. in den Arbeitsbereich des Assistenten hochgeladene Dokumente) und dem Anwendungsfall ab.
Der standardmäßige Kontext-Score (65) bietet ein moderates Maß an Relevanz, das weder sehr präzise noch völlig themenfremd ist. Wenn Sie sich über die beste Einstellung für Ihren Anwendungsfall unsicher sind, beginnen Sie mit der Standardeinstellung, führen Sie Testszenarien zur Bewertung der Ausgaben aus und passen Sie dann bei Bedarf den Kontext-Score an.
Max. Tokens: (Standard: 0 = kein Limit) Legt die maximale Länge der Systemantwort in Tokens fest. Tokens variieren zwischen verschiedenen KI-Modellen, aber allgemein entspricht ein Token etwa 0,7 Wörtern.
Wenn ein Max-Token festgelegt wird, sollte er kleiner als die Kontextgröße des Modells sein
Für viele Anwendungsfälle ist es vorzuziehen, einen Max-Token festzulegen, um die Antwort zu begrenzen (und zu verhindern, dass sie zu ausführlich wird)
Modelle unterscheiden sich in ihren Standard- oder Standardantworten, wobei einige Modelle dazu neigen, sehr ausschweifende Antworten zu geben, und andere standardmäßig kürzere und prägnantere Antworten liefern.
Erweitert: Feld für zukünftige erweiterte Konfigurationsoptionen reserviert. Kontaktieren Sie den Support, wenn Sie zusätzliche KI-Einstellungen benötigen, die über die in der Benutzeroberfläche bereitgestellten hinausgehen.
Klicken Sie auf Absenden um die Assistentenkonfiguration zu erstellen/speichern. Der Assistent wird bereitgestellt und steht zur Verwendung zur Verfügung.
KI-Dateiinhalte verwalten
Der Assistenten-Arbeitsbereich ermöglicht es Ihnen, Dateien hochzuladen und zu verwalten, um dem Assistenten eine proprietäre Wissensdatenbank mit Kontextinformationen bereitzustellen.
Um auf den Assistenten-Arbeitsbereich zuzugreifen:
Navigieren Sie zum Assistenten-Dashboard (KI > gewünschten Modell anklicken.)
Klicken Sie auf Arbeitsbereich anzeigen im linken Menü.
Dateien zum Arbeitsbereich hinzufügen
Klicken Sie auf Hochladen im linken Menü und klicken Sie auf die „Dateien auswählen“ Schaltfläche.
Navigieren und wählen Sie die gewünschte(n) Datei(en) aus.
Klicken Sie auf Öffnen um die ausgewählten Dateien zur Upload-Warteschlange hinzuzufügen.
Optional kann pro Datei eine Beschreibung und eine bevorzugte Speicherebene festgelegt werden.
Klicken Sie auf Starten um den Upload-Vorgang zu beginnen.
Arbeitsbereichsdateien bearbeiten
Wählen Sie eine Datei in der Liste aus und klicken Sie auf Bearbeiten im linken Menü, um Name, Beschreibung und/oder bevorzugte Speicherebene zu ändern.
Arbeitsbereichsdateien entfernen
Wählen Sie die gewünschte(n) Datei(en) aus und klicken Sie auf Löschen im linken Menü.
Klicken Sie auf Ja um den Löschvorgang zu bestätigen.
Fehlerbehebung
Häufige Probleme
Fehler bei der Modellinstallation
Unzureichende Ressourcen: Stellen Sie sicher, dass ausreichend CPU, RAM und Speicherplatz vorhanden sind
Netzwerkverbindung: Überprüfen Sie den Netzwerkzugriff für Modell-Downloads
Berechtigungsprobleme: Überprüfen Sie die Benutzerberechtigungen für die Modellverwaltung
Leistungsprobleme
Langsame Antworten: Erhöhen Sie die CPU-Zuweisung oder aktivieren Sie die GPU-Beschleunigung
Speicherfehler: Erhöhen Sie die RAM-Zuweisung oder aktivieren Sie Memory-Mapping
Ressourcenkonflikte: Überwachen Sie die Ressourcennutzung und passen Sie die Zuweisung an
Diagnoseschritte
Systemressourcen prüfen: Überprüfen Sie verfügbare CPU, RAM und Speicherplatz
Protokolle überprüfen: Untersuchen Sie die Systemprotokolle auf Fehlermeldungen
Netzwerkverbindung: Testen Sie den Netzwerkzugriff und die Konfiguration
Berechtigungsprüfung: Bestätigen Sie Benutzerberechtigungen und Zugriffsrechte
Modellstatus: Überprüfen Sie den Installations- und Bereitstellungsstatus des Modells
Versionskompatibilität: Diese Funktion ist in VergeOS 26.0 und höher verfügbar.
Zuletzt aktualisiert
War das hilfreich?