> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/automate-protect-and-extend/de/private-ki/configuration.md).

# KI-Konfiguration

## KI verwenden – Allgemeine Schritte

1. [Ein Modell definieren](#ai-model-management) durch Auswahl aus der enthaltenen kuratierten Auswahl oder durch Hochladen eines unterstützten Modells im .gguf-Format
2. [Einen Assistenten konfigurieren](#ai-assistant-management) basierend auf dem definierten Modell, mit angepassten Einstellungen für den jeweiligen Anwendungsfall oder die jeweilige Aufgabe
3. [Inhalte in den Arbeitsbereich hochladen](#add-files-to-the-workspace) dem Assistenten Dateien mit relevanten Inhalten bereitstellen
4. Interagieren:
   * [OpenAI Router (gängige Methode)](/automate-protect-and-extend/de/private-ki/open-ai-router.md): programmgesteuert über die integrierte Engine mit dem Assistenten verbinden
   * [Interaktive Chat-Sitzung](/automate-protect-and-extend/de/private-ki/chat-sessions.md): innerhalb der VergeOS-Benutzeroberfläche mit dem Assistenten kommunizieren (hilfreich zum Testen)
   * **VergeOS API**: den Assistenten mit standardmäßigen VergeOS-API-Befehlen aufrufen

## Allgemeine KI-Einstellungen

Navigieren Sie zu **KI** im oberen Menü und klicken Sie auf **KI-Einstellungen** um die standardmäßigen KI-Parameter zu konfigurieren.

Auf der Seite „KI-Einstellungen“ können Sie systemweite Standardwerte für KI-Komponenten konfigurieren:

* **Standard-KI-Cluster**: Gibt den standardmäßigen Rechencluster für KI-Workloads an. Neue KI-Modelle werden standardmäßig in diesem Cluster bereitgestellt.
* **Aufbewahrungsdauer des Chatverlaufs**: Legt fest, wie lange der Verlauf einer Chatsitzung aufbewahrt wird (in Tagen). Standard sind 60 Tage.

***

## KI-Modellverwaltung

KI-Modelle liefern die zugrunde liegende Intelligenz für Ihre KI-Assistenten und Anwendungen. VergeOS unterstützt eine breite Palette von KI-Modellen, indem es das Standardformat \*.gguf unterstützt und Benutzern ermöglicht, jede kompatible Datei herunterzuladen und auszuführen. Mehrere kuratierte Modelle werden direkt in der VergeOS-Benutzeroberfläche für eine schnelle Bereitstellung angezeigt.

### Ein KI-Modell installieren

{% hint style="success" %}
**Kuratierte Modelle**

Das System enthält mehrere vorkonfigurierte Modelle mit Standardeinstellungen, die automatisch heruntergeladen werden können
{% endhint %}

1. Navigieren Sie zu **KI** > **Modelle**.
2. Wählen Sie **Zum Installieren klicken** am gewünschten Modell, um eines der verfügbaren kuratierten Modelle zu installieren. **-ODER-** klicken Sie ***Neues Modell*** im linken Menü.
3. Konfigurieren Sie alle gewünschten Einstellungen:

* **Modellauswahl**: Wählen Sie aus einer kuratierten Liste von Basismodellen (z. B. Llama-3.2, Phi-4-Instruct) und wählen Sie eine Größe aus **Variante** (z. B. Klein – 1 GB). **-ODER-** wählen Sie --Benutzerdefiniert-- und geben Sie einen **URL** um eine .gguf-Modelldatei herunterzuladen
* **Namen**: Geben Sie einen aussagekräftigen Namen für Ihr Modell ein.
* **Beschreibung** (optional): Fügen Sie Details zum Zweck, zur Konfiguration oder zur beabsichtigten Verwendung des Modells hinzu.
* **Kerne**: maximale Anzahl an Kernen, die jeder Modellinstanz zugewiesen werden können.
  * GPU-fähige Modelle: Die Kernzuweisung hat nur minimale Auswirkungen.
  * Nur-CPU- oder Fallback-Modus: Die Kernzuweisung ist entscheidend für Start und Leistung.
  * Eine Überprovisionierung von Kernen verbessert die Leistung nicht; ungenutzte Kerne bleiben im Leerlauf.
* **RAM**: Pro Modellinstanz zugewiesener Speicher:
  * Eine Grundmenge an RAM ist erforderlich, um das Modell zu laden und auszuführen. Die tatsächlichen Anforderungen variieren je nach Modelltyp und -größe.
  * Als allgemeine Richtlinie für die grundlegende RAM-Menge gilt: Weisen Sie etwas mehr RAM zu als der Dateigröße des Modells entspricht (z. B. kann ein 2-GB-Modell 3 GB RAM benötigen).
  * Zusätzlicher RAM kann erforderlich sein, um gleichzeitige Anfragen (d. h. Paralleleinstellung) und größere Kontextfenster zu unterstützen.
  * Beginnen Sie mit einer großzügigen Zuweisung und überwachen Sie dann die tatsächliche Nutzung über das Modell-Dashboard. Wenn der beobachtete Verbrauch deutlich unter dem zugewiesenen Betrag liegt, reduzieren Sie ihn, um die Ressourceneffizienz zu optimieren.
* **Cluster** (standardmäßig dem im globalen KI-Setting definierten Cluster): Wählen Sie den VergeOS-Cluster aus, auf dem das Modell ausgeführt wird.
* **HA-Gruppe**: Gibt die Hochverfügbarkeitsgruppe für das Modell an. Mitglieder derselben HA-Gruppe werden nach Möglichkeit auf unterschiedlichen Knoten ausgeführt.
* **Zuweisung der GPU-Ressourcengruppe**: - Wählen Sie eine GPU-Ressourcengruppe aus, um GPU-Geräte zuzuweisen, oder wählen Sie *--Nur CPU--* um ausschließlich auf CPUs auszuführen.

{% hint style="info" %}
**GPU-Geräte werden aus Pools verteilt, die** [**Ressourcengruppen**](/run-the-platform/de/systemadministration/device-pass-overview.md#resource-groups)**.**
{% endhint %}

* **CPU-Fallback zulassen, wenn GPU-Ressourcen nicht verfügbar sind**: Aktivieren Sie diese Option, um CPU-Ressourcen zu verwenden, wenn GPU-Geräte nicht verfügbar sind. Wenn Sie diese Option verwenden, stellen Sie sicher, dass genügend CPU-Kerne für Fallback-Szenarien zugewiesen sind.
* **Bevorzugte Speicherebene**: Wählen Sie die Speicherebene für das Hosting des Modells aus.
* **Kontextgröße** (Standard 8192): - Maximale Anzahl von Tokens, die das Modell in einer aktiven Sitzung verarbeiten kann. Dazu gehören:
  * Benutzereingabe
  * KI-Ausgabe
  * System-Prompt
  * Verlauf der Unterhaltung

{% hint style="success" %}
**Tokens**

* 1 Token ≈ 4 Zeichen (Durchschnitt für Englisch)
* 1 Wort ≈ 1,33 Tokens
* 8192 Tokens ≈ 2.000–4.000 Wörter oder \~12–20 Seiten Text
  {% endhint %}

{% hint style="info" %}
**Überlegungen zur Kontextgröße**

* Kohärenz: Ein längerer Kontext verbessert die Kontinuität über Gespräche oder Dokumente hinweg

* Genauigkeit: Mehr Kontext ermöglicht bessere Entscheidungen

* Leistung: Größere Kontextgrößen erfordern mehr RAM und Rechenressourcen
  {% endhint %}

* **Parallel**: Anzahl gleichzeitiger Anfragen, die jede Modellinstanz verarbeiten kann

* **Min. Worker**: Mindestanzahl an Modellinstanzen, die beim Start des Modells gestartet werden.

* **Max. Worker**: Maximale Anzahl an Modellinstanzen, die gestartet werden können, um die Nachfrage zu decken.

{% hint style="success" %}
**Die Anzahl der laufenden Modellinstanzen (Worker) für ein Modell wird im Modell-Dashboard angezeigt, wobei jede Instanz als laufender Worker dargestellt wird.**
{% endhint %}

* **Think-Tag einfügen**:- Fügt ein benutzerdefiniertes Tag hinzu, um Chain-of-Thought-Argumentation von der endgültigen Ausgabe zu unterscheiden. Einige Modelle unterdrücken dieses Tag oder behandeln es als Nicht-Ausgabe, um die Latenz zu reduzieren.
* **Think-Tag aus dem Verlauf entfernen**: Aktivieren Sie dies, um Chain-of-Thought-Inhalte aus dem Antwortverlauf auszuschließen und nur die endgültige Antwort zurückzugeben.

5. Klicken Sie auf **Absenden** um das angegebene Modell herunterzuladen und zu konfigurieren.

{% hint style="success" %}
**Das Herunterladen des Modells kann mehrere Minuten oder länger dauern. Das Modell-Dashboard (Klicken Sie&#x20;*****Modelle*****&#x20;im linken Menü und doppelklicken Sie auf das Modell) zeigt während der aktiven Übertragung den Status „Wird heruntergeladen“ sowie den Fortschritt an.&#x20;*****Status*****&#x20;ändert sich zu „Online“, wenn das Modell vollständig heruntergeladen, initialisiert und einsatzbereit ist.**
{% endhint %}

{% hint style="success" %}
**Neuer Assistent**

Wenn Sie ein neues Modell erstellen, wird standardmäßig auch ein neuer Assistent erstellt. Das *Neuer Assistent* Formular wird angezeigt und ermöglicht die Anpassung der Standard-Einstellungen des neuen Assistenten.
{% endhint %}

## KI-Assistentenverwaltung

### Übersicht

KI-Assistenten sind konfigurierte KI-Modelle, die spezifische Fähigkeiten und Verhaltensweisen für Ihre KI-Funktionalität bereitstellen. Sie können mit bestimmten Prompts und Einstellungen angepasst werden, um Leistung und Antworttypen zu optimieren.

### Einen Assistenten erstellen

1. **Einen neuen Assistenten initiieren:** Bei der Erstellung eines neuen Modells wird automatisch ein neuer Assistent mit Standardeinstellungen oder den im *Assistent* Tab ausgewählten Einstellungen erstellt. Ein neuer Assistent kann auch über AI > Neuer Assistent erstellt werden.

* **Namen**: Geben Sie einen aussagekräftigen Namen für den Assistenten ein.

{% hint style="success" %}
**Wenn ein neuer Assistent automatisch erstellt wird (zusammen mit der Erstellung eines neuen Modells), entspricht der Name standardmäßig dem Namen des Modells.**
{% endhint %}

* **Beschreibung** (optional): Zusätzliche Details können eingegeben werden, um die Konfiguration, den Zweck usw. des Modells zu beschreiben.
* **Modell**: Wählen Sie aus den verfügbaren Basismodellen (z. B. Llama-3.2, Phi-4-Instruct). Wenn ein Assistent zusammen mit einer neuen Modellerstellung automatisch erstellt wurde, wird dieses Feld automatisch auf das zugehörige Modell gesetzt und kann nicht bearbeitet werden.
* **Konfiguration der Einstellungen**
* **Chat-Verlauf**: Gesprächsaufbewahrung konfigurieren (nur interaktive Chatsitzungen)
  * ***Standardmäßig ein*** - Der Chatverlauf ist zu Beginn einer Sitzung automatisch aktiviert, kann aber deaktiviert werden
  * ***Standardmäßig aus*** - Der Chatverlauf ist zu Beginn einer Sitzung automatisch deaktiviert, kann aber aktiviert werden
  * ***Immer ein*** - Der Chatverlauf ist immer aktiviert; kann nicht deaktiviert werden
  * ***Immer aus*** - Der Chatverlauf ist immer deaktiviert; kann nicht aktiviert werden

{% hint style="success" %}
**Es gibt auch die Option, den Chatverlauf der vorherigen Sitzung jedes Mal zu löschen, wenn Sie eine neue Chatsitzung starten.**
{% endhint %}

* **Think deaktivieren**: Aktiviert oder deaktiviert schrittweises Schlussfolgern. Wenn aktiv, „zeigt die KI ihre Arbeit“, um die Genauigkeit zu verbessern; das ist besonders nützlich für komplexe Logik, Mathematik, Debugging oder strategische Planung. Das Deaktivieren von Think führt zu schnelleren Antworten und geringerem Ressourcenverbrauch, kann jedoch die Präzision verringern.

{% hint style="info" %}
**Die Verfügbarkeit des&#x20;*****Think*****&#x20;-Features hängt von der Unterstützung des Modells ab.**
{% endhint %}

* **System-Prompt**: Legt grundlegende Anweisungen für das Verhalten, den Ton und die Aufgabenorientierung der KI fest. Dieser Prompt beeinflusst, wie das Modell den Kontext interpretiert und Antworten generiert. Präzision ist wichtig; unklare oder überladene Prompts können die Ausgabequalität verschlechtern. Die System-Prompt-Anweisung wird **dem Modell bei jeder Chat-Interaktion gegeben**.

{% hint style="info" %}
**Überlegungen zum System-Prompt**

* Längere Prompts können die Genauigkeit der Antworten und die Ausrichtung auf die Aufgabe verbessern, erhöhen aber auch den Ressourcenverbrauch.

* Der vollständige System-Prompt wird bei jeder Anfrage erneut verarbeitet und trägt zur gesamten Eingabe-Token-Anzahl (Kontextlänge) des Modells bei, wodurch der verfügbare Platz für Benutzereingaben und frühere Unterhaltungen begrenzt werden kann.
  {% endhint %}

* **Temperatur**: Steuert Kreativität und Zufälligkeit der generierten Antworten. (0,0 = deterministisch, 1,0 = kreativ), z. B. 0,2 prägnante, konsistente Formulierungen; 0,75 Metapher, Humor, unerwartete Blickwinkel Allgemeine Hinweise:
  * Niedrige Temperaturen (z. B. 0,0–0,3) – deterministische, fokussierte und reproduzierbare Antworten; ideal für Anwendungsfälle wie technische Dokumentation, Compliance-Richtlinien, Kundensupport
  * Hohe Temperaturen (z. B. 0,7–1,0) – kreative, explorative, weniger vorhersehbare Antworten; ideal für Brainstorming, Design-Ideenfindung und zielgruppenspezifische Formulierungen
  * Mittlere Temperaturen (z. B. 0,4–0,6) – Antworten balancieren Struktur mit etwas Variation, sind weniger formell und roboterhaft als niedrigere Temperaturen; großartig für Szenarioplanung, UI/UX-Analysen oder Infrastrukturabwägungen

* **Kontext-Score**: (Standard 65) Stufe zur Bestimmung, wie das Modell bewertet, wie relevant, nützlich oder hervorstechend ein Informationsteil innerhalb eines gegebenen Kontextfensters ist. Dieser Wert legt die Mindestpunktzahl fest, die ein bestimmter Kontextteil erreichen muss, um als anwendbar zu gelten. Er hilft dabei zu entscheiden, worauf man sich konzentriert, was man ignoriert oder komprimiert, was man über mehrere Turns hinweg behält usw.
  * 0 betrachtet alles als Übereinstimmung, während 100 eine strikte exakte Übereinstimmung erfordert
  * Der optimale Kontext-Score hängt vom verwendeten Modell, den Kontextinformationen (z. B. in den Arbeitsbereich des Assistenten hochgeladene Dokumente) und dem Anwendungsfall ab.
  * Der standardmäßige Kontext-Score (65) bietet ein moderates Maß an Relevanz, das weder sehr präzise noch völlig themenfremd ist. Wenn Sie sich über die beste Einstellung für Ihren Anwendungsfall unsicher sind, beginnen Sie mit der Standardeinstellung, führen Sie Testszenarien zur Bewertung der Ausgaben aus und passen Sie dann bei Bedarf den Kontext-Score an.

* **Max. Tokens**: (Standard: 0 = kein Limit) Legt die maximale Länge der Systemantwort in Tokens fest. Tokens variieren zwischen verschiedenen KI-Modellen, aber allgemein entspricht ein Token etwa 0,7 Wörtern.
  * Wenn ein Max-Token festgelegt wird, sollte er kleiner als die Kontextgröße des Modells sein
  * Für viele Anwendungsfälle ist es vorzuziehen, einen Max-Token festzulegen, um die Antwort zu begrenzen (und zu verhindern, dass sie zu ausführlich wird)
  * Modelle unterscheiden sich in ihren Standard- oder Standardantworten, wobei einige Modelle dazu neigen, sehr ausschweifende Antworten zu geben, und andere standardmäßig kürzere und prägnantere Antworten liefern.

* **Erweitert**: Feld für zukünftige erweiterte Konfigurationsoptionen reserviert. Kontaktieren Sie den Support, wenn Sie zusätzliche KI-Einstellungen benötigen, die über die in der Benutzeroberfläche bereitgestellten hinausgehen.

2. Klicken Sie auf **Absenden** um die Assistentenkonfiguration zu erstellen/speichern. Der Assistent wird bereitgestellt und steht zur Verwendung zur Verfügung.

***

## KI-Dateiinhalte verwalten

Der Assistenten-Arbeitsbereich ermöglicht es Ihnen, Dateien hochzuladen und zu verwalten, um dem Assistenten eine proprietäre Wissensdatenbank mit Kontextinformationen bereitzustellen.

**Um auf den Assistenten-Arbeitsbereich zuzugreifen**:

* Navigieren Sie zum Assistenten-Dashboard (KI > gewünschten Modell anklicken.)
* Klicken Sie auf **Arbeitsbereich anzeigen** im linken Menü.

## Dateien zum Arbeitsbereich hinzufügen

* Klicken Sie auf **Hochladen** im linken Menü und klicken Sie auf die **„Dateien auswählen“** Schaltfläche.
* **Navigieren und wählen Sie** die gewünschte(n) Datei(en) aus.
* Klicken Sie auf **Öffnen** um die ausgewählten Dateien zur Upload-Warteschlange hinzuzufügen.
* Optional kann pro Datei eine Beschreibung und eine bevorzugte Speicherebene festgelegt werden.
* Klicken Sie auf **Starten** um den Upload-Vorgang zu beginnen.

{% hint style="info" %}
**Browserfenster NICHT neu laden oder schließen**

Eine Popup-Nachricht zeigt die Upload-Warteschlange, Dateigrößen und den Upload-Fortschritt pro einzelner Datei an. Laden Sie die Browserseite erst neu und schließen Sie sie nicht, bis alle Uploads abgeschlossen sind, um die vollständige Übertragung der Dateien sicherzustellen.
{% endhint %}

## Arbeitsbereichsdateien bearbeiten

Wählen Sie eine Datei in der Liste aus und klicken Sie auf **Bearbeiten** im linken Menü, um Name, Beschreibung und/oder bevorzugte Speicherebene zu ändern.

### Arbeitsbereichsdateien entfernen

* Wählen Sie die gewünschte(n) Datei(en) aus und klicken Sie auf **Löschen** im linken Menü.
* Klicken Sie auf **Ja** um den Löschvorgang zu bestätigen.

***

## Fehlerbehebung

### Häufige Probleme

#### Fehler bei der Modellinstallation

* **Unzureichende Ressourcen**: Stellen Sie sicher, dass ausreichend CPU, RAM und Speicherplatz vorhanden sind
* **Netzwerkverbindung**: Überprüfen Sie den Netzwerkzugriff für Modell-Downloads
* **Berechtigungsprobleme**: Überprüfen Sie die Benutzerberechtigungen für die Modellverwaltung

#### Leistungsprobleme

* **Langsame Antworten**: Erhöhen Sie die CPU-Zuweisung oder aktivieren Sie die GPU-Beschleunigung
* **Speicherfehler**: Erhöhen Sie die RAM-Zuweisung oder aktivieren Sie Memory-Mapping
* **Ressourcenkonflikte**: Überwachen Sie die Ressourcennutzung und passen Sie die Zuweisung an

### Diagnoseschritte

1. **Systemressourcen prüfen**: Überprüfen Sie verfügbare CPU, RAM und Speicherplatz
2. **Protokolle überprüfen**: Untersuchen Sie die Systemprotokolle auf Fehlermeldungen
3. **Netzwerkverbindung**: Testen Sie den Netzwerkzugriff und die Konfiguration
4. **Berechtigungsprüfung**: Bestätigen Sie Benutzerberechtigungen und Zugriffsrechte
5. **Modellstatus**: Überprüfen Sie den Installations- und Bereitstellungsstatus des Modells

***

**Versionskompatibilität**: Diese Funktion ist in VergeOS 26.0 und höher verfügbar.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/automate-protect-and-extend/de/private-ki/configuration.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
