> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/automate-protect-and-extend/fr/ia-privee/configuration.md).

# Configuration de l’IA

## Utilisation de l’IA - Étapes générales

1. [Définir un modèle](#ai-model-management) en sélectionnant parmi la sélection triée sur le volet incluse ou en téléversant un modèle pris en charge au format .gguf
2. [Configurer un assistant](#ai-assistant-management) basé sur le modèle défini, avec des paramètres adaptés au cas d’usage ou à la tâche particulière
3. [Téléverser du contenu dans l’espace de travail](#add-files-to-the-workspace) en fournissant des fichiers à l’assistant avec du contenu pertinent
4. Interagir :
   * [OpenAI Router (méthode courante)](/automate-protect-and-extend/fr/ia-privee/open-ai-router.md): connectez-vous par programmation à l’assistant via le moteur intégré
   * [Session de chat interactive](/automate-protect-and-extend/fr/ia-privee/chat-sessions.md): communiquez avec l’assistant dans l’interface utilisateur VergeOS (utile pour les tests)
   * **API VergeOS**: accédez à l’assistant à l’aide des commandes standard de l’API VergeOS

## Paramètres généraux de l’IA

Accédez à **IA** dans le menu supérieur, puis cliquez sur **Paramètres de l’IA** pour configurer les paramètres IA par défaut.

La page Paramètres de l’IA vous permet de configurer des valeurs par défaut système pour les composants d’IA :

* **Cluster d’IA par défaut**: Spécifie le cluster de calcul par défaut pour les charges de travail IA. Les nouveaux modèles d’IA seront déployés sur ce cluster par défaut.
* **Durée de conservation de l’historique des conversations**: Définit la durée de conservation de l’historique des sessions de chat (en jours). La valeur par défaut est de 60 jours.

***

## Gestion des modèles d’IA

Les modèles d’IA fournissent l’intelligence sous-jacente à vos assistants et applications IA. VergeOS prend en charge un large éventail de modèles d’IA en prenant en charge le format standard \*.gguf, ce qui permet aux utilisateurs de télécharger et d’exécuter n’importe quel fichier compatible. Plusieurs modèles triés sur le volet sont présentés directement dans l’interface utilisateur VergeOS pour un déploiement rapide.

### Installer un modèle d’IA

{% hint style="success" %}
**Modèles triés sur le volet**

Le système inclut plusieurs modèles préconfigurés, configurés avec des paramètres par défaut, disponibles en téléchargement automatique
{% endhint %}

1. Accédez à **IA** > **Modèles**.
2. Sélectionnez **Cliquez pour installer** sur le modèle souhaité, pour installer l’un des modèles triés sur le volet disponibles. **-OU-** cliquez ***Nouveau modèle*** dans le menu de gauche.
3. Configurez tous les paramètres souhaités :

* **Sélection du modèle**: Choisissez parmi une liste triée sur le volet de modèles de base (par ex. Llama-3.2, Phi-4-Instruct) et sélectionnez une taille **Variante** (par ex. Petite – 1 Go). **-OU-** sélectionnez --Personnalisé-- et fournissez un **URL** pour télécharger un fichier de modèle .gguf
* **Nom**: Saisissez un nom descriptif pour votre modèle.
* **Description** (facultatif) : Ajoutez des détails sur l’objectif, la configuration ou l’utilisation prévue du modèle.
* **Cœurs**: nombre maximal de cœurs à allouer à chaque instance du modèle.
  * Modèles compatibles GPU : l’allocation des cœurs a un impact minimal.
  * Mode CPU uniquement ou de secours : l’allocation des cœurs est essentielle pour le démarrage et les performances.
  * La surallocation de cœurs n’améliore pas les performances ; les cœurs inutilisés restent inactifs.
* **RAM**: Mémoire allouée par instance de modèle :
  * Une quantité de base de RAM est requise pour charger et exécuter le modèle. Les besoins réels varient selon le type et la taille du modèle.
  * Recommandation générale pour la quantité de base de RAM nécessaire : allouez légèrement plus de RAM que la taille du fichier du modèle (par ex. un modèle de 2 Go peut nécessiter 3 Go de RAM).
  * De la RAM supplémentaire peut être nécessaire pour prendre en charge des requêtes simultanées (c’est-à-dire le réglage parallèle) et des fenêtres de contexte plus grandes.
  * Commencez par une allocation généreuse, puis surveillez l’utilisation réelle via le tableau de bord du modèle. Si la consommation observée est nettement inférieure au montant alloué, réduisez-la pour optimiser l’efficacité des ressources.
* **Cluster** (utilise par défaut le cluster défini dans les paramètres IA globaux) : Sélectionnez le cluster VergeOS sur lequel le modèle s’exécutera.
* **Groupe HA**: Spécifie le groupe de haute disponibilité pour le modèle. Les membres du même groupe HA s’exécuteront sur différents nœuds si possible.
* **Attribution du groupe de ressources GPU**: - Choisissez un groupe de ressources GPU pour attribuer des périphériques GPU, ou sélectionnez *--CPU uniquement--* pour exécuter exclusivement sur les CPU.

{% hint style="info" %}
**Les périphériques GPU sont répartis à partir de pools appelés** [**Groupes de ressources**](/run-the-platform/fr/administration-systeme/device-pass-overview.md#resource-groups)**.**
{% endhint %}

* **Autoriser le basculement sur CPU si les ressources GPU ne sont pas disponibles**: Activez cette option pour utiliser les ressources CPU si les périphériques GPU ne sont pas disponibles. Lorsque vous utilisez cette option, assurez-vous que suffisamment de cœurs CPU sont alloués pour les scénarios de secours.
* **Niveau préféré**: Sélectionnez le niveau de stockage pour héberger le modèle.
* **Taille du contexte** (par défaut 8192) : - Nombre maximal de jetons que le modèle peut traiter dans une session active. Cela inclut :
  * Entrée utilisateur
  * Sortie de l’IA
  * Prompt système
  * Historique de conversation

{% hint style="success" %}
**Jetons**

* 1 jeton ≈ 4 caractères (en moyenne pour l’anglais)
* 1 mot ≈ 1,33 jeton
* 8192 jetons ≈ 2 000 à 4 000 mots ou environ 12 à 20 pages de texte
  {% endhint %}

{% hint style="info" %}
**Considérations sur la taille du contexte**

* Cohérence : un contexte plus long améliore la continuité entre les conversations ou les documents

* Précision : davantage de contexte permet une meilleure prise de décision

* Performance : des tailles de contexte plus grandes nécessitent davantage de RAM et de ressources de calcul
  {% endhint %}

* **Parallèle**: Nombre de requêtes simultanées que chaque instance du modèle peut gérer

* **Workers min.**: Nombre minimum d’instances du modèle lancées au démarrage du modèle.

* **Workers max.**: Nombre maximum d’instances du modèle pouvant être lancées pour répondre à la demande.

{% hint style="success" %}
**Le nombre d’instances du modèle en cours d’exécution (workers) pour un modèle sera reflété sur le tableau de bord du modèle, chaque instance étant représentée comme un worker en cours d’exécution.**
{% endhint %}

* **Insérer la balise de réflexion**: Ajoute une balise personnalisée pour distinguer le raisonnement en chaîne de pensée de la sortie finale. Certains modèles suppriment cette balise ou la traitent comme non-sortie pour réduire la latence.
* **Supprimer la balise de réflexion de l’historique**: Activez cette option pour exclure le contenu de chaîne de pensée de l’historique des réponses, en ne renvoyant que la réponse finale.

5. Cliquez sur **Soumettre** pour télécharger et configurer le modèle spécifié.

{% hint style="success" %}
**Le téléchargement du modèle peut prendre plusieurs minutes, voire plus. Le tableau de bord du modèle (cliquez&#x20;*****Modèles*****&#x20;dans le menu de gauche et double-cliquez sur le modèle) indiquera un statut « Téléchargement en cours » ainsi que la progression pendant que le modèle est en cours de transfert.&#x20;*****Statut*****&#x20;passera à « En ligne » lorsque le modèle sera entièrement téléchargé, initialisé et prêt à être utilisé.**
{% endhint %}

{% hint style="success" %}
**Nouvel assistant**

Lorsque vous créez un nouveau modèle, un nouvel assistant est également créé par défaut. Le *Nouvel assistant* formulaire apparaîtra et permettra de personnaliser les paramètres par défaut du nouvel assistant.
{% endhint %}

## Gestion de l’assistant IA

### Vue d’ensemble

Les assistants IA sont des modèles d’IA configurés qui fournissent des capacités et un comportement spécifiques à vos fonctionnalités IA. Ils peuvent être personnalisés avec des prompts et des paramètres spécifiques afin d’adapter les performances et les types de réponses.

### Créer un assistant

1. **Initier un nouvel assistant :** Lors de la création d’un nouveau modèle, un nouvel assistant est créé automatiquement avec les paramètres par défaut, ou ceux sélectionnés dans l’onglet *Assistant* . Un nouvel assistant peut également être créé en accédant à IA > Nouvel assistant.

* **Nom**: Saisissez un nom descriptif pour l’assistant.

{% hint style="success" %}
**Lorsqu’un nouvel assistant est créé automatiquement (en même temps que la création d’un nouveau modèle), le nom prendra par défaut le même nom que le modèle.**
{% endhint %}

* **Description** (facultatif) : Des détails supplémentaires peuvent être saisis pour décrire la configuration, l’objectif, etc. du modèle.
* **Modèle**: Choisissez parmi les modèles de base disponibles (par ex. Llama-3.2, Phi-4-Instruct). Lorsqu’un assistant a été créé automatiquement avec la création d’un nouveau modèle, ce champ est automatiquement défini sur le modèle associé et ne peut pas être modifié.
* **Configuration des paramètres**
* **Historique de discussion**: Configurez la conservation des conversations (sessions de chat interactives uniquement)
  * ***Activé par défaut*** - l’historique de chat est automatiquement activé au début d’une session, mais peut être désactivé
  * ***Désactivé par défaut*** - l’historique de chat est automatiquement désactivé au début d’une session, mais peut être activé
  * ***Toujours activé*** - l’historique de chat est toujours activé ; il ne peut pas être désactivé
  * ***Toujours désactivé*** - l’historique de chat est toujours désactivé ; il ne peut pas être activé

{% hint style="success" %}
**Il existe également une option permettant de supprimer l’historique de chat de la session précédente chaque fois que vous démarrez une nouvelle session de chat.**
{% endhint %}

* **Désactiver Think**: Active ou désactive le raisonnement en plusieurs étapes. Lorsqu’il est actif, l’IA « montre son travail » pour améliorer la précision ; cela est particulièrement utile pour la logique complexe, les mathématiques, le débogage ou la planification stratégique. La désactivation de Think produit des réponses plus rapides et une utilisation moindre des ressources, mais peut réduire la précision.

{% hint style="info" %}
**La disponibilité de la&#x20;*****fonctionnalité Think*****&#x20;dépend de la prise en charge du modèle.**
{% endhint %}

* **Invite système**: Définit les instructions fondamentales pour le comportement, le ton et l’orientation des tâches de l’IA. Ce prompt influence la façon dont le modèle interprète le contexte et génère les réponses. La précision est importante ; des prompts ambigus ou surchargés peuvent dégrader la qualité de la sortie. L’instruction du prompt système est **donnée au modèle pour chaque interaction de chat**.

{% hint style="info" %}
**Considérations sur le prompt système**

* Des prompts plus longs peuvent améliorer la précision des réponses et l’adéquation à la tâche, mais ils augmentent aussi l’utilisation des ressources.

* Le prompt système complet est retraité à chaque requête et contribue au nombre total de jetons d’entrée du modèle (longueur du contexte), ce qui peut limiter l’espace disponible pour l’entrée utilisateur et la conversation précédente.
  {% endhint %}

* **Température**: Contrôle la créativité et l’aléatoire des réponses générées. (0,0 = déterministe, 1,0 = créatif), ex. : 0,2 formulation concise et cohérente ; 0,75 métaphore, humour, angles inattendus Conseils généraux :
  * Températures basses (par ex. 0,0–0,3) - réponses déterministes, ciblées et reproductibles ; idéales pour des usages tels que la documentation technique, les conseils de conformité, le support client
  * Températures élevées (par ex. 0,7–1,0) - réponses créatives, exploratoires et moins prévisibles ; idéales pour le brainstorming, l’idéation de conception, et les formulations adaptées à un public spécifique
  * Températures moyennes (par ex. 0,4–0,6) - les réponses équilibrent structure et variation, avec un style moins formel et moins robotique que les températures basses ; idéal pour la planification de scénarios, l’analyse UI/UX ou les arbitrages d’infrastructure

* **Score de contexte**: (par défaut 65) Niveau permettant de déterminer comment le modèle évaluera la pertinence, l’utilité ou le caractère saillant d’une information dans une fenêtre de contexte donnée. Cette valeur définit le score minimum requis pour qu’un élément de contexte soit considéré comme applicable. Elle aide à décider sur quoi se concentrer, quoi ignorer ou compresser, quoi conserver d’un tour à l’autre, etc.
  * 0 considérera tout comme une correspondance, tandis que 100 exigera une correspondance stricte et parfaite
  * Le score de contexte optimal dépendra du modèle utilisé, des informations de contexte (par ex. les documents téléversés dans l’espace de travail de l’assistant) et du cas d’usage.
  * Le score de contexte par défaut (65) offre un niveau de pertinence modéré, ni très précis ni complètement hors sujet. Si vous n’êtes pas sûr du meilleur réglage pour votre cas d’usage, commencez avec le réglage par défaut, lancez des scénarios de test pour évaluer les résultats, puis ajustez le score de contexte si nécessaire.

* **Nombre maximal de jetons**: (par défaut : 0 = aucune limite) Définissez la longueur maximale de la réponse du système en jetons. Les jetons varient selon les différents modèles d’IA, mais en général, un jeton équivaut à 0,7 mot.
  * Lors du réglage d’un nombre maximal de jetons, il doit être inférieur à la taille du contexte du modèle
  * Pour de nombreux cas d’usage, il est préférable de définir un maximum de jetons pour limiter la réponse (et éviter qu’elle soit trop verbeuse)
  * Les modèles varient dans leurs réponses standard ou par défaut, certains ayant tendance à fournir des réponses très longues et d’autres donnant par défaut des réponses plus courtes et concises.

* **Avancé**: Champ réservé à de futures options de configuration avancées. Contactez le support si vous avez besoin de paramètres IA supplémentaires au-delà de ceux fournis dans l’interface utilisateur.

2. Cliquez sur **Soumettre** pour créer/enregistrer la configuration de l’assistant. L’assistant sera déployé et deviendra disponible à l’utilisation.

***

## Gérer le contenu des fichiers IA

L’espace de travail de l’assistant vous permet de téléverser et de gérer des fichiers afin de fournir à l’assistant une base de connaissances contextuelle propriétaire.

**Pour accéder à l’espace de travail de l’assistant**:

* Accédez au tableau de bord de l’assistant (IA > cliquez sur le modèle souhaité.)
* Cliquez sur **Voir l’espace de travail** dans le menu de gauche.

## Ajouter des fichiers à l’espace de travail

* Cliquez sur **Téléverser** dans le menu de gauche et cliquez sur le **« Choisir des fichiers »** bouton.
* **Parcourez et sélectionnez** le ou les fichiers souhaités.
* Cliquez sur **Ouvrir** pour ajouter les fichiers sélectionnés à la file d’attente de téléversement.
* En option, une description et un niveau préféré peuvent être configurés pour chaque fichier.
* Cliquez sur **Démarrer** pour lancer le processus de téléversement.

{% hint style="info" %}
**NE rechargez PAS et ne fermez PAS la fenêtre du navigateur**

Une fenêtre contextuelle affichera la file d’attente de téléversement, les tailles des fichiers et la progression du téléversement pour chaque fichier individuel. Évitez de recharger ou de fermer la page du navigateur jusqu’à ce que tous les téléversements soient terminés afin d’assurer le transfert complet des fichiers.
{% endhint %}

## Modifier les fichiers de l’espace de travail

Sélectionnez un fichier dans la liste et cliquez sur **Modifier** dans le menu de gauche pour modifier le nom, la description et/ou le niveau préféré.

### Supprimer les fichiers de l’espace de travail

* Sélectionnez le ou les fichiers souhaités et cliquez sur **Supprimer** dans le menu de gauche.
* Cliquez sur **Oui** pour confirmer l’opération de suppression.

***

## Dépannage

### Problèmes courants

#### Échecs d’installation du modèle

* **Ressources insuffisantes**: Assurez-vous d’avoir suffisamment de CPU, de RAM et de stockage
* **Connectivité réseau**: Vérifiez l’accès réseau pour les téléchargements de modèles
* **Problèmes d’autorisation**: Vérifiez les autorisations utilisateur pour la gestion des modèles

#### Problèmes de performances

* **Réponses lentes**: Augmentez l’allocation CPU ou activez l’accélération GPU
* **Erreurs de mémoire**: Augmentez l’allocation de RAM ou activez le mappage mémoire
* **Contention des ressources**: Surveillez l’utilisation des ressources et ajustez l’allocation

### Étapes de diagnostic

1. **Vérifier les ressources système**: Vérifiez le CPU, la RAM et le stockage disponibles
2. **Examiner les journaux**: Examinez les journaux système pour les messages d’erreur
3. **Connectivité réseau**: Testez l’accès réseau et la configuration
4. **Vérification des autorisations**: Confirmez les autorisations utilisateur et les droits d’accès
5. **État du modèle**: Vérifiez l’état d’installation et de déploiement du modèle

***

**Compatibilité de version**: Cette fonctionnalité est disponible dans VergeOS 26.0 et versions ultérieures.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/automate-protect-and-extend/fr/ia-privee/configuration.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
