> For the complete documentation index, see [llms.txt](https://docs.verge.io/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.verge.io/automate-protect-and-extend/es/ia-privada/configuration.md).

# Configuración de IA

## Uso de la IA: pasos generales

1. [Definir un modelo](#ai-model-management) seleccionándolo de la selección curada incluida o cargando un modelo en formato .gguf compatible
2. [Configurar un asistente](#ai-assistant-management) basado en el modelo definido, con ajustes adaptados al caso de uso o tarea específicos
3. [Cargar contenido en el espacio de trabajo](#add-files-to-the-workspace) proporcionando archivos al asistente con contenido relevante
4. Interactuar:
   * [Router de OpenAI (método común)](/automate-protect-and-extend/es/ia-privada/open-ai-router.md): conectar programáticamente con el asistente a través del motor integrado
   * [Sesión de chat interactiva](/automate-protect-and-extend/es/ia-privada/chat-sessions.md): comunicarse con el asistente dentro de la interfaz de VergeOS (útil para pruebas)
   * **API de VergeOS**: acceder al asistente mediante comandos estándar de la API de VergeOS

## Ajustes generales de IA

Vaya a **IA** en el menú superior y haga clic en **Ajustes de IA** para configurar los parámetros predeterminados de la IA.

La página de Ajustes de IA le permite configurar valores predeterminados de todo el sistema para los componentes de IA:

* **Clúster de IA predeterminado**: especifica el clúster de cómputo predeterminado para las cargas de trabajo de IA. Los nuevos modelos de IA se desplegarán en este clúster de forma predeterminada.
* **Duración del historial de chat**: establece durante cuánto tiempo se conserva el historial de las sesiones de chat (en días). El valor predeterminado es 60 días.

***

## Gestión de modelos de IA

Los modelos de IA proporcionan la inteligencia subyacente para sus asistentes y aplicaciones de IA. VergeOS admite una amplia gama de modelos de IA mediante la compatibilidad con el formato estándar \*.gguf, lo que permite a los usuarios descargar y ejecutar cualquier archivo compatible. Varios modelos seleccionados se presentan directamente en la interfaz de VergeOS para una implementación rápida.

### Instalar un modelo de IA

{% hint style="success" %}
**Modelos curados**

El sistema incluye varios modelos preconfigurados, configurados con ajustes predeterminados, disponibles para descarga automática
{% endhint %}

1. Vaya a **IA** > **Modelos**.
2. Seleccione **Haga clic para instalar** en un modelo deseado, para instalar uno de los modelos curados disponibles. **-O-** haga clic en ***Nuevo modelo*** en el menú de la izquierda.
3. Configure todos los ajustes deseados:

* **Selección del modelo**: elija de una lista curada de modelos base (por ejemplo, Llama-3.2, Phi-4-Instruct) y seleccione un tamaño **Variante** (por ejemplo, Small – 1 GB). **-O-** seleccione --Personalizado-- y proporcione un **URL** para descargar un archivo de modelo .gguf
* **Nombre**: introduzca un nombre descriptivo para su modelo.
* **Descripción** (opcional): añada detalles sobre el propósito, la configuración o el uso previsto del modelo.
* **Núcleos**: número máximo de núcleos que se asignarán a cada instancia del modelo.
  * Modelos habilitados para GPU: la asignación de núcleos tiene un impacto mínimo.
  * Modo solo CPU o de respaldo: la asignación de núcleos es crítica para el inicio y el rendimiento.
  * La sobreasignación de núcleos no mejora el rendimiento; los núcleos no utilizados permanecen inactivos.
* **RAM**: memoria asignada por instancia del modelo:
  * Se requiere una cantidad base de RAM para cargar y ejecutar el modelo. Los requisitos reales varían según el tipo y el tamaño del modelo.
  * Una guía general para la cantidad fundamental de RAM necesaria: asigne ligeramente más RAM que el tamaño del archivo del modelo (por ejemplo, un modelo de 2 GB puede necesitar 3 GB de RAM).
  * Puede ser necesaria RAM adicional para admitir solicitudes simultáneas (es decir, la configuración paralela) y ventanas de contexto más grandes.
  * Comience con una asignación generosa y luego supervise el uso real a través del panel del modelo. Si el consumo observado es significativamente inferior al importe asignado, reduzca la asignación para optimizar la eficiencia de recursos.
* **Clúster** (usa por defecto el clúster definido en los ajustes globales de IA): seleccione el clúster de VergeOS en el que se ejecutará el modelo.
* **Grupo de HA**: especifica el grupo de alta disponibilidad para el modelo. Los miembros del mismo grupo de HA se ejecutarán en nodos diferentes si es posible.
* **Asignación de grupo de recursos de GPU**: - elija un grupo de recursos de GPU para asignar dispositivos GPU, o seleccione *--Solo CPU--* para ejecutarlo exclusivamente en CPU.

{% hint style="info" %}
**Los dispositivos GPU se distribuyen desde conjuntos llamados** [**Grupos de recursos**](/run-the-platform/es/administracion-del-sistema/device-pass-overview.md#resource-groups)**.**
{% endhint %}

* **Permitir CPU de respaldo si los recursos GPU no están disponibles**: habilite esta opción para usar recursos de CPU si los dispositivos GPU no están disponibles. Al usar esta opción, asegúrese de que se asignen suficientes núcleos de CPU para escenarios de respaldo.
* **Nivel preferido**: seleccione el nivel de almacenamiento para alojar el modelo.
* **Tamaño del contexto** (predeterminado 8192): - número máximo de tokens que el modelo puede procesar en una sesión activa. Esto incluye:
  * Entrada del usuario
  * Salida de la IA
  * Mensaje del sistema
  * Historial de conversación

{% hint style="success" %}
**Tokens**

* 1 token ≈ 4 caracteres (promedio para inglés)
* 1 palabra ≈ 1,33 tokens
* 8192 tokens ≈ 2.000–4.000 palabras o \~12–20 páginas de texto
  {% endhint %}

{% hint style="info" %}
**Consideraciones sobre el tamaño del contexto**

* Coherencia: un contexto más largo mejora la continuidad entre conversaciones o documentos

* Precisión: más contexto permite una mejor toma de decisiones

* Rendimiento: tamaños de contexto más grandes requieren más RAM y recursos de cómputo
  {% endhint %}

* **Paralelo**: número de solicitudes simultáneas que cada instancia del modelo puede gestionar

* **Trabajadores mínimos**: número mínimo de instancias del modelo iniciadas cuando el modelo arranca.

* **Trabajadores máximos**: número máximo de instancias del modelo que pueden iniciarse para satisfacer la demanda.

{% hint style="success" %}
**El número de instancias del modelo en ejecución (trabajadores) para un modelo se reflejará en el panel del modelo, con cada instancia representada como un trabajador en ejecución.**
{% endhint %}

* **Insertar etiqueta Think**: agrega una etiqueta personalizada para distinguir el razonamiento paso a paso de la salida final. Algunos modelos suprimen o tratan esta etiqueta como no salida para reducir la latencia.
* **Eliminar la etiqueta Think del historial**: habilite esto para excluir el contenido de razonamiento paso a paso del historial de respuestas, devolviendo solo la respuesta final.

5. Haga clic en **Enviar** para descargar y configurar el modelo especificado.

{% hint style="success" %}
**El modelo puede tardar varios minutos o más en descargarse. El panel del modelo (haga clic en&#x20;*****Modelos*****&#x20;en el menú izquierdo y haga doble clic en el modelo) indicará un estado "Descargando" y el progreso mientras el modelo se esté transfiriendo activamente.&#x20;*****Estado*****&#x20;cambiará a "En línea" cuando el modelo se haya descargado por completo, inicializado y esté listo para su uso.**
{% endhint %}

{% hint style="success" %}
**Nuevo asistente**

Cuando crea un nuevo modelo, también se crea un nuevo asistente de forma predeterminada. El *Nuevo asistente* formulario aparecerá permitiendo personalizar los ajustes predeterminados del nuevo asistente.
{% endhint %}

## Gestión del asistente de IA

### Descripción general

Los asistentes de IA son modelos de IA configurados que proporcionan capacidades y comportamiento específicos con su funcionalidad de IA. Se pueden personalizar con indicaciones y ajustes específicos para adaptar el rendimiento y los tipos de respuestas.

### Crear un asistente

1. **Iniciar un nuevo asistente:** Tras la creación de un nuevo modelo, se crea automáticamente un nuevo asistente con los ajustes predeterminados, o con los seleccionados en la *Asistente* pestaña. También se puede crear un nuevo asistente navegando a IA > Nuevo asistente.

* **Nombre**: introduzca un nombre descriptivo para el asistente.

{% hint style="success" %}
**Cuando un nuevo asistente se crea automáticamente (junto con la creación de un nuevo modelo), el nombre predeterminado será el mismo que el nombre del modelo.**
{% endhint %}

* **Descripción** (opcional): se pueden introducir detalles adicionales para describir la configuración, el propósito, etc. del modelo.
* **Modelo**: elija entre los modelos base disponibles (por ejemplo, Llama-3.2, Phi-4-Instruct). Cuando un asistente se crea automáticamente junto con la creación de un nuevo modelo, este campo se establece automáticamente en el modelo asociado y no se puede editar.
* **Configuración de ajustes**
* **Historial de chat**: configurar la retención de conversaciones (solo sesiones de chat interactivas)
  * ***Activado por defecto*** - el historial de chat se habilita automáticamente al inicio de una sesión, pero se puede deshabilitar
  * ***Desactivado por defecto*** - el historial de chat se deshabilita automáticamente al inicio de una sesión, pero se puede habilitar
  * ***Siempre activado*** - el historial de chat siempre está habilitado; no se puede deshabilitar
  * ***Siempre desactivado*** - el historial de chat siempre está deshabilitado; no se puede habilitar

{% hint style="success" %}
**También existe la opción de eliminar el historial de chat de la sesión anterior cada vez que inicia una nueva sesión de chat.**
{% endhint %}

* **Desactivar Think**: habilita o deshabilita el razonamiento de varios pasos. Cuando está activo, la IA "muestra su trabajo" para mejorar la precisión; esto es especialmente útil para lógica compleja, matemáticas, depuración o planificación estratégica. Desactivar think proporciona respuestas más rápidas y menor uso de recursos, pero puede reducir la precisión.

{% hint style="info" %}
**La disponibilidad de la&#x20;*****Think*****&#x20;función depende de la compatibilidad del modelo.**
{% endhint %}

* **Prompt del sistema**: establece instrucciones fundamentales para el comportamiento, el tono y la orientación de tareas de la IA. Este mensaje influye en cómo el modelo interpreta el contexto y genera respuestas. La precisión importa; los mensajes ambiguos o demasiado cargados pueden degradar la calidad de la salida. La instrucción del mensaje del sistema se **proporciona al modelo en cada interacción de chat**.

{% hint style="info" %}
**Consideraciones sobre el mensaje del sistema**

* Los mensajes más largos pueden mejorar la precisión de la respuesta y la alineación con la tarea, pero también aumentan el uso de recursos.

* El mensaje completo del sistema se vuelve a procesar con cada consulta y contribuye al recuento total de tokens de entrada del modelo (longitud del contexto), lo que puede limitar el espacio disponible para la entrada del usuario y la conversación previa.
  {% endhint %}

* **Temperatura**: controla la creatividad de las respuestas y la aleatoriedad de las respuestas generadas. (0.0 = determinista, 1.0 = creativo), ej.: 0.2 redacción ajustada y coherente; 0.75 metáforas, humor, ángulos inesperados. Orientación general:
  * Temperaturas bajas (p. ej., 0.0–0.3): respuestas deterministas, centradas y repetibles; ideales para usos como documentación técnica, guías de cumplimiento, soporte al cliente
  * Temperaturas altas (p. ej., 0.7–1.0): respuestas creativas, exploratorias y menos predecibles; ideales para lluvias de ideas, ideación de diseño, redacción específica para la audiencia
  * Temperaturas medias (p. ej., 0.4–0.6): las respuestas equilibran estructura con cierta variación, menos formales y robóticas que las temperaturas más bajas; excelentes para planificación de escenarios, análisis de UI/UX o compensaciones de infraestructura

* **Puntuación de contexto**: (predeterminado 65) nivel para determinar cómo evaluará el modelo cuán relevante, útil o destacada es una pieza de información dentro de una ventana de contexto dada. Este valor establece la puntuación mínima requerida para que una pieza de contexto se considere aplicable. Ayuda a decidir en qué centrarse, qué ignorar o comprimir, qué conservar entre turnos, etc.
  * 0 considerará cualquier cosa como coincidencia, mientras que 100 requerirá una coincidencia estricta y perfecta
  * La puntuación de contexto óptima dependerá del modelo utilizado, la información de contexto (por ejemplo, documentos cargados en el espacio de trabajo del asistente) y el caso de uso.
  * La puntuación de contexto predeterminada (65) proporciona un nivel moderado de relevancia que no es ni muy preciso ni completamente fuera de tema. Si no está seguro del mejor ajuste para su caso de uso, comience con la configuración predeterminada, ejecute escenarios de prueba para evaluar las salidas y luego ajuste la puntuación de contexto si es necesario.

* **Máx. de tokens**: (predeterminado: 0 = sin límite) establezca la longitud máxima de la respuesta del sistema en tokens. Los tokens varían entre los distintos modelos de IA, pero en general un token equivale a .7 palabras.
  * Al establecer un máximo de tokens, debe ser inferior al tamaño del contexto del modelo
  * Para muchos casos de uso, es preferible establecer un máximo de tokens para limitar la respuesta (y evitar que sea demasiado verbosa)
  * Los modelos varían en sus respuestas estándar o predeterminadas, y algunos tienden a dar respuestas muy largas mientras que otros proporcionan respuestas más cortas y concisas de forma predeterminada.

* **Avanzado**: campo reservado para futuras opciones de configuración mejoradas. Póngase en contacto con soporte si necesita ajustes de IA adicionales más allá de los proporcionados en la interfaz.

2. Haga clic en **Enviar** para crear/guardar la configuración del asistente. El asistente se desplegará y estará disponible para su uso.

***

## Gestionar el contenido de archivos de IA

El espacio de trabajo del asistente le permite cargar y gestionar archivos para proporcionar una base de conocimiento contextual propietaria al asistente.

**Para acceder al espacio de trabajo del asistente**:

* Navegue al panel del asistente (IA > haga clic en el modelo deseado).
* Haga clic en **Ver espacio de trabajo** en el menú de la izquierda.

## Añadir archivos al espacio de trabajo

* Haga clic en **Cargar** en el menú izquierdo y haga clic en **"Elegir archivos"** botón.
* **Navegue y seleccione** el/los archivo(s) deseado(s).
* Haga clic en **Abrir** para añadir los archivos seleccionados a la cola de carga.
* Opcionalmente, se puede configurar una descripción y el nivel preferido por archivo.
* Haga clic en **Iniciar** para comenzar el proceso de carga.

{% hint style="info" %}
**NO recargue ni cierre la ventana del navegador**

Se mostrará un mensaje emergente con la cola de carga, los tamaños de archivo y el progreso de carga de cada archivo individual. Evite recargar o cerrar la página del navegador hasta que todas las cargas se hayan completado para garantizar la transferencia completa de los archivos.
{% endhint %}

## Modificar archivos del espacio de trabajo

Seleccione un archivo de la lista y haga clic en **Editar** en el menú izquierdo para modificar el nombre, la descripción y/o el nivel preferido.

### Eliminar archivos del espacio de trabajo

* Seleccione el/los archivo(s) deseado(s) y haga clic en **Eliminar** en el menú de la izquierda.
* Haga clic en **Sí** para confirmar la operación de eliminación.

***

## Solución de problemas

### Problemas comunes

#### Errores de instalación del modelo

* **Recursos insuficientes**: asegúrese de contar con CPU, RAM y almacenamiento adecuados
* **Conectividad de red**: verifique el acceso a la red para las descargas del modelo
* **Problemas de permisos**: compruebe los permisos de usuario para la gestión de modelos

#### Problemas de rendimiento

* **Respuestas lentas**: aumente la asignación de CPU o habilite la aceleración por GPU
* **Errores de memoria**: aumente la asignación de RAM o habilite el mapeo de memoria
* **Contención de recursos**: supervise el uso de recursos y ajuste la asignación

### Pasos de diagnóstico

1. **Comprobar los recursos del sistema**: verifique la CPU, la RAM y el almacenamiento disponibles
2. **Revisar registros**: examine los registros del sistema en busca de mensajes de error
3. **Conectividad de red**: pruebe el acceso y la configuración de red
4. **Verificación de permisos**: confirme los permisos de usuario y los derechos de acceso
5. **Estado del modelo**: compruebe el estado de instalación y despliegue del modelo

***

**Compatibilidad de versiones**: Esta funcionalidad está disponible en VergeOS 26.0 y versiones posteriores.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.verge.io/automate-protect-and-extend/es/ia-privada/configuration.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
