Configuración de IA
Guía paso a paso para configurar modelos de IA, asistentes y archivos del espacio de trabajo en VergeOS Private AI, incluyendo asignación de recursos, prompts del sistema y solución de problemas.
Uso de la IA: pasos generales
Definir un modelo seleccionándolo de la selección curada incluida o cargando un modelo en formato .gguf compatible
Configurar un asistente basado en el modelo definido, con ajustes adaptados al caso de uso o tarea específicos
Cargar contenido en el espacio de trabajo proporcionando archivos al asistente con contenido relevante
Interactuar:
Router de OpenAI (método común): conectar programáticamente con el asistente a través del motor integrado
Sesión de chat interactiva: comunicarse con el asistente dentro de la interfaz de VergeOS (útil para pruebas)
API de VergeOS: acceder al asistente mediante comandos estándar de la API de VergeOS
Ajustes generales de IA
Vaya a IA en el menú superior y haga clic en Ajustes de IA para configurar los parámetros predeterminados de la IA.
La página de Ajustes de IA le permite configurar valores predeterminados de todo el sistema para los componentes de IA:
Clúster de IA predeterminado: especifica el clúster de cómputo predeterminado para las cargas de trabajo de IA. Los nuevos modelos de IA se desplegarán en este clúster de forma predeterminada.
Duración del historial de chat: establece durante cuánto tiempo se conserva el historial de las sesiones de chat (en días). El valor predeterminado es 60 días.
Gestión de modelos de IA
Los modelos de IA proporcionan la inteligencia subyacente para sus asistentes y aplicaciones de IA. VergeOS admite una amplia gama de modelos de IA mediante la compatibilidad con el formato estándar *.gguf, lo que permite a los usuarios descargar y ejecutar cualquier archivo compatible. Varios modelos seleccionados se presentan directamente en la interfaz de VergeOS para una implementación rápida.
Instalar un modelo de IA
Modelos curados
El sistema incluye varios modelos preconfigurados, configurados con ajustes predeterminados, disponibles para descarga automática
Vaya a IA > Modelos.
Seleccione Haga clic para instalar en un modelo deseado, para instalar uno de los modelos curados disponibles. -O- haga clic en Nuevo modelo en el menú de la izquierda.
Configure todos los ajustes deseados:
Selección del modelo: elija de una lista curada de modelos base (por ejemplo, Llama-3.2, Phi-4-Instruct) y seleccione un tamaño Variante (por ejemplo, Small – 1 GB). -O- seleccione --Personalizado-- y proporcione un URL para descargar un archivo de modelo .gguf
Nombre: introduzca un nombre descriptivo para su modelo.
Descripción (opcional): añada detalles sobre el propósito, la configuración o el uso previsto del modelo.
Núcleos: número máximo de núcleos que se asignarán a cada instancia del modelo.
Modelos habilitados para GPU: la asignación de núcleos tiene un impacto mínimo.
Modo solo CPU o de respaldo: la asignación de núcleos es crítica para el inicio y el rendimiento.
La sobreasignación de núcleos no mejora el rendimiento; los núcleos no utilizados permanecen inactivos.
RAM: memoria asignada por instancia del modelo:
Se requiere una cantidad base de RAM para cargar y ejecutar el modelo. Los requisitos reales varían según el tipo y el tamaño del modelo.
Una guía general para la cantidad fundamental de RAM necesaria: asigne ligeramente más RAM que el tamaño del archivo del modelo (por ejemplo, un modelo de 2 GB puede necesitar 3 GB de RAM).
Puede ser necesaria RAM adicional para admitir solicitudes simultáneas (es decir, la configuración paralela) y ventanas de contexto más grandes.
Comience con una asignación generosa y luego supervise el uso real a través del panel del modelo. Si el consumo observado es significativamente inferior al importe asignado, reduzca la asignación para optimizar la eficiencia de recursos.
Clúster (usa por defecto el clúster definido en los ajustes globales de IA): seleccione el clúster de VergeOS en el que se ejecutará el modelo.
Grupo de HA: especifica el grupo de alta disponibilidad para el modelo. Los miembros del mismo grupo de HA se ejecutarán en nodos diferentes si es posible.
Asignación de grupo de recursos de GPU: - elija un grupo de recursos de GPU para asignar dispositivos GPU, o seleccione --Solo CPU-- para ejecutarlo exclusivamente en CPU.
Permitir CPU de respaldo si los recursos GPU no están disponibles: habilite esta opción para usar recursos de CPU si los dispositivos GPU no están disponibles. Al usar esta opción, asegúrese de que se asignen suficientes núcleos de CPU para escenarios de respaldo.
Nivel preferido: seleccione el nivel de almacenamiento para alojar el modelo.
Tamaño del contexto (predeterminado 8192): - número máximo de tokens que el modelo puede procesar en una sesión activa. Esto incluye:
Entrada del usuario
Salida de la IA
Mensaje del sistema
Historial de conversación
Tokens
1 token ≈ 4 caracteres (promedio para inglés)
1 palabra ≈ 1,33 tokens
8192 tokens ≈ 2.000–4.000 palabras o ~12–20 páginas de texto
Paralelo: número de solicitudes simultáneas que cada instancia del modelo puede gestionar
Trabajadores mínimos: número mínimo de instancias del modelo iniciadas cuando el modelo arranca.
Trabajadores máximos: número máximo de instancias del modelo que pueden iniciarse para satisfacer la demanda.
El número de instancias del modelo en ejecución (trabajadores) para un modelo se reflejará en el panel del modelo, con cada instancia representada como un trabajador en ejecución.
Insertar etiqueta Think: agrega una etiqueta personalizada para distinguir el razonamiento paso a paso de la salida final. Algunos modelos suprimen o tratan esta etiqueta como no salida para reducir la latencia.
Eliminar la etiqueta Think del historial: habilite esto para excluir el contenido de razonamiento paso a paso del historial de respuestas, devolviendo solo la respuesta final.
Haga clic en Enviar para descargar y configurar el modelo especificado.
El modelo puede tardar varios minutos o más en descargarse. El panel del modelo (haga clic en Modelos en el menú izquierdo y haga doble clic en el modelo) indicará un estado "Descargando" y el progreso mientras el modelo se esté transfiriendo activamente. Estado cambiará a "En línea" cuando el modelo se haya descargado por completo, inicializado y esté listo para su uso.
Nuevo asistente
Cuando crea un nuevo modelo, también se crea un nuevo asistente de forma predeterminada. El Nuevo asistente formulario aparecerá permitiendo personalizar los ajustes predeterminados del nuevo asistente.
Gestión del asistente de IA
Descripción general
Los asistentes de IA son modelos de IA configurados que proporcionan capacidades y comportamiento específicos con su funcionalidad de IA. Se pueden personalizar con indicaciones y ajustes específicos para adaptar el rendimiento y los tipos de respuestas.
Crear un asistente
Iniciar un nuevo asistente: Tras la creación de un nuevo modelo, se crea automáticamente un nuevo asistente con los ajustes predeterminados, o con los seleccionados en la Asistente pestaña. También se puede crear un nuevo asistente navegando a IA > Nuevo asistente.
Nombre: introduzca un nombre descriptivo para el asistente.
Cuando un nuevo asistente se crea automáticamente (junto con la creación de un nuevo modelo), el nombre predeterminado será el mismo que el nombre del modelo.
Descripción (opcional): se pueden introducir detalles adicionales para describir la configuración, el propósito, etc. del modelo.
Modelo: elija entre los modelos base disponibles (por ejemplo, Llama-3.2, Phi-4-Instruct). Cuando un asistente se crea automáticamente junto con la creación de un nuevo modelo, este campo se establece automáticamente en el modelo asociado y no se puede editar.
Configuración de ajustes
Historial de chat: configurar la retención de conversaciones (solo sesiones de chat interactivas)
Activado por defecto - el historial de chat se habilita automáticamente al inicio de una sesión, pero se puede deshabilitar
Desactivado por defecto - el historial de chat se deshabilita automáticamente al inicio de una sesión, pero se puede habilitar
Siempre activado - el historial de chat siempre está habilitado; no se puede deshabilitar
Siempre desactivado - el historial de chat siempre está deshabilitado; no se puede habilitar
También existe la opción de eliminar el historial de chat de la sesión anterior cada vez que inicia una nueva sesión de chat.
Desactivar Think: habilita o deshabilita el razonamiento de varios pasos. Cuando está activo, la IA "muestra su trabajo" para mejorar la precisión; esto es especialmente útil para lógica compleja, matemáticas, depuración o planificación estratégica. Desactivar think proporciona respuestas más rápidas y menor uso de recursos, pero puede reducir la precisión.
Prompt del sistema: establece instrucciones fundamentales para el comportamiento, el tono y la orientación de tareas de la IA. Este mensaje influye en cómo el modelo interpreta el contexto y genera respuestas. La precisión importa; los mensajes ambiguos o demasiado cargados pueden degradar la calidad de la salida. La instrucción del mensaje del sistema se proporciona al modelo en cada interacción de chat.
Temperatura: controla la creatividad de las respuestas y la aleatoriedad de las respuestas generadas. (0.0 = determinista, 1.0 = creativo), ej.: 0.2 redacción ajustada y coherente; 0.75 metáforas, humor, ángulos inesperados. Orientación general:
Temperaturas bajas (p. ej., 0.0–0.3): respuestas deterministas, centradas y repetibles; ideales para usos como documentación técnica, guías de cumplimiento, soporte al cliente
Temperaturas altas (p. ej., 0.7–1.0): respuestas creativas, exploratorias y menos predecibles; ideales para lluvias de ideas, ideación de diseño, redacción específica para la audiencia
Temperaturas medias (p. ej., 0.4–0.6): las respuestas equilibran estructura con cierta variación, menos formales y robóticas que las temperaturas más bajas; excelentes para planificación de escenarios, análisis de UI/UX o compensaciones de infraestructura
Puntuación de contexto: (predeterminado 65) nivel para determinar cómo evaluará el modelo cuán relevante, útil o destacada es una pieza de información dentro de una ventana de contexto dada. Este valor establece la puntuación mínima requerida para que una pieza de contexto se considere aplicable. Ayuda a decidir en qué centrarse, qué ignorar o comprimir, qué conservar entre turnos, etc.
0 considerará cualquier cosa como coincidencia, mientras que 100 requerirá una coincidencia estricta y perfecta
La puntuación de contexto óptima dependerá del modelo utilizado, la información de contexto (por ejemplo, documentos cargados en el espacio de trabajo del asistente) y el caso de uso.
La puntuación de contexto predeterminada (65) proporciona un nivel moderado de relevancia que no es ni muy preciso ni completamente fuera de tema. Si no está seguro del mejor ajuste para su caso de uso, comience con la configuración predeterminada, ejecute escenarios de prueba para evaluar las salidas y luego ajuste la puntuación de contexto si es necesario.
Máx. de tokens: (predeterminado: 0 = sin límite) establezca la longitud máxima de la respuesta del sistema en tokens. Los tokens varían entre los distintos modelos de IA, pero en general un token equivale a .7 palabras.
Al establecer un máximo de tokens, debe ser inferior al tamaño del contexto del modelo
Para muchos casos de uso, es preferible establecer un máximo de tokens para limitar la respuesta (y evitar que sea demasiado verbosa)
Los modelos varían en sus respuestas estándar o predeterminadas, y algunos tienden a dar respuestas muy largas mientras que otros proporcionan respuestas más cortas y concisas de forma predeterminada.
Avanzado: campo reservado para futuras opciones de configuración mejoradas. Póngase en contacto con soporte si necesita ajustes de IA adicionales más allá de los proporcionados en la interfaz.
Haga clic en Enviar para crear/guardar la configuración del asistente. El asistente se desplegará y estará disponible para su uso.
Gestionar el contenido de archivos de IA
El espacio de trabajo del asistente le permite cargar y gestionar archivos para proporcionar una base de conocimiento contextual propietaria al asistente.
Para acceder al espacio de trabajo del asistente:
Navegue al panel del asistente (IA > haga clic en el modelo deseado).
Haga clic en Ver espacio de trabajo en el menú de la izquierda.
Añadir archivos al espacio de trabajo
Haga clic en Cargar en el menú izquierdo y haga clic en "Elegir archivos" botón.
Navegue y seleccione el/los archivo(s) deseado(s).
Haga clic en Abrir para añadir los archivos seleccionados a la cola de carga.
Opcionalmente, se puede configurar una descripción y el nivel preferido por archivo.
Haga clic en Iniciar para comenzar el proceso de carga.
Modificar archivos del espacio de trabajo
Seleccione un archivo de la lista y haga clic en Editar en el menú izquierdo para modificar el nombre, la descripción y/o el nivel preferido.
Eliminar archivos del espacio de trabajo
Seleccione el/los archivo(s) deseado(s) y haga clic en Eliminar en el menú de la izquierda.
Haga clic en Sí para confirmar la operación de eliminación.
Solución de problemas
Problemas comunes
Errores de instalación del modelo
Recursos insuficientes: asegúrese de contar con CPU, RAM y almacenamiento adecuados
Conectividad de red: verifique el acceso a la red para las descargas del modelo
Problemas de permisos: compruebe los permisos de usuario para la gestión de modelos
Problemas de rendimiento
Respuestas lentas: aumente la asignación de CPU o habilite la aceleración por GPU
Errores de memoria: aumente la asignación de RAM o habilite el mapeo de memoria
Contención de recursos: supervise el uso de recursos y ajuste la asignación
Pasos de diagnóstico
Comprobar los recursos del sistema: verifique la CPU, la RAM y el almacenamiento disponibles
Revisar registros: examine los registros del sistema en busca de mensajes de error
Conectividad de red: pruebe el acceso y la configuración de red
Verificación de permisos: confirme los permisos de usuario y los derechos de acceso
Estado del modelo: compruebe el estado de instalación y despliegue del modelo
Compatibilidad de versiones: Esta funcionalidad está disponible en VergeOS 26.0 y versiones posteriores.
Última actualización
¿Te fue útil?