Resumen de Private AI
Resumen de VergeOS Private AI, que permite implementar y ejecutar modelos de lenguaje grandes localmente dentro de tu infraestructura sin llamadas a APIs externas ni transmisión de datos.
VergeOS Private AI te permite implementar y ejecutar modelos de lenguaje grandes (LLM) localmente dentro de tu entorno VergeOS. Los modelos se ejecutan completamente en tu infraestructura, sin llamadas a APIs externas ni transmisión de datos.
Arquitectura
Private AI consta de cinco componentes principales:
Modelos
Los modelos son los archivos LLM que proporcionan capacidades de IA. VergeOS admite:
Modelos seleccionados: Modelos preconfigurados disponibles para instalación con un solo clic (Llama, Gemma, Phi, Qwen y otros)
Modelos personalizados: Cualquier modelo en formato GGUF de Hugging Face u otras fuentes
Los modelos definen los requisitos de recursos (núcleos de CPU, RAM, asignación de GPU) y los parámetros de inferencia (tamaño del contexto, solicitudes paralelas).
Asistentes
Los asistentes son instancias configuradas que definen cómo los usuarios y las aplicaciones interactúan con un modelo. Cada asistente especifica:
Qué modelo usar
Prompt del sistema (instrucciones de comportamiento)
Temperatura y otros parámetros de generación
Puntuación de contexto para escenarios RAG
Archivos del espacio de trabajo para contexto de documentos
Varios asistentes pueden usar el mismo modelo subyacente con diferentes configuraciones.
Workers
Los workers son los motores de inferencia que ejecutan los modelos. El sistema gestiona dos tipos:
AI-Helper Worker: Gestiona las solicitudes de API y el enrutamiento (se inicia automáticamente)
Workers de modelos: Ejecutan la inferencia para cada modelo en ejecución (se escalan automáticamente según la configuración de workers mínimos/máximos)
Sesiones de chat
Las sesiones de chat mantienen el historial de conversaciones y el contexto. Las sesiones pueden ser:
Creadas a través de la interfaz de VergeOS para pruebas interactivas
Gestionadas programáticamente mediante la API para la integración de aplicaciones
API compatible con OpenAI
La API proporciona endpoints estándar de OpenAI en https://<your-vergeos-url>/v1, lo que permite la integración con:
Cualquier biblioteca cliente de OpenAI (Python, JavaScript, Go, etc.)
IDEs y herramientas de desarrollo
Aplicaciones existentes creadas para OpenAI/Ollama
Consulte API compatible con OpenAI para la documentación de los endpoints.
Requisitos previos
VergeOS 26.0 o posterior
RAM suficiente para los archivos del modelo (varía según el modelo, normalmente entre 5 y 50 GB)
Almacenamiento para las descargas de modelos
Compatibilidad con GPU
Se recomienda la aceleración por GPU para cargas de trabajo de producción. VergeOS admite GPU de cualquier fabricante (NVIDIA, AMD, Intel) a través de Grupos de recursos. Los modelos también pueden ejecutarse en sistemas solo con CPU, aunque la inferencia será más lenta.
Inicio rápido
Vaya a IA → Modelos
Haga clic en Haga clic para instalar en un modelo seleccionado, o haga clic Nuevo modelo para modelos personalizados
Configure la asignación de recursos (núcleos, RAM, GPU)
Se crea automáticamente un asistente con el nuevo modelo
Probar vía IA → Asistentes → [Tu asistente] → Chat
Para obtener instrucciones detalladas de configuración, consulta la Guía de configuración.
Documentación relacionada
Configuración - Configuración del modelo y del asistente
API compatible con OpenAI - Endpoints de la API e integración
Sesiones de chat - Uso interactivo de la interfaz
Última actualización
¿Te fue útil?