For the complete documentation index, see llms.txt. This page is also available as Markdown.

Resumen de Private AI

Resumen de VergeOS Private AI, que permite implementar y ejecutar modelos de lenguaje grandes localmente dentro de tu infraestructura sin llamadas a APIs externas ni transmisión de datos.

VergeOS Private AI te permite implementar y ejecutar modelos de lenguaje grandes (LLM) localmente dentro de tu entorno VergeOS. Los modelos se ejecutan completamente en tu infraestructura, sin llamadas a APIs externas ni transmisión de datos.

Arquitectura

Private AI consta de cinco componentes principales:

Modelos

Los modelos son los archivos LLM que proporcionan capacidades de IA. VergeOS admite:

  • Modelos seleccionados: Modelos preconfigurados disponibles para instalación con un solo clic (Llama, Gemma, Phi, Qwen y otros)

  • Modelos personalizados: Cualquier modelo en formato GGUF de Hugging Face u otras fuentes

Los modelos definen los requisitos de recursos (núcleos de CPU, RAM, asignación de GPU) y los parámetros de inferencia (tamaño del contexto, solicitudes paralelas).

Asistentes

Los asistentes son instancias configuradas que definen cómo los usuarios y las aplicaciones interactúan con un modelo. Cada asistente especifica:

  • Qué modelo usar

  • Prompt del sistema (instrucciones de comportamiento)

  • Temperatura y otros parámetros de generación

  • Puntuación de contexto para escenarios RAG

  • Archivos del espacio de trabajo para contexto de documentos

Varios asistentes pueden usar el mismo modelo subyacente con diferentes configuraciones.

Workers

Los workers son los motores de inferencia que ejecutan los modelos. El sistema gestiona dos tipos:

  • AI-Helper Worker: Gestiona las solicitudes de API y el enrutamiento (se inicia automáticamente)

  • Workers de modelos: Ejecutan la inferencia para cada modelo en ejecución (se escalan automáticamente según la configuración de workers mínimos/máximos)

Sesiones de chat

Las sesiones de chat mantienen el historial de conversaciones y el contexto. Las sesiones pueden ser:

  • Creadas a través de la interfaz de VergeOS para pruebas interactivas

  • Gestionadas programáticamente mediante la API para la integración de aplicaciones

API compatible con OpenAI

La API proporciona endpoints estándar de OpenAI en https://<your-vergeos-url>/v1, lo que permite la integración con:

  • Cualquier biblioteca cliente de OpenAI (Python, JavaScript, Go, etc.)

  • IDEs y herramientas de desarrollo

  • Aplicaciones existentes creadas para OpenAI/Ollama

Consulte API compatible con OpenAI para la documentación de los endpoints.

Requisitos previos

  • VergeOS 26.0 o posterior

  • RAM suficiente para los archivos del modelo (varía según el modelo, normalmente entre 5 y 50 GB)

  • Almacenamiento para las descargas de modelos

Compatibilidad con GPU

Se recomienda la aceleración por GPU para cargas de trabajo de producción. VergeOS admite GPU de cualquier fabricante (NVIDIA, AMD, Intel) a través de Grupos de recursos. Los modelos también pueden ejecutarse en sistemas solo con CPU, aunque la inferencia será más lenta.

Inicio rápido

  1. Vaya a IA → Modelos

  2. Haga clic en Haga clic para instalar en un modelo seleccionado, o haga clic Nuevo modelo para modelos personalizados

  3. Configure la asignación de recursos (núcleos, RAM, GPU)

  4. Se crea automáticamente un asistente con el nuevo modelo

  5. Probar vía IA → Asistentes → [Tu asistente] → Chat

Para obtener instrucciones detalladas de configuración, consulta la Guía de configuración.

Documentación relacionada

Última actualización

¿Te fue útil?