Asistente offline Jan.ai
Despliega Jan.ai Server en Clore.ai: un servidor LLM totalmente offline y compatible con OpenAI, con centro de modelos, gestión de conversaciones e inferencia acelerada por GPU impulsada por el motor Cortex.
Descripción general
Jan.ai es una alternativa de ChatGPT de código abierto y centrada en la privacidad, con más de 40.000 estrellas en GitHub. Aunque Jan es más conocido como aplicación de escritorio, su componente de servidor — Servidor Jan — expone una API REST totalmente compatible con OpenAI que puede desplegarse en infraestructura de GPU en la nube como Clore.ai.
Jan Server está construido sobre el Cortex.cpp motor de inferencia, un entorno de ejecución de alto rendimiento que admite llama.cpp, TensorRT-LLM, y backends de ONNX. En Clore.ai puedes alquilar un servidor con GPU por tan solo $0.20/hr, ejecutar Jan Server con Docker Compose, cargar cualquier modelo GGUF o GPTQ y ofrecerlo mediante una API compatible con OpenAI, todo sin que tus datos abandonen la máquina.
Características principales:
🔒 100% sin conexión — ningún dato sale nunca de tu servidor
🤖 API compatible con OpenAI (
/v1/chat/completions,/v1/models, etc.)📦 Centro de modelos con descargas de modelos en un solo comando
🚀 Aceleración por GPU mediante CUDA (backends llama.cpp + TensorRT-LLM)
💬 Gestión de conversaciones y historial de hilos integrados
🔌 Reemplazo directo de OpenAI en aplicaciones existentes
Requisitos
Los equipos multinodo de clase 80GB no aparecen listados en el marketplace de Clore.ai. Los equipos más grandes listados hoy son 4× RTX PRO 6000 Blackwell (96GB cada una, 380GB en total) y 8–11× RTX 5090 (32GB cada una). La capacidad A100 / H200 / B200 se vende como bare metal bajo pedido. Consulta Precios y disponibilidad de GPU antes de dimensionar un despliegue.
Requisitos de hardware
Mínimo
RTX 3060 12GB
12 GB
16 GB
SSD de 50 GB
$0.03–0.07/h
Recomendado
RTX 3090
24 GB
32 GB
SSD de 100 GB
$0.07–0.21/h
Gama alta
RTX 4090
24 GB
64 GB
SSD de 200 GB
$0.14–0.42/h
Referencia de VRAM de modelos
Llama 3.1 8B (Q4)
~5 GB
RTX 3060
Llama 3.1 8B (FP16)
~16 GB
RTX 3090
Llama 3.3 70B (Q4)
~40 GB
A100 40GB
Llama 3.1 405B (Q4)
~220 GB
4× A100 80GB
Mistral 7B (Q4)
~4 GB
RTX 3060
Qwen2.5 72B (Q4)
~45 GB
A100 80GB
Requisitos de software
Cuenta de Clore.ai con saldo en la cartera
Conocimientos básicos de Docker
(Opcional) Cliente OpenSSH para reenvío de puertos
Inicio rápido
Paso 1 — Alquila un servidor GPU en Clore.ai
Navega a clore.ai e inicia sesión
Filtrar servidores: Tipo de GPU → RTX 3090 o mejor, Docker → habilitado
Selecciona un servidor y elige la Docker opción de despliegue
Usa la
nvidia/cuda:12.8.1-devel-ubuntu22.04imagen base oficial o cualquier imagen CUDAAbrir puertos: 1337 (API de Jan Server), 39281 (API de Cortex), 22 (SSH)
Paso 2 — Conéctate a tu servidor
Paso 3 — Instala Docker Compose (si no está presente)
Paso 4 — Despliega Jan Server con Docker Compose
Si el archivo compose upstream no está disponible o quieres control total, créalo manualmente:
Paso 5 — Verifica que el servidor esté en ejecución
Paso 6 — Descarga tu primer modelo
Paso 7 — Inicia el modelo y chatea
Configuración
Variables de entorno
JAN_API_HOST
0.0.0.0
Host al que enlazar el servidor de la API
JAN_API_PORT
1337
Puerto de la API de Jan Server
CORTEX_API_PORT
39281
Puerto interno del motor Cortex
CUDA_VISIBLE_DEVICES
all
Qué GPU exponer (índices separados por comas)
JAN_DATA_FOLDER
/root/jan
Ruta a la carpeta de datos de Jan
CORTEX_MODELS_PATH
/root/cortex/models
Ruta para almacenar los modelos
Configuración multi-GPU
Para servidores con varias GPU (por ejemplo, 2× RTX 3090 en Clore.ai):
O para dedicar GPU específicas:
Configuración personalizada del modelo
Asegurar la API con un token
Jan Server no incluye autenticación por defecto. Usa Nginx como proxy inverso:
Aceleración GPU
Verificando la aceleración CUDA
El motor Cortex de Jan Server detecta CUDA automáticamente. Verifica que esté usando la GPU:
Cambiando de backend de inferencia
Cortex admite múltiples backends:
Ajuste de la ventana de contexto y del tamaño de lote
ngl
Capas de GPU (más alto = más uso de GPU)
Establécelo en 99 para exprimir al máximo la GPU
ctx_len
Tamaño de la ventana de contexto
4096–32768 según la VRAM
n_batch
Tamaño de lote para el procesamiento del prompt
512 para RTX 3090, 256 para tarjetas más pequeñas
n_parallel
Ranuras de solicitudes simultáneas
4–8 para uso del servidor API
Consejos y mejores prácticas
🎯 Selección de modelo para presupuestos de Clore.ai
💾 Almacenamiento persistente de modelos
Como las instancias de Clore.ai son efímeras, considera montar almacenamiento externo:
🔗 Usar Jan Server como sustituto de OpenAI
📊 Supervisión del uso de recursos
Solución de problemas
El contenedor no arranca — no se encontró la GPU
La descarga del modelo se queda atascada o falla
Sin VRAM (memoria CUDA insuficiente)
No se puede conectar a la API desde fuera del contenedor
Inferencia lenta (retroceso a CPU)
Lecturas adicionales
Documentación oficial de Jan.ai — Documentación completa de la plataforma
Repositorio de GitHub de Jan — Código fuente y problemas
Jan Server / Jan API — Documentación específica del servidor
Motor Cortex.cpp — El motor de inferencia subyacente
Primeros pasos con Clore.ai — Conceptos básicos de la plataforma
Guía de comparación de GPU — Elige la GPU adecuada
Ejecutar Ollama en Clore.ai — Servidor LLM alternativo
Ejecutar vLLM en Clore.ai — Servidor de inferencia de alto rendimiento
Hugging Face Model Hub — Encuentra modelos GGUF
💡 Consejo de costo: Una RTX 3090 en Clore.ai ($0.07–0.21/hr) puede ejecutar Llama 3.1 8B a ~50 tokens/second — suficiente para uso personal o APIs de poco tráfico. Para cargas de trabajo de producción, considera vLLM (ver guía de vLLM) en una A100.
Última actualización
¿Te fue útil?