For the complete documentation index, see llms.txt. This page is also available as Markdown.

Asistente offline Jan.ai

Despliega Jan.ai Server en Clore.ai: un servidor LLM totalmente offline y compatible con OpenAI, con centro de modelos, gestión de conversaciones e inferencia acelerada por GPU impulsada por el motor Cortex.

Descripción general

Jan.ai es una alternativa de ChatGPT de código abierto y centrada en la privacidad, con más de 40.000 estrellas en GitHub. Aunque Jan es más conocido como aplicación de escritorio, su componente de servidor — Servidor Jan — expone una API REST totalmente compatible con OpenAI que puede desplegarse en infraestructura de GPU en la nube como Clore.ai.

Jan Server está construido sobre el Cortex.cpp motor de inferencia, un entorno de ejecución de alto rendimiento que admite llama.cpp, TensorRT-LLM, y backends de ONNX. En Clore.ai puedes alquilar un servidor con GPU por tan solo $0.20/hr, ejecutar Jan Server con Docker Compose, cargar cualquier modelo GGUF o GPTQ y ofrecerlo mediante una API compatible con OpenAI, todo sin que tus datos abandonen la máquina.

Características principales:

  • 🔒 100% sin conexión — ningún dato sale nunca de tu servidor

  • 🤖 API compatible con OpenAI (/v1/chat/completions, /v1/models, etc.)

  • 📦 Centro de modelos con descargas de modelos en un solo comando

  • 🚀 Aceleración por GPU mediante CUDA (backends llama.cpp + TensorRT-LLM)

  • 💬 Gestión de conversaciones y historial de hilos integrados

  • 🔌 Reemplazo directo de OpenAI en aplicaciones existentes


Requisitos

Requisitos de hardware

Nivel
GPU
VRAM
RAM
Almacenamiento
Precio de Clore.ai

Mínimo

RTX 3060 12GB

12 GB

16 GB

SSD de 50 GB

$0.03–0.07/h

Recomendado

RTX 3090

24 GB

32 GB

SSD de 100 GB

$0.07–0.21/h

Gama alta

RTX 4090

24 GB

64 GB

SSD de 200 GB

$0.14–0.42/h

Modelos grandes

A100 80GB

80 GB

128 GB

SSD de 500 GB

Referencia de VRAM de modelos

Modelo
VRAM requerida
GPU recomendada

Llama 3.1 8B (Q4)

~5 GB

RTX 3060

Llama 3.1 8B (FP16)

~16 GB

RTX 3090

Llama 3.3 70B (Q4)

~40 GB

A100 40GB

Llama 3.1 405B (Q4)

~220 GB

4× A100 80GB

Mistral 7B (Q4)

~4 GB

RTX 3060

Qwen2.5 72B (Q4)

~45 GB

A100 80GB

Requisitos de software

  • Cuenta de Clore.ai con saldo en la cartera

  • Conocimientos básicos de Docker

  • (Opcional) Cliente OpenSSH para reenvío de puertos


Inicio rápido

Paso 1 — Alquila un servidor GPU en Clore.ai

  1. Navega a clore.ai e inicia sesión

  2. Filtrar servidores: Tipo de GPU → RTX 3090 o mejor, Docker → habilitado

  3. Selecciona un servidor y elige la Docker opción de despliegue

  4. Usa la nvidia/cuda:12.8.1-devel-ubuntu22.04 imagen base oficial o cualquier imagen CUDA

  5. Abrir puertos: 1337 (API de Jan Server), 39281 (API de Cortex), 22 (SSH)

Paso 2 — Conéctate a tu servidor

Paso 3 — Instala Docker Compose (si no está presente)

Paso 4 — Despliega Jan Server con Docker Compose

Si el archivo compose upstream no está disponible o quieres control total, créalo manualmente:

Paso 5 — Verifica que el servidor esté en ejecución

Paso 6 — Descarga tu primer modelo

Paso 7 — Inicia el modelo y chatea


Configuración

Variables de entorno

Variable
Valor predeterminado
Descripción

JAN_API_HOST

0.0.0.0

Host al que enlazar el servidor de la API

JAN_API_PORT

1337

Puerto de la API de Jan Server

CORTEX_API_PORT

39281

Puerto interno del motor Cortex

CUDA_VISIBLE_DEVICES

all

Qué GPU exponer (índices separados por comas)

JAN_DATA_FOLDER

/root/jan

Ruta a la carpeta de datos de Jan

CORTEX_MODELS_PATH

/root/cortex/models

Ruta para almacenar los modelos

Configuración multi-GPU

Para servidores con varias GPU (por ejemplo, 2× RTX 3090 en Clore.ai):

O para dedicar GPU específicas:

Configuración personalizada del modelo

Asegurar la API con un token

Jan Server no incluye autenticación por defecto. Usa Nginx como proxy inverso:


Aceleración GPU

Verificando la aceleración CUDA

El motor Cortex de Jan Server detecta CUDA automáticamente. Verifica que esté usando la GPU:

Cambiando de backend de inferencia

Cortex admite múltiples backends:

Ajuste de la ventana de contexto y del tamaño de lote

Parámetro
Descripción
Recomendación

ngl

Capas de GPU (más alto = más uso de GPU)

Establécelo en 99 para exprimir al máximo la GPU

ctx_len

Tamaño de la ventana de contexto

4096–32768 según la VRAM

n_batch

Tamaño de lote para el procesamiento del prompt

512 para RTX 3090, 256 para tarjetas más pequeñas

n_parallel

Ranuras de solicitudes simultáneas

4–8 para uso del servidor API


Consejos y mejores prácticas

🎯 Selección de modelo para presupuestos de Clore.ai

💾 Almacenamiento persistente de modelos

Como las instancias de Clore.ai son efímeras, considera montar almacenamiento externo:

🔗 Usar Jan Server como sustituto de OpenAI

📊 Supervisión del uso de recursos


Solución de problemas

El contenedor no arranca — no se encontró la GPU

La descarga del modelo se queda atascada o falla

Sin VRAM (memoria CUDA insuficiente)

No se puede conectar a la API desde fuera del contenedor

Inferencia lenta (retroceso a CPU)


Lecturas adicionales

💡 Consejo de costo: Una RTX 3090 en Clore.ai ($0.07–0.21/hr) puede ejecutar Llama 3.1 8B a ~50 tokens/second — suficiente para uso personal o APIs de poco tráfico. Para cargas de trabajo de producción, considera vLLM (ver guía de vLLM) en una A100.

Última actualización

¿Te fue útil?