Aphrodite Engine
Ejecuta Aphrodite Engine para inferencia de LLM en GPUs antiguas y modernas en Clore.ai
Aphrodite Engine es un servidor de inferencia LLM optimizado construido sobre vLLM, diseñado específicamente para la comunidad de escritura creativa y roleplay. Admite una amplia gama de GPUs desde Pascal (serie GTX 1000), lo que lo convierte en la opción perfecta para ejecutar modelos de lenguaje en servidores GPU CLORE.AI antiguos o económicos donde otros marcos fallan. Aphrodite añade APIs compatibles con Kobold, muestreo Mirostat y algoritmos avanzados de muestreo de texto que no se encuentran en los marcos de servicio convencionales.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Marketplace de CLORE.AI.
Requisitos del servidor
RAM
16 GB
32 GB+
VRAM
6 GB
16 GB+
Disco
40 GB
150 GB+
GPU
NVIDIA Pascal+ (GTX 1060+)
RTX 3090, A100
Despliegue rápido en CLORE.AI
Imagen de Docker: alpindale/aphrodite-engine:latest
Puertos: 22/tcp, 2242/http
Variables de entorno:
HF_TOKEN
hf_xxx...
Token de HuggingFace para modelos restringidos
APHRODITE_MODEL
mistralai/Mistral-7B-Instruct-v0.3
Modelo a cargar
Configuración paso a paso
1. Alquila un servidor GPU en CLORE.AI
La amplia compatibilidad de GPUs de Aphrodite te permite conseguir servidores económicos en Marketplace de CLORE.AI:
Pascal (GTX 1060–1080 Ti): 6–11 GB de VRAM — ejecuta modelos pequeños de 3B-7B con cuantización
Turing (serie RTX 2000): 8–24 GB de VRAM — modelos 7B-13B, mejor rendimiento
Ampere (RTX 3000/A100): 24–80 GB de VRAM — modelos 30B-70B, velocidad completa
Ada (serie RTX 4000): 16–24 GB de VRAM — mejor relación rendimiento/coste
2. Conéctate vía SSH
3. Descarga la imagen de Aphrodite Engine
4. Inicia Aphrodite Engine
Inicio básico con un modelo 7B:
Con token de HuggingFace (Llama 3):
Con cuantización GPTQ (para VRAM limitada):
Con cuantización AWQ:
Ejecutando un modelo GGUF (Aphrodite admite GGUF de forma nativa):
5. Verifica el servidor
6. Accede a través del proxy HTTP de CLORE.AI
El panel de pedidos de CLORE.AI proporciona una http_pub URL para el puerto 2242. Úsala en tus aplicaciones cliente:
Ejemplos de uso
Ejemplo 1: Chat compatible con OpenAI
Ejemplo 2: Muestreo avanzado con Mirostat
Aphrodite admite muestreo Mirostat para un texto largo más coherente:
Ejemplo 3: API compatible con Kobold
Aphrodite incluye un endpoint compatible con Kobold para su uso con frontends basados en KoboldAI:
Ejemplo 4: Cliente Python con muestreadores personalizados
Ejemplo 5: Completaciones por lotes
Configuración
Parámetros clave de inicio
--model
obligatorio
ID del modelo o ruta local
--host
127.0.0.1
Dirección de enlace
--port
2242
Puerto del servidor
--dtype
auto
float16, bfloat16, float32
--quantization
ninguno
awq, gptq, squeezellm, fp8
--max-model-len
máximo del modelo
Sobrescribe la longitud máxima del contexto
--gpu-memory-utilization
0.90
fracción de memoria de GPU
--tensor-parallel-size
1
Número de GPUs para paralelismo tensorial
--max-num-seqs
256
Máximo de secuencias concurrentes
--trust-remote-code
false
Permitir código personalizado del modelo
--api-keys
ninguno
Claves API separadas por comas para autenticación
--served-model-name
nombre del modelo
Nombre personalizado para las respuestas de la API
Añadir autenticación con clave API
Luego usa Authorization: Bearer mysecretkey1 en las solicitudes.
Carga de modelos locales
Consejos de rendimiento
1. Elige la cuantización adecuada para tu GPU
6 GB
GPTQ/AWQ Q4
❌
❌
8 GB
GPTQ Q4
GPTQ Q4 (ajustado)
❌
12 GB
Float16
GPTQ Q4
❌
16 GB
Float16
Float16
GPTQ Q4
24 GB
Float16
Float16
GPTQ Q4
48 GB
Float16
Float16
Float16
2. Ajusta la utilización de memoria de la GPU
Empieza con un valor bajo y aumenta si no obtienes errores de OOM.
3. Usa bfloat16 en GPUs Ampere+
Mejor estabilidad numérica que float16, misma velocidad.
4. Optimiza para roleplay/escritura creativa
Estos muestreadores funcionan bien para texto narrativo:
5. Consejos para GPUs Pascal (GTX 10xx)
Para GPUs Pascal, evita Flash Attention (no es compatible):
Solución de problemas
Problema: "CUDA capability sm_6x not supported"
Las GPUs Pascal requieren un tratamiento especial. Usa:
Si sigue fallando, comprueba si la versión de la imagen admite Pascal:
Problema: "out of memory" en GPUs pequeñas
Problema: generación lenta de tokens
Comprueba que realmente se esté usando la GPU:
nvidia-smidentro del contenedorActiva tamaños de lote más grandes:
--max-num-seqs 64Usa AWQ en lugar de GPTQ (inferencia más rápida)
Problema: modelo no encontrado / errores 404
Comprueba siempre que el nombre de tu modelo coincida exactamente:
Usa el nombre exacto del modelo de la respuesta en tus solicitudes.
Problema: salida repetitiva
Añade penalización por repetición:
Problema: el contenedor Docker se cierra silenciosamente
Enlaces
Recomendaciones de GPU para Clore.ai
Desarrollo/Pruebas
RTX 3090 (24GB)
$0.07–0.21/gpu/hr
Producción (7B–13B)
RTX 4090 (24GB)
$0.14–0.42/gpu/hr
Modelos grandes (70B+)
A100 80GB / H100
~$1.04/gpu/h
💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.
Última actualización
¿Te fue útil?