For the complete documentation index, see llms.txt. This page is also available as Markdown.

Aphrodite Engine

Ejecuta Aphrodite Engine para inferencia de LLM en GPUs antiguas y modernas en Clore.ai

Aphrodite Engine es un servidor de inferencia LLM optimizado construido sobre vLLM, diseñado específicamente para la comunidad de escritura creativa y roleplay. Admite una amplia gama de GPUs desde Pascal (serie GTX 1000), lo que lo convierte en la opción perfecta para ejecutar modelos de lenguaje en servidores GPU CLORE.AI antiguos o económicos donde otros marcos fallan. Aphrodite añade APIs compatibles con Kobold, muestreo Mirostat y algoritmos avanzados de muestreo de texto que no se encuentran en los marcos de servicio convencionales.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

16 GB

32 GB+

VRAM

6 GB

16 GB+

Disco

40 GB

150 GB+

GPU

NVIDIA Pascal+ (GTX 1060+)

RTX 3090, A100

Aphrodite Engine es uno de los pocos servidores LLM que admiten GPUs de la generación Pascal (serie GTX 10xx). Esto lo hace ideal para servidores económicos en CLORE.AI con GPUs antiguas y precios de alquiler bajos.

Despliegue rápido en CLORE.AI

Imagen de Docker: alpindale/aphrodite-engine:latest

Puertos: 22/tcp, 2242/http

Variables de entorno:

Variable
Ejemplo
Descripción

HF_TOKEN

hf_xxx...

Token de HuggingFace para modelos restringidos

APHRODITE_MODEL

mistralai/Mistral-7B-Instruct-v0.3

Modelo a cargar

Configuración paso a paso

1. Alquila un servidor GPU en CLORE.AI

La amplia compatibilidad de GPUs de Aphrodite te permite conseguir servidores económicos en Marketplace de CLORE.AI:

  • Pascal (GTX 1060–1080 Ti): 6–11 GB de VRAM — ejecuta modelos pequeños de 3B-7B con cuantización

  • Turing (serie RTX 2000): 8–24 GB de VRAM — modelos 7B-13B, mejor rendimiento

  • Ampere (RTX 3000/A100): 24–80 GB de VRAM — modelos 30B-70B, velocidad completa

  • Ada (serie RTX 4000): 16–24 GB de VRAM — mejor relación rendimiento/coste

2. Conéctate vía SSH

3. Descarga la imagen de Aphrodite Engine

4. Inicia Aphrodite Engine

Inicio básico con un modelo 7B:

Con token de HuggingFace (Llama 3):

Con cuantización GPTQ (para VRAM limitada):

Con cuantización AWQ:

Ejecutando un modelo GGUF (Aphrodite admite GGUF de forma nativa):

5. Verifica el servidor

6. Accede a través del proxy HTTP de CLORE.AI

El panel de pedidos de CLORE.AI proporciona una http_pub URL para el puerto 2242. Úsala en tus aplicaciones cliente:


Ejemplos de uso

Ejemplo 1: Chat compatible con OpenAI

Ejemplo 2: Muestreo avanzado con Mirostat

Aphrodite admite muestreo Mirostat para un texto largo más coherente:

Ejemplo 3: API compatible con Kobold

Aphrodite incluye un endpoint compatible con Kobold para su uso con frontends basados en KoboldAI:

Ejemplo 4: Cliente Python con muestreadores personalizados

Ejemplo 5: Completaciones por lotes


Configuración

Parámetros clave de inicio

Parámetro
Valor predeterminado
Descripción

--model

obligatorio

ID del modelo o ruta local

--host

127.0.0.1

Dirección de enlace

--port

2242

Puerto del servidor

--dtype

auto

float16, bfloat16, float32

--quantization

ninguno

awq, gptq, squeezellm, fp8

--max-model-len

máximo del modelo

Sobrescribe la longitud máxima del contexto

--gpu-memory-utilization

0.90

fracción de memoria de GPU

--tensor-parallel-size

1

Número de GPUs para paralelismo tensorial

--max-num-seqs

256

Máximo de secuencias concurrentes

--trust-remote-code

false

Permitir código personalizado del modelo

--api-keys

ninguno

Claves API separadas por comas para autenticación

--served-model-name

nombre del modelo

Nombre personalizado para las respuestas de la API

Añadir autenticación con clave API

Luego usa Authorization: Bearer mysecretkey1 en las solicitudes.

Carga de modelos locales


Consejos de rendimiento

1. Elige la cuantización adecuada para tu GPU

VRAM de GPU
Modelo 7B
Modelo 13B
Modelo 30B

6 GB

GPTQ/AWQ Q4

8 GB

GPTQ Q4

GPTQ Q4 (ajustado)

12 GB

Float16

GPTQ Q4

16 GB

Float16

Float16

GPTQ Q4

24 GB

Float16

Float16

GPTQ Q4

48 GB

Float16

Float16

Float16

2. Ajusta la utilización de memoria de la GPU

Empieza con un valor bajo y aumenta si no obtienes errores de OOM.

3. Usa bfloat16 en GPUs Ampere+

Mejor estabilidad numérica que float16, misma velocidad.

4. Optimiza para roleplay/escritura creativa

Estos muestreadores funcionan bien para texto narrativo:

5. Consejos para GPUs Pascal (GTX 10xx)

Para GPUs Pascal, evita Flash Attention (no es compatible):


Solución de problemas

Problema: "CUDA capability sm_6x not supported"

Las GPUs Pascal requieren un tratamiento especial. Usa:

Si sigue fallando, comprueba si la versión de la imagen admite Pascal:

Problema: "out of memory" en GPUs pequeñas

Problema: generación lenta de tokens

  • Comprueba que realmente se esté usando la GPU: nvidia-smi dentro del contenedor

  • Activa tamaños de lote más grandes: --max-num-seqs 64

  • Usa AWQ en lugar de GPTQ (inferencia más rápida)

Problema: modelo no encontrado / errores 404

Comprueba siempre que el nombre de tu modelo coincida exactamente:

Usa el nombre exacto del modelo de la respuesta en tus solicitudes.

Problema: salida repetitiva

Añade penalización por repetición:

Problema: el contenedor Docker se cierra silenciosamente


Enlaces


Recomendaciones de GPU para Clore.ai

Caso de uso
GPU recomendada
Costo estimado en Clore.ai

Desarrollo/Pruebas

RTX 3090 (24GB)

$0.07–0.21/gpu/hr

Producción (7B–13B)

RTX 4090 (24GB)

$0.14–0.42/gpu/hr

Modelos grandes (70B+)

A100 80GB / H100

~$1.04/gpu/h

💡 Todos los ejemplos de esta guía pueden desplegarse en Clore.ai servidores GPU. Explora las GPUs disponibles y alquila por hora: sin compromisos, acceso root completo.

Última actualización

¿Te fue útil?