LocalAI
API autoalojada compatible con OpenAI con LocalAI en Clore.ai
Ejecute una API compatible con OpenAI autohospedada con LocalAI.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de CLORE.AI Marketplace.
Requisitos del servidor
RAM
8GB
16GB+
VRAM
6GB
8GB+
Red
200Mbps
500Mbps+
Tiempo de inicio
5-10 minutos
-
Importante: LocalAI tarda 5-10 minutos en inicializarse completamente en el primer arranque. HTTP 502 durante este tiempo es normal: el servicio está descargando y cargando modelos.
¿Qué es LocalAI?
LocalAI proporciona:
Reemplazo directo de la API de OpenAI
Soporte para múltiples formatos de modelos
Generación de texto, imagen, audio y embeddings
No se requiere GPU (pero es más rápido con GPU)
Modelos compatibles
LLM
GGUF, GGML
Llama, Mistral, Phi
Embeddings
GGUF
all-MiniLM, BGE
Imágenes
Diffusers
SD 1.5, SDXL
Audio
Whisper
De voz a texto
TTS
Piper, Bark
Texto a voz
Despliegue rápido
Imagen Docker:
Puertos:
No se necesita comando - el servidor se inicia automáticamente.
Verificar que funciona
Después del despliegue, encuentra tu http_pub URL en Mis Pedidos y probar:
Si obtiene HTTP 502, espere 5-10 minutos: LocalAI tarda más en inicializarse que otros servicios.
Modelos preinstalados
LocalAI viene con varios modelos disponibles listos para usar:
gpt-4
Chat
LLM de propósito general
gpt-4o
Chat
LLM de propósito general
gpt-4o-mini
Chat
LLM más pequeño y rápido
whisper-1
STT
De voz a texto
tts-1
TTS
Texto a voz
text-embedding-ada-002
Embeddings
Vectores de 384 dimensiones
jina-reranker-v1-base-en
Reordenamiento
Reordenamiento de documentos
Accediendo a tu servicio
Cuando se despliega en CLORE.AI, acceda a LocalAI a través de la http_pub URL:
Despliegue con Docker (alternativa)
Descargar modelos
Desde la galería de modelos
LocalAI tiene una galería de modelos incorporada:
Desde Hugging Face
Configuración del modelo
Cree un archivo YAML de configuración para cada modelo:
models/llama-3.1-8b.yaml:
Uso de la API
Chat Completions (compatible con OpenAI)
Streaming
Embeddings
Generación de imágenes
Ejemplos con cURL
Chat
Embeddings
Respuesta:
Texto a voz (TTS)
Voces disponibles: alloy, echo, fable, onyx, nova, shimmer
Voz a texto (STT)
Respuesta:
Reordenamiento
Reordenar documentos por relevancia a una consulta:
Respuesta:
Referencia completa de la API
Endpoints estándar (compatibles con OpenAI)
/v1/models
GET
Listar modelos disponibles
/v1/chat/completions
POST
Completación de chat
/v1/completions
POST
Completación de texto
/v1/embeddings
POST
Generar embeddings
/v1/audio/speech
POST
Texto a voz
/v1/audio/transcriptions
POST
De voz a texto
/v1/images/generations
POST
Generación de imágenes
Endpoints adicionales
/readyz
GET
Comprobación de disponibilidad
/healthz
GET
Comprobación de salud
/version
GET
Obtener la versión de LocalAI
/v1/rerank
POST
Reordenamiento de documentos
/models/available
GET
Listar modelos de la galería
/models/apply
POST
Instalar modelo desde la galería
/swagger/
GET
Documentación Swagger UI
/metrics
GET
Métricas de Prometheus
Obtener versión
Respuesta:
Documentación Swagger
Ábralo en el navegador para documentación interactiva de la API:
Aceleración por GPU
Backend CUDA
Descarga completa a GPU
Múltiples modelos
LocalAI puede servir múltiples modelos simultáneamente:
Acceda a cada uno mediante el nombre del modelo en las llamadas a la API.
Ajuste de rendimiento
Para velocidad
Para memoria
Benchmarks
Llama 3.1 8B Q4
RTX 3090
~100
Mistral 7B Q4
RTX 3090
~110
Llama 3.1 8B Q4
RTX 4090
~140
Mixtral 8x7B Q4
A100
~60
Benchmarks actualizados en enero de 2026.
Solución de problemas
HTTP 502 en la URL http_pub
LocalAI tarda más en iniciarse que otros servicios. Espere 5-10 minutos y vuelva a intentar:
El modelo no carga
Compruebe la ruta del archivo en el YAML
Verifique la compatibilidad del formato GGUF
Compruebe la VRAM disponible
Respuestas lentas
Aumente
gpu_layersHabilite
use_mmapReducir
context_size
Memoria insuficiente
Reducir
gpu_layersUse cuantización más pequeña (Q4 en lugar de Q8)
Reducir el tamaño del lote
Problemas con la generación de imágenes
Stable Diffusion puede tener problemas de compatibilidad con CUDA en algunas configuraciones de GPU. Si encuentra errores de CUDA con la generación de imágenes, considere usar una imagen dedicada de Stable Diffusion en su lugar.
Estimación de costos
Tarifas típicas del mercado de CLORE.AI:
RTX 3060
12GB
$0.15–0.30
Modelos 7B
RTX 3090
24GB
$0.30–1.00
Modelos 13B
RTX 4090
24GB
$0.50–2.00
Inferencia rápida
A100
40GB
$1.50–3.00
Modelos grandes
Precios en USD/día. Las tarifas varían según el proveedor: consulte CLORE.AI Marketplace para las tarifas actuales.
Próximos pasos
Inferencia vLLM - Mayor rendimiento
Guía de Ollama - Configuración más simple
RAG con LangChain - Construir aplicaciones
Última actualización
¿Te fue útil?