MLC-LLM
Despliegue universal de LLM mediante compilación de ML — ejecuta cualquier modelo de lenguaje grande en cualquier hardware con el máximo rendimiento usando compilación de aprendizaje automático.
🌟 Más de 20,000 estrellas en GitHub | Mantenido por el equipo de MLC AI | Licencia Apache-2.0
¿Qué es MLC-LLM?
MLC-LLM (Compilación de Aprendizaje Automático para Modelos de Lenguaje Grandes) es un marco universal que permite el despliegue eficiente de modelos de lenguaje grandes en diversos backends de hardware. Aprovechando TVM (Máquina Virtual Tensorial) como su backend de compilación, MLC-LLM compila los modelos LLM directamente a código nativo de hardware, logrando un rendimiento casi óptimo sin ingeniería específica para el hardware.
Capacidades clave
Compatibilidad universal con hardware — NVIDIA CUDA, AMD ROCm, Apple Metal, Vulkan, WebGPU
API REST compatible con OpenAI — reemplazo directo para flujos de trabajo existentes
Múltiples formatos de modelo — Llama, Mistral, Gemma, Phi, Qwen, Falcon y más
Cuantización de 4 bits / 8 bits — ejecuta modelos grandes en GPUs de consumo
Interfaz de chat — interfaz web integrada para pruebas inmediatas
Herramientas de Python y CLI — opciones de integración flexibles
¿Por qué usar MLC-LLM en Clore.ai?
El marketplace de GPU de Clore.ai te da acceso a GPUs NVIDIA de alto rendimiento a tarifas de alquiler competitivas. El enfoque de compilación de MLC-LLM exprime el máximo rendimiento de cada GPU, lo que lo hace ideal para:
Inferencia de API de producción a escala
Investigación y evaluación comparativa entre tamaños de modelo
Servicio rentable con modelos cuantizados
Despliegue de varios modelos en una sola instancia de GPU
Inicio rápido en Clore.ai
Paso 1: Encuentra un servidor GPU
Ve a clore.ai marketplace
Filtrar servidores: GPU NVIDIA, mínimo 8 GB de VRAM (se recomiendan 16 GB+ para modelos 7B+)
Para un rendimiento óptimo: RTX 3090, RTX 4090, A100 o H100
Paso 2: Desplegar MLC-LLM
Usa una imagen base de NVIDIA CUDA en la configuración de tu pedido de Clore.ai:
Mapeo de puertos:
22
Acceso SSH
8000
Servidor API REST
Variables de entorno recomendadas:
Script de inicio (ejecutar después de SSH):
Paso 3: Conectarse por SSH
Instalación y configuración
Opción A: Usar modelos precompilados (la más rápida)
MLC-AI mantiene una biblioteca de modelos precompilados en Hugging Face. No se necesita compilación:
Opción B: Compilar tu propio modelo
Para modelos personalizados o requisitos específicos de cuantización:
Ejecutar el servidor API
Iniciar el servidor compatible con OpenAI
Salida de inicio del servidor
Endpoints de API disponibles
/v1/chat/completions
POST
Completions de chat (formato OpenAI)
/v1/completions
POST
Completions de texto
/v1/models
GET
Listar modelos disponibles
/v1/debug/dump_event_trace
GET
Depuración de rendimiento
Ejemplos de uso de la API
Completions de chat (Python)
Respuesta en streaming
Ejemplo de cURL
Modelos precompilados disponibles
MLC-AI proporciona modelos compilados listos para usar en Hugging Face:
Serie Llama 3
Mistral / Mixtral
Gemma
Phi
Lista completa de modelos: Explora todos los modelos precompilados en huggingface.co/mlc-ai
Opciones de cuantización
MLC-LLM admite varios esquemas de cuantización. Elige según tu presupuesto de VRAM:
q4f16_1
4 bits
★★★★☆
~4 GB
~7 GB
q4f32_1
4 bits (acumulación f32)
★★★★☆
~4 GB
~7 GB
q8f16_1
8 bits
★★★★★
~8 GB
~14 GB
q0f16
16 bits (sin cuantización)
★★★★★
~14 GB
~26 GB
q0f32
32 bits (sin cuantización)
★★★★★
~28 GB
~52 GB
Recomendación de VRAM: Deja siempre 2–3 GB de margen para la sobrecarga de CUDA y la caché KV. Un modelo 7B con q4f16_1 necesita ~6–7 GB en total en una carga de trabajo típica.
Despliegue multi-GPU
Para modelos grandes (70B+) que requieren varias GPUs:
Comprueba la topología de la GPU antes de desplegar:
Interfaz de chat web
MLC-LLM incluye una interfaz web integrada accesible una vez que el servidor está en ejecución:
Accede a la interfaz en: http://<clore-node-ip>:<api-port>
Ajuste del rendimiento
Optimizar el tamaño de lote
Monitorizar el uso de la GPU
Medir el rendimiento
Configuración con Docker Compose
Para un despliegue listo para producción en Clore.ai usando una imagen base NVIDIA CUDA con MLC-LLM instalado mediante pip:
Solución de problemas
Fallo en la descarga del modelo
Falta de memoria (OOM)
Incompatibilidad de versión de CUDA
Error común: Las ruedas pip de MLC-LLM son específicas de la versión de CUDA. Asegúrate de instalar la variante correcta que coincida con la versión de CUDA de tu servidor. Consulta las ruedas disponibles en mlc.ai/wheels.
Servidor no accesible
Recomendaciones de GPU para Clore.ai
El enfoque de compilación de MLC-LLM ofrece un rendimiento casi óptimo en cada nivel de GPU. Elige según el tamaño del modelo y el presupuesto:
RTX 3090
24 GB
$0.07–0.21/h
Modelos 7B–13B, servicio económico
~85 tok/s
RTX 4090
24 GB
$0.14–0.42/h
Modelos 7B–34B, servicio rápido
~140 tok/s
H100 SXM
80 GB
~$1.04/h
Máximo rendimiento, FP8
~280 tok/s
Punto de partida recomendado: La RTX 3090 a $0.07–0.21/h es la mejor relación precio-rendimiento para servir Llama 3 8B y Mistral 7B mediante MLC-LLM. Los kernels compilados extraen una utilización casi máxima de las GPUs de consumo.
Para modelos 70B (por ejemplo, Llama 3 70B Q4): usa A100 40GB (bare metal) o dos RTX 3090 mediante paralelismo tensorial.
Recursos
📦 Ruedas Pip: mlc.ai/wheels (instalar mediante pip, no hay imagen de Docker Hub disponible)
🐙 GitHub: github.com/mlc-ai/mlc-llm
📚 Documentación: llm.mlc.ai/docs
🤗 Modelos precompilados: huggingface.co/mlc-ai
💬 Discord: discord.gg/9Xpy2HGBuD
Última actualización
¿Te fue útil?