For the complete documentation index, see llms.txt. This page is also available as Markdown.

MLC-LLM

Despliegue universal de LLM mediante compilación de ML — ejecuta cualquier modelo de lenguaje grande en cualquier hardware con el máximo rendimiento usando compilación de aprendizaje automático.

🌟 Más de 20,000 estrellas en GitHub | Mantenido por el equipo de MLC AI | Licencia Apache-2.0


¿Qué es MLC-LLM?

MLC-LLM (Compilación de Aprendizaje Automático para Modelos de Lenguaje Grandes) es un marco universal que permite el despliegue eficiente de modelos de lenguaje grandes en diversos backends de hardware. Aprovechando TVM (Máquina Virtual Tensorial) como su backend de compilación, MLC-LLM compila los modelos LLM directamente a código nativo de hardware, logrando un rendimiento casi óptimo sin ingeniería específica para el hardware.

Capacidades clave

  • Compatibilidad universal con hardware — NVIDIA CUDA, AMD ROCm, Apple Metal, Vulkan, WebGPU

  • API REST compatible con OpenAI — reemplazo directo para flujos de trabajo existentes

  • Múltiples formatos de modelo — Llama, Mistral, Gemma, Phi, Qwen, Falcon y más

  • Cuantización de 4 bits / 8 bits — ejecuta modelos grandes en GPUs de consumo

  • Interfaz de chat — interfaz web integrada para pruebas inmediatas

  • Herramientas de Python y CLI — opciones de integración flexibles

¿Por qué usar MLC-LLM en Clore.ai?

El marketplace de GPU de Clore.ai te da acceso a GPUs NVIDIA de alto rendimiento a tarifas de alquiler competitivas. El enfoque de compilación de MLC-LLM exprime el máximo rendimiento de cada GPU, lo que lo hace ideal para:

  • Inferencia de API de producción a escala

  • Investigación y evaluación comparativa entre tamaños de modelo

  • Servicio rentable con modelos cuantizados

  • Despliegue de varios modelos en una sola instancia de GPU


Inicio rápido en Clore.ai

Paso 1: Encuentra un servidor GPU

  1. Ve a clore.ai marketplace

  2. Filtrar servidores: GPU NVIDIA, mínimo 8 GB de VRAM (se recomiendan 16 GB+ para modelos 7B+)

  3. Para un rendimiento óptimo: RTX 3090, RTX 4090, A100 o H100

Paso 2: Desplegar MLC-LLM

Nota: MLC-LLM no publica una imagen Docker oficial preconstruida en Docker Hub. El enfoque de despliegue recomendado es usar una imagen base de NVIDIA CUDA e instalar MLC-LLM mediante pip. Usa nvidia/cuda:12.8.1-devel-ubuntu22.04 como tu imagen base en Clore.ai.

Usa una imagen base de NVIDIA CUDA en la configuración de tu pedido de Clore.ai:

Mapeo de puertos:

Puerto del contenedor
Propósito

22

Acceso SSH

8000

Servidor API REST

Variables de entorno recomendadas:

Script de inicio (ejecutar después de SSH):

Paso 3: Conectarse por SSH


Instalación y configuración

Opción A: Usar modelos precompilados (la más rápida)

MLC-AI mantiene una biblioteca de modelos precompilados en Hugging Face. No se necesita compilación:

Opción B: Compilar tu propio modelo

Para modelos personalizados o requisitos específicos de cuantización:

Tiempo de compilación: Compilar un modelo 7B suele tardar de 10 a 30 minutos en la primera ejecución. Los artefactos compilados se almacenan en caché y se reutilizan en lanzamientos posteriores.


Ejecutar el servidor API

Iniciar el servidor compatible con OpenAI

Salida de inicio del servidor

Endpoints de API disponibles

Endpoint
Método
Descripción

/v1/chat/completions

POST

Completions de chat (formato OpenAI)

/v1/completions

POST

Completions de texto

/v1/models

GET

Listar modelos disponibles

/v1/debug/dump_event_trace

GET

Depuración de rendimiento


Ejemplos de uso de la API

Completions de chat (Python)

Respuesta en streaming

Ejemplo de cURL


Modelos precompilados disponibles

MLC-AI proporciona modelos compilados listos para usar en Hugging Face:

Serie Llama 3

Mistral / Mixtral

Gemma

Phi


Opciones de cuantización

MLC-LLM admite varios esquemas de cuantización. Elige según tu presupuesto de VRAM:

Cuantización
Bits
Calidad
VRAM (7B)
VRAM (13B)

q4f16_1

4 bits

★★★★☆

~4 GB

~7 GB

q4f32_1

4 bits (acumulación f32)

★★★★☆

~4 GB

~7 GB

q8f16_1

8 bits

★★★★★

~8 GB

~14 GB

q0f16

16 bits (sin cuantización)

★★★★★

~14 GB

~26 GB

q0f32

32 bits (sin cuantización)

★★★★★

~28 GB

~52 GB


Despliegue multi-GPU

Para modelos grandes (70B+) que requieren varias GPUs:

Comprueba la topología de la GPU antes de desplegar:

Mejor rendimiento: El multi-GPU funciona mejor con tarjetas conectadas por NVLink (por ejemplo, pares de A100 80GB SXM). Las GPUs conectadas por PCIe mostrarán cuellos de botella en modelos grandes.


Interfaz de chat web

MLC-LLM incluye una interfaz web integrada accesible una vez que el servidor está en ejecución:

Accede a la interfaz en: http://<clore-node-ip>:<api-port>


Ajuste del rendimiento

Optimizar el tamaño de lote

Monitorizar el uso de la GPU

Medir el rendimiento


Configuración con Docker Compose

Para un despliegue listo para producción en Clore.ai usando una imagen base NVIDIA CUDA con MLC-LLM instalado mediante pip:


Solución de problemas

Fallo en la descarga del modelo

Falta de memoria (OOM)

Incompatibilidad de versión de CUDA

Servidor no accesible


Recomendaciones de GPU para Clore.ai

El enfoque de compilación de MLC-LLM ofrece un rendimiento casi óptimo en cada nivel de GPU. Elige según el tamaño del modelo y el presupuesto:

GPU
VRAM
Precio de Clore.ai
Ideal para
Rendimiento (Llama 3 8B Q4)

RTX 3090

24 GB

$0.07–0.21/h

Modelos 7B–13B, servicio económico

~85 tok/s

RTX 4090

24 GB

$0.14–0.42/h

Modelos 7B–34B, servicio rápido

~140 tok/s

A100 40GB

40 GB

34B–70B, API de producción

~110 tok/s

A100 80GB

80 GB

70B+, servicio multi-modelo

~130 tok/s

H100 SXM

80 GB

~$1.04/h

Máximo rendimiento, FP8

~280 tok/s

Punto de partida recomendado: La RTX 3090 a $0.07–0.21/h es la mejor relación precio-rendimiento para servir Llama 3 8B y Mistral 7B mediante MLC-LLM. Los kernels compilados extraen una utilización casi máxima de las GPUs de consumo.

Para modelos 70B (por ejemplo, Llama 3 70B Q4): usa A100 40GB (bare metal) o dos RTX 3090 mediante paralelismo tensorial.


Recursos

Última actualización

¿Te fue útil?