Mistral.rs
Inferencia LLM ultrarrápida escrita en Rust — servidor listo para producción con compatibilidad con GGUF, GGML, SafeTensors y API compatible con OpenAI.
🦀 Construido en Rust para máximo rendimiento | compatibilidad con GGUF y modelos de visión | Licencia Apache-2.0
¿Qué es Mistral.rs?
Mistral.rs es un motor de inferencia LLM de alto rendimiento escrito completamente en Rust. Originalmente centrado en modelos Mistral, ahora admite todo el panorama de los LLM modernos. La base de Rust proporciona:
Abstracciones de costo cero — sin pausas por recolección de basura durante la inferencia
Seguridad de memoria — sin excepciones por punteros nulos ni fugas de memoria
Rendimiento determinista — latencia constante sin la sobrecarga de JVM/Python
Optimizaciones en tiempo de compilación — SIMD, hilos y kernels GPU optimizados en tiempo de compilación
Características clave
Compatibilidad con GGUF — ejecuta cualquier modelo cuantizado (Q4_K_M, Q8_0, etc.)
ISQ (cuantización in situ) — cuantiza sobre la marcha al cargar
PagedAttention — caché KV eficiente con batching continuo
Modelos de visión y lenguaje — compatibilidad con LLaVA, Phi-3 Vision e Idefics
Decodificación especulativa — inferencia más rápida con modelos borrador
X-LoRA — compatibilidad escalable con adaptadores afinados
API REST compatible con OpenAI — reemplazo directo
Familias de modelos compatibles
Llama 2/3
GGUF, SafeTensors
CUDA en Rust
Mistral/Mixtral
GGUF, SafeTensors
CUDA en Rust
Phi-2/3
GGUF, SafeTensors
CUDA en Rust
Gemma
GGUF, SafeTensors
CUDA en Rust
Qwen 2
GGUF, SafeTensors
CUDA en Rust
Starcoder 2
GGUF
CUDA en Rust
LLaVA 1.5/1.6
SafeTensors
Visión
Phi-3 Vision
SafeTensors
Visión
Inicio rápido en Clore.ai
Paso 1: Encuentra un servidor GPU
En clore.ai mercado:
Mínimo: 8 GB de VRAM (para modelos Q4 de 7B)
Recomendado: RTX 3090/4090 (24 GB) para modelos más grandes
Se requiere CUDA 11.8+
Paso 2: Desplegar el Docker de Mistral.rs
Mapeo de puertos:
22
Acceso SSH
8080
Servidor API REST
Variantes de imagen disponibles:
Paso 3: Conectar y verificar
Ejecutando el servidor
Inicio rápido con modelo GGUF
Servir Mistral 7B (SafeTensors)
Servir con cuantización in situ (ISQ)
ISQ cuantiza el modelo al cargar — no se necesita un modelo precuantizado:
Modelo de visión y lenguaje
Decodificación especulativa
Decodificación especulativa puede proporcionar una aceleración de 2–3x para la mayoría de las cargas de trabajo conversacionales donde el pequeño modelo borrador predice con precisión los siguientes tokens.
Uso de la API
Puntos finales compatibles con OpenAI
/v1/chat/completions
POST
Completaciones de chat
/v1/completions
POST
Completions de texto
/v1/models
GET
Listar modelos
/v1/images/generations
POST
Generación de imágenes (VLMs)
/v1/re_isq
POST
Recuantizar el modelo cargado
/health
GET
Comprobación de estado
Ejemplo en Python
Respuesta en streaming
Entrada de visión/imagen
Ejemplos de cURL
Opciones de configuración
Flags del servidor
Referencia de cuantización ISQ
Q2K
2
★★☆☆☆
~2.5 GB
Q3K
3
★★★☆☆
~3.5 GB
Q4_0
4
★★★★☆
~4.5 GB
Q4K
4
★★★★☆
~4.5 GB
Q5K
5
★★★★★
~5.5 GB
Q6K
6
★★★★★
~6.5 GB
Q8_0
8
★★★★★
~8 GB
HQQ4
4
★★★★☆
~4.5 GB
HQQ8
8
★★★★★
~8 GB
Funciones avanzadas
X-LoRA (mezcla de adaptadores LoRA)
Ejecuta múltiples adaptadores afinados que se seleccionan dinámicamente por token:
Recuantización en tiempo de ejecución
Registro de solicitudes
Ajuste del rendimiento
Optimizar para rendimiento
Optimizar para baja latencia
Monitorear rendimiento
Docker Compose
Compilación desde el código fuente
Si la imagen de Docker no coincide con tu versión de CUDA:
Tiempo de compilación: La compilación de Rust es lenta. Espera entre 10 y 20 minutos para una compilación completa. Usa sccache para acelerar las compilaciones incrementales: cargo install sccache && RUSTC_WRAPPER=sccache cargo build --release --features cuda
Solución de problemas
Biblioteca CUDA no encontrada
Fallo en la descarga del modelo
Puerto 8080 en uso
Memoria insuficiente durante la cuantización
ISQ vs GGUF: ISQ cuantiza al cargar usando memoria de la GPU (pico temporal). Si vas justo de VRAM, usa archivos GGUF precuantizados de TheBloke o similares — utilizan menos memoria pico durante la carga.
Recomendaciones de GPU para Clore.ai
Mistral.rs es un motor nativo de Rust — su baja sobrecarga significa que obtienes más rendimiento por dólar de GPU frente a servidores basados en Python.
RTX 3090
24 GB
$0.07–0.21/h
Mejor opción económica — modelos 7B Q4/Q8, modelos de visión
~120 tok/s
RTX 4090
24 GB
$0.14–0.42/h
7B–34B de alto rendimiento, decodificación especulativa
~200 tok/s
Por qué la RTX 3090 destaca aquí: Los kernels CUDA de Rust de Mistral.rs evitan la sobrecarga del GIL de Python y las pausas por recolección de basura que perjudican a los servidores Python. Una RTX 3090 ejecutando Mistral 7B Q4_K_M ofrece ~120 tok/s — comparable a vLLM en el mismo hardware por una fracción del costo ($0.07–0.21/h frente a proveedores en la nube que cobran $0.07–0.21/h).
Decodificación especulativa: Combina un modelo grande (34B) con un pequeño modelo borrador (3B) para obtener una aceleración de 2–3x sin pérdida de calidad. RTX 4090 es ideal para este patrón.
Recursos
🐙 GitHub: github.com/EricLBuehler/mistral.rs
📦 Registro de contenedores: ghcr.io/ericlbuehler/mistral.rs
📚 Documentación: ericlbuehler.github.io/mistral.rs
💬 Discord: discord.gg/SZrecqK8qw
🤗 Modelos GGUF: huggingface.co/TheBloke
Última actualización
¿Te fue útil?