For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral.rs

Inferencia LLM ultrarrápida escrita en Rust — servidor listo para producción con compatibilidad con GGUF, GGML, SafeTensors y API compatible con OpenAI.

🦀 Construido en Rust para máximo rendimiento | compatibilidad con GGUF y modelos de visión | Licencia Apache-2.0


¿Qué es Mistral.rs?

Mistral.rs es un motor de inferencia LLM de alto rendimiento escrito completamente en Rust. Originalmente centrado en modelos Mistral, ahora admite todo el panorama de los LLM modernos. La base de Rust proporciona:

  • Abstracciones de costo cero — sin pausas por recolección de basura durante la inferencia

  • Seguridad de memoria — sin excepciones por punteros nulos ni fugas de memoria

  • Rendimiento determinista — latencia constante sin la sobrecarga de JVM/Python

  • Optimizaciones en tiempo de compilación — SIMD, hilos y kernels GPU optimizados en tiempo de compilación

Características clave

  • Compatibilidad con GGUF — ejecuta cualquier modelo cuantizado (Q4_K_M, Q8_0, etc.)

  • ISQ (cuantización in situ) — cuantiza sobre la marcha al cargar

  • PagedAttention — caché KV eficiente con batching continuo

  • Modelos de visión y lenguaje — compatibilidad con LLaVA, Phi-3 Vision e Idefics

  • Decodificación especulativa — inferencia más rápida con modelos borrador

  • X-LoRA — compatibilidad escalable con adaptadores afinados

  • API REST compatible con OpenAI — reemplazo directo

Familias de modelos compatibles

Familia
Formato
Motor

Llama 2/3

GGUF, SafeTensors

CUDA en Rust

Mistral/Mixtral

GGUF, SafeTensors

CUDA en Rust

Phi-2/3

GGUF, SafeTensors

CUDA en Rust

Gemma

GGUF, SafeTensors

CUDA en Rust

Qwen 2

GGUF, SafeTensors

CUDA en Rust

Starcoder 2

GGUF

CUDA en Rust

LLaVA 1.5/1.6

SafeTensors

Visión

Phi-3 Vision

SafeTensors

Visión


Inicio rápido en Clore.ai

Paso 1: Encuentra un servidor GPU

En clore.ai mercado:

  • Mínimo: 8 GB de VRAM (para modelos Q4 de 7B)

  • Recomendado: RTX 3090/4090 (24 GB) para modelos más grandes

  • Se requiere CUDA 11.8+

Paso 2: Desplegar el Docker de Mistral.rs

Mapeo de puertos:

Puerto del contenedor
Propósito

22

Acceso SSH

8080

Servidor API REST

Variantes de imagen disponibles:

Paso 3: Conectar y verificar


Ejecutando el servidor

Inicio rápido con modelo GGUF

Servir Mistral 7B (SafeTensors)

Servir con cuantización in situ (ISQ)

ISQ cuantiza el modelo al cargar — no se necesita un modelo precuantizado:

Modelo de visión y lenguaje

Decodificación especulativa


Uso de la API

Puntos finales compatibles con OpenAI

Endpoint
Método
Descripción

/v1/chat/completions

POST

Completaciones de chat

/v1/completions

POST

Completions de texto

/v1/models

GET

Listar modelos

/v1/images/generations

POST

Generación de imágenes (VLMs)

/v1/re_isq

POST

Recuantizar el modelo cargado

/health

GET

Comprobación de estado

Ejemplo en Python

Respuesta en streaming

Entrada de visión/imagen

Ejemplos de cURL


Opciones de configuración

Flags del servidor

Referencia de cuantización ISQ

Opción ISQ
Bits
Calidad
VRAM (7B)

Q2K

2

★★☆☆☆

~2.5 GB

Q3K

3

★★★☆☆

~3.5 GB

Q4_0

4

★★★★☆

~4.5 GB

Q4K

4

★★★★☆

~4.5 GB

Q5K

5

★★★★★

~5.5 GB

Q6K

6

★★★★★

~6.5 GB

Q8_0

8

★★★★★

~8 GB

HQQ4

4

★★★★☆

~4.5 GB

HQQ8

8

★★★★★

~8 GB

HQQ (Cuantización Half-Quadratic) a menudo logra mejor calidad que GGUF Q4 al mismo nivel de bits, especialmente para tareas de seguimiento de instrucciones.


Funciones avanzadas

X-LoRA (mezcla de adaptadores LoRA)

Ejecuta múltiples adaptadores afinados que se seleccionan dinámicamente por token:

Recuantización en tiempo de ejecución

Registro de solicitudes


Ajuste del rendimiento

Optimizar para rendimiento

Optimizar para baja latencia

Monitorear rendimiento


Docker Compose


Compilación desde el código fuente

Si la imagen de Docker no coincide con tu versión de CUDA:


Solución de problemas

Biblioteca CUDA no encontrada

Fallo en la descarga del modelo

Puerto 8080 en uso

Memoria insuficiente durante la cuantización


Recomendaciones de GPU para Clore.ai

Mistral.rs es un motor nativo de Rust — su baja sobrecarga significa que obtienes más rendimiento por dólar de GPU frente a servidores basados en Python.

GPU
VRAM
Precio de Clore.ai
Uso recomendado
Rendimiento (Mistral 7B Q4)

RTX 3090

24 GB

$0.07–0.21/h

Mejor opción económica — modelos 7B Q4/Q8, modelos de visión

~120 tok/s

RTX 4090

24 GB

$0.14–0.42/h

7B–34B de alto rendimiento, decodificación especulativa

~200 tok/s

A100 40GB

40 GB

Servicio en producción Q4 de 34B–70B

~160 tok/s

A100 80GB

80 GB

70B de precisión completa, multimodelo

~185 tok/s

Por qué la RTX 3090 destaca aquí: Los kernels CUDA de Rust de Mistral.rs evitan la sobrecarga del GIL de Python y las pausas por recolección de basura que perjudican a los servidores Python. Una RTX 3090 ejecutando Mistral 7B Q4_K_M ofrece ~120 tok/s — comparable a vLLM en el mismo hardware por una fracción del costo ($0.07–0.21/h frente a proveedores en la nube que cobran $0.07–0.21/h).

Decodificación especulativa: Combina un modelo grande (34B) con un pequeño modelo borrador (3B) para obtener una aceleración de 2–3x sin pérdida de calidad. RTX 4090 es ideal para este patrón.


Recursos

Última actualización

¿Te fue útil?