Mistral et Mixtral
Exécutez les modèles Mistral et Mixtral sur les GPU Clore.ai
Exécutez les modèles Mistral et Mixtral pour une génération de texte de haute qualité.
Tous les exemples peuvent être exécutés sur des serveurs GPU loués via la place de marché CLORE.AI.
Louer sur CLORE.AI
Visitez la place de marché CLORE.AI
Filtrez par type de GPU, VRAM et prix
Choisissez À la demande (tarif fixe) ou Spot (prix d'enchère)
Configurez votre commande :
Sélectionnez l'image Docker
Définissez les ports (TCP pour SSH, HTTP pour les interfaces web)
Ajoutez des variables d'environnement si nécessaire
Entrez la commande de démarrage
Sélectionnez le paiement : CLORE, BTC, ou USDT/USDC
Créez la commande et attendez le déploiement
Accédez à votre serveur
Trouvez les détails de connexion dans Mes commandes
Interfaces web : utilisez l'URL du port HTTP
SSH :
ssh -p <port> root@<proxy-address>
Aperçu du modèle
Mistral-7B
7B
8 Go
Usage général
Mistral-7B-Instruct
7B
8 Go
Chat/instructions
Mixtral-8x7B
46.7B (12.9B active)
24GB
MoE, meilleure qualité
Mixtral-8x22B
141B
80 Go+
Plus grand MoE
Déploiement rapide
Image Docker :
Ports :
Commande :
Accéder à votre service
Après le déploiement, trouvez votre http_pub URL dans Mes commandes:
Accédez à Mes commandes la page
Cliquez sur votre commande
Trouvez le
http_pubURL (par ex.,abc123.clorecloud.net)
Utilisez https://YOUR_HTTP_PUB_URL au lieu de localhost dans les exemples ci-dessous.
Options d'installation
Avec Ollama (le plus simple)
Avec vLLM
Utilisation de Transformers
Mistral-7B avec Transformers
Mixtral-8x7B
Modèles quantifiés (moins de VRAM)
Quantification sur 4 bits
GGUF avec llama.cpp
Serveur vLLM (production)
API compatible OpenAI
Flux continu
Appel de fonction
Mistral prend en charge l'appel de fonctions :
Interface Gradio
Comparaison des performances
Débit (jetons/sec)
Mistral-7B FP16
45
80
120
150
Mistral-7B Q4
70
110
160
200
Mixtral-8x7B FP16
-
-
30
60
Mixtral-8x7B Q4
-
25
50
80
Mixtral-8x22B Q4
-
-
-
25
Temps jusqu'au premier jeton (TTFT)
Mistral-7B
80ms
50ms
35 ms
Mixtral-8x7B
-
150 ms
90ms
Mixtral-8x22B
-
-
200 ms
Longueur de contexte vs VRAM (Mistral-7B)
4K
15 Go
9GB
5 Go
8K
18 Go
11GB
7 Go
16K
24GB
15 Go
9GB
32K
36GB
22 Go
14GB
Exigences en VRAM
Mistral-7B
14GB
8 Go
5 Go
Mixtral-8x7B
90GB
45GB
24GB
Mixtral-8x22B
180GB
90GB
48GB
Cas d’usage
Génération de code
Analyse des données
Écriture créative
Dépannage
Mémoire insuffisante
Utilisez une quantification 4 bits
Utilisez Mistral-7B au lieu de Mixtral
Réduisez max_model_len
Génération lente
Utilisez vLLM pour la production
Activez Flash Attention
Utilisez le parallélisme de tenseurs pour plusieurs GPU
Qualité de sortie médiocre
Ajustez la température (0.1-0.9)
Utilisez la variante instruct
De meilleurs prompts système
Estimation des coûts
Tarifs typiques du marché CLORE.AI (en 2024) :
RTX 3060
~$0.03
~$0.70
~$0.12
RTX 3090
~$0.06
~$1.50
~$0.25
RTX 4090
~$0.10
~$2.30
~$0.40
A100 40 Go
~$0.17
~$4.00
~$0.70
A100 80 Go
~$0.25
~$6.00
~$1.00
Les prix varient selon le fournisseur et la demande. Vérifiez la place de marché CLORE.AI les tarifs actuels.
Économisez de l'argent :
Utilisez le Spot marché pour les travaux interrompables — environ un tiers des serveurs ont un prix spot inférieur au tarif à la demande (médiane ~13 % de remise), les autres s'alignent dessus
Payez avec CLORE jetons
Comparez les prix entre différents fournisseurs
Étapes suivantes
vLLM - Diffusion en production
Ollama - Déploiement facile
DeepSeek-V3 - Meilleur modèle de raisonnement
Qwen2.5 - Alternative multilingue
Mis à jour
Ce contenu vous a-t-il été utile ?