For the complete documentation index, see llms.txt. This page is also available as Markdown.

Mistral et Mixtral

Exécutez les modèles Mistral et Mixtral sur les GPU Clore.ai

De nouvelles versions sont disponibles ! Découvrez Mistral Small 3.1 (24B, Apache 2.0, tient sur une RTX 4090) et Mistral Large 3 (675B MoE, classe frontière).

Exécutez les modèles Mistral et Mixtral pour une génération de texte de haute qualité.

Louer sur CLORE.AI

  1. Filtrez par type de GPU, VRAM et prix

  2. Choisissez À la demande (tarif fixe) ou Spot (prix d'enchère)

  3. Configurez votre commande :

    • Sélectionnez l'image Docker

    • Définissez les ports (TCP pour SSH, HTTP pour les interfaces web)

    • Ajoutez des variables d'environnement si nécessaire

    • Entrez la commande de démarrage

  4. Sélectionnez le paiement : CLORE, BTC, ou USDT/USDC

  5. Créez la commande et attendez le déploiement

Accédez à votre serveur

  • Trouvez les détails de connexion dans Mes commandes

  • Interfaces web : utilisez l'URL du port HTTP

  • SSH : ssh -p <port> root@<proxy-address>

Aperçu du modèle

Modèle
Paramètres
VRAM
Spécialité

Mistral-7B

7B

8 Go

Usage général

Mistral-7B-Instruct

7B

8 Go

Chat/instructions

Mixtral-8x7B

46.7B (12.9B active)

24GB

MoE, meilleure qualité

Mixtral-8x22B

141B

80 Go+

Plus grand MoE

Déploiement rapide

Image Docker :

Ports :

Commande :

Accéder à votre service

Après le déploiement, trouvez votre http_pub URL dans Mes commandes:

  1. Accédez à Mes commandes la page

  2. Cliquez sur votre commande

  3. Trouvez le http_pub URL (par ex., abc123.clorecloud.net)

Utilisez https://YOUR_HTTP_PUB_URL au lieu de localhost dans les exemples ci-dessous.

Options d'installation

Avec Ollama (le plus simple)

Avec vLLM

Utilisation de Transformers

Mistral-7B avec Transformers

Mixtral-8x7B

Modèles quantifiés (moins de VRAM)

Quantification sur 4 bits

GGUF avec llama.cpp

Serveur vLLM (production)

API compatible OpenAI

Flux continu

Appel de fonction

Mistral prend en charge l'appel de fonctions :

Interface Gradio

Comparaison des performances

Débit (jetons/sec)

Modèle
RTX 3060
RTX 3090
RTX 4090
A100 40 Go

Mistral-7B FP16

45

80

120

150

Mistral-7B Q4

70

110

160

200

Mixtral-8x7B FP16

-

-

30

60

Mixtral-8x7B Q4

-

25

50

80

Mixtral-8x22B Q4

-

-

-

25

Temps jusqu'au premier jeton (TTFT)

Modèle
RTX 3090
RTX 4090
A100

Mistral-7B

80ms

50ms

35 ms

Mixtral-8x7B

-

150 ms

90ms

Mixtral-8x22B

-

-

200 ms

Longueur de contexte vs VRAM (Mistral-7B)

Contexte
FP16
Q8
Q4

4K

15 Go

9GB

5 Go

8K

18 Go

11GB

7 Go

16K

24GB

15 Go

9GB

32K

36GB

22 Go

14GB

Exigences en VRAM

Modèle
FP16
8-bit
4-bit

Mistral-7B

14GB

8 Go

5 Go

Mixtral-8x7B

90GB

45GB

24GB

Mixtral-8x22B

180GB

90GB

48GB

Cas d’usage

Génération de code

Analyse des données

Écriture créative

Dépannage

Mémoire insuffisante

  • Utilisez une quantification 4 bits

  • Utilisez Mistral-7B au lieu de Mixtral

  • Réduisez max_model_len

Génération lente

  • Utilisez vLLM pour la production

  • Activez Flash Attention

  • Utilisez le parallélisme de tenseurs pour plusieurs GPU

Qualité de sortie médiocre

  • Ajustez la température (0.1-0.9)

  • Utilisez la variante instruct

  • De meilleurs prompts système

Estimation des coûts

Tarifs typiques du marché CLORE.AI (en 2024) :

GPU
Tarif horaire
Tarif journalier
Session de 4 heures

RTX 3060

~$0.03

~$0.70

~$0.12

RTX 3090

~$0.06

~$1.50

~$0.25

RTX 4090

~$0.10

~$2.30

~$0.40

A100 40 Go

~$0.17

~$4.00

~$0.70

A100 80 Go

~$0.25

~$6.00

~$1.00

Les prix varient selon le fournisseur et la demande. Vérifiez la place de marché CLORE.AI les tarifs actuels.

Économisez de l'argent :

  • Utilisez le Spot marché pour les travaux interrompables — environ un tiers des serveurs ont un prix spot inférieur au tarif à la demande (médiane ~13 % de remise), les autres s'alignent dessus

  • Payez avec CLORE jetons

  • Comparez les prix entre différents fournisseurs

Étapes suivantes

Mis à jour

Ce contenu vous a-t-il été utile ?