> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35.md).

# Qwen3.5

Exécutez Alibaba Qwen3.5 sur Clore.ai — le modèle frontière le plus récent (févr. 2026)

Qwen3.5, sorti le 16 février 2026, est le dernier modèle phare d'Alibaba et l'une des sorties open source les plus en vue de 2026. Le **fleuron MoE de 397B** a battu Claude 4.5 Opus sur le benchmark mathématique HMMT, tandis que le plus petit **modèle dense de 35B** tient sur une seule RTX 4090. Tous les modèles sont livrés d'emblée avec des capacités agentiques (utilisation d'outils, appel de fonctions, exécution autonome de tâches) et une compréhension multimodale.

## Caractéristiques clés

* **Trois tailles**: 9B (dense), 35B (dense), 397B (MoE) — il y en a pour tous les GPU
* **A battu Claude 4.5 Opus** sur le benchmark mathématique HMMT
* **Multimodal natif**: Compréhension du texte et des images
* **Capacités agentiques**: Utilisation d'outils, appel de fonctions, flux de travail autonomes
* **Fenêtre de contexte de 128K**: Gère de grands documents et bases de code
* **Licence Apache 2.0**: Utilisation commerciale complète, sans restrictions

## Variantes du modèle

| Modèle       | Paramètres | Type  | VRAM (Q4) | VRAM (FP16) | Atout                      |
| ------------ | ---------- | ----- | --------- | ----------- | -------------------------- |
| Qwen3.5-9B   | 9B         | Dense | 6 Go      | 18 Go       | Rapide, efficace           |
| Qwen3.5-35B  | 35B        | Dense | 22 Go     | 70 Go       | Meilleur sur une seule GPU |
| Qwen3.5-397B | 397B       | MoE   | \~100 Go  | 400 Go+     | Niveau de pointe           |

## Exigences

{% hint style="warning" %}
**Les configurations multi-GPU de classe 80 Go ne sont pas répertoriées sur la place de marché Clore.ai.** Les plus grosses machines listées aujourd'hui sont des 4× RTX PRO 6000 Blackwell (96 Go chacune, 380 Go au total) et des 8–11× RTX 5090 (32 Go chacune). La capacité A100 / H200 / B200 est vendue en [serveur nu](https://clore.ai/bare-metal) sur demande. Consultez [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) avant de dimensionner un déploiement.
{% endhint %}

| Composant | 9B (Q4)        | 35B (Q4)       | 397B (multi-GPU) |
| --------- | -------------- | -------------- | ---------------- |
| GPU       | RTX 3080 10 Go | RTX 4090 24 Go | 4× H100 80 Go    |
| VRAM      | 8 Go           | 22 Go          | 320 Go+          |
| RAM       | 16 Go          | 32 Go          | 128 Go           |
| Disque    | 15 Go          | 30 Go          | 250 Go           |

**GPU Clore.ai recommandé**: RTX 4090 24 Go ($0.14–0.42/h) pour le 35B — le meilleur rapport qualité-prix

## Démarrage rapide avec Ollama

```bash
# Installer Ollama
curl -fsSL https://ollama.com/install.sh | sh

# 9B — fonctionne sur tout (8 Go de VRAM)
ollama run qwen3.5:9b

# 35B quantifié — nécessite une RTX 4090 (24 Go)
ollama run qwen3.5:35b

# En tant que serveur API
ollama serve &
curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "qwen3.5:35b",
    "messages": [{"role": "user", "content": "Résous ceci : si f(x) = x^3 - 3x + 1, trouve toutes les racines réelles"}]
  }'
```

## Configuration vLLM (production)

```bash
pip install vllm

# 35B sur une seule GPU
vllm serve Qwen/Qwen3.5-35B-Instruct \
  --max-model-len 32768 \
  --gpu-memory-utilization 0.90

# 9B avec long contexte
vllm serve Qwen/Qwen3.5-9B-Instruct \
  --max-model-len 65536

# 397B sur un cluster multi-GPU
vllm serve Qwen/Qwen3.5-397B-A45B-Instruct \
  --tensor-parallel-size 8 \
  --max-model-len 32768
```

## Transformers HuggingFace

```python
import torch
from transformers import AutoModelForCausalLM, AutoTokenizer

model_name = "Qwen/Qwen3.5-35B-Instruct"
tokenizer = AutoTokenizer.from_pretrained(model_name)
model = AutoModelForCausalLM.from_pretrained(
    model_name,
    torch_dtype=torch.bfloat16,
    device_map="auto",
    load_in_4bit=True  # S'adapte au 35B sur 24 Go
)

messages = [
    {"role": "system", "content": "Tu es un tuteur en mathématiques utile."},
    {"role": "user", "content": "Prouve que la racine carrée de 2 est irrationnelle."}
]

input_ids = tokenizer.apply_chat_template(messages, return_tensors="pt").to(model.device)
output = model.generate(input_ids, max_new_tokens=2048, temperature=0.7, do_sample=True)
print(tokenizer.decode(output[0][input_ids.shape[-1]:], skip_special_tokens=True))
```

## Exemple agentique / utilisation d'outil

```python
import json
from openai import OpenAI

client = OpenAI(base_url="http://localhost:11434/v1", api_key="ollama")

tools = [{
    "type": "function",
    "function": {
        "name": "get_gpu_price",
        "description": "Obtenir le prix de location actuel d'un modèle de GPU sur Clore.ai",
        "parameters": {
            "type": "object",
            "properties": {
                "gpu_model": {"type": "string", "description": "Nom du modèle de GPU, par ex. RTX 4090"}
            },
            "required": ["gpu_model"]
        }
    }
}]

response = client.chat.completions.create(
    model="qwen3.5:35b",
    messages=[{"role": "user", "content": "Quel est le GPU le moins cher que je peux louer pour faire tourner un modèle 7B ?"}],
    tools=tools,
    tool_choice="auto"
)

# Qwen3.5 appellera get_gpu_price avec les paramètres appropriés
print(response.choices[0].message)
```

## Pourquoi Qwen3.5 sur Clore.ai ?

Le modèle 35B est sans doute le **meilleur modèle que vous pouvez exécuter sur une seule RTX 4090**:

* Bat Llama 4 Scout en mathématiques et en raisonnement
* Bat Gemma 3 27B sur les tâches agentiques
* L'utilisation d'outils / l'appel de fonctions fonctionne dès l'installation
* Apache 2.0 = aucun souci de licence

À 0,14–0,42 $/h pour une RTX 4090, vous obtenez une IA de niveau de pointe pour le prix d'un café.

## Conseils pour les utilisateurs de Clore.ai

* **Le 35B est le point idéal**: Tient sur une RTX 4090 en Q4, surpasse la plupart des modèles 70B
* **9B pour les petits budgets**: Même une RTX 3060 (0,03–0,07 $/h) fait bien tourner le modèle 9B
* **Utilisez Ollama pour démarrer rapidement**: Une seule commande pour servir ; API compatible OpenAI incluse
* **Flux de travail agentiques**: Qwen3.5 excelle dans l'utilisation d'outils — combinez-le avec l'appel de fonctions pour l'automatisation
* **Modèle récent = moins en cache**: Le premier téléchargement prend du temps (\~20 Go pour le 35B). Pré-téléchargez avant le démarrage de votre charge de travail

## Dépannage

| Problème                                | Solution                                                                            |
| --------------------------------------- | ----------------------------------------------------------------------------------- |
| OOM du 35B sur 24 Go                    | Utiliser `load_in_4bit=True` ou réduire `--max-model-len`                           |
| Modèle Ollama introuvable               | Mettre à jour Ollama : `curl -fsSL https://ollama.com/install.sh \| sh`             |
| Lent à la première requête              | Le chargement du modèle prend 30 à 60 s ; les requêtes suivantes sont rapides       |
| Les appels d'outils ne fonctionnent pas | Assurez-vous de passer `tools` paramètre ; utilisez uniquement la variante instruct |

## Pour aller plus loin

* [Blog Qwen](https://qwenlm.github.io/)
* [Modèles HuggingFace](https://huggingface.co/Qwen)
* [Bibliothèque Ollama](https://ollama.com/library/qwen3.5)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
