> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35-omni.md).

# Qwen3.5-Omni (multimodal)

d'Alibaba **Qwen3.5-Omni** est un modèle multimodal unifié de bout en bout publié le 30 mars 2026 sous licence Apache 2.0. Il peut comprendre et raisonner simultanément à travers le texte, l'audio, les images et la vidéo — et générer à la fois du texte et de la parole en sortie. Le faire tourner sur un GPU Clore.ai loué vous donne un assistant multimodal de niveau production pour une fraction du coût des API cloud.

***

## Qu'est-ce que Qwen3.5-Omni ?

Qwen3.5-Omni est un **modèle multimodal de bout en bout** construit sur une architecture clairesemée de mélange d'experts. La version Hugging Face (`Qwen3.5-Omni-7B`) utilise la convention de nommage d'Alibaba où « 7B » désigne la configuration de paramètres actifs par étape d'inférence ; le point de contrôle complet inclut tous les poids des experts. C'est cette parcimonie qui le rend déployable sur une seule RTX 4090 (24 Go) grâce à la quantification INT4 — un modèle qui nécessiterait autrement beaucoup plus de VRAM en pleine précision.

### Principales capacités

| Modalité | Entrée                                           | Sortie              |
| -------- | ------------------------------------------------ | ------------------- |
| Texte    | ✅                                                | ✅                   |
| Audio    | ✅ (transcription, compréhension)                 | ✅ (synthèse vocale) |
| Image    | ✅ (compréhension, OCR, analyse)                  | —                   |
| Vidéo    | ✅ (compréhension des scènes, questions-réponses) | —                   |

Contrairement aux précédents modèles multimodaux qui assemblent des encodeurs séparés, Qwen3.5-Omni traite toutes les modalités en une seule passe avant unifiée. Il peut simultanément transcrire de l'audio parlé, analyser une image vidéo et répondre à la fois par du texte et une voix synthétisée — en un seul appel d'inférence.

### Points forts de l'architecture

* **Réseaux Delta à portes (GDN)** pour une modélisation efficace des séquences avec une complexité sous-quadratique sur les longs flux audio/vidéo
* **Mélange clairsemé d'experts** — 30B paramètres au total, \~3B actifs par jeton ; qualité comparable aux modèles denses 7–14B mais plus rapide à grande échelle
* **Tokeniseur unifié** couvrant le texte, les trames audio, les patchs d'image et les séquences d'images vidéo
* **Décodeur TTS intégré** — génère nativement des formes d'onde de parole plutôt que via un pipeline séparé

Publié le 30 mars 2026 · Licence : **Apache 2.0** · [HuggingFace](https://huggingface.co/Qwen/Qwen3.5-Omni-7B)

***

## Qwen3.5-Omni vs. modèles associés

| Modèle                     | Paramètres          | Modalités en entrée        | Sortie vocale | Licence      | VRAM (INT4)    |
| -------------------------- | ------------------- | -------------------------- | ------------- | ------------ | -------------- |
| **Qwen3.5-Omni**           | 30B MoE (3B actifs) | Texte, audio, image, vidéo | ✅             | Apache 2.0   | \~15 Go        |
| Qwen3.5 (texte uniquement) | 32B                 | Texte uniquement           | ❌             | Apache 2.0   | \~18 Go        |
| Qwen2.5-VL                 | 72B                 | Texte, image, vidéo        | ❌             | Apache 2.0   | \~40 Go        |
| Gemini 2.0 Flash           | —                   | Texte, audio, image, vidéo | ✅             | Propriétaire | API uniquement |

Comparé à **Qwen3.5 (texte uniquement)**, la variante Omni ajoute la compréhension audio/vidéo et la génération vocale tout en nécessitant en réalité *moins* de VRAM en INT4 grâce à l'architecture MoE. Comparé à **Qwen2.5-VL**, il ajoute l'entrée/sortie audio mais nécessite beaucoup moins de matériel.

***

## Configuration matérielle requise

| Précision      | VRAM requise | GPU recommandé            |
| -------------- | ------------ | ------------------------- |
| BF16 (complet) | 64–80 Go     | A100 80 Go, H100          |
| BF16 multi-GPU | 2× 40 Go     | 2× A40 / 2× A6000         |
| INT4 / GGUF    | \~15 Go      | RTX 4090 (24 Go) ✅        |
| INT8           | \~30 Go      | A6000 48 Go, RTX 6000 Ada |

Pour la plupart des cas d'utilisation auto-hébergés, **l'INT4 sur une RTX 4090** est le meilleur compromis : toutes les capacités multimodales pour 0,14–0,42 $/h sur Clore.ai.

***

## Démarrage rapide sur Clore.ai

### Étape 1 : Louez un GPU

Accédez à [clore.ai/marketplace](https://clore.ai/marketplace) et louez :

* **INT4 / GPU unique**: RTX 4090 (24 Go) — à partir de **0,14–0,42 $/h**
* **BF16 / pleine précision**: A100 80 Go ou H100 — à partir de **\~1,04 $/h**

Utilisez le **vllm/vllm-openai** image Docker ou l'image CUDA standard.

### Étape 2 : Déployez avec vLLM (recommandé)

vLLM v0.17.0+ est requis pour la prise en charge de Qwen3.5-Omni.

```bash
# Téléchargez et lancez le serveur vLLM compatible OpenAI
docker run --gpus all --rm -it \\
  -p 8000:8000 \
  -v /workspace/models:/root/.cache/huggingface \\
  vllm/vllm-openai:v0.17.0 \\
  --model Qwen/Qwen3.5-Omni-7B \\
  --quantization awq_marlin \\
  --max-model-len 32768 \
  --trust-remote-code
```

> **Remarque :** Le `awq_marlin` l'option nécessite un modèle AWQ pré-quantifié. Téléchargez `Qwen/Qwen3.5-Omni-7B-AWQ` à la place du modèle de base, ou omettez `--quantization` pour BF16 sur A100/H100.

Une fois le serveur en cours d'exécution, il expose une API compatible OpenAI à `http://localhost:8000/v1`.

### Étape 3 : Déployez avec Ollama (configuration plus simple)

Pour des essais rapides sans la complexité de Docker :

```bash
# Installer Ollama
curl -fsSL https://ollama.ai/install.sh | sh

# Téléchargez Qwen3.5-Omni (quantifié)
# Remarque : vérifiez https://ollama.com/library pour la disponibilité — le tag peut varier
ollama pull qwen3.5-omni

# Démarrez le serveur
ollama serve
```

Ollama gère la quantification automatiquement et fournit un simple `/api/generate` point de terminaison.

***

## Exemples d'appels API

### Entrée multimodale : image + texte

```python
import openai
import base64

client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none")

# Chargez une image
with open("screenshot.png", "rb") as f:
    image_b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="Qwen/Qwen3.5-Omni-7B",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "image_url",
                    "image_url": {"url": f"data:image/png;base64,{image_b64}"}
                },
                {
                    "type": "text",
                    "text": "Décrivez ce que vous voyez dans cette image et identifiez tout texte."
                }
            ]
        }
    ],
    max_tokens=512
)
print(response.choices[0].message.content)
```

### Transcription audio + compréhension

```python
import openai
import base64

client = openai.OpenAI(base_url="http://localhost:8000/v1", api_key="none")

with open("meeting_recording.wav", "rb") as f:
    audio_b64 = base64.b64encode(f.read()).decode()

response = client.chat.completions.create(
    model="Qwen/Qwen3.5-Omni-7B",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "audio_url",
                    "audio_url": {"url": f"data:audio/wav;base64,{audio_b64}"}
                },
                {
                    "type": "text",
                    "text": "Transcrivez cet audio et résumez les points clés."
                }
            ]
        }
    ]
)
print(response.choices[0].message.content)
```

### Compréhension vidéo

```python
# Les images vidéo peuvent être transmises comme une séquence d'URL d'images
# ou comme video_url lors de l'utilisation de l'API native Qwen3.5-Omni
response = client.chat.completions.create(
    model="Qwen/Qwen3.5-Omni-7B",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "video_url",
                    "video_url": {"url": "https://example.com/product-demo.mp4"}
                },
                {
                    "type": "text",
                    "text": "Que se passe-t-il dans cette vidéo ? Décrivez chaque scène."
                }
            ]
        }
    ]
)
```

***

## Configuration multi-GPU pour BF16

Si vous louez une machine multi-GPU sur Clore.ai (par ex. 2× A40 ou 2× A6000), utilisez le parallélisme tensoriel :

```bash
docker run --gpus all --rm -it \\
  -p 8000:8000 \
  -v /workspace/models:/root/.cache/huggingface \\
  vllm/vllm-openai:v0.17.0 \\
  --model Qwen/Qwen3.5-Omni-7B \\
  --tensor-parallel-size 2 \
  --dtype bfloat16 \\
  --max-model-len 65536 \\
  --trust-remote-code
```

Cela répartit le modèle sur les deux GPU pour un débit et une qualité maximum.

***

## Cas d’usage

### 1. Automatisation du service client

Qwen3.5-Omni peut écouter les appels vocaux des clients, les transcrire en temps réel, comprendre le problème et générer à la fois un résumé textuel et une réponse vocale. Le tout dans un seul modèle, sans assembler des pipelines ASR + LLM + TTS séparés.

### 2. Compréhension du contenu vidéo

Téléversez des vidéos de démonstration de produits, des enregistrements de cours ou des images de surveillance et obtenez des descriptions textuelles détaillées, des résumés horodatés ou des questions-réponses. Le modèle gère jusqu'à 32K jetons de contexte, couvrant des vidéos de plusieurs minutes.

### 3. Agents vocaux en temps réel

Créez des assistants vocaux conversationnels qui comprennent le contexte à travers les tours audio. Qwen3.5-Omni conserve la mémoire conversationnelle et peut entremêler son raisonnement textuel avec la génération vocale — idéal pour les bots d'assistance client par téléphone.

### 4. Analyse de documents + captures d'écran

OCR, compréhension de la mise en page, interprétation de graphiques — transmettez des captures d'écran de tableaux de bord, des PDF ou des notes manuscrites et obtenez une sortie textuelle structurée ou une analyse détaillée.

### 5. Traitement audio multilingue

Le modèle prend en charge 29 langues pour le texte et la parole, ce qui le rend adapté à l'assistance client internationale, aux pipelines de transcription multilingues et à l'analyse vidéo interlingue.

***

## Estimation des coûts sur Clore.ai

| GPU          | Précision                   | VRAM    | Prix/jour | Idéal pour                                        |
| ------------ | --------------------------- | ------- | --------- | ------------------------------------------------- |
| RTX 4090     | INT4                        | 24 Go   | \~$0.50   | Développement, tests, production à petite échelle |
| RTX 6000 Ada | INT8                        | 48 Go   | \~$1.20   | Meilleure qualité, débit modéré                   |
| A100 80 Go   | BF16                        | 80 Go   | \~$2.50   | Qualité complète, débit élevé                     |
| 2× A40       | Parallélisme tensoriel BF16 | 2×48 Go | \~$2.00   | Qualité complète, économique                      |

Faire tourner Qwen3.5-Omni en INT4 sur une RTX 4090 coûte moins par jour qu'un seul appel à l'API OpenAI pour une tâche multimodale complexe à grande échelle.

***

## Conseils et dépannage

**"CUDA out of memory" sur RTX 4090**

* Ajoutez `--gpu-memory-utilization 0.90` à la commande vLLM
* Réduisez `--max-model-len` à 16384 si vous traitez des entrées courtes

**L'entrée audio ne fonctionne pas**

* Assurez-vous que la version de vLLM est exactement `v0.17.0` ou plus récente — les versions antérieures ne prennent pas en charge l'audio Omni
* Les fichiers WAV doivent être en mono 16 kHz pour de meilleurs résultats ; utilisez `ffmpeg -ar 16000 -ac 1` pour convertir

**Première inférence lente**

* vLLM compile les noyaux CUDA au premier lancement ; le préchauffage prend 2 à 5 minutes. Les appels suivants sont rapides.

**Ollama ne reconnaît pas l'entrée vidéo**

* Ollama prend actuellement en charge uniquement image+texte et audio ; pour la compréhension vidéo, utilisez le déploiement vLLM.

***

## Résumé

Qwen3.5-Omni apporte une véritable IA multimodale de bout en bout — texte, audio, image et vidéo en entrée, texte et parole en sortie — dans un seul modèle open source qui fonctionne sur du matériel grand public. En INT4, il tient dans une RTX 4090 de 24 Go et coûte moins d'un dollar par jour sur Clore.ai. Avec une licence Apache 2.0 et une API compatible OpenAI via vLLM, il s'intègre directement dans les pipelines existants.

**→** [**Louez une RTX 4090 sur Clore.ai**](https://clore.ai/marketplace) et déployez Qwen3.5-Omni dès aujourd'hui.


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35-omni.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
