> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/hy3-preview.md).

# Hy3 Preview (Tencent Hunyuan 3, MoE 295B)

Déployez Hy3 Preview de Tencent (MoE 295B, 21B actifs, ctx 256K) sur Clore.ai — le premier modèle de la nouvelle pile d'entraînement de Tencent Hunyuan, optimisé pour le raisonnement à long terme et le codage agentique

{% hint style="info" %}
**Statut (avril 2026) :** Hy3 Preview est la première version publique de **l'infrastructure d'entraînement reconstruite de Tencent Hunyuan**, publiée le **13 avril 2026** et mise à jour pour la dernière fois le **23 avril 2026**. Les poids sont disponibles sur [huggingface.co/tencent/Hy3-preview](https://huggingface.co/tencent/Hy3-preview) sous la **Licence communautaire Tencent Hy**. La prise en charge dès le jour 0 est arrivée dans vLLM et SGLang.
{% endhint %}

Hy3 Preview est un **modèle de langage Mixture-of-Experts de 295 Md de paramètres** qui n'active que **\~21 Md de paramètres par jeton** (192 experts, routage top-8). Il vise deux charges de travail pour lesquelles Tencent rattrape visiblement son retard : **le raisonnement à long horizon** (FrontierScience-Olympiad, IMOAnswerBench, examens de doctorat en maths) et **la programmation agentique** (SWE-bench Verified 74,4 %, Terminal-Bench 2.0 54,4 %, d'après les chiffres du fournisseur). La fenêtre de contexte de 256K ainsi qu'une couche spéculative MTP (Multi-Token Prediction) rendent ce modèle pratique pour les agents de codage à l'échelle de l'IDE et le RAG gourmand en documents.

Pour les utilisateurs de Clore.ai, le chiffre clé est **21 Md actifs**. Vous n'avez pas besoin d'un rack complet 8×H200. Un déploiement en parallélisme de tenseur sur **4×A100 80 Go** ou **2×H100 80 Go** (BF16 avec déchargement) suffit pour le servir à un débit utilisable — du codage agentique de niveau frontier pour \~2,08 $/h sur la place de marché, les poids restant sur votre propre machine.

### Spécifications clés

| Propriété            | Valeur                                               |
| -------------------- | ---------------------------------------------------- |
| Paramètres totaux    | 295B (MoE)                                           |
| Paramètres actifs    | 21B par passe avant                                  |
| Experts              | 192 au total, routage top-8                          |
| Couches              | 80 transformeurs + 1 MTP                             |
| Attention            | 64 têtes, GQA avec 8 têtes KV, dimension de tête 128 |
| Taille cachée        | 4096                                                 |
| Taille intermédiaire | 13,312                                               |
| Vocabulaire          | 120,832                                              |
| Fenêtre de contexte  | 256 000 jetons                                       |
| Précision native     | BF16                                                 |
| Licence              | Licence communautaire Tencent Hy                     |
| Date de sortie       | 13 avril 2026                                        |
| Organisation         | Tencent Hunyuan                                      |
| Outils principaux    | vLLM, SGLang, AngelSlim, LLaMA-Factory               |

### Pourquoi Hy3 Preview ?

* **Premier sur la pile RL reconstruite de Tencent** — Tencent a réécrit son infrastructure d'entraînement pour cette sortie ; attendez-vous à une itération rapide tout au long de 2026
* **MoE actif de 21 Md** — payez le coût d'inférence d'un modèle dense d'environ 21 Md, pas de 295 Md
* **Contexte 256K** — assez pour des dépôts complets, de longues traces d'agent ou un RAG multi-document en une seule fois
* **Couche spéculative MTP** — la prédiction multi-jetons intégrée apporte \~1,5 à 2× de vitesse de décodage sur les GPU de classe Hopper
* **Deux modes de raisonnement** — `reasoning_effort: "high"` pour la chaîne de pensée, `"no_think"` pour des réponses directes rapides
* **Priorité au codage agentique** — explicitement optimisé pour l'utilisation multi-tours d'outils à la manière de SWE-bench et pour les agents de terminal
* **Licence favorable à l'open source** — la licence communautaire Tencent Hy est de style Apache pour la plupart des usages ; vérifiez le fichier LICENSE pour votre cas

***

## Exigences

{% hint style="warning" %}
**Les configurations multi-GPU de classe 80 Go ne sont pas répertoriées sur la place de marché Clore.ai.** Les plus grosses machines répertoriées aujourd’hui sont 4× RTX PRO 6000 Blackwell (96 Go chacune, 380 Go au total) et 8–11× RTX 5090 (32 Go chacune). La capacité A100 / H200 / B200 est proposée en bare metal sur demande. Consultez [bare metal](https://clore.ai/bare-metal) sur demande. Consultez [Tarifs et disponibilité des GPU](/guides/guides_v2-fr/premiers-pas/pricing.md) avant de dimensionner un déploiement.
{% endhint %}

{% hint style="warning" %}
**Cela reste un modèle de classe 295B.** "21B active" décrit le calcul d'inférence, pas l'empreinte mémoire. Les poids BF16 complets font environ 590 Go et doivent résider en VRAM (ou être déchargés). Prévoyez 8×H100/H200 si vous voulez un débit sans contrainte ; 4×A100 80 Go fonctionnent avec déchargement et des contextes plus courts.
{% endhint %}

| Composant | Minimum (Q4 GGUF, déchargement)          | Recommandé (BF16, TP)  | BF16 complet (production)  |
| --------- | ---------------------------------------- | ---------------------- | -------------------------- |
| VRAM GPU  | \~80 Go + déchargement sur 256 Go de RAM | 4× A100 80 Go (320 Go) | 8× H100 80 Go ou 8× H20-3e |
| RAM       | 256 Go                                   | 384 Go                 | 512 Go                     |
| Disque    | 700 Go NVMe                              | 1 To NVMe              | 1,5 To NVMe                |
| CUDA      | 12.8+                                    | 12.8+                  | 12.8+                      |
| Pilote    | 550+                                     | 550+                   | 560+                       |

**Adéquation matérielle :** Pour la plupart des équipes, **4× A100 80 Go** avec parallélisme de tenseur BF16 et `--max-model-len 65536` est le meilleur compromis ([bare metal](https://clore.ai/bare-metal)). Si vous avez besoin du contexte complet 256K avec des utilisateurs simultanés, passez à 8×H100.

***

## Option A — Ollama / GGUF (quantifiés, versions communautaires)

{% hint style="warning" %}
**Attention :** Hy3 Preview est tout nouveau (13 avril 2026) et utilise une architecture MoE personnalisée. La prise en charge communautaire pour llama.cpp / GGUF arrive généralement **2 à 4 semaines** après la sortie. Si vous en avez besoin aujourd'hui, utilisez vLLM (Option B). Vérifiez [huggingface.co/models?search=hy3-preview+gguf](https://huggingface.co/models?search=hy3-preview+gguf) pour les quantifications communautaires avant de récupérer.
{% endhint %}

```bash
# Une fois qu'une build Q4_K_M est publiée
docker exec ollama ollama pull hy3-preview:q4_K_M
docker exec ollama ollama run hy3-preview:q4_K_M

# Ou avec llama.cpp directement sur un GGUF communautaire
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/hy3-preview-q4_k_m.gguf \
  --n-gpu-layers 80 --ctx-size 32768 \
  --port 8080 --host 0.0.0.0
```

Avant les jours du GGUF, AngelSlim (la boîte à outils de quantification de Tencent) peut produire directement des poids W4A16 / W8A8 à partir du checkpoint BF16.

***

## Option B — vLLM (API de production, recommandé)

vLLM est la cible de service de premier ordre de Tencent pour Hy3 Preview. La couche spéculative MTP est intégrée via `--speculative-config.method mtp`.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model tencent/Hy3-preview
      --tensor-parallel-size 8
      --max-model-len 65536
      --gpu-memory-utilization 0.90
      --speculative-config.method mtp
      --speculative-config.num_speculative_tokens 1
      --tool-call-parser hy_v3
      --reasoning-parser hy_v3
      --enable-auto-tool-choice
      --served-model-name hy3-preview
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Testez l'API avec un effort de raisonnement élevé
curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "hy3-preview",
    "messages": [
      {"role": "system", "content": "Vous êtes un ingénieur logiciel expert."},
      {"role": "user", "content": "Refactorez cette fonction Python pour utiliser async/await et ajoutez une gestion d'erreur appropriée."}
    ],
    "max_tokens": 4096,
    "temperature": 0.9,
    "top_p": 1.0,
    "reasoning_effort": "high"
  }'
```

{% hint style="info" %}
**Modes de raisonnement.** Définissez `reasoning_effort: "high"` pour activer des traces de chaîne de pensée (plus lent, bien meilleur sur les tâches de maths/codage/agentiques) ou `"no_think"` pour des réponses directes rapides. L'échantillonnage recommandé par le fournisseur est `temperature=0.9, top_p=1.0` — un échantillonnage à température nulle peut casser les traces de raisonnement.
{% endhint %}

{% hint style="info" %}
**À court de GPU ?** Descendez à `--tensor-parallel-size 4` sur 4× A100 80 Go. Conservez `--max-model-len 32768` et ajoutez `--enable-chunked-prefill` pour garder une latence de préremplissage raisonnable.
{% endhint %}

***

## Option C — SGLang

SGLang fournit la prise en charge dès le jour 0 et associe la couche MTP à EAGLE pour un débit supplémentaire sur Hopper.

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \
  --model tencent/Hy3-preview \
  --tp 8 \
  --tool-call-parser hunyuan \
  --reasoning-parser hunyuan \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 1 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 2 \
  --mem-fraction-static 0.88 \\
  --context-length 65536 \\
  --served-model-name hy3-preview
```

Attendez-vous à un gain de débit de 1,5 à 2× sur les longues boucles d'agent par rapport au décodage classique.

***

## Recommandations GPU Clore.ai

| Configuration  | VRAM     | Performances attendues                                     | Coût Clore.ai                             | Louer                                           |
| -------------- | -------- | ---------------------------------------------------------- | ----------------------------------------- | ----------------------------------------------- |
| 4× A100 80 Go  | 320 Go   | BF16 shardé, contexte 64K, \~15–25 tok/s                   | [bare metal](https://clore.ai/bare-metal) | [Bare metal](https://clore.ai/bare-metal)       |
| 2× H100 80 Go  | 160 Go   | BF16 avec déchargement, contexte plus petit, \~12–20 tok/s | \~2,08 $/h                                | [Louer H100](https://clore.ai/rent-h100.html)   |
| 8× H100 80 Go  | 640 Go   | BF16 complet, contexte 256K, 60+ tok/s avec MTP            | \~8,32 $/h                                | [Louer H100](https://clore.ai/rent-h100.html)   |
| 8× H200 141 Go | 1 128 Go | BF16 complet + concurrence maximale                        | [bare metal](https://clore.ai/bare-metal) | [Bare metal](https://clore.ai/bare-metal)       |
| 1× RTX 5090    | 32 Go    | Q4 GGUF, déchargement sur RAM, utilisateur unique          | 0,25–0,77 $/h                             | [Place de marché](https://clore.ai/marketplace) |

{% hint style="success" %}
**Meilleur choix :** 4× A100 80 Go avec parallélisme de tenseur BF16 et une fenêtre de contexte 64K, disponibles sous la forme de [bare metal](https://clore.ai/bare-metal) plutôt qu'une location sur la place de marché. Vous obtenez un agentic coder open-weight de classe 295B pour à peu près le prix d'un abonnement Claude Pro, et les poids ne quittent jamais votre machine louée.
{% endhint %}

***

## Cas d’usage

* **Agents SWE autonomes** — 74,4 % SWE-bench Verified (d'après les chiffres du fournisseur) et optimisation explicite pour de longues boucles d'appels d'outils ; associez-le à OpenHands, SWE-agent ou Aider
* **Agents pilotés par le terminal** — 54,4 % sur Terminal-Bench 2.0 le place dans le haut du panier pour les workflows shell/CLI
* **Raisonnement à long horizon** — maths de niveau olympiade (IMOAnswerBench, FrontierScience-Olympiad) et STEM de niveau doctorat
* **RAG à l'échelle d'une base de code** — le contexte 256K permet de faire tenir un dépôt de taille moyenne complet plus les tests dans un seul prompt
* **Agents de recherche et de navigation** — l'optimisation BrowseComp / WideSearch en fait un excellent planificateur pour la recherche web en plusieurs étapes
* **Agent d'agents** — utilisez Hy3 Preview comme planificateur et des modèles ouverts plus légers ([Qwen3.5](/guides/guides_v2-fr/modeles-de-langage/qwen35.md), [GLM-4.7 Flash](/guides/guides_v2-fr/modeles-de-langage/glm-47-flash.md)) comme exécutants

***

## Benchmarks

{% hint style="warning" %}
**Déclaré par le fournisseur — vérifiez indépendamment.** Tous les chiffres ci-dessous proviennent de la fiche modèle de Tencent du 13 avril 2026. Les reproductions indépendantes (en particulier sur SWE-bench Verified) continuent d'arriver. Considérez-les comme des bornes supérieures jusqu'à confirmation par LMSYS / OpenCompass.
{% endhint %}

| Benchmark          | Hy3 Preview | GLM-5.1 | DeepSeek R1 | GPT-5.4 |
| ------------------ | ----------- | ------- | ----------- | ------- |
| SWE-bench Verified | **74.4%**   | \~79%   | \~71%       | \~78%   |
| Terminal-Bench 2.0 | **54.4%**   | —       | —           | —       |
| GPQA Diamond       | **87.2%**   | —       | \~84%       | \~88%   |
| SuperGPQA          | 51.6%       | —       | —           | —       |
| HLE                | \~30        | —       | —           | —       |

Tencent annonce également de bons résultats sur les benchmarks propriétaires CL-bench / CL-bench-Life d'apprentissage de contexte et l'examen de doctorat en mathématiques Qiuzhen de l'université Tsinghua (printemps 2026).

***

## Dépannage

| Problème                                | Solution                                                                                                                                                                              |
| --------------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` au chargement        | BF16 nécessite environ 590 Go de VRAM au total. Descendez à 4×A100 avec `--max-model-len 32768` ou utilisez les quantifications AngelSlim W4A16.                                      |
| Téléchargement HuggingFace lent         | Utilisez `huggingface-cli download tencent/Hy3-preview --local-dir ./weights --resume-download`. Attendez-vous à 590 Go et plus.                                                      |
| Appels d'outils ignorés silencieusement | Assurez-vous que `--tool-call-parser hy_v3` (vLLM) ou `--tool-call-parser hunyuan` (SGLang) est défini, et `--enable-auto-tool-choice` est activé.                                    |
| Trace de raisonnement vide / incorrecte | Utilisez `temperature=0.9, top_p=1.0`. Le décodage gourmand à température nulle casse la chaîne de pensée. Vérifiez `reasoning_effort: "high"`.                                       |
| Erreurs de décodage spéculatif MTP      | Nécessite une version récente de vLLM (build postérieure à avril 2026). Exécutez `pip install -U vllm --pre` ou épinglez à une version qui mentionne `mtp` dans les notes de version. |
| OOM avec un contexte 256K               | Commencez à `--max-model-len 32768`, activez `--enable-chunked-prefill`, augmentez progressivement. Le 256K complet nécessite en pratique 8× H200.                                    |
| Architecture personnalisée rejetée      | Passez toujours `--trust-remote-code`. Hy3 est livré avec du code de modélisation personnalisé dans le checkpoint.                                                                    |
| Ollama / GGUF non disponible            | Les quantifications communautaires arrivent généralement 2 à 4 semaines après la sortie. Utilisez vLLM ou AngelSlim en attendant.                                                     |

***

## Étapes suivantes

* **Concurrent open-weight le plus proche :** [GLM-5.1](/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md) — MoE 744B / 40B actif, licence MIT, meilleurs scores SWE-bench Pro
* **Alternative multimodale :** [Qwen3.5-Omni](/guides/guides_v2-fr/modeles-de-langage/qwen35-omni.md) — texte + audio + image + vidéo, fonctionne sur une seule RTX 4090
* **Alternative axée uniquement sur le raisonnement :** [DeepSeek R1](/guides/guides_v2-fr/modeles-de-langage/deepseek-r1.md) — spécialiste pur du raisonnement long format
* **Louez le matériel :** [A100 80 Go en bare metal](https://clore.ai/bare-metal) — instances 4× A100 80 Go de [bare metal](https://clore.ai/bare-metal)
* **Place de marché complète :** [clore.ai/marketplace](https://clore.ai/marketplace) — H100, H200, A100, RTX 5090 à partir de 0,25–0,77 $/h

### Liens

* [Hy3 Preview sur HuggingFace](https://huggingface.co/tencent/Hy3-preview)
* [Dépôt GitHub de Hy3 Preview](https://github.com/Tencent-Hunyuan/Hy3-preview)
* [Organisation Tencent Hunyuan](https://huggingface.co/tencent)
* [documentation vLLM](https://docs.vllm.ai)
* [dépôt SGLang](https://github.com/sgl-project/sglang)
* [AngelSlim — la boîte à outils de quantification de Tencent](https://github.com/Tencent/AngelSlim)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/hy3-preview.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
