> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage.md).

# Modèles de langage

- [Aperçu](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/language-models.md)
- [Ollama](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/ollama.md): Exécutez des LLM localement avec Ollama sur les GPU Clore.ai
- [Open WebUI](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/open-webui.md): Interface de type ChatGPT pour exécuter des LLM sur les GPU Clore.ai
- [vLLM](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/vllm.md): Inférence LLM à haut débit avec vLLM sur les GPU Clore.ai
- [Llama.cpp Server](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/llamacpp-server.md): Inférence LLM efficace avec le serveur llama.cpp sur les GPU Clore.ai
- [Text Generation WebUI](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/text-generation-webui.md): Exécutez text-generation-webui pour l'inférence LLM sur les GPU Clore.ai
- [ExLlamaV2](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/exllamav2-fast.md): Inférence LLM à vitesse maximale avec ExLlamaV2 sur les GPU Clore.ai
- [LocalAI](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/localai-openai-compatible.md): API compatible OpenAI auto-hébergée avec LocalAI sur Clore.ai
- [Llama 3.3 70B](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/llama33.md): Exécutez le modèle Llama 3.3 70B de Meta sur les GPU Clore.ai
- [Mistral et Mixtral](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-mixtral.md): Exécutez les modèles Mistral et Mixtral sur les GPU Clore.ai
- [DeepSeek Coder](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-coder.md): Génération de code de premier plan avec DeepSeek Coder sur Clore.ai
- [DeepSeek-V3](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-v3.md): Exécutez DeepSeek-V3 avec un raisonnement exceptionnel sur les GPU Clore.ai
- [Modèle de raisonnement DeepSeek-R1](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-r1.md): Exécutez le modèle de raisonnement open source DeepSeek-R1 sur les GPU Clore.ai
- [Qwen2.5](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen25.md): Exécutez les LLM multilingues Qwen2.5 d'Alibaba sur les GPU Clore.ai
- [CodeLlama](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/codellama.md): Générez, complétez et expliquez du code avec CodeLlama sur Clore.ai
- [Gemma 2](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/gemma2.md): Exécutez efficacement les modèles Gemma 2 de Google sur les GPU Clore.ai
- [Phi-4](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/phi4.md): Exécutez le petit modèle de langage Phi-4 de Microsoft sur les GPU Clore.ai
- [Llama 4 (Scout et Maverick)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/llama4.md): Exécutez les modèles MoE Meta Llama 4 Scout et Maverick sur les GPU Clore.ai
- [Gemma 3](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/gemma3.md): Exécutez les modèles multimodaux Gemma 3 de Google sur Clore.ai — surpassent Llama-405B en étant 15 fois plus petits
- [Gemma 4 (MoE 26B, 4B actifs)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/gemma4.md): Déployez Gemma 4 (MoE 26B, 4B actifs) de Google sur Clore.ai — le modèle à poids ouverts publié en avril 2026 qui a grimpé jusqu'à
- [Mistral Small 3.1](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-small.md): Déployez Mistral Small 3.1 (24B) sur Clore.ai — le modèle de production idéal sur un seul GPU
- [Qwen3.5](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35.md): Exécutez Alibaba Qwen3.5 sur Clore.ai — le modèle frontière le plus récent (févr. 2026)
- [Qwen3.5-Omni (multimodal)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen35-omni.md)
- [GLM-5](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm5.md): Déployez GLM-5 (MoE 744B) de Zhipu AI sur Clore.ai — accès API et auto-hébergement avec vLLM
- [GLM-4.7-Flash](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm-47-flash.md): Déployez GLM-4.7-Flash (MoE 30B) de Zhipu AI sur Clore.ai — modèle de langage efficace avec 59,2 % de performance SWE-bench
- [Kimi K2.5](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/kimi-k2.md): Déployez Kimi K2.5 (MoE multimodal 1T) de Moonshot AI sur les GPU Clore.ai
- [Mistral Large 3 (MoE 675B)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-large3.md): Exécutez Mistral Large 3 — un modèle frontière MoE de 675B avec 41B de paramètres actifs sur les GPU Clore.ai
- [Mistral Medium 3.5 (dense 128B, 256K)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-medium35.md): Déployez Mistral Medium 3.5 sur Clore.ai — dense 128B, contexte 256K, raisonnement en mode double, publié en avril 2026. Configuration vLLM/SGLang de production sur 4× H100 ou 2× H200.
- [MiMo-V2-Flash](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mimo-v2-flash.md): Déployez MiMo-V2-Flash (MoE 309B) avec décodage spéculatif sur Clore.ai — inférence ultra-rapide à plus de 150 tok/s
- [Ling-2.5-1T (1 billion de paramètres)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/ling25.md): Exécutez Ling-2.5-1T — le LLM open source à 1 billion de paramètres d'Ant Group avec attention linéaire hybride sur les GPU Clore.ai
- [LFM2-24B-A2B](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/lfm2-24b.md): Déployez LFM2-24B-A2B de Liquid AI sur Clore.ai — architecture hybride SSM+Attention avec 24B paramètres au total / 2B actifs
- [DeepSeek V4 (MoE 1,6T, multimodal)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/deepseek-v4.md): Déployez DeepSeek V4 sur Clore.ai — le MoE frontière sous licence MIT, actualisé en Flash-0731 et Pro-0813
- [GLM-5.1 (MoE 744B, n°1 SWE-Bench Pro)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm-5-1.md): Déployez GLM-5.1 (MoE 744B, 40B actifs) de Z.ai sur Clore.ai — le modèle à poids ouverts qui a dominé SWE-Bench Pro en avril 2026
- [NVIDIA Nemotron 3 Super (MoE 120B)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/nvidia-nemotron-3-super.md)
- [Gemini 3.1 Flash Lite](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/gemini-3-1-flash-lite.md)
- [Hy3 Preview (Tencent Hunyuan 3, MoE 295B)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/hy3-preview.md): Déployez Hy3 Preview de Tencent (MoE 295B, 21B actifs, ctx 256K) sur Clore.ai — le premier modèle de la nouvelle pile d'entraînement de Tencent Hunyuan, optimisé pour le raisonnement à long terme et le codage agentique
- [MiMo-V2.5-Pro (MoE 1T de Xiaomi)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mimo-v25-pro.md): Déployez MiMo-V2.5-Pro (MoE 1,02T, 42B actifs, contexte 1M) de Xiaomi sur Clore.ai — le premier niveau Pro à poids ouverts de l'équipe MiMo, natif FP8, attention hybride
- [MiniMax M2.7 (codage MoE 229B)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/minimax-m27.md): Déployez MiniMax M2.7 (MoE 229B) sur Clore.ai — la version open-weight auto-hébergeable derrière l'offensive d'agent de codage de MiniMax, avec déploiement FP8 sur un seul nœud sur H100/H200
- [Ling-2.6-flash (MoE 104B d'Ant Group)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/ling-26-flash.md): Déployez Ling-2.6-flash (MoE 104B, 7,4B actifs) d'Ant Group sur Clore.ai — la variante flash optimisée pour les agents qui tient sur une seule RTX 4090
- [Qwen3.6-27B (dense, un seul GPU)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen36-27b.md): Déployez Qwen3.6-27B d'Alibaba sur Clore.ai — un 27B dense qui tient sur une seule RTX 4090 et est fourni avec un contexte natif de 262K
- [Qwen3.8-27B (VLM dense, une carte)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/qwen38-27b.md): Déployez Qwen3.8-27B sur Clore.ai — le modèle vision-langage dense 27B d'Alibaba qui fonctionne sur une seule RTX 4090 en Q4 et une seule RTX 5090 en FP8
- [GLM-5.2 (MIT, contexte 1M)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/glm-5-2.md): Exécutez GLM-5.2, le modèle phare de codage à contexte 1M sous licence MIT de Z.ai, sur une grande configuration multi-GPU du marketplace Clore.ai
- [MiniMax M3 (428B multimodal)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/minimax-m3.md): Déployez MiniMax M3, un MoE multimodal natif de 428B avec un contexte de 1M de tokens, sur des configurations Clore.ai multi-GPU
- [NVIDIA Nemotron 3 Ultra (550B Mamba-MoE)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/nemotron-3-ultra.md): Exécutez NVIDIA Nemotron 3 Ultra, l'hybride ouvert Mamba-MoE de 550B, sur des configurations Blackwell du marketplace Clore.ai
- [Mistral Small 4 (MoE 119B, 6,5B actifs)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-small4.md): Déployez Mistral Small 4 (MoE 119B, 6,5B actifs) sur deux GPU grand public du marketplace Clore.ai — Apache 2.0, contexte 256K, vision et raisonnement dans un seul modèle
- [Kimi K3 (2,8T — ce qu'il faut)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/kimi-k3.md): Ce qu'est Kimi K3, ce qu'il faut réellement pour auto-héberger 2,8 billions de paramètres, et quoi exécuter à la place sur Clore.ai
- [TGI (Text Generation Inference)](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/tgi.md): Exécutez HuggingFace Text Generation Inference (TGI) pour la mise en service de LLM en production sur les GPU Clore.ai
- [SGLang](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/sglang.md): Déployez SGLang pour la mise en service LLM haute performance avec RadixAttention sur les GPU Clore.ai
- [Aphrodite Engine](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/aphrodite-engine.md): Exécutez Aphrodite Engine pour l'inférence LLM sur les GPU anciens et modernes sur Clore.ai
- [Passerelle IA LiteLLM](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/litellm.md): Déployez LiteLLM comme proxy de passerelle IA pour plus de 100 LLM sur les GPU Clore.ai
- [MLC-LLM](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mlc-llm.md)
- [PowerInfer](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/powerinfer.md)
- [LMDeploy](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/lmdeploy.md)
- [Mistral.rs](https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage/mistral-rs.md)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-fr/modeles-de-langage.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
