> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje.md).

# Modelos de lenguaje

- [Descripción general](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/language-models.md)
- [Ollama](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/ollama.md): Ejecuta LLMs localmente con Ollama en GPUs de Clore.ai
- [Open WebUI](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/open-webui.md): Interfaz similar a ChatGPT para ejecutar LLMs en GPUs de Clore.ai
- [vLLM](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/vllm.md): Inferencia de LLM de alto rendimiento con vLLM en GPUs de Clore.ai
- [Llama.cpp Server](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/llamacpp-server.md): Inferencia eficiente de LLM con el servidor llama.cpp en GPUs de Clore.ai
- [Text Generation WebUI](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/text-generation-webui.md): Ejecuta text-generation-webui para inferencia de LLM en GPUs de Clore.ai
- [ExLlamaV2](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/exllamav2-fast.md): Inferencia de LLM a máxima velocidad con ExLlamaV2 en GPUs de Clore.ai
- [LocalAI](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/localai-openai-compatible.md): API autoalojada compatible con OpenAI con LocalAI en Clore.ai
- [Llama 3.3 70B](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/llama33.md): Ejecuta el modelo Llama 3.3 70B de Meta en GPUs de Clore.ai
- [Mistral y Mixtral](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-mixtral.md): Ejecuta modelos Mistral y Mixtral en GPUs de Clore.ai
- [DeepSeek Coder](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-coder.md): Generación de código de primer nivel con DeepSeek Coder en Clore.ai
- [DeepSeek-V3](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v3.md): Ejecuta DeepSeek-V3 con razonamiento excepcional en GPUs de Clore.ai
- [Modelo de razonamiento DeepSeek-R1](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-r1.md): Ejecuta el modelo de razonamiento de código abierto DeepSeek-R1 en GPUs de Clore.ai
- [Qwen2.5](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen25.md): Ejecuta los LLMs multilingües Qwen2.5 de Alibaba en GPUs de Clore.ai
- [CodeLlama](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/codellama.md): Genera, completa y explica código con CodeLlama en Clore.ai
- [Gemma 2](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/gemma2.md): Ejecuta los modelos Gemma 2 de Google de forma eficiente en GPUs de Clore.ai
- [Phi-4](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/phi4.md): Ejecuta el modelo de lenguaje pequeño Phi-4 de Microsoft en GPUs de Clore.ai
- [Llama 4 (Scout y Maverick)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/llama4.md): Ejecuta los modelos MoE Meta Llama 4 Scout y Maverick en GPUs de Clore.ai
- [Gemma 3](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/gemma3.md): Ejecuta los modelos multimodales Google Gemma 3 en Clore.ai: supera a Llama-405B siendo 15 veces más pequeño
- [Gemma 4 (26B MoE, 4B activo)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/gemma4.md): Despliega Gemma 4 (26B MoE, 4B activo) de Google en Clore.ai: el modelo de pesos abiertos lanzado en abril de 2026 que subió hasta
- [Mistral Small 3.1](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-small.md): Despliega Mistral Small 3.1 (24B) en Clore.ai: el modelo ideal de producción para una sola GPU
- [Qwen3.5](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen35.md): Ejecuta Alibaba Qwen3.5 en Clore.ai: el modelo frontier más reciente (feb. 2026)
- [Qwen3.5-Omni (multimodal)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen35-omni.md)
- [GLM-5](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm5.md): Despliega GLM-5 (744B MoE) de Zhipu AI en Clore.ai: acceso por API y autoalojamiento con vLLM
- [GLM-4.7-Flash](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm-47-flash.md): Despliega GLM-4.7-Flash (30B MoE) de Zhipu AI en Clore.ai: modelo de lenguaje eficiente con un 59.2% de rendimiento en SWE-bench
- [Kimi K2.5](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/kimi-k2.md): Despliega Kimi K2.5 (1T MoE multimodal) de Moonshot AI en GPUs de Clore.ai
- [Mistral Large 3 (675B MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-large3.md): Ejecuta Mistral Large 3: un modelo frontier MoE de 675B con 41B parámetros activos en GPUs de Clore.ai
- [Mistral Medium 3.5 (128B denso, 256K)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-medium35.md): Despliega Mistral Medium 3.5 en Clore.ai: 128B denso, contexto de 256K, razonamiento de modo dual lanzado en abril de 2026. Configuración de producción vLLM/SGLang en 4× H100 o 2× H200.
- [MiMo-V2-Flash](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v2-flash.md): Despliega MiMo-V2-Flash (309B MoE) con decodificación especulativa en Clore.ai: inferencia ultrarrápida con más de 150 tok/s
- [Ling-2.5-1T (1 billón de parámetros)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/ling25.md): Ejecuta Ling-2.5-1T: el LLM de código abierto de 1 billón de parámetros de Ant Group con atención lineal híbrida en GPUs de Clore.ai
- [LFM2-24B-A2B](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/lfm2-24b.md): Despliega LFM2-24B-A2B de Liquid AI en Clore.ai: arquitectura híbrida SSM+atención con 24B en total / 2B parámetros activos
- [DeepSeek V4 (1.6T MoE, multimodal)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/deepseek-v4.md): Despliega DeepSeek V4 en Clore.ai: el MoE frontier con licencia MIT, actualizado como Flash-0731 y Pro-0813
- [GLM-5.1 (744B MoE, #1 en SWE-Bench Pro)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm-5-1.md): Despliega GLM-5.1 (744B MoE, 40B activos) de Z.ai en Clore.ai: el modelo de pesos abiertos que encabezó SWE-Bench Pro en abril de 2026
- [NVIDIA Nemotron 3 Super (120B MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/nvidia-nemotron-3-super.md)
- [Gemini 3.1 Flash Lite](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/gemini-3-1-flash-lite.md)
- [Hy3 Preview (Tencent Hunyuan 3, 295B MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/hy3-preview.md): Despliega Hy3 Preview de Tencent (295B MoE, 21B activos, contexto de 256K) en Clore.ai: el primer modelo del stack de entrenamiento reconstruido de Tencent Hunyuan, afinado para razonamiento de largo alcance y codificación agéntica
- [MiMo-V2.5-Pro (Xiaomi 1T MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mimo-v25-pro.md): Despliega MiMo-V2.5-Pro (1.02T MoE, 42B activos, contexto de 1M) de Xiaomi en Clore.ai: el primer nivel Pro de pesos abiertos del equipo MiMo, FP8 nativo, atención híbrida
- [MiniMax M2.7 (229B MoE para código)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/minimax-m27.md): Despliega MiniMax M2.7 (229B MoE) en Clore.ai: la versión autoalojada de pesos abiertos detrás del impulso del agente de codificación de MiniMax, con despliegue de un solo nodo FP8 en H100/H200
- [Ling-2.6-flash (Ant Group 104B MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/ling-26-flash.md): Despliega Ling-2.6-flash (104B MoE, 7.4B activos) de Ant Group en Clore.ai: el hermano flash afinado para agentes que cabe en una sola RTX 4090
- [Qwen3.6-27B (denso, una sola GPU)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen36-27b.md): Despliega Qwen3.6-27B de Alibaba en Clore.ai: un modelo denso de 27B que cabe en una sola RTX 4090 y viene con contexto nativo de 262K
- [Qwen3.8-27B (VLM denso, una sola tarjeta)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/qwen38-27b.md): Despliega Qwen3.8-27B en Clore.ai: el modelo denso de visión y lenguaje de 27B de Alibaba que funciona en una sola RTX 4090 en Q4 y una sola RTX 5090 en FP8
- [GLM-5.2 (MIT, contexto de 1M)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/glm-5-2.md): Ejecuta GLM-5.2, la joya de codificación con contexto de 1M de Z.ai con licencia MIT, en un gran rig multi-GPU del marketplace de Clore.ai
- [MiniMax M3 (428B multimodal)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/minimax-m3.md): Despliega MiniMax M3, un MoE nativamente multimodal de 428B con contexto de 1M tokens, en rigs multi-GPU de Clore.ai
- [NVIDIA Nemotron 3 Ultra (550B Mamba-MoE)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/nemotron-3-ultra.md): Ejecuta NVIDIA Nemotron 3 Ultra, el híbrido abierto Mamba-MoE de 550B, en rigs Blackwell del marketplace de Clore.ai
- [Mistral Small 4 (119B MoE, 6.5B activo)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-small4.md): Despliega Mistral Small 4 (119B MoE, 6.5B activo) en dos GPUs de consumo del marketplace de Clore.ai: Apache 2.0, contexto de 256K, visión y razonamiento en un solo modelo
- [Kimi K3 (2.8T — Lo que hace falta)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/kimi-k3.md): Qué es Kimi K3, lo que realmente hace falta para autoalojar 2.8 billones de parámetros y qué ejecutar en su lugar en Clore.ai
- [TGI (Text Generation Inference)](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/tgi.md): Ejecuta HuggingFace Text Generation Inference (TGI) para servir LLMs en producción en GPUs de Clore.ai
- [SGLang](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/sglang.md): Despliega SGLang para servicio de LLM de alto rendimiento con RadixAttention en GPUs de Clore.ai
- [Aphrodite Engine](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/aphrodite-engine.md): Ejecuta Aphrodite Engine para inferencia de LLM en GPUs antiguas y modernas en Clore.ai
- [Pasarela de IA LiteLLM](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/litellm.md): Despliega LiteLLM como proxy de pasarela de IA para más de 100 LLMs en GPUs de Clore.ai
- [MLC-LLM](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mlc-llm.md)
- [PowerInfer](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/powerinfer.md)
- [LMDeploy](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/lmdeploy.md)
- [Mistral.rs](https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje/mistral-rs.md)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-es/modelos-de-lenguaje.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
