For the complete documentation index, see llms.txt. This page is also available as Markdown.

Ollama

Ejecuta LLMs localmente con Ollama en GPUs de Clore.ai

La forma más fácil de ejecutar LLMs localmente en GPU de CLORE.AI.

Versión actual: v0.6+ — Esta guía cubre Ollama v0.6 y posteriores. Las nuevas funciones clave incluyen salidas estructuradas (aplicación de esquema JSON), un endpoint de embeddings compatible con OpenAI (/api/embed), y carga concurrente de modelos (ejecuta varios modelos simultáneamente sin intercambio). Consulta Novedades en v0.6+ para más detalles.

Requisitos del servidor

Parámetro
Mínimo
Recomendado

RAM

8 GB

16 GB+

VRAM

6 GB

8 GB+

Red

100 Mbps

500 Mbps+

Tiempo de arranque

~30 segundos

-

Ollama es ligero y funciona en la mayoría de los servidores GPU. Para modelos más grandes (13B+), elige servidores con 16 GB+ de RAM y 12 GB+ de VRAM.

¿Por qué Ollama?

  • Configuración con un solo comando - Sin Python, sin dependencias

  • Biblioteca de modelos - Descarga modelos con ollama pull

  • API compatible con OpenAI - Reemplazo directo

  • Aceleración por GPU - Detección automática de CUDA

  • Multimodelo - Ejecuta varios modelos simultáneamente (v0.6+)

Despliegue rápido en CLORE.AI

Imagen de Docker:

Puertos:

Comando:

Verifica que funciona

Después del despliegue, encuentra tu http_pub URL en Mis pedidos y prueba:

Acceso a tu servicio

Cuando se despliega en CLORE.AI, accede a tu instancia de Ollama a través de la http_pub URL:

Todos localhost:11434 los ejemplos siguientes funcionan cuando te conectas vía SSH. Para acceso externo, reemplaza por tu https://your-http-pub.clorecloud.net/ URL.

Instalación

Usando Docker (recomendado)

Instalación manual

Este único comando instala la última versión de Ollama, configura el servicio systemd y configura automáticamente la detección de GPU. Funciona en Ubuntu, Debian, Fedora y la mayoría de las distribuciones Linux modernas.

Ejecución de modelos

Descargar y ejecutar

Modelos populares

Modelo
Tamaño
Caso de uso

llama3.2

3B

Rápido, de uso general

llama3.1

8B

Mejor calidad

llama3.1:70b

70B

Mejor calidad

mistral

7B

Rápido, buena calidad

mixtral

47B

MoE, alta calidad

codellama

7-34B

Generación de código

deepseek-coder-v2

16B

Mejor para código

deepseek-r1

7B-671B

Modelo de razonamiento

deepseek-r1:32b

32B

Razonamiento equilibrado

qwen2.5

7B

Multilingüe

qwen2.5:72b

72B

Mejor calidad de Qwen

phi4

14B

Lo último de Microsoft

gemma2

9B

Modelo de Google

Variantes del modelo

Novedades en v0.6+

Ollama v0.6 introdujo varias funciones importantes para cargas de trabajo de producción:

Salidas estructuradas (JSON Schema)

Fuerza que las respuestas del modelo coincidan con un esquema JSON específico. Útil para construir aplicaciones que necesitan salidas fiables y analizables:

Ejemplo en Python con salidas estructuradas:

Endpoint de embeddings compatible con OpenAI (/api/embed)

Novedad en v0.6+: el /api/embed endpoint es totalmente compatible con OpenAI y admite entradas por lotes:

El cliente de OpenAI funciona directamente con /v1/embeddings:

Modelos de embeddings populares:

Carga concurrente de modelos

Antes de v0.6, Ollama descargaba un modelo para cargar otro. v0.6+ permite ejecutar varios modelos simultáneamente, limitado solo por la VRAM disponible:

Configurar concurrencia:

Esto es especialmente útil para:

  • Pruebas A/B de diferentes modelos

  • Modelos especializados para distintas tareas (código + chat)

  • Mantener en VRAM modelos usados con frecuencia

Uso de la API

Finalización de chat

Añade "stream": false para obtener la respuesta completa de una vez en lugar de en streaming.

Endpoint compatible con OpenAI

Streaming

Embeddings

Generación de texto (no chat)

Referencia completa de la API

Todos los endpoints funcionan con ambos http://localhost:11434 (vía SSH) y https://your-http-pub.clorecloud.net (externo).

Gestión de modelos

Endpoint
Método
Descripción

/api/tags

GET

Listar todos los modelos descargados

/api/show

POST

Obtener detalles del modelo

/api/pull

POST

Descargar un modelo

/api/delete

DELETE

Eliminar un modelo

/api/ps

GET

Listar los modelos que se están ejecutando actualmente

/api/version

GET

Obtener la versión de Ollama

Listar modelos

Respuesta:

Mostrar detalles del modelo

Descargar modelo vía API

Respuesta:

Eliminar modelo

Listar modelos en ejecución

Respuesta:

Obtener versión

Respuesta:

Endpoints de inferencia

Endpoint
Método
Descripción

/api/generate

POST

Finalización de texto

/api/chat

POST

Finalización de chat

/api/embeddings

POST

Generar embeddings (heredado)

/api/embed

POST

Generar embeddings v0.6+ (por lotes, compatible con OpenAI)

/v1/chat/completions

POST

Chat compatible con OpenAI

/v1/embeddings

POST

Embeddings compatibles con OpenAI

Creación de modelos personalizados

Crea modelos personalizados con prompts de sistema específicos a través de la API:

Configuración de GPU

Comprobar uso de GPU

Multi-GPU

Ollama usa automáticamente las GPU disponibles. Para una GPU específica:

Gestión de memoria

Modelos personalizados (Modelfile)

Crea modelos personalizados con prompts de sistema:

Ejecutar como servicio

Systemd

Consejos de rendimiento

  1. Usa la cuantización adecuada

    • Q4_K_M para velocidad

    • Q8_0 para calidad

    • fp16 para la máxima calidad

  2. Ajusta el modelo a la VRAM

    • 8 GB: modelos de 7B (Q4)

    • 16 GB: modelos de 13B o 7B (Q8)

    • 24 GB: modelos de 34B (Q4)

    • 48 GB+: modelos de 70B

  3. Mantén el modelo cargado

  4. Un SSD rápido mejora el rendimiento

    • La carga del modelo y la caché KV se benefician del almacenamiento rápido

    • Los servidores con SSD NVMe pueden lograr un rendimiento 2-3x mejor

Benchmarks

Velocidad de generación (tokens/seg)

Modelo
RTX 3060
RTX 3090
RTX 4090
A100 40 GB

Llama 3.2 3B (Q4)

120

160

200

220

Llama 3.1 8B (Q4)

60

100

130

150

Llama 3.1 8B (Q8)

45

80

110

130

Mistral 7B (Q4)

70

110

140

160

Mixtral 8x7B (Q4)

-

35

55

75

Llama 3.1 70B (Q4)

-

-

18

35

DeepSeek-R1 7B (Q4)

65

105

135

155

DeepSeek-R1 32B (Q4)

-

-

22

42

Qwen2.5 72B (Q4)

-

-

15

30

Phi-4 14B (Q4)

-

50

75

90

Benchmarks actualizados en enero de 2026. Las velocidades reales pueden variar según la configuración del servidor.

Tiempo hasta el primer token (ms)

Modelo
RTX 3090
RTX 4090
A100

3B

50

35

25

7-8B

120

80

60

13B

250

150

100

34B

600

350

200

70B

-

1200

500

Longitud de contexto vs VRAM (Q4)

Modelo
Ctx 2K
Ctx 4K
Ctx 8K
Ctx 16K

7B

5 GB

6 GB

8 GB

12 GB

13B

8 GB

10 GB

14 GB

22 GB

34B

20 GB

24 GB

32 GB

48 GB

70B

40 GB

48 GB

64 GB

96 GB

Requisitos de GPU

Modelo
VRAM Q4
VRAM Q8

3B

3 GB

5 GB

7-8B

5 GB

9 GB

13B

8 GB

15 GB

34B

20 GB

38 GB

70B

40 GB

75 GB

Estimación de costos

Tarifas típicas del mercado CLORE.AI:

GPU
VRAM
Precio/día
Bueno para

24 GB

$0.30–1.00

Modelos de 13B-34B

24 GB

$0.50–2.00

Modelos de 34B, rápido

RTX 4070

12 GB

$0.20–0.50

Modelos de 7B

A100 80 GB

80 GB

$1.50–3.00

Modelos de 70B

Precios en USD/día. Las tarifas varían según el proveedor — consulta Mercado de CLORE.AI para conocer las tarifas actuales.

Solución de problemas

El modelo no se carga

Generación lenta

Conexión rechazada

HTTP 502 en la URL http_pub

Esto significa que el servicio todavía se está iniciando. Espera 30-60 segundos y vuelve a intentarlo:

Siguientes pasos

Última actualización

¿Te fue útil?