Ollama
Ejecuta LLMs localmente con Ollama en GPUs de Clore.ai
La forma más fácil de ejecutar LLMs localmente en GPU de CLORE.AI.
Todos los ejemplos se pueden ejecutar en servidores GPU alquilados a través de Mercado de CLORE.AI.
Requisitos del servidor
RAM
8 GB
16 GB+
VRAM
6 GB
8 GB+
Red
100 Mbps
500 Mbps+
Tiempo de arranque
~30 segundos
-
¿Por qué Ollama?
Configuración con un solo comando - Sin Python, sin dependencias
Biblioteca de modelos - Descarga modelos con
ollama pullAPI compatible con OpenAI - Reemplazo directo
Aceleración por GPU - Detección automática de CUDA
Multimodelo - Ejecuta varios modelos simultáneamente (v0.6+)
Despliegue rápido en CLORE.AI
Imagen de Docker:
Puertos:
Comando:
Verifica que funciona
Después del despliegue, encuentra tu http_pub URL en Mis pedidos y prueba:
Si obtienes HTTP 502, espera 30-60 segundos: el servicio todavía se está iniciando.
Acceso a tu servicio
Cuando se despliega en CLORE.AI, accede a tu instancia de Ollama a través de la http_pub URL:
Instalación
Usando Docker (recomendado)
Instalación manual
Este único comando instala la última versión de Ollama, configura el servicio systemd y configura automáticamente la detección de GPU. Funciona en Ubuntu, Debian, Fedora y la mayoría de las distribuciones Linux modernas.
Ejecución de modelos
Descargar y ejecutar
Modelos populares
llama3.2
3B
Rápido, de uso general
llama3.1
8B
Mejor calidad
llama3.1:70b
70B
Mejor calidad
mistral
7B
Rápido, buena calidad
mixtral
47B
MoE, alta calidad
codellama
7-34B
Generación de código
deepseek-coder-v2
16B
Mejor para código
deepseek-r1
7B-671B
Modelo de razonamiento
deepseek-r1:32b
32B
Razonamiento equilibrado
qwen2.5
7B
Multilingüe
qwen2.5:72b
72B
Mejor calidad de Qwen
phi4
14B
Lo último de Microsoft
gemma2
9B
Modelo de Google
Variantes del modelo
Novedades en v0.6+
Ollama v0.6 introdujo varias funciones importantes para cargas de trabajo de producción:
Salidas estructuradas (JSON Schema)
Fuerza que las respuestas del modelo coincidan con un esquema JSON específico. Útil para construir aplicaciones que necesitan salidas fiables y analizables:
Ejemplo en Python con salidas estructuradas:
Endpoint de embeddings compatible con OpenAI (/api/embed)
Novedad en v0.6+: el /api/embed endpoint es totalmente compatible con OpenAI y admite entradas por lotes:
El cliente de OpenAI funciona directamente con /v1/embeddings:
Modelos de embeddings populares:
Carga concurrente de modelos
Antes de v0.6, Ollama descargaba un modelo para cargar otro. v0.6+ permite ejecutar varios modelos simultáneamente, limitado solo por la VRAM disponible:
Configurar concurrencia:
Esto es especialmente útil para:
Pruebas A/B de diferentes modelos
Modelos especializados para distintas tareas (código + chat)
Mantener en VRAM modelos usados con frecuencia
Uso de la API
Finalización de chat
Endpoint compatible con OpenAI
Streaming
Embeddings
Generación de texto (no chat)
Referencia completa de la API
Todos los endpoints funcionan con ambos http://localhost:11434 (vía SSH) y https://your-http-pub.clorecloud.net (externo).
Gestión de modelos
/api/tags
GET
Listar todos los modelos descargados
/api/show
POST
Obtener detalles del modelo
/api/pull
POST
Descargar un modelo
/api/delete
DELETE
Eliminar un modelo
/api/ps
GET
Listar los modelos que se están ejecutando actualmente
/api/version
GET
Obtener la versión de Ollama
Listar modelos
Respuesta:
Mostrar detalles del modelo
Descargar modelo vía API
Respuesta:
Los modelos grandes pueden tardar varios minutos en descargarse. Para modelos muy grandes (30 GB+), considera usar SSH y la CLI: ollama pull model-name
Eliminar modelo
Listar modelos en ejecución
Respuesta:
Obtener versión
Respuesta:
Endpoints de inferencia
/api/generate
POST
Finalización de texto
/api/chat
POST
Finalización de chat
/api/embeddings
POST
Generar embeddings (heredado)
/api/embed
POST
Generar embeddings v0.6+ (por lotes, compatible con OpenAI)
/v1/chat/completions
POST
Chat compatible con OpenAI
/v1/embeddings
POST
Embeddings compatibles con OpenAI
Creación de modelos personalizados
Crea modelos personalizados con prompts de sistema específicos a través de la API:
Configuración de GPU
Comprobar uso de GPU
Multi-GPU
Ollama usa automáticamente las GPU disponibles. Para una GPU específica:
Gestión de memoria
Modelos personalizados (Modelfile)
Crea modelos personalizados con prompts de sistema:
Ejecutar como servicio
Systemd
Consejos de rendimiento
Usa la cuantización adecuada
Q4_K_M para velocidad
Q8_0 para calidad
fp16 para la máxima calidad
Ajusta el modelo a la VRAM
8 GB: modelos de 7B (Q4)
16 GB: modelos de 13B o 7B (Q8)
24 GB: modelos de 34B (Q4)
48 GB+: modelos de 70B
Mantén el modelo cargado
Un SSD rápido mejora el rendimiento
La carga del modelo y la caché KV se benefician del almacenamiento rápido
Los servidores con SSD NVMe pueden lograr un rendimiento 2-3x mejor
Benchmarks
Velocidad de generación (tokens/seg)
Llama 3.2 3B (Q4)
120
160
200
220
Llama 3.1 8B (Q4)
60
100
130
150
Llama 3.1 8B (Q8)
45
80
110
130
Mistral 7B (Q4)
70
110
140
160
Mixtral 8x7B (Q4)
-
35
55
75
Llama 3.1 70B (Q4)
-
-
18
35
DeepSeek-R1 7B (Q4)
65
105
135
155
DeepSeek-R1 32B (Q4)
-
-
22
42
Qwen2.5 72B (Q4)
-
-
15
30
Phi-4 14B (Q4)
-
50
75
90
Benchmarks actualizados en enero de 2026. Las velocidades reales pueden variar según la configuración del servidor.
Tiempo hasta el primer token (ms)
3B
50
35
25
7-8B
120
80
60
13B
250
150
100
34B
600
350
200
70B
-
1200
500
Longitud de contexto vs VRAM (Q4)
7B
5 GB
6 GB
8 GB
12 GB
13B
8 GB
10 GB
14 GB
22 GB
34B
20 GB
24 GB
32 GB
48 GB
70B
40 GB
48 GB
64 GB
96 GB
Requisitos de GPU
3B
3 GB
5 GB
7-8B
5 GB
9 GB
13B
8 GB
15 GB
34B
20 GB
38 GB
70B
40 GB
75 GB
Estimación de costos
Tarifas típicas del mercado CLORE.AI:
Precios en USD/día. Las tarifas varían según el proveedor — consulta Mercado de CLORE.AI para conocer las tarifas actuales.
Solución de problemas
El modelo no se carga
Generación lenta
Conexión rechazada
HTTP 502 en la URL http_pub
Esto significa que el servicio todavía se está iniciando. Espera 30-60 segundos y vuelve a intentarlo:
Siguientes pasos
Open WebUI - Interfaz de chat hermosa para Ollama
vLLM - Servicio de producción de alto rendimiento
DeepSeek-R1 - Modelo de razonamiento
DeepSeek-V3 - Mejor modelo general
Qwen2.5 - Alternativa multilingüe
Text Generation WebUI - Funciones avanzadas
Última actualización
¿Te fue útil?