For the complete documentation index, see llms.txt. This page is also available as Markdown.

Descripción general

Ejecuta modelos de lenguaje grandes (LLM) en GPU de CLORE.AI para inferencia y aplicaciones de chat.

Herramientas populares

Herramienta
Caso de uso
Dificultad

La configuración de LLM más sencilla

Principiante

Interfaz tipo ChatGPT

Principiante

Servicio de producción de alto rendimiento

Medio

Inferencia GGUF eficiente

Fácil

Interfaz de chat completa

Fácil

La inferencia EXL2 más rápida

Medio

API compatible con OpenAI

Medio

Generación estructurada rápida

Medio

Solución de servicio de HuggingFace

Medio

Kit de herramientas de servicio de MMlab

Medio

Fork de vLLM con funciones adicionales

Medio

Compilación de aprendizaje automático

Difícil

Proxy de API unificada

Medio

Inferencia de modelos dispersos

Difícil

Motor de inferencia basado en Rust

Medio

Guías de modelos

Últimos y mejores modelos

Modelo
Parámetros
Licencia
Cabe en

27B denso

Apache 2.0

1× RTX 4090 (Q4)

119B / 6.5B activos

Apache 2.0

2× RTX 4090 (Q2)

~750B / 40B activos

MIT

10× RTX 5090 (Q2)

Flash 167GB · Pro 893GB

MIT

6–8× RTX 5090 (Flash)

428B / 23B activos

minimax-community

6–8× RTX 5090 (Q2–Q3)

550B / 55B activos

OpenMDW-1.1

4× RTX PRO 6000 (NVFP4)

2.8T

licencia de Kimi K3

Nada en el mercado

744B / 40B activos

MIT

Equipos grandes

Scout y Maverick

Comunidad Llama

1× RTX 4090 (Scout Q4)

671B MoE

MIT

Equipos grandes

0.5B–72B

Apache 2.0

Cualquier tarjeta

Modelos especializados

Modelo
Parámetros
Ideal para

6.7B-33B

Generación de código

7B-34B

Autocompletado de código

4.7B

Chino/inglés rápido

Por anunciar

Lo último de Zhipu AI

Por anunciar

Modelo de Moonshot AI

1T

LLM de código abierto masivo

24B

Modelo de Liquid AI

Por anunciar

Modelo de inferencia rápida

Modelos eficientes

Modelo
Parámetros
Ideal para

2B-27B

Inferencia eficiente

Por anunciar

Lo más reciente y compacto de Google

14B

Pequeño pero capaz

7B / 8x7B

Uso general

675B MoE

De nivel empresarial

Por anunciar

Variante eficiente de Mistral

Recomendaciones de GPU

Tamaño del modelo
GPU mínima
Recomendado
Coste en Clore.ai

7B (Q4)

RTX 3060 12GB

RTX 3090

$0.03–0.21/hr

13B (Q4)

RTX 3090 24GB

RTX 4090

$0.07–0.42/hr

27B (Q4)

RTX 3090 24GB

RTX 4090 / 5090

$0.07–0.77/hr

34B (Q4)

2× RTX 3090

1× RTX 5090

$0.14–0.77/hr

70B (Q4)

2× RTX 5090

1× RTX PRO 6000 96GB

$0.50–1.54/h

120B+ (Q2)

2× RTX 4090

2× RTX 5090

$0.28–1.54/hr

400B+ (Q2)

8× RTX 5090

4× RTX PRO 6000

~$2.00–5.00/hr

Guía de cuantización

Formato
Uso de VRAM
Calidad
Velocidad

Q2_K

Más bajo

Deficiente

Más rápido

Q4_K_M

Baja

Bueno

Rápido

Q5_K_M

Medio

Excelente

Medio

Q8_0

Alta

Excelente

Más lento

FP16

Máxima

Mejor

El más lento

Ver también

Última actualización

¿Te fue útil?