> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-hi/language-models/lfm2-24b.md).

# LFM2-24B-A2B

Clore.ai पर Liquid AI द्वारा LFM2-24B-A2B डिप्लॉय करें — हाइब्रिड SSM+Attention आर्किटेक्चर, 24B कुल / 2B सक्रिय पैरामीटर के साथ

> LFM2-24B-A2B लिक्विड AI के हाइब्रिड के माध्यम से कुशल भाषा मॉडलिंग में एक बड़ी सफलता का प्रतिनिधित्व करता है **स्टेट स्पेस मॉडल + अटेंशन** आर्किटेक्चर। 24B कुल पैरामीटर होने के बावजूद, लेकिन प्रति टोकन केवल 2B सक्रिय होने के कारण, यह FP16 इन्फ़रेंस के लिए केवल \~6GB VRAM की आवश्यकता के साथ प्रभावशाली प्रदर्शन देता है। मॉडल RTX 4090 पर \~350 tok/s प्राप्त करता है, जिससे यह उपलब्ध सबसे तेज़ बड़े भाषा मॉडलों में से एक बनता है।

## संक्षेप में

* **मॉडल आकार**: 24B कुल / 2B सक्रिय पैरामीटर (हाइब्रिड SSM+अटेंशन)
* **लाइसेंस**: Liquid AI ओपन लाइसेंस (गैर-व्यावसायिक उपयोग हेतु निःशुल्क, व्यावसायिक लाइसेंस उपलब्ध)
* **संदर्भ**: 32K टोकन
* **प्रदर्शन**: 7B-13B घने मॉडलों के बराबर प्रतिस्पर्धी
* **VRAM**: \~6GB FP16, \~3GB INT8
* **गति**: RTX 4090 पर \~350 tok/s, RTX 3090 पर \~200 tok/s

## LFM2-24B-A2B क्यों?

**क्रांतिकारी आर्किटेक्चर**: LFM2-24B-A2B स्टेट स्पेस मॉडल (SSMs) को चयनात्मक अटेंशन तंत्र के साथ जोड़ता है। SSMs अनुक्रमिक प्रसंस्करण को कुशलता से संभालते हैं, जबकि अटेंशन परतें जटिल तर्क पर ध्यान केंद्रित करती हैं। यह हाइब्रिड दृष्टिकोण छोटे मॉडल की दक्षता के साथ बड़े मॉडल की गुणवत्ता प्राप्त करता है।

**असाधारण गति**: 2B सक्रिय-पैरामीटर डिज़ाइन बिजली-सी तेज़ इन्फ़रेंस सक्षम करता है। पारंपरिक मॉडलों के विपरीत जहाँ सभी पैरामीटर सक्रिय होते हैं, LFM2 केवल आवश्यक घटकों को ही चुनिंदा रूप से सक्रिय करता है, जिससे उपभोक्ता हार्डवेयर पर 350+ tokens/second मिलता है।

**स्मृति-कुशल**: FP16 के लिए केवल 6GB VRAM पर, LFM2-24B-A2B मध्यम-श्रेणी के GPUs पर आराम से चलता है। यह इसे एज परिनियोजन, विकास वातावरण, और लागत-सचेत उत्पादन सेटअप के लिए आदर्श बनाता है।

**Liquid AI का नवाचार**: MIT शोधकर्ताओं द्वारा स्थापित Liquid AI द्वारा विकसित, LFM2 न्यूरल आर्किटेक्चर में अत्याधुनिक शोध का प्रतिनिधित्व करता है। हाइब्रिड SSM+अटेंशन डिज़ाइन कुशल भाषा मॉडलिंग का भविष्य हो सकता है।

**लाइसेंसिंग नोट**: Liquid AI ओपन लाइसेंस निःशुल्क गैर-व्यावसायिक उपयोग की अनुमति देता है। व्यावसायिक परिनियोजन के लिए Liquid AI से अलग लाइसेंस आवश्यक है। यह **नहीं** MIT — उत्पादन उपयोग से पहले लाइसेंस शर्तों की पुष्टि करें।

## GPU सिफारिशें

| GPU             | VRAM | प्रदर्शन        | दैनिक लागत\* |
| --------------- | ---- | --------------- | ------------ |
| RTX 3060 12GB   | 12GB | \~180 tok/s     | \~$0.80      |
| RTX 3070        | 8GB  | \~220 tok/s     | \~$0.90      |
| **RTX 4060 Ti** | 16GB | \~300 tok/s     | \~$1.20      |
| **RTX 4090**    | 24GB | **\~350 tok/s** | \~$2.10      |
| RTX 3090        | 24GB | \~200 tok/s     | \~$1.10      |
| A100 40GB       | 40GB | \~400 tok/s     | \~$3.50      |

**सर्वोत्तम मूल्य**: RTX 4060 Ti 16GB प्रति डॉलर उत्कृष्ट प्रदर्शन प्रदान करता है। **अधिकतम गति**: RTX 4090 LFM2 की पूरी क्षमता को उजागर करता है।

\*Clore.ai बाज़ार के अनुमानित मूल्य

## vLLM के साथ डिप्लॉय करें

### vLLM इंस्टॉल करें

```bash
pip install vllm>=0.6.0
# या नवीनतम
pip install git+https://github.com/vllm-project/vllm.git
```

### एकल GPU सेटअप

```bash
vllm serve liquid-ai/LFM2-24B-A2B \
  --model liquid-ai/LFM2-24B-A2B \
  --tensor-parallel-size 1 \
  --dtype float16 \\
  --max-model-len 32768 \\
  --served-model-name lfm2-24b \
  --trust-remote-code \
  --disable-log-stats
```

### सर्वर से क्वेरी करें

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1", 
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="lfm2-24b",
    messages=[
        {"role": "system", "content": "आप एक सहायक AI सहायक हैं जो तकनीकी व्याख्याओं में विशेषज्ञ हैं."},
        {"role": "user", "content": "स्टेट स्पेस मॉडल और पारंपरिक ट्रांसफॉर्मर्स के बीच अंतर समझाएँ"}
    ],
    max_tokens=1024,
    temperature=0.7
)

print(response.choices[0].message.content)
```

## Ollama के साथ परिनियोजन करें

Ollama सबसे सरल परिनियोजन मार्ग प्रदान करता है:

```bash
# Ollama इंस्टॉल करें
curl -fsSL https://ollama.com/install.sh | sh

# LFM2 मॉडल प्राप्त करें
ollama pull liquid-ai/lfm2:24b

# इंटरैक्टिव रूप से चलाएँ
ollama run liquid-ai/lfm2:24b

# API मोड
ollama serve
```

### Ollama API का उपयोग

```python
import requests

# सरल पूर्णता
response = requests.post('http://localhost:11434/api/generate',
    json={
        'model': 'liquid-ai/lfm2:24b',
        'prompt': 'मेमोइज़ेशन का उपयोग करके फाइबोनैचि संख्याओं की गणना करने के लिए एक Python फ़ंक्शन लिखें',
        'stream': False
    }
)

print(response.json()['response'])

# चैट प्रारूप
chat_response = requests.post('http://localhost:11434/api/chat',
    json={
        'model': 'liquid-ai/lfm2:24b',
        'messages': [
            {'role': 'user', 'content': 'सरल शब्दों में क्वांटम एंटैंगलमेंट समझाएँ'}
        ],
        'stream': False
    }
)

print(chat_response.json()['message']['content'])
```

## Docker टेम्पलेट

```dockerfile
FROM nvidia/cuda:12.8.1-devel-ubuntu22.04

# Python 3.10 स्थापित करें
RUN apt-get update && apt-get install -y \\
    python3.10 python3-pip curl && \
    rm -rf /var/lib/apt/lists/*

# vLLM स्थापित करें
RUN pip install vllm>=0.6.0 transformers

# परिवेश सेट करें
ENV PYTHONUNBUFFERED=1

# मॉडल पहले से डाउनलोड करें (वैकल्पिक)
# RUN python3 -c "from transformers import AutoModel; AutoModel.from_pretrained('liquid-ai/LFM2-24B-A2B', trust_remote_code=True)"

EXPOSE 8000

CMD ["vllm", "serve", "liquid-ai/LFM2-24B-A2B", \
     "--host", "0.0.0.0", \\
     "--port", "8000", \
     "--dtype", "float16", \
     "--max-model-len", "16384", \
     "--trust-remote-code"]
```

बिल्ड और रन करें:

```bash
docker build -t lfm2-24b .
docker run --gpus all -p 8000:8000 lfm2-24b
```

## गति बेंचमार्क

LFM2 की असाधारण इन्फ़रेंस गति का परीक्षण करें:

```python
import time
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

def speed_test():
    prompts = [
        "एक अनुच्छेद में मशीन लर्निंग समझाएँ",
        "एक त्वरित Python सॉर्टिंग एल्गोरिद्म लिखें",
        "नवीकरणीय ऊर्जा के लाभों का वर्णन करें",
        "फ्रांस की राजधानी क्या है और यह महत्वपूर्ण क्यों है?",
        "एक साधारण HTML पेज संरचना बनाएँ"
    ]
    
    total_tokens = 0
    total_time = 0
    
    for prompt in prompts:
        start_time = time.time()
        
        response = client.chat.completions.create(
            model="lfm2-24b",
            messages=[{"role": "user", "content": prompt}],
            max_tokens=200,
            temperature=0.1
        )
        
        end_time = time.time()
        
        tokens = len(response.choices[0].message.content.split())
        duration = end_time - start_time
        
        total_tokens += tokens
        total_time += duration
        
        print(f"Prompt: {prompt[:30]}...")
        print(f"Tokens: {tokens}, Time: {duration:.2f}s, Speed: {tokens/duration:.1f} tok/s\n")
    
    avg_speed = total_tokens / total_time
    print(f"Average speed: {avg_speed:.1f} tokens/second")
    return avg_speed

# गति परीक्षण चलाएँ
speed_test()
```

## कम VRAM के लिए क्वांटाइजेशन

सीमित VRAM वाले GPUs के लिए, क्वांटाइज़्ड संस्करणों का उपयोग करें:

### GPTQ क्वांटाइजेशन

```bash
# auto-gptq स्थापित करें
pip install auto-gptq

# क्वांटाइज़्ड मॉडल का उपयोग करें (VRAM को ~3GB तक कम करता है)
vllm serve liquid-ai/LFM2-24B-A2B-GPTQ \
  --model liquid-ai/LFM2-24B-A2B-GPTQ \
  --quantization gptq \
  --dtype float16 \\
  --max-model-len 16384
```

### AWQ क्वांटाइजेशन

```bash
# autoawq स्थापित करें
pip install autoawq

# AWQ क्वांटाइज़्ड मॉडल का उपयोग करें
vllm serve liquid-ai/LFM2-24B-A2B-AWQ \
  --model liquid-ai/LFM2-24B-A2B-AWQ \
  --quantization awq \\
  --dtype float16
```

## उन्नत कॉन्फ़िगरेशन

### मेमोरी-अनुकूलित सेटअप

8GB GPUs के लिए:

```bash
vllm serve liquid-ai/LFM2-24B-A2B \
  --model liquid-ai/LFM2-24B-A2B \
  --dtype float16 \\
  --max-model-len 8192 \
  --gpu-memory-utilization 0.85 \
  --swap-space 4 \
  --trust-remote-code
```

### उच्च-थ्रूपुट सेटअप

उत्पादन कार्यभार के लिए:

```bash
vllm serve liquid-ai/LFM2-24B-A2B \
  --model liquid-ai/LFM2-24B-A2B \
  --tensor-parallel-size 1 \
  --max-num-seqs 32 \
  --max-num-batched-tokens 8192 \
  --dtype float16 \\
  --trust-remote-code
```

## SSM आर्किटेक्चर के लाभ

LFM2 का हाइब्रिड SSM+अटेंशन अद्वितीय लाभ प्रदान करता है:

**रेखीय स्केलिंग**: SSMs अनुक्रम लंबाई के साथ रेखीय रूप से स्केल होते हैं, जबकि पारंपरिक ट्रांसफॉर्मर द्विघात रूप से स्केल होते हैं। यह कुशल दीर्घ-प्रसंग प्रसंस्करण सक्षम करता है।

**चयनात्मक अटेंशन**: केवल महत्वपूर्ण टोकन पूर्ण अटेंशन तंत्र को सक्रिय करते हैं, जिससे गणनात्मक ओवरहेड कम होता है।

**मेमोरी दक्षता**: 2B सक्रिय-पैरामीटर डिज़ाइन का अर्थ है कि इन्फ़रेंस के दौरान 24B पैरामीटरों में से अधिकांश निष्क्रिय रहते हैं, जिससे मेमोरी बैंडविड्थ आवश्यकताएँ बहुत कम हो जाती हैं।

**तेज़ क्रमिक प्रसंस्करण**: SSMs पाठ निर्माण जैसे क्रमिक कार्यों में उत्कृष्ट हैं, और शुद्ध अटेंशन तंत्रों की तुलना में अधिक थ्रूपुट प्राप्त करते हैं।

## Clore.ai उपयोगकर्ताओं के लिए सुझाव

* **एकल GPU-केंद्रित**: LFM2-24B-A2B एकल-GPU परिनियोजन के लिए अनुकूलित है। मल्टी-GPU सेटअप महत्वपूर्ण लाभ नहीं देते।
* **संदर्भ लंबाई**: अधिकतम गति के लिए छोटे संदर्भ (8K-16K) का उपयोग करें। लंबे संदर्भ SSM दक्षता लाभ को कम करते हैं।
* **तापमान सेटिंग्स**: कम तापमान (0.1-0.3) अनिश्चितता कम करके इन्फ़रेंस गति को अधिकतम करते हैं।
* **बैच आकार**: कई समवर्ती अनुरोधों के लिए मल्टीपल GPUs के बजाय बैच आकार बढ़ाएँ।
* **लाइसेंस अनुपालन**: उत्पादन परिनियोजन से पहले Liquid AI के साथ व्यावसायिक लाइसेंस आवश्यकताओं की पुष्टि करें।

## समस्या निवारण

| समस्या                             | समाधान                                                                                      |
| ---------------------------------- | ------------------------------------------------------------------------------------------- |
| `ImportError: liquid_transformers` | इंस्टॉल करें: `pip install git+https://github.com/LiquidAI-project/liquid-transformers.git` |
| धीमी स्टार्टअप                     | पहले डाउनलोड करें: `huggingface-cli download liquid-ai/LFM2-24B-A2B`                        |
| `OutOfMemoryError`                 | क्वांटाइज़्ड संस्करण का उपयोग करें या कम करें `max-model-len`                               |
| खराब गुणवत्ता वाले उत्तर           | लाइसेंस प्रतिबंधों की जाँच करें — कुछ मॉडल संस्करणों की क्षमताएँ सीमित होती हैं             |
| SSM लेयर त्रुटियाँ                 | transformers अपडेट करें: `pip install transformers>=4.45.0`                                 |

## प्रदर्शन तुलना

| मॉडल             | सक्रिय पैरामीटर | VRAM (FP16) | गति (RTX 4090)  |
| ---------------- | --------------- | ----------- | --------------- |
| Llama 3.2 3B     | 3B              | \~6GB       | \~280 tok/s     |
| Qwen2.5 7B       | 7B              | \~14GB      | \~180 tok/s     |
| **LFM2-24B-A2B** | **2B**          | **\~6GB**   | **\~350 tok/s** |
| Mistral 7B       | 7B              | \~14GB      | \~200 tok/s     |
| Phi-3.5 3.8B     | 3.8B            | \~8GB       | \~250 tok/s     |

LFM2-24B-A2B अपनी श्रेणी में VRAM-प्रति-सर्वश्रेष्ठ गति अनुपात प्राप्त करता है।

## संसाधन

* [Hugging Face पर LFM2-24B-A2B](https://huggingface.co/liquid-ai/LFM2-24B-A2B)
* [Liquid AI कंपनी](https://liquid.ai/)
* [SSM आर्किटेक्चर पेपर](https://arxiv.org/abs/2312.00752)
* [Liquid AI लाइसेंसिंग](https://liquid.ai/licensing)
* [vLLM SSM सपोर्ट](https://docs.vllm.ai/en/latest/models/supported_models.html#liquid-ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-hi/language-models/lfm2-24b.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
