> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/lfm2-24b.md).

# LFM2-24B-A2B

> LFM2-24B-A2B представляет собой прорыв в эффективном языковом моделировании благодаря гибридной **Модель пространства состояний + внимание** архитектуре. Имея 24B общих параметров, но только 2B активных на токен, она обеспечивает впечатляющую производительность, при этом для FP16-инференса требуется всего \~6 ГБ VRAM. Модель достигает \~350 tok/s на RTX 4090, что делает её одной из самых быстрых доступных больших языковых моделей.

## Сводка

* **Размер модели**: 24B общих / 2B активных параметров (гибрид SSM+Attention)
* **Лицензия**: Лицензия Liquid AI Open License (бесплатно для некоммерческого использования, коммерческая лицензия доступна)
* **Контекст**: 32K токенов
* **Производительность**: конкурентоспособна с плотными моделями 7B-13B
* **VRAM**: \~6 ГБ FP16, \~3 ГБ INT8
* **Скорость**: \~350 tok/s на RTX 4090, \~200 tok/s на RTX 3090

## Почему LFM2-24B-A2B?

**Революционная архитектура**: LFM2-24B-A2B сочетает модели пространства состояний (SSM) с механизмами селективного внимания. SSM эффективно обрабатывают последовательности, а слои внимания фокусируются на сложном рассуждении. Этот гибридный подход обеспечивает качество большой модели при эффективности маленькой.

**Исключительная скорость**: Конструкция с 2B активных параметров обеспечивает молниеносный инференс. В отличие от традиционных моделей, где активируются все параметры, LFM2 выборочно задействует только необходимые компоненты, обеспечивая 350+ токенов в секунду на потребительском железе.

**Эффективность по памяти**: При всего 6 ГБ VRAM для FP16 LFM2-24B-A2B комфортно работает на GPU среднего уровня. Это делает его идеальным для edge-развертывания, сред разработки и экономичных производственных конфигураций.

**Инновации Liquid AI**: Разработанный Liquid AI (основанной исследователями MIT), LFM2 представляет собой передовые исследования в области нейросетевой архитектуры. Гибридная конструкция SSM+Attention может стать будущим эффективного языкового моделирования.

**Примечание о лицензии**: Лицензия Liquid AI Open License разрешает бесплатное некоммерческое использование. Коммерческое развертывание требует отдельной лицензии от Liquid AI. Это **не** MIT — проверьте условия лицензии перед использованием в production.

## Рекомендации по GPU

| GPU             | VRAM  | Производительность | Ежедневная стоимость\* |
| --------------- | ----- | ------------------ | ---------------------- |
| RTX 3060 12GB   | 12GB  | \~180 ток/с        | \~$0.80                |
| RTX 3070        | 8 ГБ  | \~220 ток/с        | \~$0.90                |
| **RTX 4060 Ti** | 16GB  | \~300 ток/с        | \~$1.20                |
| **RTX 4090**    | 24 ГБ | **\~350 ток/с**    | \~$2.10                |
| RTX 3090        | 24 ГБ | \~200 ток/с        | \~$1.10                |
| A100 40 ГБ      | 40 ГБ | \~400 ток/с        | \~$3.50                |

**Лучшее соотношение цены и качества**: RTX 4060 Ti 16 ГБ предлагает отличное соотношение производительности к цене. **Максимальная скорость**: RTX 4090 раскрывает весь потенциал LFM2.

\*Оценочные цены на маркетплейсе Clore.ai

## Развертывание с vLLM

### Установите vLLM

```bash
pip install vllm>=0.6.0
# или последнюю версию
pip install git+https://github.com/vllm-project/vllm.git
```

### Настройка на одной GPU

```bash
vllm serve liquid-ai/LFM2-24B-A2B \\
  --model liquid-ai/LFM2-24B-A2B \\
  --tensor-parallel-size 1 \\
  --dtype float16 \\
  --max-model-len 32768 \
  --served-model-name lfm2-24b \\
  --trust-remote-code \\
  --disable-log-stats
```

### Обратиться к серверу

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1", 
    api_key="EMPTY"
)

response = client.chat.completions.create(
    model="lfm2-24b",
    messages=[
        {"role": "system", "content": "Вы — полезный AI-ассистент, специализирующийся на технических объяснениях."},
        {"role": "user", "content": "Объясните различия между моделями пространства состояний и традиционными трансформерами"}
    ],
    max_tokens=1024,
    temperature=0.7
)

print(response.choices[0].message.content)
```

## Развертывание с Ollama

Ollama предоставляет самый простой путь развертывания:

```bash
# Установите Ollama
curl -fsSL https://ollama.com/install.sh | sh

# Скачать модель LFM2
ollama pull liquid-ai/lfm2:24b

# Запустить интерактивно
ollama run liquid-ai/lfm2:24b

# Режим API
ollama serve
```

### Использование API Ollama

```python
import requests

# Простое завершение
response = requests.post('http://localhost:11434/api/generate',
    json={
        'model': 'liquid-ai/lfm2:24b',
        'prompt': 'Напишите функцию на Python для вычисления чисел Фибоначчи с использованием мемоизации',
        'stream': False
    }
)

print(response.json()['response'])

# Формат чата
chat_response = requests.post('http://localhost:11434/api/chat',
    json={
        'model': 'liquid-ai/lfm2:24b',
        'messages': [
            {'role': 'user', 'content': 'Объясните квантовую запутанность простыми словами'}
        ],
        'stream': False
    }
)

print(chat_response.json()['message']['content'])
```

## Шаблон Docker

```dockerfile
FROM nvidia/cuda:12.8.1-devel-ubuntu22.04

# Установить Python 3.10
RUN apt-get update && apt-get install -y \\
    python3.10 python3-pip curl && \\
    rm -rf /var/lib/apt/lists/*

# Установить vLLM
RUN pip install vllm>=0.6.0 transformers

# Задать окружение
ENV PYTHONUNBUFFERED=1

# Предзагрузить модель (необязательно)
# RUN python3 -c "from transformers import AutoModel; AutoModel.from_pretrained('liquid-ai/LFM2-24B-A2B', trust_remote_code=True)"

EXPOSE 8000

CMD ["vllm", "serve", "liquid-ai/LFM2-24B-A2B", \\
     "--host", "0.0.0.0", \\
     "--port", "8000", \\
     "--dtype", "float16", \\
     "--max-model-len", "16384", \\
     "--trust-remote-code"]
```

Сборка и запуск:

```bash
docker build -t lfm2-24b .
docker run --gpus all -p 8000:8000 lfm2-24b
```

## Бенчмарк скорости

Проверьте исключительную скорость инференса LFM2:

```python
import time
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="EMPTY")

def speed_test():
    prompts = [
        "Объясните машинное обучение в одном абзаце",
        "Напишите быстрый алгоритм сортировки на Python",
        "Опишите преимущества возобновляемой энергии",
        "Какова столица Франции и почему она важна?",
        "Создайте простую структуру HTML-страницы"
    ]
    
    total_tokens = 0
    total_time = 0
    
    for prompt in prompts:
        start_time = time.time()
        
        response = client.chat.completions.create(
            model="lfm2-24b",
            messages=[{"role": "user", "content": prompt}],
            max_tokens=200,
            temperature=0.1
        )
        
        end_time = time.time()
        
        tokens = len(response.choices[0].message.content.split())
        duration = end_time - start_time
        
        total_tokens += tokens
        total_time += duration
        
        print(f"Промпт: {prompt[:30]}...")
        print(f"Токенов: {tokens}, Время: {duration:.2f}s, Скорость: {tokens/duration:.1f} tok/s\n")
    
    avg_speed = total_tokens / total_time
    print(f"Средняя скорость: {avg_speed:.1f} токенов/секунду")
    return avg_speed

# Запустить тест скорости
speed_test()
```

## Квантование для меньшего VRAM

Для GPU с ограниченным VRAM используйте квантованные версии:

### Квантование GPTQ

```bash
# Установить auto-gptq
pip install auto-gptq

# Использовать квантованную модель (снижает до ~3 ГБ VRAM)
vllm serve liquid-ai/LFM2-24B-A2B-GPTQ \\
  --model liquid-ai/LFM2-24B-A2B-GPTQ \\
  --quantization gptq \\
  --dtype float16 \\
  --max-model-len 16384
```

### Квантование AWQ

```bash
# Установить autoawq
pip install autoawq

# Использовать квантованную модель AWQ
vllm serve liquid-ai/LFM2-24B-A2B-AWQ \\
  --model liquid-ai/LFM2-24B-A2B-AWQ \\
  --quantization awq \\
  --dtype float16
```

## Расширенная конфигурация

### Настройка с оптимизацией памяти

Для GPU с 8 ГБ:

```bash
vllm serve liquid-ai/LFM2-24B-A2B \\
  --model liquid-ai/LFM2-24B-A2B \\
  --dtype float16 \\
  --max-model-len 8192 \
  --gpu-memory-utilization 0.85 \\
  --swap-space 4 \\
  --trust-remote-code
```

### Настройка высокой пропускной способности

Для производственных нагрузок:

```bash
vllm serve liquid-ai/LFM2-24B-A2B \\
  --model liquid-ai/LFM2-24B-A2B \\
  --tensor-parallel-size 1 \\
  --max-num-seqs 32 \\
  --max-num-batched-tokens 8192 \\
  --dtype float16 \\
  --trust-remote-code
```

## Преимущества архитектуры SSM

Гибридная SSM+Attention у LFM2 дает уникальные преимущества:

**Линейное масштабирование**: SSM масштабируются линейно с длиной последовательности, тогда как традиционные трансформеры — квадратично. Это обеспечивает эффективную обработку длинного контекста.

**Селективное внимание**: Только критические токены запускают полные механизмы внимания, снижая вычислительные накладные расходы.

**Эффективность памяти**: Конструкция с 2B активных параметров означает, что большинство из 24B параметров остаются неактивными во время инференса, резко снижая требования к пропускной способности памяти.

**Быстрая последовательная обработка**: SSM отлично справляются с последовательными задачами, такими как генерация текста, обеспечивая более высокую пропускную способность, чем чистые механизмы внимания.

## Советы для пользователей Clore.ai

* **Оптимизация под одну GPU**: LFM2-24B-A2B оптимизирован для развертывания на одной GPU. Многопроцессорные конфигурации не дают существенных преимуществ.
* **Длина контекста**: Используйте более короткие контексты (8K-16K) для максимальной скорости. Более длинные контексты уменьшают преимущество эффективности SSM.
* **Настройки температуры**: Более низкие температуры (0.1-0.3) максимизируют скорость инференса, уменьшая неопределенность.
* **Размер батча**: Увеличивайте размер батча для нескольких одновременных запросов вместо использования нескольких GPU.
* **Соблюдение лицензии**: Перед производственным развертыванием проверьте у Liquid AI требования к коммерческой лицензии.

## Устранение неполадок

| Проблема                                  | Решение                                                                                   |
| ----------------------------------------- | ----------------------------------------------------------------------------------------- |
| `Ошибка ImportError: liquid_transformers` | Установите: `pip install git+https://github.com/LiquidAI-project/liquid-transformers.git` |
| Медленный запуск                          | Предзагрузите: `huggingface-cli download liquid-ai/LFM2-24B-A2B`                          |
| `OutOfMemoryError`                        | Используйте квантованную версию или уменьшите `max-model-len`                             |
| Низкое качество ответов                   | Проверьте ограничения лицензии — некоторые версии модели имеют ограниченные возможности   |
| Ошибки слоя SSM                           | Обновите transformers: `pip install transformers>=4.45.0`                                 |

## Сравнение производительности

| Модель           | Активные параметры | VRAM (FP16) | Скорость (RTX 4090) |
| ---------------- | ------------------ | ----------- | ------------------- |
| Llama 3.2 3B     | 3B                 | \~6 ГБ      | \~280 tok/s         |
| Qwen2.5 7B       | 7B                 | \~14 ГБ     | \~180 ток/с         |
| **LFM2-24B-A2B** | **2B**             | **\~6 ГБ**  | **\~350 ток/с**     |
| Mistral 7B       | 7B                 | \~14 ГБ     | \~200 ток/с         |
| Phi-3.5 3.8B     | 3.8B               | \~8 ГБ      | \~250 tok/s         |

LFM2-24B-A2B достигает лучшего в своем классе соотношения скорости к VRAM.

## Ресурсы

* [LFM2-24B-A2B на Hugging Face](https://huggingface.co/liquid-ai/LFM2-24B-A2B)
* [Компания Liquid AI](https://liquid.ai/)
* [Статья об архитектуре SSM](https://arxiv.org/abs/2312.00752)
* [Лицензирование Liquid AI](https://liquid.ai/licensing)
* [Поддержка SSM в vLLM](https://docs.vllm.ai/en/latest/models/supported_models.html#liquid-ai)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/lfm2-24b.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
