> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/ling25.md).

# Ling-2.5-1T (1 триллион параметров)

Ling-2.5-1T от Ant Group (выпущен 16 февраля 2026 года) — одна из крупнейших когда-либо выпущенных open-source языковых моделей — **1 триллион параметров всего, из них 63 млрд активных**. Она представляет собой гибридную архитектуру линейного внимания, обеспечивающую эффективный инференс на длинах контекста до 1 миллиона токенов. Вместе с ней Ant Group выпустила Ring-2.5-1T — первую в мире thinking-модель с гибридной линейной архитектурой. Вместе они представляют собой новый рубеж в open-source ИИ — конкурентоспособный с GPT-5.2, DeepSeek V3.2 и Kimi K2.5 в бенчмарках на рассуждение и агентные задачи.

**HuggingFace:** [inclusionAI/Ling-2.5-1T](https://huggingface.co/inclusionAI/Ling-2.5-1T) **Сопутствующая модель:** [inclusionAI/Ring-2.5-1T](https://huggingface.co/inclusionAI/Ring-2.5-1T) (вариант для мышления/рассуждения) **Лицензия:** Open source (Ant Group InclusionAI License)

## Ключевые особенности

* **1 триллион параметров всего, 63 млрд активных** — огромный масштаб при эффективной активации в стиле MoE
* **Гибридное линейное внимание** — сочетает MLA (Multi-head Linear Attention) с Lightning Linear Attention для исключительной пропускной способности на длинных последовательностях
* **Контекстное окно на 1 млн токенов** — через расширение YaRN от нативных 256K, обрабатывает целые кодовые базы и документы книжного объёма
* **Передовое рассуждение** — приближается к производительности thinking-моделей, используя примерно в 4 раза меньше выходных токенов
* **Агентные возможности** — обучена с Agentic RL, совместима с Claude Code, OpenCode и OpenClaw
* **Сопутствующая Ring-2.5-1T** — специализированный вариант для рассуждения достигает уровня золотой медали IMO 2025 и CMO 2025

## Подробности архитектуры

| Компонент               | Подробности                                          |
| ----------------------- | ---------------------------------------------------- |
| Общее число параметров  | 1T (1 000B)                                          |
| Активные параметры      | 63B                                                  |
| Архитектура             | Гибридное линейное внимание (MLA + Lightning Linear) |
| Данные для предобучения | 29T токенов                                          |
| Нативный контекст       | 256K токенов                                         |
| Расширенный контекст    | 1M токенов (YaRN)                                    |
| Дата выпуска            | 16 февраля 2026 года                                 |

## Требования

{% hint style="warning" %}
**Многопроцессорные установки класса 80 ГБ GPU не указаны на маркетплейсе Clore.ai.** Самые крупные доступные сейчас конфигурации — 4× RTX PRO 6000 Blackwell (по 96 ГБ, всего 380 ГБ) и 8–11× RTX 5090 (по 32 ГБ). Возможности A100 / H200 / B200 продаются как [bare metal](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед тем, как подбирать конфигурацию для развёртывания.
{% endhint %}

Запуск Ling-2.5-1T в полной точности требует значительных ресурсов. Квантованные версии делают его более доступным.

| Конфигурация | Квантованная (Q4 GGUF) | FP8            | BF16 (полная)    |
| ------------ | ---------------------- | -------------- | ---------------- |
| GPU          | 8× RTX 4090            | 8× H100 80GB   | 16× H100 80GB    |
| VRAM         | 8×24GB (192GB)         | 8×80GB (640GB) | 16×80GB (1.28TB) |
| ОЗУ          | 256GB                  | 512GB          | 1TB              |
| Диск         | 600GB                  | 1.2TB          | 2TB+             |
| CUDA         | 12.8+                  | 12.8+          | 12.8+            |

**Рекомендуемая конфигурация Clore.ai:**

* **Квантованная (Q4):** 8× RTX 4090 ($1.12–3.36/час) — подходит для экспериментов и умеренных нагрузок
* **Продакшн (FP8):** 8× H100 (\~$8.32/час) — полное качество при хорошей пропускной способности
* **Примечание:** Это чрезвычайно большая модель. Для пользователей, ориентированных на бюджет, рассмотрите более маленькие модели семейства Ling на [HuggingFace](https://huggingface.co/inclusionAI).

## Быстрый старт с vLLM

vLLM — рекомендуемый фреймворк обслуживания для Ling-2.5-1T:

```bash
# Установить vLLM
pip install vllm

# Запустить Ling-2.5-1T с тензорным параллелизмом на 8 GPU
vllm serve inclusionAI/Ling-2.5-1T \
    --tensor-parallel-size 8 \
    --max-model-len 65536 \
    --gpu-memory-utilization 0.90 \
    --trust-remote-code \
    --host 0.0.0.0 \
    --port 8000

# Для меньшего потребления памяти ограничьте длину контекста:
vllm serve inclusionAI/Ling-2.5-1T \
    --tensor-parallel-size 8 \
    --max-model-len 16384 \
    --gpu-memory-utilization 0.95 \
    --trust-remote-code \
    --host 0.0.0.0 \
    --port 8000
```

## Быстрый старт с llama.cpp (квантованная)

Для конфигураций с потребительскими GPU доступны квантования GGUF:

```bash
# Установить llama.cpp
git clone https://github.com/ggerganov/llama.cpp
cd llama.cpp
cmake -B build -DGGML_CUDA=ON
cmake --build build --config Release -j$(nproc)

# Скачать квантованный GGUF (проверьте HuggingFace на наличие доступных квантизаций)
huggingface-cli download inclusionAI/Ling-2.5-1T-GGUF \
    --include "*.Q4_K_M.gguf" \
    --local-dir ./models/

# Запуск через llama-server (подстройте -ngl под количество ваших GPU)
./build/bin/llama-server \
    -m ./models/Ling-2.5-1T-Q4_K_M.gguf \
    -ngl 99 \
    -c 8192 \
    --host 0.0.0.0 \
    --port 8000
```

## Примеры использования

### 1. Chat Completion через OpenAI API

После запуска vLLM или llama-server:

```python
from openai import OpenAI

client = OpenAI(
    base_url="http://localhost:8000/v1",
    api_key="not-needed"
)

response = client.chat.completions.create(
    model="inclusionAI/Ling-2.5-1T",
    messages=[
        {"role": "system", "content": "Вы — ассистент мирового уровня для рассуждений. Думайте пошагово."},
        {"role": "user", "content": "Докажите, что квадратный корень из 2 иррационален."}
    ],
    temperature=0.1,
    max_tokens=4096
)

print(response.choices[0].message.content)
```

### 2. Анализ документов с длинным контекстом

Гибридное линейное внимание Ling-2.5-1T делает его исключительно эффективным для длинных документов:

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

# Загрузить большой документ
with open("full_codebase.txt", "r") as f:
    codebase = f.read()  # Может содержать сотни тысяч токенов

response = client.chat.completions.create(
    model="inclusionAI/Ling-2.5-1T",
    messages=[
        {"role": "system", "content": "Вы — старший архитектор программного обеспечения."},
        {"role": "user", "content": f"Проанализируй эту кодовую базу на наличие уязвимостей безопасности и архитектурных проблем:\n\n{codebase}"}
    ],
    temperature=0.1,
    max_tokens=8192
)

print(response.choices[0].message.content)
```

### 3. Агентное использование инструментов

Ling-2.5-1T обучена с Agentic RL для вызова инструментов:

```python
from openai import OpenAI

client = OpenAI(base_url="http://localhost:8000/v1", api_key="n/a")

tools = [
    {
        "type": "function",
        "function": {
            "name": "search_database",
            "description": "Поиск в базе данных продуктов",
            "parameters": {
                "type": "object",
                "properties": {
                    "query": {"type": "string"},
                    "category": {"type": "string", "enum": ["electronics", "clothing", "books"]},
                    "max_price": {"type": "number"}
                },
                "required": ["query"]
            }
        }
    }
]

response = client.chat.completions.create(
    model="inclusionAI/Ling-2.5-1T",
    messages=[{"role": "user", "content": "Найдите мне ноутбук до $1000 с хорошими отзывами"}],
    tools=tools,
    tool_choice="auto"
)

print(response.choices[0].message.tool_calls)
```

## Ling-2.5-1T vs Ring-2.5-1T

| Аспект                   | Ling-2.5-1T                                  | Ring-2.5-1T                                        |
| ------------------------ | -------------------------------------------- | -------------------------------------------------- |
| Тип                      | Мгновенная (быстрая) модель                  | Thinking (модель для рассуждения)                  |
| Архитектура              | Гибридное линейное внимание                  | Гибридное линейное внимание                        |
| Лучше всего для          | Общий чат, программирование, агентные задачи | Математика, формальное рассуждение, сложные задачи |
| Стиль вывода             | Прямые ответы                                | Пошаговое рассуждение                              |
| Эффективность по токенам | Высокая (меньше выходных токенов)            | Использует больше токенов для рассуждения          |
| IMO 2025                 | Конкурентоспособно                           | Уровень золотой медали                             |

## Советы для пользователей Clore.ai

1. **Этой модели нужно серьёзное железо** — При 1T параметров даже квантование Q4 требует около 500GB хранилища и 192GB+ VRAM. Убедитесь, что ваш инстанс Clore.ai имеет достаточно диска и несколько GPU перед загрузкой.
2. **Начните с `--max-model-len 8192`** — При первом тестировании используйте короткий контекст, чтобы проверить, что модель загружается и работает корректно. Увеличьте длину контекста, когда всё заработает.
3. **Используйте постоянное хранилище** — Модель весит 1–2TB. Подключите большой постоянный том на Clore.ai, чтобы избежать повторной загрузки. Скачайте один раз с помощью `huggingface-cli download`.
4. **Рассмотрите Ring-2.5-1T для задач рассуждения** — Если ваш сценарий использования в основном связан с математикой, логикой или формальным рассуждением, сопутствующая модель Ring-2.5-1T специально оптимизирована для пошагового рассуждения.
5. **Следите за памятью GPU** — В конфигурациях с 8 GPU используйте `nvidia-smi -l 1` для мониторинга использования памяти и отслеживания OOM во время генерации с длинным контекстом.

## Устранение неполадок

| Проблема                         | Решение                                                                                                                                                 |
| -------------------------------- | ------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `CUDA out of memory`             | Уменьшите `--max-model-len`; убедитесь, что `--tensor-parallel-size` соответствует числу GPU; попробуйте `--gpu-memory-utilization 0.95`                |
| Очень медленная генерация        | Линейному вниманию нужен прогрев; первые несколько запросов могут быть медленными. Также проверьте, что между GPU есть NVLink                           |
| Сбой загрузки модели             | Модель в BF16 весит около 2TB. Убедитесь, что хватает дискового пространства. Используйте `--resume-download` флаг с `huggingface-cli`                  |
| vLLM не поддерживает архитектуру | Убедитесь, что вы используете vLLM ≥0.7.0 с `--trust-remote-code`; пользовательские слои внимания требуют этот флаг                                     |
| GGUF недоступен                  | Проверьте [unsloth](https://huggingface.co/unsloth) или community-квантования; сообществу может потребоваться время, чтобы выполнить квантизацию модели |
| Низкое качество ответов          | Используйте temperature ≤0.1 для фактических задач; добавьте системный промпт; убедитесь, что вы не обрезаете контекст                                  |

## Дополнительное чтение

* [Официальное объявление (BusinessWire)](https://www.businesswire.com/news/home/20260215551663/en/) — Подробности релиза и бенчмарки
* [HuggingFace — Ling-2.5-1T](https://huggingface.co/inclusionAI/Ling-2.5-1T) — Веса модели и документация
* [HuggingFace — Ring-2.5-1T](https://huggingface.co/inclusionAI/Ring-2.5-1T) — Сопутствующая модель для рассуждения
* [Зеркало ModelScope](https://www.modelscope.cn/models/inclusionAI/Ling-2.5-1T) — Более быстрая загрузка в Азии
* [Документация vLLM](https://docs.vllm.ai/) — Фреймворк обслуживания


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/ling25.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
