> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/ling-26-flash.md).

# Ling-2.6-flash (Ant Group 104B MoE)

{% hint style="info" %}
**Статус (29 апреля 2026):** Ling-2.6-flash был выпущен Ant Group's **inclusionAI** командой на **28 апреля 2026** (на момент написания — один день назад). Это младший, небольшой и быстрый, настроенный под агентов собрат [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) — та же линия, та же ДНК гибридного линейного внимания, но всего лишь **7,4 млрд активных параметров** из 104-миллиардной разреженной MoE. Веса находятся по адресу [huggingface.co/inclusionAI/Ling-2.6-flash](https://huggingface.co/inclusionAI/Ling-2.6-flash) под **лицензией MIT**.
{% endhint %}

Где [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) требовалась стойка с 8 GPU, чтобы даже запуститься, Ling-2.6-flash — это **первый релиз inclusionAI, который помещается на одном потребительском GPU**. Путь с 7,4 млрд активных параметров означает, что вы платите за инференс как за плотную 8B-модель, но используете пул из 104 млрд параметров — и Ant Group настроила этот пул специально для **агентных рабочих процессов**: вызовов инструментов, многосоставного планирования и структурированной диспетчеризации функций.

По данным, опубликованным поставщиком, Ling-2.6-flash достигает SOTA на **BFCL-V4** и **TAU2-bench** в своём классе размеров, с пропускной способностью примерно **340 ток/с на 4× H20** в официальной конфигурации бенчмарка. Для пользователей Clore.ai куда интереснее другая, гораздо меньшая цифра: **INT4 спокойно помещается на одной RTX 4090 (24 ГБ)** с запасом для контекста 32K+, а **FP8 помещается на одном H100 80 ГБ**. Это выводит свежую небольшую модель frontier-класса, настроенную под агентов, примерно на \~$1.04/ч на [Маркетплейс Clore.ai](https://clore.ai/marketplace).

### Ключевые характеристики

| Параметр               | Значение                                                           |
| ---------------------- | ------------------------------------------------------------------ |
| Общее число параметров | 104B (MoE)                                                         |
| Активные параметры     | 7,4 млрд на один прямой проход                                     |
| Архитектура            | 1:7 гибридное внимание MLA + Lightning Linear                      |
| Окно контекста         | 262 144 токена                                                     |
| Квантизации            | BF16, FP8, INT4                                                    |
| Лицензия               | MIT                                                                |
| Дата выпуска           | 28 апреля 2026                                                     |
| Организация            | Ant Group — inclusionAI                                            |
| Основные инструменты   | SGLang (рекомендуется), vLLM, llama.cpp/Ollama (общественные GGUF) |

### Почему Ling-2.6-flash?

* **Можно развернуть на одной GPU** — INT4 на одной [RTX 4090](https://clore.ai/rent-4090.html) или [RTX 3090](https://clore.ai/rent-3090.html), FP8 на одном H100. Никакой возни с несколькими GPU, никакой борьбы с NVLink.
* **Настроен под агентов** — специально обучен под циклы вызова инструментов в стиле BFCL-V4 / TAU2-bench, а не просто протестирован на них постфактум.
* **Качество разреженной MoE при стоимости 7,4 млрд активных параметров** — вы получаете пул знаний на 104 млрд параметров через путь инференса на 7,4 млрд.
* **Контекст 256K из коробки** — 262K нативных токенов, без трюков YaRN для длинных агентных трасс.
* **лицензией MIT** — полностью коммерческий, дообучаемый и распространяемый.
* **Происхождение** — прямой потомок [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) и Ring-2.5; архитектура проверена в бою.

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="success" %}
**Дружелюбен к Clore.** Это первая модель в линейке inclusionAI, которая работает на одном потребительском GPU. Если вы были вытеснены ценой из [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) или [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md), это точка входа.
{% endhint %}

| Компонент             | INT4 (одна 24 ГБ)          | FP8 (одна 80 ГБ)     | BF16 (полное качество)           |
| --------------------- | -------------------------- | -------------------- | -------------------------------- |
| VRAM GPU              | 1× RTX 4090 / 3090 (24 ГБ) | 1× H100 / A100 80 ГБ | 2× A100 80 ГБ или 1× H200 141 ГБ |
| ОЗУ                   | 32GB                       | 64GB                 | 128 ГБ                           |
| Диск                  | 60GB NVMe                  | 120 ГБ NVMe          | 220 ГБ NVMe                      |
| CUDA                  | 12.8+                      | 12.8+                | 12.8+                            |
| Практический контекст | 32K–64K                    | 128K                 | 256K                             |

**Выбор Clore.ai:** Для большинства агентных нагрузок один [RTX 4090 ($0.14–0.42/час)](https://clore.ai/rent-4090.html) с INT4 GGUF непревзойдён по цене. Переходите на один H100, если вам нужно качество FP8 или контекст 128K+.

***

## Вариант A — Ollama / GGUF (квантованный, одна GPU)

Это путь, который подойдёт большинству пользователей Clore.ai. Общественные GGUF обычно появляются на HuggingFace через несколько дней после релиза inclusionAI.

{% hint style="warning" %}
**Важно в первый день:** Ling-2.6-flash вышел 28 апреля 2026 года. На момент написания общественные GGUF-кванты всё ещё могут появляться. Следите за [huggingface.co/models?search=ling-2.6-flash+gguf](https://huggingface.co/models?search=ling-2.6-flash+gguf) и [unsloth](https://huggingface.co/unsloth) за первыми сборками. Если `ollama pull` возвращает 404, укажите llama.cpp напрямую на файл GGUF.
{% endhint %}

```bash
# Когда будет опубликована общественная сборка Q4_K_M
docker exec ollama ollama pull ling-2.6-flash:q4_K_M
docker exec ollama ollama run ling-2.6-flash:q4_K_M

# Или через llama.cpp напрямую на загруженном GGUF
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/ling-2.6-flash-q4_k_m.gguf \\
  --n-gpu-layers 99 --ctx-size 32768 \\
  --port 8080 --host 0.0.0.0
```

Одна RTX 4090 должна выдавать **\~80–120 ток/с** на Q4\_K\_M с контекстом 32K — более чем достаточно для интерактивной агентной работы.

***

## Вариант B — vLLM (production API)

vLLM — лучший выбор для обслуживания Ling-2.6-flash для нескольких одновременных агентов. Используйте контрольную точку FP8 на одном H100 / A100 80 ГБ:

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model inclusionAI/Ling-2.6-flash-FP8
      --tensor-parallel-size 1
      --max-model-len 65536
      --gpu-memory-utilization 0.90
      --enable-auto-tool-choice
      --tool-call-parser hermes
      --served-model-name ling-2.6-flash
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: 1
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Проверьте агентный путь
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "ling-2.6-flash",
    "messages": [
      {"role": "system", "content": "Вы агент с доступом к инструментам. Спланируйте, вызовите инструменты, затем ответьте."},
      {"role": "user", "content": "Найдите мне сейчас самую дешёвую RTX 4090 на Clore.ai."}
    ],
    "tools": [{"type": "function", "function": {"name": "search_marketplace", "parameters": {"type":"object","properties":{"gpu":{"type":"string"}}}}}],
    "tool_choice": "auto",
    "max_tokens": 2048
  }'
```

{% hint style="info" %}
Для BF16 с полным качеством на длинных контекстах (200K+) увеличьте `--tensor-parallel-size 2` до 2× A100 80 ГБ или закрепите на одном H200 141 ГБ.
{% endhint %}

***

## Вариант C — SGLang (рекомендуется для максимальной пропускной способности)

SGLang — это то, что Ant Group использует для официального бенчмарка 340 ток/с — путь гибридного линейного внимания работает быстрее всего в runtime SGLang.

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \
  --model-path inclusionAI/Ling-2.6-flash-FP8 \\
  --tp-size 1 \
  --tool-call-parser hermes \\
  --mem-fraction-static 0.90 \\
  --context-length 65536 \
  --served-model-name ling-2.6-flash \\
  --host 0.0.0.0 --port 30000

# Чтобы воспроизвести фирменный показатель 340 ток/с (требуется класс 4x H20 / H100)
python3 -m sglang.launch_server \
  --model-path inclusionAI/Ling-2.6-flash \\
  --tp-size 4 \
  --mem-fraction-static 0.92 \\
  --context-length 32768 \\
  --served-model-name ling-2.6-flash
```

***

## Рекомендации по GPU для Clore.ai

| Конфигурация                                          | VRAM   | Квант       | Ожидаемая производительность | Стоимость на Clore.ai                       |
| ----------------------------------------------------- | ------ | ----------- | ---------------------------- | ------------------------------------------- |
| 1× [RTX 3090](https://clore.ai/rent-3090.html)        | 24 ГБ  | INT4 GGUF   | \~60–90 ток/с                | **$0.07–0.21/ч**                            |
| 1× [RTX 4090](https://clore.ai/rent-4090.html)        | 24 ГБ  | INT4 GGUF   | \~80–120 ток/с               | **$0.14–0.42/ч**                            |
| 1× [A100 80 ГБ](https://clore.ai/rent-a100-80gb.html) | 80 ГБ  | FP8         | \~120–180 ток/с              | [голое железо](https://clore.ai/bare-metal) |
| 1× H100 80 ГБ                                         | 80 ГБ  | FP8         | \~150–220 ток/с              | \~$1.04/ч                                   |
| 4× H100 80 ГБ                                         | 320 ГБ | BF16 + TP=4 | \~340 ток/с (поставщик)      | \~$4.16/ч                                   |

{% hint style="success" %}
**Лучшее соотношение цены и качества:** Одна RTX 4090 за $0.14–0.42/ч, работающая с Q4\_K\_M GGUF. Вы получаете модель MoE 104B, настроенную под агентов, с лицензией MIT и контекстом 32K дешевле чашки кофе в час. Это именно тот формат развёртывания, для которого был создан маркетплейс потребительских GPU Clore.ai.
{% endhint %}

***

## Сценарии использования

* **Агенты с вызовом инструментов** — настройка под BFCL-V4 и TAU2-bench означает, что структурированная диспетчеризация функций — это сильная сторона, а не второстепенная мысль.
* **Циклы многосоставного планирования** — устойчивые цепочки вызовов инструментов без дрейфа, типичного для небольших моделей.
* **Локальная замена Claude Code / OpenHands** — готовый к использованию API, совместимый с OpenAI, на вашей собственной RTX 4090.
* **Пакетные агентные задачи большого объёма** — 340 ток/с на 4×H100 делает это пригодным для обработки тысяч агентных транскриптов в час.
* **RAG на длинном контексте** — нативный контекст 256K покрывает большинство корпоративных наборов документов в одном промпте.
* **Дешёвая dev-песочница для** [**Ling-2.5-1T**](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) **рабочих процессов** — прототипируйте на flash, развёртывайте на варианте 1T.

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Все числа ниже взяты из model card inclusionAI от 28 апреля 2026 года. Модели всего один день; общественные воспроизведения на BFCL-V4 и TAU2-bench ещё не опубликованы. Воспринимайте это как ориентиры, а не как истину в последней инстанции.
{% endhint %}

| Бенчмарк                      | Ling-2.6-flash (поставщик)      | Примечания                                      |
| ----------------------------- | ------------------------------- | ----------------------------------------------- |
| BFCL-V4                       | SOTA для своего класса размеров | Berkeley Function Calling Leaderboard v4        |
| TAU2-bench                    | SOTA для своего класса размеров | Бенчмарк инструментального агента v2            |
| SWE-bench Verified / Resolved | \~61.2%                         | Доля решённых задач на верифицированной выборке |
| MathArena AIME 2026           | 73.85                           |                                                 |
| MathArena HMMT Feb 2026       | 49.29                           |                                                 |
| Пропускная способность        | \~340 ток/с                     | 4× H20-3e, TP=4, batch 32                       |

***

## Устранение неполадок

| Проблема                                          | Решение                                                                                                                                                                                                                                      |
| ------------------------------------------------- | -------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` на RTX 4090                    | Перейдите на Q4\_K\_S или Q3\_K\_M; уменьшите `--ctx-size` до 16384; закройте другие GPU-процессы                                                                                                                                            |
| GGUF ещё нет на HuggingFace                       | Модели один день. Проверьте [unsloth](https://huggingface.co/unsloth), [bartowski](https://huggingface.co/bartowski), и [TheBloke](https://huggingface.co/TheBloke) зеркала; или самостоятельно квантуйте из BF16 с помощью `llama-quantize` |
| vLLM отклоняет архитектуру                        | Убедитесь, что vLLM ≥ 0.7.x с `--trust-remote-code`; слои гибридного линейного внимания являются пользовательскими                                                                                                                           |
| Вызовы инструментов возвращаются обычным текстом  | Установите `--enable-auto-tool-choice --tool-call-parser hermes` в vLLM; SGLang обрабатывает это автоматически                                                                                                                               |
| Медленное предзаполнение на длинных контекстах    | У линейного внимания есть затраты на прогрев; первый запрос всегда самый медленный. Используйте `--enable-chunked-prefill` в vLLM                                                                                                            |
| Пропускная способность значительно ниже 340 ток/с | Фирменный показатель получен на 4× H20 с TP=4 и batch 32. Одна GPU + batch 1, естественно, намного медленнее — это ожидаемо, а не баг                                                                                                        |
| Искажённый вывод при высокой температуре          | Понизьте до `temperature=0.7` для чата, `0.1` для вызова инструментов                                                                                                                                                                        |

***

## Дальнейшие шаги

* **Более крупный собрат:** [Ling-2.5-1T](/guides/guides_v2-ru/yazykovye-modeli/ling25.md) — та же семья, всего 1T / 63B активных, frontier-рассуждения ценой работы на нескольких GPU
* **Похожий агент для одной GPU:** [MiMo-V2-Flash](/guides/guides_v2-ru/yazykovye-modeli/mimo-v2-flash.md) — 309B/15B активных, со встроенным speculative decoding
* **Альтернатива для кодинга с открытыми весами:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — 744B/40B активных, лидер SWE-Bench Pro
* **Недорогая аренда GPU:** [Аренда RTX 4090 от $0.14–0.42/ч](https://clore.ai/rent-4090.html) или [RTX 3090 от $0.07–0.21/ч](https://clore.ai/rent-3090.html)
* **Маркетплейс Clore.ai:** [clore.ai/marketplace](https://clore.ai/marketplace) — полный каталог GPU с почасовой и spot-ценой

### Ссылки

* [Ling-2.6-flash на HuggingFace](https://huggingface.co/inclusionAI/Ling-2.6-flash)
* [организация inclusionAI](https://huggingface.co/inclusionAI) — открытая AI-лаборатория Ant Group
* [Репозиторий SGLang](https://github.com/sgl-project/sglang) — рекомендуемый фреймворк для сервинга
* [Документация vLLM](https://docs.vllm.ai)
* [лидерборд BFCL-V4](https://gorilla.cs.berkeley.edu/leaderboard.html) — Berkeley Function Calling


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/ling-26-flash.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
