> For the complete documentation index, see [llms.txt](https://docs.clore.ai/llms.txt). Markdown versions of documentation pages are available by appending `.md` to page URLs; this page is available as [Markdown](https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/hy3-preview.md).

# Hy3 Preview (Tencent Hunyuan 3, 295B MoE)

{% hint style="info" %}
**Статус (апрель 2026):** Hy3 Preview — это первый публичный релиз **перестроенной инфраструктуры обучения Tencent Hunyuan**, опубликованный **13 апреля 2026 года** и последний раз обновлён **23 апреля 2026 года**. Веса доступны по адресу [huggingface.co/tencent/Hy3-preview](https://huggingface.co/tencent/Hy3-preview) под **Лицензия Tencent Hy Community**. Поддержка с первого дня появилась в vLLM и SGLang.
{% endhint %}

Hy3 Preview — это **модель Mixture-of-Experts с 295 млрд параметров** языковая модель, которая активирует только **\~21 млрд параметров на токен** (192 эксперта, маршрутизация top-8). Она нацелена на две задачи, в которых Tencent заметно догоняет: **долгосрочное рассуждение** (FrontierScience-Olympiad, IMOAnswerBench, экзамены по математике уровня PhD) и **агентное программирование** (SWE-bench Verified 74.4%, Terminal-Bench 2.0 54.4%, по заявлению вендора). Окно контекста 256K плюс слой MTP (Multi-Token Prediction) для speculative decoding делают его практичным для IDE-масштабных кодирующих агентов и RAG с большим объёмом документов.

Для пользователей Clore.ai главное число — **21 млрд активных**. Вам не нужен полный массив 8×H200. Достаточно tensor-parallel развёртывания на **4×A100 80GB** или **2×H100 80GB** (BF16 с offload) — этого достаточно для обслуживания с приемлемой пропускной способностью — агентное кодирование уровня frontier примерно за \~$2.08/ч на маркетплейсе, при этом веса остаются на вашем собственном сервере.

### Ключевые характеристики

| Параметр               | Значение                                          |
| ---------------------- | ------------------------------------------------- |
| Общее число параметров | 295B (MoE)                                        |
| Активные параметры     | 21B за один проход вперёд                         |
| Эксперты               | всего 192, маршрутизация top-8                    |
| Слои                   | 80 трансформерных + 1 MTP                         |
| Внимание               | 64 головы, GQA с 8 KV-головами, размер головы 128 |
| Скрытый размер         | 4096                                              |
| Промежуточный размер   | 13,312                                            |
| Словарь                | 120,832                                           |
| Окно контекста         | 256 000 токенов                                   |
| Нативная точность      | BF16                                              |
| Лицензия               | Лицензия Tencent Hy Community                     |
| Дата выпуска           | 13 апреля 2026 года                               |
| Организация            | Tencent Hunyuan                                   |
| Основные инструменты   | vLLM, SGLang, AngelSlim, LLaMA-Factory            |

### Почему Hy3 Preview?

* **Первый на обновлённом стеке RL Tencent** — Tencent переписала свою инфраструктуру обучения для этого релиза; ожидайте быстрой итерации в течение 2026 года
* **21 млрд активных MoE** — вы платите за инференс как за \~21-миллиардную dense-модель, а не за 295B
* **контекст 256K** — достаточно для полных репозиториев, длинных трасс агента или много-документного RAG за один запуск
* **слой MTP speculative decoding** — встроенное предсказание нескольких токенов даёт ускорение декодирования примерно в 1.5–2× на GPU класса Hopper
* **Два режима рассуждения** — `reasoning_effort: "high"` для chain-of-thought, `"no_think"` для быстрых прямых ответов
* **Ориентация на агентное кодирование** — явно настроен для многотурового использования инструментов в стиле SWE-bench и терминальных агентов
* **Лицензия, дружественная к open-source** — Tencent Hy Community License по сути Apache-стиля для большинства случаев; проверьте файл LICENSE для вашего случая

***

## Требования

{% hint style="warning" %}
**Многопроцессорные конфигурации с GPU класса 80GB не представлены на маркетплейсе Clore.ai.** Самые крупные доступные сейчас машины — это 4× RTX PRO 6000 Blackwell (по 96GB, всего 380GB) и 8–11× RTX 5090 (по 32GB). Ёмкость A100 / H200 / B200 продаётся как [голое железо](https://clore.ai/bare-metal) по запросу. Проверьте [Цены и доступность GPU](/guides/guides_v2-ru/nachalo-raboty/pricing.md) перед выбором размера развёртывания.
{% endhint %}

{% hint style="warning" %}
**Всё ещё модель класса 295B.** «21B active» описывает вычисления инференса, а не объём памяти. Полные веса BF16 занимают около \~590 ГБ и должны находиться в VRAM (или быть выгружены). Планируйте 8×H100/H200, если вам нужна неограниченная пропускная способность; 4×A100 80GB работают с offload и более короткими контекстами.
{% endhint %}

| Компонент | Минимум (Q4 GGUF, offload)   | Рекомендуется (BF16, TP) | Полный BF16 (production)   |
| --------- | ---------------------------- | ------------------------ | -------------------------- |
| VRAM GPU  | \~80GB + offload в 256GB RAM | 4× A100 80GB (320GB)     | 8× H100 80GB или 8× H20-3e |
| ОЗУ       | 256 ГБ                       | 384GB                    | 512 ГБ                     |
| Диск      | 700GB NVMe                   | 1TB NVMe                 | 1,5 ТБ NVMe                |
| CUDA      | 12.8+                        | 12.8+                    | 12.8+                      |
| Драйвер   | 550+                         | 550+                     | 560+                       |

**Соответствие железу:** Для большинства команд, **4× A100 80GB** с BF16 tensor-parallel и `--max-model-len 65536` — это оптимальный вариант ([голое железо](https://clore.ai/bare-metal)). Если вам нужен полный контекст 256K с одновременными пользователями, переходите на 8× H100.

***

## Вариант A — Ollama / GGUF (квантизированные, сборки сообщества)

{% hint style="warning" %}
**Внимание:** Hy3 Preview совсем новый (13 апреля 2026 года) и использует кастомную архитектуру MoE. Поддержка community llama.cpp / GGUF обычно появляется **через 2–4 недели** после релиза. Если вам нужно это сегодня, используйте vLLM (Вариант B). Проверьте [huggingface.co/models?search=hy3-preview+gguf](https://huggingface.co/models?search=hy3-preview+gguf) на наличие community quant-версий перед загрузкой.
{% endhint %}

```bash
# Когда будет опубликована сборка Q4_K_M
docker exec ollama ollama pull hy3-preview:q4_K_M
docker exec ollama ollama run hy3-preview:q4_K_M

# Или с llama.cpp напрямую на community GGUF
docker run --gpus all -it --rm -p 8080:8080 \\
  -v $(pwd)/models:/models \\
  ghcr.io/ggerganov/llama.cpp:server-cuda \\
  -m /models/hy3-preview-q4_k_m.gguf \
  --n-gpu-layers 80 --ctx-size 32768 \
  --port 8080 --host 0.0.0.0
```

До появления GGUF AngelSlim (собственный инструмент Tencent для квантизации) может напрямую создавать веса W4A16 / W8A8 из BF16-чекпойнта.

***

## Вариант B — vLLM (production API, рекомендуется)

vLLM — это основной целевой сервер Tencent для Hy3 Preview. Слой MTP speculative decoding подключается через `--speculative-config.method mtp`.

```yaml
version: "3.8"
services:
  vllm:
    image: vllm/vllm-openai:latest
    ports:
      - "8000:8000"
    volumes:
      - hf_cache:/root/.cache/huggingface
    command: >
      --model tencent/Hy3-preview
      --tensor-parallel-size 8
      --max-model-len 65536
      --gpu-memory-utilization 0.90
      --speculative-config.method mtp
      --speculative-config.num_speculative_tokens 1
      --tool-call-parser hy_v3
      --reasoning-parser hy_v3
      --enable-auto-tool-choice
      --served-model-name hy3-preview
      --trust-remote-code
    deploy:
      resources:
        reservations:
          devices:
            - driver: nvidia
              count: all
              capabilities: [gpu]
    shm_size: "16gb"

volumes:
  hf_cache:
```

```bash
# Проверьте API с высоким уровнем reasoning
curl http://localhost:8000/v1/chat/completions \\
  -H "Content-Type: application/json" \\
  -d '{
    "model": "hy3-preview",
    "messages": [
      {"role": "system", "content": "Вы — экспертный инженер-программист."},
      {"role": "user", "content": "Рефакторьте эту функцию Python, чтобы использовать async/await, и добавьте корректную обработку ошибок."}
    ],
    "max_tokens": 4096,
    "temperature": 0.9,
    "top_p": 1.0,
    "reasoning_effort": "high"
  }'
```

{% hint style="info" %}
**Режимы рассуждения.** Установите `reasoning_effort: "high"` для включения трасс chain-of-thought (медленнее, намного лучше для математики/кода/задач агента) или `"no_think"` для быстрых прямых ответов. Рекомендуемая вендором выборка — `temperature=0.9, top_p=1.0` — выборка с нулевой температурой может ломать цепочки рассуждений.
{% endhint %}

{% hint style="info" %}
**Мало GPU?** Понизьте до `--tensor-parallel-size 4` на 4× A100 80GB. Держите `--max-model-len 32768` и добавьте `--enable-chunked-prefill` чтобы сохранить разумную задержку prefill.
{% endhint %}

***

## Вариант C — SGLang

SGLang поддерживает это с первого дня и сочетает слой MTP с EAGLE speculative decoding для дополнительной пропускной способности на Hopper.

```bash
docker pull lmsysorg/sglang:latest

python3 -m sglang.launch_server \
  --model tencent/Hy3-preview \
  --tp 8 \
  --tool-call-parser hunyuan \
  --reasoning-parser hunyuan \
  --speculative-algorithm EAGLE \
  --speculative-num-steps 1 \
  --speculative-eagle-topk 1 \
  --speculative-num-draft-tokens 2 \
  --mem-fraction-static 0.88 \
  --context-length 65536 \
  --served-model-name hy3-preview
```

Ожидайте увеличения пропускной способности на 1.5–2× в длинных агентных циклах по сравнению с обычным decode.

***

## Рекомендации по GPU для Clore.ai

| Конфигурация   | VRAM     | Ожидаемая производительность                    | Стоимость на Clore.ai                       | Аренда                                            |
| -------------- | -------- | ----------------------------------------------- | ------------------------------------------- | ------------------------------------------------- |
| 4× A100 80GB   | 320 ГБ   | BF16 sharded, контекст 64K, \~15–25 ток/с       | [голое железо](https://clore.ai/bare-metal) | [Выделенное железо](https://clore.ai/bare-metal)  |
| 2× H100 80GB   | 160 ГБ   | BF16 с offload, меньший контекст, \~12–20 ток/с | \~$2.08/ч                                   | [Арендуйте H100](https://clore.ai/rent-h100.html) |
| 8× H100 80 ГБ  | 640 ГБ   | Полный BF16, контекст 256K, 60+ ток/с с MTP     | \~$8.32/ч                                   | [Арендуйте H100](https://clore.ai/rent-h100.html) |
| 8× H200 141 ГБ | 1,128 ГБ | Полный BF16 + максимальная параллельность       | [голое железо](https://clore.ai/bare-metal) | [Выделенное железо](https://clore.ai/bare-metal)  |
| 1× RTX 5090    | 32GB     | Q4 GGUF, offload в RAM, один пользователь       | $0.25–0.77/ч                                | [Маркетплейс](https://clore.ai/marketplace)       |

{% hint style="success" %}
**Лучшее соответствие:** 4× A100 80GB с BF16 tensor-parallel и окном контекста 64K, доступные как [голое железо](https://clore.ai/bare-metal) а не как аренда на маркетплейсе. Вы получаете open-weight агентный кодер класса 295B примерно по цене подписки Claude Pro, и веса никогда не покидают ваш арендованный сервер.
{% endhint %}

***

## Сценарии использования

* **Автономные SWE-агенты** — 74.4% SWE-bench Verified (по заявлению вендора) и явная настройка для длинных циклов вызова инструментов; используйте вместе с OpenHands, SWE-agent или Aider
* **Агенты, управляемые терминалом** — 54.4% на Terminal-Bench 2.0 ставят его в верхний эшелон для shell/CLI рабочих процессов
* **Долгосрочное рассуждение** — математика уровня олимпиад (IMOAnswerBench, FrontierScience-Olympiad) и STEM уровня PhD
* **RAG на масштабе кодовой базы** — контекст 256K помещает целый репозиторий среднего размера плюс тесты в один промпт
* **Агенты поиска и веб-обхода** — настройка BrowseComp / WideSearch делает его сильным планировщиком для многошагового веб-исследования
* **Агент из агентов** — используйте Hy3 Preview как планировщик и более лёгкие open models ([Qwen3.5](/guides/guides_v2-ru/yazykovye-modeli/qwen35.md), [GLM-4.7 Flash](/guides/guides_v2-ru/yazykovye-modeli/glm-47-flash.md)) в качестве исполнителей

***

## Бенчмарки

{% hint style="warning" %}
**Утверждения вендора — проверяйте независимо.** Все числа ниже взяты из model card Tencent от 13 апреля 2026 года. Независимые воспроизведения (особенно на SWE-bench Verified) всё ещё появляются. Считайте их верхними пределами, пока LMSYS / OpenCompass не подтвердят.
{% endhint %}

| Бенчмарк           | Hy3 Preview | GLM-5.1 | DeepSeek R1 | GPT-5.4 |
| ------------------ | ----------- | ------- | ----------- | ------- |
| SWE-bench Verified | **74.4%**   | \~79%   | \~71%       | \~78%   |
| Terminal-Bench 2.0 | **54.4%**   | —       | —           | —       |
| GPQA Diamond       | **87.2%**   | —       | \~84%       | \~88%   |
| SuperGPQA          | 51.6%       | —       | —           | —       |
| HLE                | \~30        | —       | —           | —       |

Tencent также сообщает о сильных результатах на проприетарных бенчмарках CL-bench / CL-bench-Life по обучению на контексте и на экзамене Tsinghua Qiuzhen Math PhD (весна 2026).

***

## Устранение неполадок

| Проблема                               | Решение                                                                                                                                                                |
| -------------------------------------- | ---------------------------------------------------------------------------------------------------------------------------------------------------------------------- |
| `OutOfMemoryError` при загрузке        | BF16 требует около \~590 ГБ общей VRAM. Переходите на 4×A100 с `--max-model-len 32768` или используйте кванты AngelSlim W4A16.                                         |
| Медленная загрузка с HuggingFace       | Используйте `huggingface-cli download tencent/Hy3-preview --local-dir ./weights --resume-download`. Ожидайте 590GB+.                                                   |
| Вызовы инструментов тихо отбрасываются | Убедитесь, что `--tool-call-parser hy_v3` (vLLM) или `--tool-call-parser hunyuan` (SGLang) установлен, и `--enable-auto-tool-choice` включён.                          |
| Пустая / неверная reasoning-трасса     | Используйте `temperature=0.9, top_p=1.0`. Жадное декодирование с нулевой температурой ломает chain-of-thought. Проверьте `reasoning_effort: "high"`.                   |
| Ошибки MTP speculative decoding        | Требуется свежая версия vLLM (сборка после апреля 2026). Запустите `pip install -U vllm --pre` или закрепите версию на теге, где в примечаниях к релизу указан `mtp` . |
| OOM при контексте 256K                 | Начните с `--max-model-len 32768`, включите `--enable-chunked-prefill`, увеличивайте постепенно. Для полного 256K реалистично нужно 8× H200.                           |
| Кастомная архитектура отклонена        | Всегда передавайте `--trust-remote-code`. Hy3 поставляется с кастомным кодом моделирования вместе с checkpoint.                                                        |
| Ollama / GGUF недоступны               | Community quants обычно появляются через 2–4 недели после релиза. Пока используйте vLLM или AngelSlim.                                                                 |

***

## Дальнейшие шаги

* **Ближайший open-weight аналог:** [GLM-5.1](/guides/guides_v2-ru/yazykovye-modeli/glm-5-1.md) — MoE 744B / 40B-active, лицензия MIT, лучшие оценки SWE-bench Pro
* **Мультимодальная альтернатива:** [Qwen3.5-Omni](/guides/guides_v2-ru/yazykovye-modeli/qwen35-omni.md) — текст + аудио + изображение + видео, работает на одной RTX 4090
* **Альтернатива только для рассуждения:** [DeepSeek R1](/guides/guides_v2-ru/yazykovye-modeli/deepseek-r1.md) — специализированная модель для чистого длинного reasoning
* **Арендуйте железо:** [A100 80GB как bare metal](https://clore.ai/bare-metal) — инстансы 4× A100 80GB от [голое железо](https://clore.ai/bare-metal)
* **Полный маркетплейс:** [clore.ai/marketplace](https://clore.ai/marketplace) — H100, H200, A100, RTX 5090 от $0.25–0.77/ч

### Ссылки

* [Hy3 Preview на HuggingFace](https://huggingface.co/tencent/Hy3-preview)
* [GitHub-репозиторий Hy3 Preview](https://github.com/Tencent-Hunyuan/Hy3-preview)
* [Организация Tencent Hunyuan](https://huggingface.co/tencent)
* [Документация vLLM](https://docs.vllm.ai)
* [Репозиторий SGLang](https://github.com/sgl-project/sglang)
* [AngelSlim — инструмент Tencent для квантизации](https://github.com/Tencent/AngelSlim)


---

# Agent Instructions
This documentation is published with GitBook. GitBook is the documentation platform designed so that both humans and AI agents can read, navigate, and reason over technical content effectively. Learn more at gitbook.com.

## Querying This Documentation
If you need additional information that is not directly available in this page, you can query the documentation dynamically by asking a question.

Perform an HTTP GET request on the current page URL with the `ask` query parameter, and the optional `goal` query parameter:

```
GET https://docs.clore.ai/guides/guides_v2-ru/yazykovye-modeli/hy3-preview.md?ask=<question>&goal=<endgoal>
```

`ask` is the immediate question: it should be specific, self-contained, and written in natural language.
`goal` is optional and describes the broader end goal you are ultimately trying to accomplish on behalf of the user. GitBook uses it to tailor the answer towards what is most useful for that goal.

The response will contain a direct answer to the question and relevant excerpts and sources from the documentation.

Use this mechanism when the answer is not explicitly present in the current page, you need clarification or additional context, or you want to retrieve related documentation sections.
