GPUИндекс
LLM

GPU для Kimi K3

Kimi K3 - открытая frontier-модель Moonshot AI (2.8T параметров, Stable LatentMoE: 16 из 896 экспертов), с Kimi Delta Attention, native vision и окном 1M токенов. Веса в MXFP4; Moonshot рекомендует деплой на supernode от 64 ускорителей. Для продакшна обычно vLLM с KDA; альтернатива - API у агрегаторов без своего кластера.

Требования к VRAM

1400 ГБ
Минимум
Суммарно, MXFP4 (~18× H100 80 ГБ)
5120 ГБ
Рекомендуется
64×80 ГБ, supernode Moonshot

Нода GPU от

133,20 ₽/час

цена одной карты ≥ 80 ГБ

API от

299,58 ₽/1M

без своего сервера · у агрегаторов

Суммарно мин.
1400 ГБ
Рекомендуется
5120 ГБ
Ноды ≥ 80 ГБ
7
Сайт проекта →

Ноды кластера под Kimi K3

7 видеокарт ≥ 80 ГБ. Полный деплой - суммарно от 1400 ГБ (~18× нод по 80 ГБ).

Все GPU →
RTX 6000 PROФлагманский класс GPU
96 ГБGDDR7
от 133,20 ₽/час
≈ 97 236 ₽ / мес
32 предложения
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене3D, рендер и видеомонтаж
A100 80GBФлагманский класс GPU
80 ГБHBM2e
от 185,00 ₽/час
≈ 135 050 ₽ / мес
50 предложений
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене
H100Флагманский класс GPU
80 ГБHBM3
от 242,00 ₽/час
≈ 176 660 ₽ / мес
47 предложений
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене
H100 NVLФлагманский класс GPU
94 ГБHBM3
от 364,74 ₽/час
≈ 266 257 ₽ / мес
4 предложения
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене
H200Флагманский класс GPU
141 ГБHBM3e
от 375,00 ₽/час
≈ 273 750 ₽ / мес
22 предложения
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене
B200Флагманский класс GPU
180 ГБHBM3e
от 842,16 ₽/час
≈ 614 777 ₽ / мес
3 предложения
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене
B300Флагманский класс GPU
288 ГБHBM3e
от 941,78 ₽/час
≈ 687 500 ₽ / мес
4 предложения
Обучение моделей с нуляФайнтюнинг и LoRAИнференс и API в продакшене

Без своего сервера - через API агрегаторов

Альтернатива аренде GPU: готовый API с оплатой в рублях

Все LLM API →

Kimi K3

от 299,58 ₽/1M за вход

Частые вопросы

Сколько VRAM нужно для Kimi K3?+
Все 2.8T параметров должны лежать в памяти (MoE не уменьшает вес чекпоинта). В MXFP4 это порядка ~1.4 ТБ суммарной VRAM (~18× H100 80 ГБ). Moonshot для нормального throughput рекомендует supernode от 64 ускорителей (~5.1 ТБ при 80 ГБ на карту). Одна H100/H200 - нода кластера, не полный деплой.
Как запустить Kimi K3 на арендованном GPU?+
Собери multi-node кластер (H100/H200/B200) с быстрой связью на суммарные ≥1.4 ТБ VRAM. Инференс через vLLM с Kimi Delta Attention. Для старта без железа - API: /llm-api/kimi-k3.
Kimi K3 или API-агрегатор?+
Self-host имеет смысл при огромном объёме и контроле данных. Иначе дешевле и проще API у российских агрегаторов с оплатой в рублях - цены на /llm-api/kimi-k3.
Чем Kimi K3 отличается от Kimi K2?+
K3 крупнее (2.8T vs линейка K2), нативная мультимодальность, контекст 1M, архитектура KDA + AttnRes и MXFP4 QAT. K2/K2.5/K2.6 легче поднять на меньшем железе; K3 - кластерный frontier.

Похожие инструменты