Аренда GPU кластера
GPU кластер это несколько карт в одном сервере: 2×, 4× или 8× H100, A100, RTX 4090. Суммарный VRAM складывается, карты связаны NVLink. Такие конфигурации нужны под модели, которые в одну карту не влезают.
Одна H100 это нода кластера, а не полный деплой. DeepSeek-V3, Llama 405B и Qwen 235B начинаются от двух-четырёх карт, крупные версии требуют 8×H100. Кластер берут на выделенном сервере или в облаке с полной картой.
Выделенные кластеры
Облачные кластеры
Полная карта в облачной ВМ (Passthrough), без шардинга. Удобнее для коротких прогонов, когда карты нужны на час.
Что такое GPU кластер
Кластер объединяет карты через NVLink или сеть. При инференсе vLLM раскладывает веса по картам, каждая считает свою часть, суммарная память складывается: 8×H100 это 640 ГБ VRAM.
NVLink важен: без него карты общаются по сети и коммуникация тормозит прогон. На одном узле NVLink идёт напрямую, между узлами нужен быстрый интерконнект.
Сколько карт нужно
Одна карта тянет модели до ~80 ГБ. Всё, что крупнее, требует кластер. Минимум под популярные модели:
| Модель | Минимум | Комфортно |
|---|---|---|
| DeepSeek-V3 | Суммарно, Q4/INT4 (~4× H100 80 ГБ) | 8×80 ГБ, FP8 |
| Llama 405B | Суммарно, Q4/AWQ (~4× H100 80 ГБ) | 8×80 ГБ, FP8 |
| Llama 4 Maverick | Суммарно, Q4/FP8 (~2× H100) | 4×80 ГБ |
| Qwen 235B | Суммарно, Q4/FP8 (~2× H100 80 ГБ) | 4×80 ГБ, запас под батч и контекст |
Выделенный или облачный
На выделенных серверах карты стоят в одном физическом узле с NVLink, без соседей на железе. Облачный Passthrough отдаёт полную карту в ВМ: деплой из панели за минуты, можно взять на час и масштабировать. vGPU для кластера не годится, там карта делится с другими арендаторами.
Аренда или покупка кластера
Покупка кластера на 8×H100 это миллионы рублей плюс электричество, охлаждение и обслуживание. Аренда: платите за конфигурацию в месяц или за час, карты обновляете под задачу и не думаете о железе.