32 vCPU / 32 ГБ RAM · Россия
Выделенный сервер с 4×NVIDIA H100
от 986 100 ₽/мес· от 246 525 ₽/мес за карту
Выберите GPU
| GPU | vCPU / RAM | Страна | ||
|---|---|---|---|---|
NVIDIA H100 1Dedic 80 ГБ × 4 = 320 ГБ | 32 vCPU / 32 ГБ RAM | Россия | 986 100 ₽/мес ≈ 246 525 ₽/мес / карта | Перейти → |
Почему NVIDIA H100 на 4 GPU
4 карты H100, оптимум для полного файнтюнинга моделей класса 70B в FP16: суммарные 320 ГБ вмещают модель целиком, без квантизации, но без переплаты за лишние карты. Конфигурация даёт tensor parallelism, оставаясь заметно доступнее 8-карточной машины. В Dedicated-режиме весь сервер работает только на вашу задачу, без vGPU-шардинга и соседей. На 4 картах спокойно живут длинные обучения и продакшн-инференс: тарифы у 1Dedic от 986 100 ₽/мес.
Несколько карт и суммарная память
4×80 ГБ, это не карта на 320 ГБ: суммарная память складывается из четырёх ускорителей. Если карты связаны NVLink, tensor parallelism гоняет данные по быстрым межкарточным каналам (до 900 ГБ/с у H100 SXM), и модель распределяется практически без потерь относительно единого GPU. Если связь только по PCIe, суммарные 320 ГБ всё равно образуют общий пул, но обмен данными медленнее, и масштабирование хуже. Поэтому у 4 карт прирост — в первую очередь по объёму памяти, а скорость зависит от того, как карты связаны у конкретного провайдера.
Что помещается в эту конфигурацию
В 320 ГБ суммарного VRAM помещается полный файнтюнинг моделей класса 70B в FP16, с запасом под батч и контекст. Для инференса это несколько крупных моделей сразу или 70B-класс с длинным контекстом. Это граница, где конфигурация ещё в «человеческом» бюджете, но уже даёт полноценное обучение большой модели без обрезки весов.
Альтернативы
Если 70B помещается в FP16 и батчи умеренные, 4 карты оптимальны: от 986 100 ₽/мес против 1 785 400 ₽/мес за 8 карт. Две карты (160 ГБ) дешевле, от 522 300 ₽/мес, но это уже инференс 70B в 4-бит или файнтюнинг до 34B, а не полный FP16. Если нужны крупные батчи, длинный контекст или несколько моделей одновременно, смотрите 8×H100. Для коротких задач и доли карты подойдёт vGPU: дешевле, но с делением VRAM и соседями по производительности.