32 vCPU / 32 ГБ RAM · Россия
Выделенный сервер с 2×NVIDIA L40
от 190 900 ₽/мес· от 95 450 ₽/мес за карту
Выберите GPU
128 vCPU / 1024 ГБ RAM · Россия
Почему NVIDIA L40 на 2 GPU
2 карты L40, это 96 ГБ суммарного VRAM: конфигурация, где начинается класс «30–34B в FP16» без перехода во флагманский ценник. L40, универсальная карта Ada для инференса и рендера, а связка из двух снимает ограничение одной карты в 48 ГБ. В Dedicated-режиме обе карты работают только на вас: длинные инференсы и рендер не замедляются соседями. Тариф у 1Dedic, Yandex Cloud, 190 900 ₽/мес.
Несколько карт и суммарная память
У L40 нет NVLink: карты общаются по шине PCIe. Две карты всё равно работают как multi-GPU, модель распределяется через tensor parallelism, но обмен данными идёт по PCIe, что медленнее выделенного межкарточного канала. Суммарные 96 ГБ складываются в общий пул памяти, но из-за медленного обмена масштабирование на L40 эффективнее в инференсе, чем в интенсивном обучении. Для такой связки это нормальный рабочий сценарий, просто без аппаратного ускорения обмена.
Что помещается в эту конфигурацию
96 ГБ суммарного VRAM, инференс и файнтюнинг моделей 30–34B в FP16 и до 70B в 4-битной квантизации, с запасом под батч и контекст. Генерация изображений и рендер с большими сценами тоже комфортны. Одна L40 (48 ГБ) держит 34B в FP16 впритык, а две карты добавляют запас по памяти. Связка работает через PCIe, поэтому прирост в основном по объёму, а не по скорости обмена.
Альтернативы
Если модель влезает в 48 ГБ, одна L40 дешевле (от 124 700 ₽/мес) и проще. Две карты берут, когда не хватает памяти под батч и контекст. Сравнение с соседями: 2×L40 (96 ГБ, 190 900 ₽/мес) против 2×L40S (96 ГБ, от 199 000 ₽/мес), L40S быстрее в ИИ-задачах за счёт FP8, но дороже. Если важнее цена за объём, 4×L4 (96 ГБ) дают тот же объём почти в полтора раза дешевле. Хотя L40 и L40S без NVLink, у обеих связка через PCIe.