GPUИндекс

5 июня 2026 г.

Запуск Llama и DeepSeek на арендованном GPU-сервере

Что понадобится

  • GPU-сервер с 24–80 ГБ VRAM (RTX 4090, L40S, A100, см. каталог GPU)
  • Ubuntu 22.04 с установленными драйверами NVIDIA и CUDA
  • Доступ по SSH

Шаг 1. Аренда сервера

Возьмите почасовой инстанс у провайдера с быстрым запуском: Immers.cloud, HOSTKEY, Selectel или Timeweb Cloud. Для DeepSeek-R1 distill 32B хватит одной A100 80GB.

Шаг 2. Установка vLLM

pip install vllm

Шаг 3. Запуск сервера

vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
  --max-model-len 8192 --gpu-memory-utilization 0.92

Шаг 4. Проверка

Эндпоинт совместим с OpenAI API:

curl http://localhost:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{"model":"deepseek-ai/DeepSeek-R1-Distill-Qwen-32B","messages":[{"role":"user","content":"Привет"}]}'

Экономия

Не забывайте останавливать инстанс после работы, почасовая оплата считает каждый час простоя.