5 июня 2026 г.
Запуск Llama и DeepSeek на арендованном GPU-сервере
Что понадобится
- GPU-сервер с 24–80 ГБ VRAM (RTX 4090, L40S, A100, см. каталог GPU)
- Ubuntu 22.04 с установленными драйверами NVIDIA и CUDA
- Доступ по SSH
Шаг 1. Аренда сервера
Возьмите почасовой инстанс у провайдера с быстрым запуском: Immers.cloud, HOSTKEY, Selectel или Timeweb Cloud. Для DeepSeek-R1 distill 32B хватит одной A100 80GB.
Шаг 2. Установка vLLM
pip install vllmШаг 3. Запуск сервера
vllm serve deepseek-ai/DeepSeek-R1-Distill-Qwen-32B \
--max-model-len 8192 --gpu-memory-utilization 0.92Шаг 4. Проверка
Эндпоинт совместим с OpenAI API:
curl http://localhost:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{"model":"deepseek-ai/DeepSeek-R1-Distill-Qwen-32B","messages":[{"role":"user","content":"Привет"}]}'Экономия
Не забывайте останавливать инстанс после работы, почасовая оплата считает каждый час простоя.