GPUИндекс

12 июля 2026 г.

Российские LLM локально: T-Pro, Vikhr, ruGPT-3.5 - что выбрать и как запустить

Карточки на сайте: T-pro, T-lite, Vikhr, ruGPT-3.5.

По VRAM

  • 6-12 ГБ - T-lite-it-2.1 в Q4 (~5 ГБ файл). RTX 3060 12GB хватает на чат и лёгкий RAG.
  • 16-24 ГБ - Vikhr-Nemo-12B в Q4 или T-lite без жёсткого кванта. На 4090 уже комфортно держать длинный контекст.
  • 24 ГБ и выше - T-pro-it-2.1 в Q4_K_M (файл ~19.8 ГБ). На 4090 влезает, на L40S 48GB / A100 - с запасом под батч и контекст 8-32k.
  • ruGPT-3.5-13B - Q4 от ~10 ГБ, но это другая эпоха моделей (см. ниже).

Цены на карты - в каталоге GPU. Почасовой инстанс лучше гасить после работы.

Бенчмарки

Цифры с карточек T-tech (декабрь 2025 / линейка 2.1). Ru Arena Hard - сложные русские диалоги; ruBFCL - вызов функций на русском; ruIFeval - следование инструкциям.

Класс ~8B (T-lite-it-2.1 vs база Qwen3-8B, режим без thinking):

  • Ru Arena Hard: 83.9 у T-lite против 57.2 у Qwen3-8B
  • ruBFCL: 56.5 против 52.6
  • ACEBench: 61.0 против 48.1
  • ruIFeval почти рядом: 75.9 vs 74.0 - тут выигрыш небольшой

Класс ~32-33B (T-pro-it-2.1 vs Qwen3-32B):

  • Ru Arena Hard: 93.8 против 87.3
  • ruBFCL: 66.0 против 57.3
  • ACEBench: 73.6 против 65.0
  • относительно T-pro-it-2.0 на ruIFeval: 80.7 против 69.3 (+9 п.п., как пишут авторы)

Итого: на русском диалоге и вызове инструментов линейка T- обгоняет одноразмерный Qwen3 по их же таблицам. На «просто следовать инструкции» разрыв меньше, чем на Arena Hard.

Vikhr-Nemo-12B своих цифр в том же формате на карточке не публикует в одной таблице с T-/Qwen. Авторы отдельно заявляют сильный RAG (в т.ч. режим с ролью documents и привязкой к id кусков) и сравнивают со своими инструктивными бенчмарками - смотри карточку Vikhrmodels. Для выбора между Vikhr и T-lite ориентируйся на задачу: 12B + длинный контекст (заявлен до 128k у Nemo-базы) vs 8B с официальными ruBFCL/Arena.

T-lite-it-2.1 - если памяти мало

~8B на Qwen3, русский токенизатор, из коробки умеет вызывать инструменты (у 1.0 этого не было).

Ollama:

curl -fsSL https://ollama.com/install.sh | sh
ollama run t-tech/T-lite-it-2.1:q4_K_M

API совместим с OpenAI (localhost:11434/v1):

curl http://localhost:11434/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "t-tech/T-lite-it-2.1:q4_K_M",
    "messages": [{"role":"user","content":"Кратко: что такое договор цессии?"}]
  }'

vLLM (как в карточке модели - с парсером инструментов):

pip install vllm
vllm serve t-tech/T-lite-it-2.1 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.90

Параметры генерации с карточки: temperature=0.7, top_p=0.8, top_k=20, presence_penalty=1.0.

T-pro-it-2.1 - когда 8B уже не тянет

~33B. Имеет смысл, если нужны жёсткие инструкции, многошаговый вызов функций, агенты. На 24 ГБ - только квант (Q4); BF16 без оффлоада - ближе к 64+ ГБ.

ollama run t-tech/T-pro-it-2.1:q4_K_M
vllm serve t-tech/T-pro-it-2.1 \
  --enable-auto-tool-choice \
  --tool-call-parser hermes \
  --max-model-len 8192 \
  --gpu-memory-utilization 0.92

GGUF официальный: t-tech/T-pro-it-2.1-GGUF. Q4_K_M ≈ 19.8 ГБ.

./llama-server -m T-pro-it-2.1-q4_k_m.gguf -c 8192 -ngl 99

Нативный контекст 32k; длиннее - через YaRN, как в карточке Qwen3/T-pro (для vLLM: --rope-scaling + больший --max-model-len).

Vikhr-Nemo-12B - средний размер, упор в RAG и диалог

Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24, база Mistral-Nemo. Не путать со старым Vikhr-7B на карточке сайта - для новых установок бери Nemo-12B.

ollama run rscr/vikhr_nemo_12b:Q4_K_M
vllm serve Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24 \
  --dtype half \
  --max-model-len 32000 \
  --gpu-memory-utilization 0.90

GGUF (сторонние кванты): например QuantFactory/Vikhr-Nemo-12B-Instruct-R-21-09-24-GGUF.

Если в пайплайне важна выдача с опорой на конкретные фрагменты базы (роль документов в шаблоне чата) - смотри примеры в README Vikhr; у T-lite/T-pro это решается обычным RAG снаружи, без их спец-роли.

ruGPT-3.5-13B - зачем она ещё лежит на диске

ai-forever/ruGPT-3.5-13B - continuation-модель (дописывает текст), не instruct-чат. Обучали на сотнях миллиардов токенов (V100/A100 эпохи 2023); perplexity по-русски у авторов ~8.8.

Про GigaChat: в карточке Hugging Face написано, что модель «использовалась при обучении GigaChat». На практике это одна из ранних/тестовых открытых баз того контура, а не «скачал ruGPT = получил локальный GigaChat». Веса GigaChat не открыты.

Имеет смысл, если:

  • уже висят LoRA/адаптеры именно под ruGPT
  • нужен именно режим «продолжи текст», а не диалог ассистента
  • воспроизводишь старый пайплайн или статью 2023-2024

Для нового чат-бота или агента - T-lite / T-pro / Vikhr: иначе придётся городить шаблоны вида «Вопрос: … Ответ: …» и ловить мусор на выходе. Сторонний GGUF: oblivious/ruGPT-3.5-13B-GGUF.

Что поставить на конкретной карте

  • RTX 3060 12GB / 4060 Ti 16GB - T-lite Q4
  • RTX 3090 / 4090 24GB - Vikhr-Nemo Q4 или T-pro Q4 (T-pro будет впритык по памяти + KV-кэш)
  • L40S 48GB - T-pro Q4/Q5 или Vikhr без жёсткого кванта, нормальный батч
  • A100/H100 40-80GB - T-pro BF16 или длинный контекст, несколько воркеров vLLM

Тот же стек для Llama/DeepSeek разобран отдельно: запуск на арендованном GPU.

Веса без интернета на сервере: скачай заранее с HF и передай локальный путь в vllm serve / llama-server.

Открытые модели t-tech (T-lite, T-pro), Vikhr-Nemo и ruGPT-3.5 запускаются через Ollama, vLLM или llama.cpp. На GPUIndex - карточки с ориентиром по VRAM и аренда GPU под инференс.