12 июля 2026 г.
Российские LLM локально: T-Pro, Vikhr, ruGPT-3.5 - что выбрать и как запустить
Карточки на сайте: T-pro, T-lite, Vikhr, ruGPT-3.5.
По VRAM
- 6-12 ГБ - T-lite-it-2.1 в Q4 (~5 ГБ файл). RTX 3060 12GB хватает на чат и лёгкий RAG.
- 16-24 ГБ - Vikhr-Nemo-12B в Q4 или T-lite без жёсткого кванта. На 4090 уже комфортно держать длинный контекст.
- 24 ГБ и выше - T-pro-it-2.1 в Q4_K_M (файл ~19.8 ГБ). На 4090 влезает, на L40S 48GB / A100 - с запасом под батч и контекст 8-32k.
- ruGPT-3.5-13B - Q4 от ~10 ГБ, но это другая эпоха моделей (см. ниже).
Цены на карты - в каталоге GPU. Почасовой инстанс лучше гасить после работы.
Бенчмарки
Цифры с карточек T-tech (декабрь 2025 / линейка 2.1). Ru Arena Hard - сложные русские диалоги; ruBFCL - вызов функций на русском; ruIFeval - следование инструкциям.
Класс ~8B (T-lite-it-2.1 vs база Qwen3-8B, режим без thinking):
- Ru Arena Hard: 83.9 у T-lite против 57.2 у Qwen3-8B
- ruBFCL: 56.5 против 52.6
- ACEBench: 61.0 против 48.1
- ruIFeval почти рядом: 75.9 vs 74.0 - тут выигрыш небольшой
Класс ~32-33B (T-pro-it-2.1 vs Qwen3-32B):
- Ru Arena Hard: 93.8 против 87.3
- ruBFCL: 66.0 против 57.3
- ACEBench: 73.6 против 65.0
- относительно T-pro-it-2.0 на ruIFeval: 80.7 против 69.3 (+9 п.п., как пишут авторы)
Итого: на русском диалоге и вызове инструментов линейка T- обгоняет одноразмерный Qwen3 по их же таблицам. На «просто следовать инструкции» разрыв меньше, чем на Arena Hard.
Vikhr-Nemo-12B своих цифр в том же формате на карточке не публикует в одной таблице с T-/Qwen. Авторы отдельно заявляют сильный RAG (в т.ч. режим с ролью documents и привязкой к id кусков) и сравнивают со своими инструктивными бенчмарками - смотри карточку Vikhrmodels. Для выбора между Vikhr и T-lite ориентируйся на задачу: 12B + длинный контекст (заявлен до 128k у Nemo-базы) vs 8B с официальными ruBFCL/Arena.
T-lite-it-2.1 - если памяти мало
~8B на Qwen3, русский токенизатор, из коробки умеет вызывать инструменты (у 1.0 этого не было).
Ollama:
curl -fsSL https://ollama.com/install.sh | sh
ollama run t-tech/T-lite-it-2.1:q4_K_MAPI совместим с OpenAI (localhost:11434/v1):
curl http://localhost:11434/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "t-tech/T-lite-it-2.1:q4_K_M",
"messages": [{"role":"user","content":"Кратко: что такое договор цессии?"}]
}'vLLM (как в карточке модели - с парсером инструментов):
pip install vllm
vllm serve t-tech/T-lite-it-2.1 \
--enable-auto-tool-choice \
--tool-call-parser hermes \
--max-model-len 8192 \
--gpu-memory-utilization 0.90Параметры генерации с карточки: temperature=0.7, top_p=0.8, top_k=20, presence_penalty=1.0.
T-pro-it-2.1 - когда 8B уже не тянет
~33B. Имеет смысл, если нужны жёсткие инструкции, многошаговый вызов функций, агенты. На 24 ГБ - только квант (Q4); BF16 без оффлоада - ближе к 64+ ГБ.
ollama run t-tech/T-pro-it-2.1:q4_K_Mvllm serve t-tech/T-pro-it-2.1 \
--enable-auto-tool-choice \
--tool-call-parser hermes \
--max-model-len 8192 \
--gpu-memory-utilization 0.92GGUF официальный: t-tech/T-pro-it-2.1-GGUF. Q4_K_M ≈ 19.8 ГБ.
./llama-server -m T-pro-it-2.1-q4_k_m.gguf -c 8192 -ngl 99Нативный контекст 32k; длиннее - через YaRN, как в карточке Qwen3/T-pro (для vLLM: --rope-scaling + больший --max-model-len).
Vikhr-Nemo-12B - средний размер, упор в RAG и диалог
Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24, база Mistral-Nemo. Не путать со старым Vikhr-7B на карточке сайта - для новых установок бери Nemo-12B.
ollama run rscr/vikhr_nemo_12b:Q4_K_Mvllm serve Vikhrmodels/Vikhr-Nemo-12B-Instruct-R-21-09-24 \
--dtype half \
--max-model-len 32000 \
--gpu-memory-utilization 0.90GGUF (сторонние кванты): например QuantFactory/Vikhr-Nemo-12B-Instruct-R-21-09-24-GGUF.
Если в пайплайне важна выдача с опорой на конкретные фрагменты базы (роль документов в шаблоне чата) - смотри примеры в README Vikhr; у T-lite/T-pro это решается обычным RAG снаружи, без их спец-роли.
ruGPT-3.5-13B - зачем она ещё лежит на диске
ai-forever/ruGPT-3.5-13B - continuation-модель (дописывает текст), не instruct-чат. Обучали на сотнях миллиардов токенов (V100/A100 эпохи 2023); perplexity по-русски у авторов ~8.8.
Про GigaChat: в карточке Hugging Face написано, что модель «использовалась при обучении GigaChat». На практике это одна из ранних/тестовых открытых баз того контура, а не «скачал ruGPT = получил локальный GigaChat». Веса GigaChat не открыты.
Имеет смысл, если:
- уже висят LoRA/адаптеры именно под ruGPT
- нужен именно режим «продолжи текст», а не диалог ассистента
- воспроизводишь старый пайплайн или статью 2023-2024
Для нового чат-бота или агента - T-lite / T-pro / Vikhr: иначе придётся городить шаблоны вида «Вопрос: … Ответ: …» и ловить мусор на выходе. Сторонний GGUF: oblivious/ruGPT-3.5-13B-GGUF.
Что поставить на конкретной карте
- RTX 3060 12GB / 4060 Ti 16GB - T-lite Q4
- RTX 3090 / 4090 24GB - Vikhr-Nemo Q4 или T-pro Q4 (T-pro будет впритык по памяти + KV-кэш)
- L40S 48GB - T-pro Q4/Q5 или Vikhr без жёсткого кванта, нормальный батч
- A100/H100 40-80GB - T-pro BF16 или длинный контекст, несколько воркеров vLLM
Тот же стек для Llama/DeepSeek разобран отдельно: запуск на арендованном GPU.
Веса без интернета на сервере: скачай заранее с HF и передай локальный путь в vllm serve / llama-server.
Открытые модели t-tech (T-lite, T-pro), Vikhr-Nemo и ruGPT-3.5 запускаются через Ollama, vLLM или llama.cpp. На GPUIndex - карточки с ориентиром по VRAM и аренда GPU под инференс.