28 июля 2026 г.
Kimi K3 из России: как пользоваться, API и цены
Коротко
Kimi K3 - флагман Moonshot AI: ~2.8T параметров (MoE), native vision, контекст 1M. Из России подключаешь через API-агрегаторы с оплатой в рублях, без VPN. Актуальные цены на странице модели; self-host на GPU - /modeli/kimi-k3.
Kimi K3 в России: варианты доступа
- API-агрегатор - основной путь. Один ключ, модель
kimi-k3/moonshotai/kimi-k3, рубли, OpenAI-совместимый endpoint. - Официальный Kimi API / kimi.com - прямой канал Moonshot. Условия оплаты и доступности из РФ другие; для большинства команд агрегатор проще.
- Self-host - открытые веса, но нужен multi-node кластер (ориентир Moonshot: 64+ ускорителей, порядка ~1.4 ТБ VRAM в MXFP4). На одной H100/H200 не встанет.
Как пользоваться через API
Схема как у ChatGPT API: меняешь base_url и имя модели.
Где взять ключ (есть оффер K3 в каталоге): RouterAI, Polza AI, RouterAPI, AITUNNEL. Общий обзор: агрегаторы нейросетей, API без VPN.
Код: разбор SQL
from openai import OpenAI
client = OpenAI(
api_key="ключ-агрегатора",
base_url="https://API_ХОСТ_АГРЕГАТОРА/v1", # из доки провайдера
)
sql = """
SELECT u.id, u.email, COUNT(o.id) AS orders
FROM users u
LEFT JOIN orders o ON o.user_id = u.id
WHERE u.created_at > '2025-01-01'
GROUP BY u.id
ORDER BY orders DESC;
"""
resp = client.chat.completions.create(
model="kimi-k3", # или moonshotai/kimi-k3 - как у агрегатора
messages=[
{
"role": "user",
"content": (
"PostgreSQL 16, таблица orders ~50M строк. "
"Разбери план: какие индексы нужны, где sequential scan, "
"как переписать запрос без потери смысла.\n\n" + sql
),
}
],
)
print(resp.choices[0].message.content)Код: vision (картинка + текст)
K3 принимает изображения нативно - удобно для скриншотов UI, ER-диаграмм, дашбордов.
import base64
from pathlib import Path
from openai import OpenAI
client = OpenAI(
api_key="ключ-агрегатора",
base_url="https://API_ХОСТ_АГРЕГАТОРА/v1",
)
img_b64 = base64.b64encode(Path("dashboard.png").read_bytes()).decode()
resp = client.chat.completions.create(
model="kimi-k3",
messages=[
{
"role": "user",
"content": [
{
"type": "text",
"text": (
"На скриншоте дашборд Metabase. "
"Найди аномалии по метрикам, предложи 3 SQL-проверки "
"и что поправить в визуализации."
),
},
{
"type": "image_url",
"image_url": {
"url": f"data:image/png;base64,{img_b64}"
},
},
],
}
],
)
print(resp.choices[0].message.content)Вместо base64 можно отдать публичный https://... в image_url.url, если агрегатор это принимает.
Практические замечания
- Thinking effort. У K3 по умолчанию высокий режим рассуждений - ответы длиннее и дороже по output-токенам. Для простых задач урезай промпт и
max_tokens. - Cache-read. У части агрегаторов (Polza, RouterAPI и др.) есть отдельный тариф на cache-hit: повторный префикс (система + длинный контекст) дешевле обычного входа. На агентных сессиях с одним и тем же репо/доками это главный рычаг экономии.
- Контекст 1M - не повод слать весь монорепо в каждый запрос. Платишь за вход; держи в промпте только нужные файлы.
- Vision - прокидывай multimodal только если провайдер явно поддерживает image input для
kimi-k3.
Цены на Kimi K3 API
Актуальные цены обновляются автоматически на странице модели. У части агрегаторов есть отдельный тариф cache-read: повторный префикс на длинных сессиях дешевле полного входа.
Kimi K3 бесплатно
Тестовые кредиты у агрегаторов дают - хватает проверить ключ и пару запросов. На kimi.com есть ручной чат. Полноценного бесплатного API нет.
Self-host «бесплатен» только если железо уже своё; аренда кластера под K3 на малых объёмах дороже API. Для дешёвого массового трафика бери младшие модели или DeepSeek V4 Flash.
Kimi K3 vs GPT, Claude, DeepSeek
Цифры по тарифам - на страницах моделей в каталоге. Здесь только сценарии.
Берите K3, если...
- Нужен длинный контекст до 1M и агентная работа по большому репо или пачке документов из РФ без иностранной карты.
- Важен vision в том же чекпоинте - скриншоты UI, схемы, дашборды вместе с кодом/SQL.
- Рассматриваешь self-host позже: веса открыты (Moonshot / Hugging Face
moonshotai).
Берите DeepSeek, если...
- Нужен максимум токенов за рубль: V4 Flash на черновики и высокий QPS, V4 Pro когда качество важнее Flash, но бюджет жёстче K3.
- Self-host на меньшем железе: у DeepSeek есть дистилли и меньшие чекпоинты, их проще поднять, чем полный K3.
Берите Claude, если...
- Уже зашит стек Anthropic (промпты, tool-calling, привычный стиль ответа) и менять модель дороже, чем платить за Claude через тот же агрегатор.
- Нужен аккуратный код и длинные инструкции без ставки на open weights и 1M-vision пакет K3.
GPT-линейка - если продукт уже завязан на экосистему OpenAI. Подключение из РФ то же: агрегатор, см. API без VPN.
Kimi K3 локально и «скачать»
Веса открыты (релизы Moonshot / Hugging Face, организация moonshotai). «Скачать» = чекпоинт, не мобильное приложение.
- Формат с QAT: MXFP4 → порядка ~1.4 ТБ только на веса.
- Moonshot: supernode от 64 ускорителей.
- Инференс: vLLM с Kimi Delta Attention (KDA).
Подбор карт: /modeli/kimi-k3. Аренда: /gpus.
Для чата на одной потребительской карте бери меньшие модели (Kimi K2.x, DeepSeek distill, T-lite/T-pro): российские LLM локально, запуск Llama/DeepSeek.
Куда дальше
Kimi K3 (Moonshot AI) из России подключают через API-агрегаторы с оплатой в рублях. Актуальные цены - на /llm-api/kimi-k3, требования к GPU для self-host - на /modeli/kimi-k3.