GPUИндекс

28 июля 2026 г.

Kimi K3 из России: как пользоваться, API и цены

Коротко

Kimi K3 - флагман Moonshot AI: ~2.8T параметров (MoE), native vision, контекст 1M. Из России подключаешь через API-агрегаторы с оплатой в рублях, без VPN. Актуальные цены на странице модели; self-host на GPU - /modeli/kimi-k3.

Kimi K3 в России: варианты доступа

  1. API-агрегатор - основной путь. Один ключ, модель kimi-k3 / moonshotai/kimi-k3, рубли, OpenAI-совместимый endpoint.
  2. Официальный Kimi API / kimi.com - прямой канал Moonshot. Условия оплаты и доступности из РФ другие; для большинства команд агрегатор проще.
  3. Self-host - открытые веса, но нужен multi-node кластер (ориентир Moonshot: 64+ ускорителей, порядка ~1.4 ТБ VRAM в MXFP4). На одной H100/H200 не встанет.

Как пользоваться через API

Схема как у ChatGPT API: меняешь base_url и имя модели.

Где взять ключ (есть оффер K3 в каталоге): RouterAI, Polza AI, RouterAPI, AITUNNEL. Общий обзор: агрегаторы нейросетей, API без VPN.

Код: разбор SQL

from openai import OpenAI

client = OpenAI(
    api_key="ключ-агрегатора",
    base_url="https://API_ХОСТ_АГРЕГАТОРА/v1",  # из доки провайдера
)

sql = """
SELECT u.id, u.email, COUNT(o.id) AS orders
FROM users u
LEFT JOIN orders o ON o.user_id = u.id
WHERE u.created_at > '2025-01-01'
GROUP BY u.id
ORDER BY orders DESC;
"""

resp = client.chat.completions.create(
    model="kimi-k3",  # или moonshotai/kimi-k3 - как у агрегатора
    messages=[
        {
            "role": "user",
            "content": (
                "PostgreSQL 16, таблица orders ~50M строк. "
                "Разбери план: какие индексы нужны, где sequential scan, "
                "как переписать запрос без потери смысла.\n\n" + sql
            ),
        }
    ],
)
print(resp.choices[0].message.content)

Код: vision (картинка + текст)

K3 принимает изображения нативно - удобно для скриншотов UI, ER-диаграмм, дашбордов.

import base64
from pathlib import Path
from openai import OpenAI

client = OpenAI(
    api_key="ключ-агрегатора",
    base_url="https://API_ХОСТ_АГРЕГАТОРА/v1",
)

img_b64 = base64.b64encode(Path("dashboard.png").read_bytes()).decode()

resp = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {
            "role": "user",
            "content": [
                {
                    "type": "text",
                    "text": (
                        "На скриншоте дашборд Metabase. "
                        "Найди аномалии по метрикам, предложи 3 SQL-проверки "
                        "и что поправить в визуализации."
                    ),
                },
                {
                    "type": "image_url",
                    "image_url": {
                        "url": f"data:image/png;base64,{img_b64}"
                    },
                },
            ],
        }
    ],
)
print(resp.choices[0].message.content)

Вместо base64 можно отдать публичный https://... в image_url.url, если агрегатор это принимает.

Практические замечания

  • Thinking effort. У K3 по умолчанию высокий режим рассуждений - ответы длиннее и дороже по output-токенам. Для простых задач урезай промпт и max_tokens.
  • Cache-read. У части агрегаторов (Polza, RouterAPI и др.) есть отдельный тариф на cache-hit: повторный префикс (система + длинный контекст) дешевле обычного входа. На агентных сессиях с одним и тем же репо/доками это главный рычаг экономии.
  • Контекст 1M - не повод слать весь монорепо в каждый запрос. Платишь за вход; держи в промпте только нужные файлы.
  • Vision - прокидывай multimodal только если провайдер явно поддерживает image input для kimi-k3.

Цены на Kimi K3 API

Актуальные цены обновляются автоматически на странице модели. У части агрегаторов есть отдельный тариф cache-read: повторный префикс на длинных сессиях дешевле полного входа.

Kimi K3 бесплатно

Тестовые кредиты у агрегаторов дают - хватает проверить ключ и пару запросов. На kimi.com есть ручной чат. Полноценного бесплатного API нет.

Self-host «бесплатен» только если железо уже своё; аренда кластера под K3 на малых объёмах дороже API. Для дешёвого массового трафика бери младшие модели или DeepSeek V4 Flash.

Kimi K3 vs GPT, Claude, DeepSeek

Цифры по тарифам - на страницах моделей в каталоге. Здесь только сценарии.

Берите K3, если...

  • Нужен длинный контекст до 1M и агентная работа по большому репо или пачке документов из РФ без иностранной карты.
  • Важен vision в том же чекпоинте - скриншоты UI, схемы, дашборды вместе с кодом/SQL.
  • Рассматриваешь self-host позже: веса открыты (Moonshot / Hugging Face moonshotai).

Берите DeepSeek, если...

  • Нужен максимум токенов за рубль: V4 Flash на черновики и высокий QPS, V4 Pro когда качество важнее Flash, но бюджет жёстче K3.
  • Self-host на меньшем железе: у DeepSeek есть дистилли и меньшие чекпоинты, их проще поднять, чем полный K3.

Берите Claude, если...

  • Уже зашит стек Anthropic (промпты, tool-calling, привычный стиль ответа) и менять модель дороже, чем платить за Claude через тот же агрегатор.
  • Нужен аккуратный код и длинные инструкции без ставки на open weights и 1M-vision пакет K3.

GPT-линейка - если продукт уже завязан на экосистему OpenAI. Подключение из РФ то же: агрегатор, см. API без VPN.

Kimi K3 локально и «скачать»

Веса открыты (релизы Moonshot / Hugging Face, организация moonshotai). «Скачать» = чекпоинт, не мобильное приложение.

  • Формат с QAT: MXFP4 → порядка ~1.4 ТБ только на веса.
  • Moonshot: supernode от 64 ускорителей.
  • Инференс: vLLM с Kimi Delta Attention (KDA).

Подбор карт: /modeli/kimi-k3. Аренда: /gpus.

Для чата на одной потребительской карте бери меньшие модели (Kimi K2.x, DeepSeek distill, T-lite/T-pro): российские LLM локально, запуск Llama/DeepSeek.

Куда дальше

Kimi K3 (Moonshot AI) из России подключают через API-агрегаторы с оплатой в рублях. Актуальные цены - на /llm-api/kimi-k3, требования к GPU для self-host - на /modeli/kimi-k3.