К содержимому
пилотная партия · РФпроверяю узлы…

Российская GPU‑инфра­структура для больших AI‑моделей

Карта на 64 ГБ HBM2e — от 59 ₽ в час или 34 900 ₽ в месяц. Сервер целиком, шесть карт: 329 ₽ в час или 199 000 ₽ в месяц — 384 ГБ видеопамяти в одной машине. Все цены с НДС 5 %.

Локальные LLM, RAG и пакетный инференс, когда 24–32 ГБ видеопамяти уже не хватает. Выделенная физическая карта без соседей: Linux, SSH, Docker, PyTorch, llama.cpp.

  • остановили сервер — не платите
  • диск хранится 7 суток
  • тест модели до оплаты
карта памяти узла · 6 × 64 ГБ
Llama 3.1 70B
Q4_K_M · 40 ГБ · 1 карта · ещё 24 ГБ свободно
пишет ответ 17,1 ток/с · читает запрос 359 ток/с

Замеры 19.08.2026, llama.cpp, модель целиком в видеопамяти. Раскладка по картам — как в наших запусках.

64ГБ
HBM2e на одной карте
1 310ГБ/с
полоса памяти — наш замер, паспорт 1 493
59₽/ч
карта, с НДС 5 %
384ГБ
видеопамяти в одном узле
для чего нужна карта

Под какие задачи берут 64 ГБ

Всё, чему мало 24–32 ГБ видеопамяти. Каждая плитка — сценарий, который мы запускали на этих же картах; цифры в плитках — из наших замеров.

Qwen2.5 72B · Q4_K_M1 карта
45 ГБ весовещё 19 ГБ под контекст
› Отвечает 16,8 ток/с, модель целиком в одной карте — ни разрезания, ни настройки обмена.

Локальные LLM в высоком качестве

Модель до 35 млрд параметров — в одну карту в Q8, без агрессивного квантования и разбиения на карты; 70B в Q4 — тоже в одну. Скорость остаётся полной.

замеры моделей
LoRAQLoRAUnslothPyTorch

Дообучение одной картой

LoRA и QLoRA на 64 ГБ без обмена градиентами между картами. LoRA на одной карте — за пару минут, готовый файл дообучения на месте.

144 ролика/ч · LTX-2.3 22BFLUX.1 · ComfyUI · SD 3.5

Видео и картинки

LTX-2.3 — 144 ролика в час на одной карте, MiniMax H3 — видео со звуком. FLUX.1, ComfyUI и Stable Diffusion 3.5 уже в образах.

замеры видео
модель + KV-кэш · 64 ГБ

RAG и обработка документов

Длинный контекст и очередь заданий на ночь: 64 ГБ держат и модель, и KV-кэш целиком. То, что не влезало в 24 ГБ, здесь идёт одним проходом.

$ curl ваш-ip:8000/v1/chat/completions
→ 200 OK · Qwen3.8 27B · 35,4 ток/с
$
llama.cpp · vLLM · Ollama — в образах

Свой API для инференса

SSH, Docker и белый IPv4: поднимите llama.cpp, vLLM или Ollama и отдавайте ответы своему продукту — без чужих API и лимитов на токены.

собрать сервер
данные в РФдоговор с юрлицомбез внешних API

Закрытый корпоративный контур

AI-агенты и поиск по своим документам на вашем сервере в России. Карты — физически ваши, договор — с российским юрлицом, ни один документ не уходит в чужое облако.

Ваша задача — другая?

Пришлите модель — запустим на нашей карте и вернём отчёт: занятая память, скорость запроса и ответа, какая конфигурация нужна. Бесплатно и до оплаты.

Не подойдут: production без резерва, задачи, которым нужны ECC или NVLink, и обучение с параллелизмом на несколько карт — говорим это до оплаты. Для компаний: договор, оплата по счёту, закрывающие через ЭДО (Контур Диадок), бесплатный тестовый период — Telegram или gpu@25tb-vram.ru.

Собрать сервер под мою задачу
главное отличие

Одна карта вместо нескольких

64 ГБ на карте меняют саму раскладку: модель, которую на обычных картах приходится резать на части, у нас целиком помещается в одну. Слева — наши замеры, справа — сколько карт по 24 ГБ нужно, чтобы модель просто поместилась.

Llama 3.1 70B

40 ГБ · Q4_K_M
1 картау нас · 64 ГБ
2 картыпо 24 ГБ

Тот же случай: одна карта вместо двух на 24 ГБ.

Qwen2.5 72B

45 ГБ · Q4_K_M
1 картау нас · 64 ГБ
2 картыпо 24 ГБ

Целиком в одной карте: ни разрезания, ни настройки обмена — запустил и работаешь.

Mistral Large 123B

69 ГБ · Q4_K_M
2 картыу нас · 64 ГБ
3 картыпо 24 ГБ

На картах по 24 ГБ этой модели нужно минимум три карты: чем больше кусков, тем больше времени уходит на обмен между ними.

цены

Сколько это стоит

Выберите параметры — цена пересчитывается сразу и совпадает с той, что выставит кабинет. Все суммы с НДС 5 %.

карта · 64 ГБ HBM2e
59 ₽/ч
или 34 900 ₽/мес · 18 ГБ RAM и 250 ГБ NVMe включены
сервер целиком · 6 карт · 384 ГБ
329 ₽/ч
или 199 000 ₽/мес · дешевле шести карт по отдельности
тариф
количество GPU · CMP 170HX 64 ГБ

При нескольких картах VRAM суммируется, но не образует единую память — подходит для параллельных задач, не для NVLink-нагрузок.

оперативная память

18 ГБ (18 на карту) входит в цену. Модель сначала грузится в оперативную память и только потом попадает в карту — для больших моделей её стоит взять с запасом.

диск NVMe250 ГБ
250 ГБ включенодо 400 ГБ

10 vCPU / 18 ГБ RAM на карту · Ubuntu 24.04 + CUDA + Docker · SSH на выделенном порту

замеры на нашем железе

Даже большой модели хватает одной карты

Проверено запуском на той самой карте, которую вы арендуете, — не расчёт по спецификации. llama.cpp, модель целиком в видеопамяти, один поток.

  • GLM-514,4 ток/с
    UD-Q2_K_XL · 263 ГБ 5читает 90 ток/с
  • DeepSeek-R1 671B18,6 ток/с
    IQ1_S · 131 ГБ 3читает 141 ток/с
  • Mistral Large 123B10,5 ток/с
    Q4_K_M · 69 ГБ 2читает 204 ток/с
  • Qwen2.5 72B16,8 ток/с
    Q4_K_M · 45 ГБ 1читает 342 ток/с
  • Llama 3.1 70B17,1 ток/с
    Q4_K_M · 40 ГБ 1читает 359 ток/с
  • Qwen3.8 27B35,4 ток/с
    Q4_K_M · 16 ГБ 1читает 833 ток/с
  • Qwen2.5-Coder 7B117,8 ток/с
    Q4_K_M · 5 ГБ 1читает 3 360 ток/с
«читает запрос» — pp512 · «пишет ответ» — tg128 · замер 19.08.2026все замеры
наша сборка llama.cpp

Длинный запрос читается в полтора раза быстрее

  • +71 %
    Llama 3.1 70B
  • +49 %
    Qwen3.8 27B
  • +47 %
    Qwen2.5-Coder 7B

Одна галочка в конфигураторе — собирать и настраивать ничего не нужно. Скорость ответа та же, быстрее именно чтение запроса.

видео со звуком на тех же картах

Роликов в час — и это масштабируется по картам

  • 144 /ч
    LTX-2.3 22B · 1280×704, 5 с при 24 к/с
  • 103 /ч
    MiniMax H3 · 768×512, 4 с при 24 к/с

Веса лежат в нашем общем хранилище и место на диске арендатора не занимают. Замер 19.08.2026.

в образахFLUX.1ComfyUILTX-2.3 (видео)MiniMax H3 (видео)Stable Diffusion 3.5PyTorchHugging FaceUnslothLoRA / QLoRAllama.cppvLLMOllamaСтавим по запросу: Fooocus, InvokeAI, Axolotl, SGLang, Triton, Stable Diffusion WebUI, text-generation-webui.
честно о цене

Если модель влезает в 24 ГБ — берите 4090

На счёте она нас обгонит: новее архитектура, кратно больше вычислений. Наше преимущество узкое и конкретное — объём памяти и скорость доступа к ней. Разговор начинается там, где модель в 24 ГБ уже не помещается.

другой провайдер

RTX 4090 · 24 ГБ GDDR6

97,29 ₽/ч с НДС
  • Быстрее нас там, где всё решают вычисления: обучение, генерация картинок, разбор длинного запроса
  • 70B в Q4 — это 40 ГБ весов: в 24 ГБ не входит, нужны две карты и разрезание
  • Чтобы собрать 384 ГБ, нужно 16 таких серверов
у нас

CMP 170HX · 64 ГБ HBM2e

59 ₽/ч с НДС 5 %
  • На 40 ГБ больше памяти и на 39,4 % дешевле за тот же час
  • HBM2e: паспортные 1 493 ГБ/с, наш замер 1 310 ГБ/с — выдача токенов упирается в память, и здесь мы впереди
  • До шести карт в одной машине: 384 ГБ без сети между ними
384 ГБ в одном узле
199 000 ₽/мес
329 ₽/ч за сервер целиком · с НДС 5 %
₽ за 1 ГБ памяти в месяц, чтобы собрать те же 384 ГБ
  • 518
    CMP 170HX 64 ГБ — у нас
    1 машина, 6 карт
  • 1 307–1 561
    RTX PRO 6000 96 ГБ
    4 сервера у двух других провайдеров
  • 2 724
    RTX 4090 24 ГБ
    16 серверов

Чужие цены — по открытым прейскурантам на 02.09.2026, без их скидок; сравниваем прейскурантный час с прейскурантным часом. Наши 1 310 ГБ/с — замер копированием внутри видеопамяти (8 ГиБ, десять проходов); 1 493 ГБ/с — паспортная цифра, её мы за измеренную не выдаём.

что включено

Всё включено в стоимость

Каждый сервер готов к работе — без скрытых платежей и доплат.

Остановили сервер — перестали платить

Остаток мгновенно возвращается на баланс. Диск хранится бесплатно ещё 7 суток после остановки — место закреплено за вами.

Тест модели до оплаты

Пришлите модель — запустим и вернём отчёт: занятая память, время загрузки, фактические токены в секунду. Бесплатно.

SSH и свой белый IPv4

Каждый сервер получает выделенный внешний IP. Подключайтесь как удобно вашему стеку: SSH, Docker, свои ключи.

Безлимитный гигабит

Никаких счётчиков и лимитов на байты. Гигабитный канал уже включён в стоимость сервера.

ЭДО и закрывающие документы

Договор с юрлицом, оплата по счёту, документооборот через Контур Диадок — закрывающие приходят автоматом.

Карта без соседей

Выделенная физическая GPU, а не слайс. Вся память и вся полоса — только вашим задачам, без переподписки.

площадка в РФ
сеть, питание и эксплуатация, на которых держится работа клиентских серверов
  • Выделенная физическая карта

    Целиком ваша, без соседей и переподписки: вся память, вся полоса, весь compute — только вашим задачам.

  • Два независимых интернет-канала

    Физически разные линии от двух операторов. Канал лёг — трафик уходит на резерв за секунды, без смены IP.

  • Резервное питание (ИБП + ДГУ)

    Город пропал — ИБП подхватывает мгновенно, дизель-генератор выходит на нагрузку за минуту.

  • Мониторинг 24/7

    Температура, port-флапы и утилизация круглосуточно. Дежурный видит проблему раньше клиента.

  • Инженер на площадке

    В ЦОД дежурит инженер: IPMI-ребут, зомби-GPU, замена диска — без задержек на въезд.

вопросы и ответы

Часто спрашивают

старт за пару минут

Создайте аккаунт и запустите сервер

  1. 01
    Создайте аккаунт
    Регистрация по email займёт меньше минуты
  2. 02
    Пополните баланс
    Картой, через СБП или по счёту для юрлиц
  3. 03
    Запустите сервер
    Выберите конфигурацию и подтвердите запуск
  4. 04
    Подключитесь
    SSH сразу после старта, окружение уже настроено

Сервер выдаётся за секунды после оплаты (новый образ — до 15 минут). Поддержка ежедневно 10:00–17:00 по Москве. Остановили сервер — платить перестали, диск хранится 7 суток бесплатно.

Создать сервер
бесплатно и до оплаты

Проверим вашу модель бесплатно

Пришлите ссылку на модель — запустим и вернём отчёт: занятая память, скорость промпта и генерации, какая конфигурация нужна.

Нажимая кнопку, вы соглашаетесь на обработку персональных данных. SSH не выдаём — тест делаем сами и присылаем отчёт. Обычно отвечаем в тот же день.