Локальные LLM в высоком качестве
Модель до 35 млрд параметров — в одну карту в Q8, без агрессивного квантования и разбиения на карты; 70B в Q4 — тоже в одну. Скорость остаётся полной.
замеры моделейКарта на 64 ГБ HBM2e — от 59 ₽ в час или 34 900 ₽ в месяц. Сервер целиком, шесть карт: 329 ₽ в час или 199 000 ₽ в месяц — 384 ГБ видеопамяти в одной машине. Все цены с НДС 5 %.
Локальные LLM, RAG и пакетный инференс, когда 24–32 ГБ видеопамяти уже не хватает. Выделенная физическая карта без соседей: Linux, SSH, Docker, PyTorch, llama.cpp.
Замеры 19.08.2026, llama.cpp, модель целиком в видеопамяти. Раскладка по картам — как в наших запусках.
Всё, чему мало 24–32 ГБ видеопамяти. Каждая плитка — сценарий, который мы запускали на этих же картах; цифры в плитках — из наших замеров.
Модель до 35 млрд параметров — в одну карту в Q8, без агрессивного квантования и разбиения на карты; 70B в Q4 — тоже в одну. Скорость остаётся полной.
замеры моделейLoRA и QLoRA на 64 ГБ без обмена градиентами между картами. LoRA на одной карте — за пару минут, готовый файл дообучения на месте.
LTX-2.3 — 144 ролика в час на одной карте, MiniMax H3 — видео со звуком. FLUX.1, ComfyUI и Stable Diffusion 3.5 уже в образах.
замеры видеоДлинный контекст и очередь заданий на ночь: 64 ГБ держат и модель, и KV-кэш целиком. То, что не влезало в 24 ГБ, здесь идёт одним проходом.
SSH, Docker и белый IPv4: поднимите llama.cpp, vLLM или Ollama и отдавайте ответы своему продукту — без чужих API и лимитов на токены.
собрать серверAI-агенты и поиск по своим документам на вашем сервере в России. Карты — физически ваши, договор — с российским юрлицом, ни один документ не уходит в чужое облако.
Пришлите модель — запустим на нашей карте и вернём отчёт: занятая память, скорость запроса и ответа, какая конфигурация нужна. Бесплатно и до оплаты.
Не подойдут: production без резерва, задачи, которым нужны ECC или NVLink, и обучение с параллелизмом на несколько карт — говорим это до оплаты. Для компаний: договор, оплата по счёту, закрывающие через ЭДО (Контур Диадок), бесплатный тестовый период — Telegram или gpu@25tb-vram.ru.
Собрать сервер под мою задачу64 ГБ на карте меняют саму раскладку: модель, которую на обычных картах приходится резать на части, у нас целиком помещается в одну. Слева — наши замеры, справа — сколько карт по 24 ГБ нужно, чтобы модель просто поместилась.
Тот же случай: одна карта вместо двух на 24 ГБ.
Целиком в одной карте: ни разрезания, ни настройки обмена — запустил и работаешь.
На картах по 24 ГБ этой модели нужно минимум три карты: чем больше кусков, тем больше времени уходит на обмен между ними.
Выберите параметры — цена пересчитывается сразу и совпадает с той, что выставит кабинет. Все суммы с НДС 5 %.
10 vCPU / 18 ГБ RAM на карту · Ubuntu 24.04 + CUDA + Docker · SSH на выделенном порту
Проверено запуском на той самой карте, которую вы арендуете, — не расчёт по спецификации. llama.cpp, модель целиком в видеопамяти, один поток.
| Модель | Квант · размер | Карт | Читает запрос | Пишет ответ | Устройство |
|---|---|---|---|---|---|
| GLM-5 | UD-Q2_K_XL · 263 ГБ | 5 | 90 ток/с | 14,4 ток/с | очень крупная, разнесена на пять карт |
| DeepSeek-R1 671B | IQ1_S · 131 ГБ | 3 | 141 ток/с | 18,6 ток/с | смешанная — на токен работает 37 млрд из 671 |
| Mistral Large 123B | Q4_K_M · 69 ГБ | 2 | 204 ток/с | 10,5 ток/с | плотная — работают все 123 млрд |
| Qwen2.5 72B | Q4_K_M · 45 ГБ | 1 | 342 ток/с | 16,8 ток/с | плотная |
| Llama 3.1 70B | Q4_K_M · 40 ГБ | 1 | 359 ток/с | 17,1 ток/с | плотная |
| Qwen3.8 27B | Q4_K_M · 16 ГБ | 1 | 833 ток/с | 35,4 ток/с | плотная |
| Qwen2.5-Coder 7B | Q4_K_M · 5 ГБ | 1 | 3 360 ток/с | 117,8 ток/с | плотная |
Одна галочка в конфигураторе — собирать и настраивать ничего не нужно. Скорость ответа та же, быстрее именно чтение запроса.
Веса лежат в нашем общем хранилище и место на диске арендатора не занимают. Замер 19.08.2026.
На счёте она нас обгонит: новее архитектура, кратно больше вычислений. Наше преимущество узкое и конкретное — объём памяти и скорость доступа к ней. Разговор начинается там, где модель в 24 ГБ уже не помещается.
Чужие цены — по открытым прейскурантам на 02.09.2026, без их скидок; сравниваем прейскурантный час с прейскурантным часом. Наши 1 310 ГБ/с — замер копированием внутри видеопамяти (8 ГиБ, десять проходов); 1 493 ГБ/с — паспортная цифра, её мы за измеренную не выдаём.
Каждый сервер готов к работе — без скрытых платежей и доплат.
Остаток мгновенно возвращается на баланс. Диск хранится бесплатно ещё 7 суток после остановки — место закреплено за вами.
Пришлите модель — запустим и вернём отчёт: занятая память, время загрузки, фактические токены в секунду. Бесплатно.
Каждый сервер получает выделенный внешний IP. Подключайтесь как удобно вашему стеку: SSH, Docker, свои ключи.
Никаких счётчиков и лимитов на байты. Гигабитный канал уже включён в стоимость сервера.
Договор с юрлицом, оплата по счёту, документооборот через Контур Диадок — закрывающие приходят автоматом.
Выделенная физическая GPU, а не слайс. Вся память и вся полоса — только вашим задачам, без переподписки.
Целиком ваша, без соседей и переподписки: вся память, вся полоса, весь compute — только вашим задачам.
Физически разные линии от двух операторов. Канал лёг — трафик уходит на резерв за секунды, без смены IP.
Город пропал — ИБП подхватывает мгновенно, дизель-генератор выходит на нагрузку за минуту.
Температура, port-флапы и утилизация круглосуточно. Дежурный видит проблему раньше клиента.
В ЦОД дежурит инженер: IPMI-ребут, зомби-GPU, замена диска — без задержек на въезд.
Сервер выдаётся за секунды после оплаты (новый образ — до 15 минут). Поддержка ежедневно 10:00–17:00 по Москве. Остановили сервер — платить перестали, диск хранится 7 суток бесплатно.
Создать серверОтветят живые люди — быстро и по делу, без автоответчиков.