← на главную

Сколько видеопамяти нужно, чтобы запустить языковую модель

Правило простое: в видеопамяти должен поместиться файл модели плюс запас на контекст — обычно от 10 до 20 % сверху. Модель на 70 миллиардов параметров в четырёхбитном квантовании занимает около 40 ГБ и целиком входит в одну карту на 64 ГБ.

Ниже — не расчёт по формуле, а наши замеры: мы запускали каждую модель и снимали по карте, пока она помещалась.

Сколько карт по 64 ГБ нужно конкретным моделям

МодельКвантованиеРазмерКартУстройство
GLM-5UD-Q2_K_XL263 ГБ5очень крупная, разнесена на пять карт
DeepSeek-R1 671BIQ1_S131 ГБ3смешанная — на токен работает 37 млрд из 671
Mistral Large 123BQ4_K_M69 ГБ2плотная — работают все 123 млрд
Qwen2.5 72BQ4_K_M45 ГБ1плотная
Llama 3.1 70BQ4_K_M40 ГБ1плотная
Qwen3.8 27BQ4_K_M16 ГБ1плотная
Qwen2.5-Coder 7BQ4_K_M5 ГБ1плотная

Замерено 2026-08-19. llama.cpp, вся модель в видеопамяти. «Читает запрос» — pp512, «пишет ответ» — tg128, один поток. Минимум карт найден перебором: запускали и снимали по карте, пока модель помещалась.

Почему 70B влезает в одну карту, а на 24 ГБ нужно три

Модель, которая не помещается в одну карту, разрезается на части, и карты начинают обмениваться промежуточными результатами на каждом шаге. Обмен идёт по шине, которая в десятки раз медленнее видеопамяти, и чем больше кусков — тем больше времени уходит на пересылку вместо счёта.

Поэтому 4 из 7 моделей в таблице работают на одной карте: ни разрезания, ни настройки обмена, ни потерь на пересылку. Это и есть главное, что даёт объём 64 ГБ вместо 24.

Сколько памяти съедает контекст

Кроме самих весов память нужна под KV-кэш — промежуточное состояние для уже прочитанных токенов. Он растёт линейно с длиной запроса, и именно он чаще всего не даёт запустить длинный контекст на карте, в которую модель «еле влезла». Запас в 20–25 ГБ поверх весов — то, ради чего берут 64 ГБ под модель, которой формально хватило бы 40.

Когда 64 ГБ не нужны

Если модель помещается в 24 ГБ и длинный контекст не нужен — берите карту поменьше, она будет дешевле и быстрее на единицу цены. Объём выигрывает там, где иначе пришлось бы разносить модель на несколько карт.

Самое крупное, что мы запускали, — GLM-5: 263 ГБ на 5 картах из шести.

Проверить свою модель

Коротко

Главная · Цены · Сколько памяти нужно · Замеры скорости · Про карту CMP 170HX · Контакты

Обновлено 16 сентября 2026