Правило простое: в видеопамяти должен поместиться файл модели плюс запас на контекст — обычно от 10 до 20 % сверху. Модель на 70 миллиардов параметров в четырёхбитном квантовании занимает около 40 ГБ и целиком входит в одну карту на 64 ГБ.
Ниже — не расчёт по формуле, а наши замеры: мы запускали каждую модель и снимали по карте, пока она помещалась.
| Модель | Квантование | Размер | Карт | Устройство |
|---|---|---|---|---|
| GLM-5 | UD-Q2_K_XL | 263 ГБ | 5 | очень крупная, разнесена на пять карт |
| DeepSeek-R1 671B | IQ1_S | 131 ГБ | 3 | смешанная — на токен работает 37 млрд из 671 |
| Mistral Large 123B | Q4_K_M | 69 ГБ | 2 | плотная — работают все 123 млрд |
| Qwen2.5 72B | Q4_K_M | 45 ГБ | 1 | плотная |
| Llama 3.1 70B | Q4_K_M | 40 ГБ | 1 | плотная |
| Qwen3.8 27B | Q4_K_M | 16 ГБ | 1 | плотная |
| Qwen2.5-Coder 7B | Q4_K_M | 5 ГБ | 1 | плотная |
Замерено 2026-08-19. llama.cpp, вся модель в видеопамяти. «Читает запрос» — pp512, «пишет ответ» — tg128, один поток. Минимум карт найден перебором: запускали и снимали по карте, пока модель помещалась.
Модель, которая не помещается в одну карту, разрезается на части, и карты начинают обмениваться промежуточными результатами на каждом шаге. Обмен идёт по шине, которая в десятки раз медленнее видеопамяти, и чем больше кусков — тем больше времени уходит на пересылку вместо счёта.
Поэтому 4 из 7 моделей в таблице работают на одной карте: ни разрезания, ни настройки обмена, ни потерь на пересылку. Это и есть главное, что даёт объём 64 ГБ вместо 24.
Кроме самих весов память нужна под KV-кэш — промежуточное состояние для уже прочитанных токенов. Он растёт линейно с длиной запроса, и именно он чаще всего не даёт запустить длинный контекст на карте, в которую модель «еле влезла». Запас в 20–25 ГБ поверх весов — то, ради чего берут 64 ГБ под модель, которой формально хватило бы 40.
Если модель помещается в 24 ГБ и длинный контекст не нужен — берите карту поменьше, она будет дешевле и быстрее на единицу цены. Объём выигрывает там, где иначе пришлось бы разносить модель на несколько карт.
Самое крупное, что мы запускали, — GLM-5: 263 ГБ на 5 картах из шести.
Проверить свою модельГлавная · Цены · Сколько памяти нужно · Замеры скорости · Про карту CMP 170HX · Контакты
Обновлено 16 сентября 2026