Наши замеры на CMP 170HX: Qwen2.5-Coder 7B — 117,8 токена в секунду, плотная 70B — 17,1, самая крупная открытая модель DeepSeek-R1 671B — 18,6. Чтение запроса идёт в разы быстрее выдачи: от 90,1 до 3 360 токенов в секунду в зависимости от модели.
Это не паспортные цифры производителя, а результаты прогонов на том железе, которое мы сдаём. Методика — в конце страницы.
| Модель | Карт | Читает запрос, ток/с | Пишет ответ, ток/с |
|---|---|---|---|
| Qwen2.5-Coder 7B | 1 | 3360,3 | 117,8 |
| Qwen3.8 27B | 1 | 833,3 | 35,4 |
| DeepSeek-R1 671B | 3 | 141 | 18,6 |
| Llama 3.1 70B | 1 | 358,9 | 17,1 |
| Qwen2.5 72B | 1 | 341,5 | 16,8 |
| GLM-5 | 5 | 90,1 | 14,4 |
| Mistral Large 123B | 2 | 203,5 | 10,5 |
Решает устройство модели, а не размер файла. В «смешанных» моделях (MoE) на каждый токен считается лишь часть весов — поэтому DeepSeek-R1 на 671 миллиард параметров отвечает быстрее, чем плотная модель на 70 миллиардов: 18,6 токена в секунду против 17,1. Файл у первой втрое больше.
Если выбираете модель по скорости ответа, смотрите не на число параметров, а на то, сколько их участвует в каждом токене.
Скорость чтения длинного запроса зависит от того, как собран llama.cpp. Сборка с cuBLAS даёт заметный прирост, причём на выдачу ответа он не влияет — ускоряется именно разбор того, что вы прислали:
| Модель | Обычная сборка | С cuBLAS | Прирост |
|---|---|---|---|
| Llama 3.1 70B | 361,8 | 616,9 | ×1,7 |
| Qwen3.8 27B | 855,1 | 1277,7 | ×1,5 |
| Qwen2.5-Coder 7B | 3390,7 | 4998,3 | ×1,5 |
Одна карта, запрос 512 токенов, llama-bench. Для 27B и 70B — по пять повторов, для 7B — три. Скорость выдачи ответа при этом не меняется: ускоряется именно чтение запроса.
Пропускная способность видеопамяти по паспорту 1 493 ГБ/с, наш замер — 1 310 ГБ/с. Именно она определяет скорость выдачи токенов у плотных моделей.
А вот обмен с картой идёт по gen2 x4 (1,52 ГБ/с, замер) — это узкое место при загрузке модели и при работе модели, разнесённой на несколько карт. Ограничение самой карты, обойти его нельзя, и мы говорим об этом до оплаты, а не после.
llama.cpp, вся модель в видеопамяти. «Читает запрос» — pp512, «пишет ответ» — tg128, один поток. Минимум карт найден перебором: запускали и снимали по карте, пока модель помещалась. Замеры от 2026-08-19, оборудование: CMP 170HX · GA100, 64 ГБ HBM2e на карту, драйвер 610.43.03.
Показания стенда в реальном времени публикуем открыто — температура, питание и загрузка карт видны на странице панели.
Прогнать свою модельГлавная · Цены · Сколько памяти нужно · Замеры скорости · Про карту CMP 170HX · Контакты
Обновлено 16 сентября 2026