← на главную

Сколько токенов в секунду выдают модели на карте 64 ГБ

Наши замеры на CMP 170HX: Qwen2.5-Coder 7B — 117,8 токена в секунду, плотная 70B — 17,1, самая крупная открытая модель DeepSeek-R1 671B — 18,6. Чтение запроса идёт в разы быстрее выдачи: от 90,1 до 3 360 токенов в секунду в зависимости от модели.

Это не паспортные цифры производителя, а результаты прогонов на том железе, которое мы сдаём. Методика — в конце страницы.

Скорость по моделям

МодельКартЧитает запрос, ток/с Пишет ответ, ток/с
Qwen2.5-Coder 7B13360,3117,8
Qwen3.8 27B1833,335,4
DeepSeek-R1 671B314118,6
Llama 3.1 70B1358,917,1
Qwen2.5 72B1341,516,8
GLM-5590,114,4
Mistral Large 123B2203,510,5

Почему модели одного размера работают с разной скоростью

Решает устройство модели, а не размер файла. В «смешанных» моделях (MoE) на каждый токен считается лишь часть весов — поэтому DeepSeek-R1 на 671 миллиард параметров отвечает быстрее, чем плотная модель на 70 миллиардов: 18,6 токена в секунду против 17,1. Файл у первой втрое больше.

Если выбираете модель по скорости ответа, смотрите не на число параметров, а на то, сколько их участвует в каждом токене.

Чтение запроса можно ускорить

Скорость чтения длинного запроса зависит от того, как собран llama.cpp. Сборка с cuBLAS даёт заметный прирост, причём на выдачу ответа он не влияет — ускоряется именно разбор того, что вы прислали:

МодельОбычная сборкаС cuBLASПрирост
Llama 3.1 70B361,8616,9×1,7
Qwen3.8 27B855,11277,7×1,5
Qwen2.5-Coder 7B3390,74998,3×1,5

Одна карта, запрос 512 токенов, llama-bench. Для 27B и 70B — по пять повторов, для 7B — три. Скорость выдачи ответа при этом не меняется: ускоряется именно чтение запроса.

Где предел этой карты

Пропускная способность видеопамяти по паспорту 1 493 ГБ/с, наш замер — 1 310 ГБ/с. Именно она определяет скорость выдачи токенов у плотных моделей.

А вот обмен с картой идёт по gen2 x4 (1,52 ГБ/с, замер) — это узкое место при загрузке модели и при работе модели, разнесённой на несколько карт. Ограничение самой карты, обойти его нельзя, и мы говорим об этом до оплаты, а не после.

Методика

llama.cpp, вся модель в видеопамяти. «Читает запрос» — pp512, «пишет ответ» — tg128, один поток. Минимум карт найден перебором: запускали и снимали по карте, пока модель помещалась. Замеры от 2026-08-19, оборудование: CMP 170HX · GA100, 64 ГБ HBM2e на карту, драйвер 610.43.03.

Показания стенда в реальном времени публикуем открыто — температура, питание и загрузка карт видны на странице панели.

Прогнать свою модель

Коротко

Главная · Цены · Сколько памяти нужно · Замеры скорости · Про карту CMP 170HX · Контакты

Обновлено 16 сентября 2026