Skip to content

Qwen2.5 32B-Instruct

AWQ·32B params·safetensors
checkpoint: Qwen/Qwen2.5-32B-Instruct-AWQ
commit: 5c7cb76a268f
weights 18.00 GiB

All runs (15)

legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wchat1
42.0
41.0835.8—61ms23.8—49872.08s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wchat1
41.9
41.0842.0—61ms23.8—49872.08s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wrag1
41.7
39.916214.9—53ms24.0—855551.60s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wrag1
41.6
39.916170.4—53ms24.0—855551.60s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wcodegen1
41.5
41.3824.4—95ms24.1—8164615.63s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wcodegen1
41.5
41.3820.3—95ms24.1—8164615.63s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wagent1
41.4
41.011422.7—54ms24.2—6062927.49s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wagent1
41.4
41.011335.8—54ms24.2—6062927.50s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wagent4
38.8
38.58763.4—95ms25.8—6063017.79s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wagent4
38.8
38.57334.1—102ms25.8—6063188.25s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinechat1
19.5
19.2455.7—112ms51.3—49874.20s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinecodegen1
19.4
19.3413.1—189ms51.4—8162532.42s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselineagent1
19.4
19.25096.9—119ms51.5—60630115.70s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinerag1
19.0
18.88194.7—114ms52.6—855553.41s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselineagent4
18.7
18.74615.3—155ms53.4—60630116.11s0.000 GiB

Environment

GeForce RTX 3090 · 24 GiB
cpuAMD EPYC 7302P 16-Core Processor
gpuNVIDIA GeForce RTX 3090
archNVIDIA
vram24 GiB (system 64.0 GiB)
power420 W / 450 W max(93% cap)
hardware probes
copy 42% of theoryFP16 peak 65.4 TFcopy/math flat across caps
384-bit9751 MHz82 SM/CU
Microbenchmarks for memory copy and tensor math; raw-engine decode and API workload rows measure model-serving speed.
captheorycopyfp16bf16
200 W936 GB/s391 GB/s65.4 TF65.4 TF
300 W936 GB/s391 GB/s65.4 TF65.3 TF
450 W936 GB/s391 GB/s65.4 TF65.4 TF
compute: 8.6
backendvLLM 0.21.0 (cuda)
osUbuntu 24.04 LTS
kernel6.17.13-7-pve
driver590.48.01
python3.12.3
runs/cell5
warmups2
endpoint/v1/chat/completions
streamingtrue
GeForce RTX 3090 · 24 GiB
cpuAMD EPYC 7302P 16-Core Processor
gpuNVIDIA GeForce RTX 3090
archNVIDIA
vram24 GiB (system 64.0 GiB)
power200 W / 450 W max(44% cap)
backendvLLM 0.21.0 (cuda)
osUbuntu 24.04 LTS
kernel6.17.13-7-pve
driver590.48.01
python3.12.3
runs/cell5
warmups2
endpoint/v1/chat/completions
streamingtrue