Skip to content

Qwen2.5-Coder 14B-Instruct

AWQ·14B params·safetensors
checkpoint: Qwen/Qwen2.5-Coder-14B-Instruct-AWQ
commit: eb3172f06a6d
weights 9.29 GiB

All runs (15)

legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wchat1
82.5
80.71577.0—32ms12.1—49931.14s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wchat1
82.4
80.71541.2—33ms12.1—49931.14s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wcodegen1
81.6
81.21772.1—44ms12.3—815546.83s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wrag1
81.6
77.329814.2—34ms12.3—85568894ms0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wcodegen1
81.6
81.11754.9—44ms12.3—815546.84s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wrag1
81.5
77.230194.7—36ms12.3—85568895ms0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wagent1
81.0
80.221337.3—31ms12.3—6062363.10s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wagent1
81.0
80.221252.2—30ms12.4—6062363.10s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-350wagent4
74.5
73.610112.3—66ms13.4—6062363.19s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 420 Wdrv 590
vLLM 0.21.0 (cuda)baseline-pl-450wagent4
74.3
73.414834.0—58ms13.5—6062363.18s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinechat1
43.7
42.6873.7—58ms22.9—49932.06s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinecodegen1
41.2
41.1807.6—97ms24.3—8155413.49s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselineagent1
41.1
40.610574.6—57ms24.3—6062366.04s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselinerag1
40.7
39.915660.6—55ms24.6—855681.76s0.000 GiB
legacystack comparable
GeForce RTX 3090 · 24 GiBcap 200 Wdrv 590
vLLM 0.21.0 (cuda)baselineagent4
39.5
38.98209.5—105ms25.3—6062366.06s0.000 GiB

Environment

GeForce RTX 3090 · 24 GiB
cpuAMD EPYC 7302P 16-Core Processor
gpuNVIDIA GeForce RTX 3090
archNVIDIA
vram24 GiB (system 64.0 GiB)
power420 W / 450 W max(93% cap)
hardware probes
copy 42% of theoryFP16 peak 65.4 TFcopy/math flat across caps
384-bit9751 MHz82 SM/CU
Microbenchmarks for memory copy and tensor math; raw-engine decode and API workload rows measure model-serving speed.
captheorycopyfp16bf16
200 W936 GB/s391 GB/s65.4 TF65.4 TF
300 W936 GB/s391 GB/s65.4 TF65.3 TF
450 W936 GB/s391 GB/s65.4 TF65.4 TF
compute: 8.6
backendvLLM 0.21.0 (cuda)
osUbuntu 24.04 LTS
kernel6.17.13-7-pve
driver590.48.01
python3.12.3
runs/cell5
warmups2
endpoint/v1/chat/completions
streamingtrue
GeForce RTX 3090 · 24 GiB
cpuAMD EPYC 7302P 16-Core Processor
gpuNVIDIA GeForce RTX 3090
archNVIDIA
vram24 GiB (system 64.0 GiB)
power200 W / 450 W max(44% cap)
backendvLLM 0.21.0 (cuda)
osUbuntu 24.04 LTS
kernel6.17.13-7-pve
driver590.48.01
python3.12.3
runs/cell5
warmups2
endpoint/v1/chat/completions
streamingtrue