🚀 FOUNDER PASS LAUNCH:Get Full TensorRT-LLM Pro for only €4.99/mo (Locked for Life) — 814 Spots Left!Claim Pass →
OFFICIAL SPEED & THROUGHPUT LEADERBOARD

NVIDIA Hardware Benchmarks

Verified throughput (tokens/sec) and Time To First Token (TTFT) comparing TensorRT-LLM and vLLM against baseline vanilla PyTorch.

ModelHardware ClusterRuntime EnginePrecisionThroughputTTFT LatencySpeedup
DeepSeek-R1 (671B MoE)
671B (37B active)
8x NVIDIA B200 SXM NVLinkTensorRT-LLMFP8218.4 tok/s24.5 ms4.8x faster
DeepSeek-R1 (671B MoE)
671B (37B active)
8x NVIDIA H200 SXM (1128 GB)TensorRT-LLMFP8142.6 tok/s38.2 ms4.1x faster
Llama-3.1-70B-Instruct
70B
1x NVIDIA H100 SXM5 80GBTensorRT-LLMFP8165.2 tok/s14.8 ms3.9x faster
Llama-3.1-70B-Instruct
70B
1x NVIDIA H100 SXM5 80GBvLLMFP8138.5 tok/s19.4 ms3.2x faster
Llama-3.1-70B-Instruct
70B
2x RTX 4090 24GB (48GB total)TensorRT-LLMINT4-AWQ54.8 tok/s42.1 ms2.8x faster
Llama-3.1-8B-Instruct
8B
1x RTX 4090 24GBTensorRT-LLMINT4-AWQ118.2 tok/s11.2 ms3.4x faster
Llama-3.1-8B-Instruct
8B
1x RTX 4090 24GBVanilla PyTorchFP1634.6 tok/s45 ms1x faster