Qwen/Qwen3.6-27B-FP8 · FP8
8xH100Stack vLLM
Every container runs next to vLLM in your own cloud account. Same engine, same API, same weights. The serving configuration is what changes.
8xH100Stack vLLM
8xH100Stack vLLM
8xH100Stack vLLM
8xH100Stack vLLM
2xH100Stack vLLM
4xH100Stack vLLM
A100Stack vLLM
A100Stack vLLM
H100Stack
L40SStack
2xA100Stack
L40SStack
H100Stack
2xH100Stack
2xH100Stack
A100Stack
H100Stack
L40SStack
2xH100Stack
2xH100Stack
H100Stack
A100Stack
A100Stack
A100Stack
A100Stack
L40SStack
A100Stack
H100Stack
H100Stack
2xH100Stack
H100Stack
2xA100Stack
L40SStack
A100Stack
A100Stack
4xB200Stack
2xB200Stack
8xA100Stack
8xH100Stack
8xH100Stack
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
L4Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
8xA100Stack vLLM
8xH100Stack vLLM
Every reduction on this page is measured against stock vLLM on the GPU named on the card, at a fixed latency target, with the same weights and the same request mix. Nothing is extrapolated from one GPU class to another.
A container appears in the library before its benchmark is finished. Until the measurement is signed off, the card shows the shape of the result and not the number.
Unit of analysis: model × precision × GPU class. A container measured on A100 does not carry its number to H100.
We measure your production baseline on your own GPUs first.
You keep the measurement whether or not you go further.