Model & workload

TP sizes must divide the model's KV-head count evenly.

Model-specific runtime options appear here.

Memory footprint

Per device size --
= -- GB
Per sequence --
Per token --
Bytes per element --
Total cache size all devices --
Calculation --

--

Model details