Articles
Topology-Aware Data Movement for Disaggregated GPU Inference⭐10
Topology-aware KV cache transfer cuts GPU inference latency by 3-18x via NVLink, InfiniBand, and CXL optimizations.
Topology-aware KV cache transfer cuts GPU inference latency by 3-18x via NVLink, InfiniBand, and CXL optimizations.