来源:AWS Machine Learning Blog 2026-08-12 13:42

使用 Curvine 在 Amazon SageMaker HyperPod 上为大型 LLM 提供分层 KV 缓存

缓存 KV 使用 Curvine Amazon
大规模运行大型语言模型推理会迫使 KV 缓存进行权衡:超大的 GPU 实例或缓慢的首次令牌时间。本文在 Amazon SageMaker HyperPod 上构建了一个分层 KV 缓存,将缓存扩展到使用 Curvine 的共享分布式 NVMe 池中,因此副本可以在经济高效的实例上以接近本地磁盘的速度重用缓存。

相关文章推荐

返回首页