Xwriter

Xwriter / 热点

所有热点
AI2026/8/24

PagedAttention:为 KV 缓存引入虚拟内存

KV 缓存随序列长度线性增长,在长上下文场景下占用的 GPU 显存甚至超过模型权重本身,默认情况下就是稀缺资源。PagedAttention 把虚拟内存分页的思路引入注意力内核,减少这种浪费。

查看原始来源基于这条生成一条推文

信息仅供写作研究。发布前请核对原始来源;市场数据不构成投资建议。