Xwriter

Xwriter / 热点

所有热点
AI2026/8/22

SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启

SGLang 的 Weight Cache Daemon 通过 CUDA IPC 零拷贝映射,把模型权重加载时间从约 495 秒降到约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。这是其 Fast Engine Recovery Framework 的第一阶段,支持推理基础设施的亚秒级主备切换。

查看原始来源基于这条生成一条推文

信息仅供写作研究。发布前请核对原始来源;市场数据不构成投资建议。