Xwriter / 热点
← 所有热点AI2026/8/22
SGLang 推出 Weight Cache Daemon,实现亚秒级引擎重启
SGLang 的 Weight Cache Daemon 通过 CUDA IPC 零拷贝映射,把模型权重加载时间从约 495 秒降到约 0.63 秒(约 785 倍加速),端到端启动时间减少 93.9%。这是其 Fast Engine Recovery Framework 的第一阶段,支持推理基础设施的亚秒级主备切换。
查看原始来源 ↗基于这条生成一条推文信息仅供写作研究。发布前请核对原始来源;市场数据不构成投资建议。