Files
rtos_llm_opt/项目框架1-基于RTOS的五类场景AI实时性研究/10-研究框架/参考文件/02-KV-Cache与内存管理参考.md
T
Mo1s 60e0d2e46b Merge remote-tracking branch 'origin/main' into moyixin-patch-1
# Conflicts:
#	10-研究框架/README.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/03-实验设计.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/metric.md
2026-09-22 15:50:56 +08:00

3.4 KiB

KV Cache 与内存管理参考

1. 与本项目的关系

KV Cache 同时影响容量、内存带宽、请求并发和尾延迟。在 RTOS 场景中,研究重点不是单纯提高缓存命中率,而是控制动态分配、换入换出、DMA 和回收行为对关键任务造成的不可预测干扰。

2. 核心必引资料

资料 等级 可支撑内容 本项目使用方式
W. Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention,” SOSP 2023. arXiv A/B 块式 KV 分配、碎片控制、共享与调度耦合 作为分页池设计和 vLLM 基线
Y. Sheng et al., “FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU,” ICML 2023. PMLR A GPU/CPU/存储分层放置与 I/O 调度 支撑分层 KV/权重放置,但需强调其吞吐导向
Z. Zhang et al., “H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models,” NeurIPS 2023. NeurIPS A 基于重要 token 的 KV 淘汰及质量影响 用于“容量—质量—时延”三目标实验
W. Lee et al., “InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management,” OSDI 2024. USENIX A KV 预取、CPU offload、动态池管理 对应 CPU—加速器带宽与预取干扰研究
P. Patel et al., “vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention,” 2024. arXiv B 利用虚拟内存保持逻辑连续、比较分页内核复杂度 作为 PagedAttention 的替代路线和消融参考

3. 研究问题映射

本项目问题 参考资料启发 必须补充的 RTOS 证据
内存池预分配是否减少尾延迟 PagedAttention 的块式管理 分配路径时延、关键任务 P99.9/Max、碎片率
KV 换出是否可控 FlexGen、InfiniGen DMA/内存带宽竞争、外部接口响应和违约率
KV 淘汰如何影响可用性 H2O 固定题集质量、输出可用率、恢复到全量 KV 的开销
多请求是否相互污染 分页与共享机制 每租户上限、OOM 隔离、Jain 指数和逐租户 SLO
B8/B16 容量边界 各类压缩/分页工作 峰值驻留集、KV 增长曲线、首次失败点和错误类型

4. 建议实验变量

  • KV 块大小、内存池大小、预分配比例和保留余量;
  • 上下文长度、并发度、输出长度和突发到达;
  • GPU/NPU 本地、主存和存储三级放置;
  • 淘汰策略:LRU、近期 token、重要 token、固定配额;
  • 是否锁页、是否异步预取、DMA 并发数和带宽限额。

输出至少包括峰值内存、碎片率、分配失败率、KV 迁移字节数、带宽、TTFT/TPOT、质量、关键任务尾延迟和 OOM 恢复行为。

5. 不应直接推出的结论

  • 内存占用减少不必然降低端到端时延;压缩、索引和搬移可能增加尾延迟。
  • 论文中的 perplexity 或准确率保持不代表任务关键应用输出可用。
  • Linux/CUDA 的虚拟内存和 UVM 机制不能假定在 SylixOS、NPU SDK 或受限 SoC 上等价存在。