Files
rtos_llm_opt/10-研究框架/参考文件/01-推理图任务调度参考.md
T

3.9 KiB

推理图任务调度参考

1. 与本项目的关系

本方向连接两类研究:一类是固定优先级、EDF、响应时间分析等经典实时调度理论;另一类是 LLM 服务中的连续批处理、prefill/decode 分离、分块 prefill 和 SLO 感知调度。本项目的增量应落在两者交叉处:把推理图阶段映射为可度量、可准入、可隔离的 RTOS 任务,同时保障关键周期任务。

2. 核心必引资料

资料 等级 可支撑内容 本项目使用方式
C. L. Liu, J. W. Layland, “Scheduling Algorithms for Multiprogramming in a Hard-Real-Time Environment,” JACM, 1973. DOI A 周期任务、固定优先级与 EDF 的理论基础 定义关键保障任务模型和可调度性讨论的起点
N. Audsley et al., “Applying New Scheduling Theory to Static Priority Pre-emptive Scheduling,” 1993. DOI A 含阻塞和释放抖动的固定优先级响应时间分析 为推理、中断与共享资源干扰进入 RTA 提供基础
W. Yu et al., “Orca: A Distributed Serving System for Transformer-Based Generative Models,” OSDI 2022. USENIX A 迭代级调度和连续批处理 作为 LLM 服务调度基线,不作为实时保证
W. Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention,” SOSP 2023. arXiv A/B 请求调度与 KV 分页耦合、吞吐提升 支撑调度与内存联合设计及 vLLM 对照
A. Agrawal et al., “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve,” OSDI 2024. USENIX A 分块 prefill、decode 干扰与吞吐—时延权衡 支撑 prefill 可分段化和关键任务插入点设计
Y. Zhong et al., “DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving,” OSDI 2024. USENIX A TTFT/TPOT 双 SLO、prefill/decode 解耦和 goodput 对应本项目 TTFT、TPOT 和有效吞吐联合门槛

3. 扩展参考

资料 关注点
A. Gujarati et al., “Serving DNNs like Clockwork: Performance Predictability from the Bottom Up,” OSDI 2020. USENIX DNN 推理可预测性、受控执行和 deadline-aware 调度
A. Agrawal et al., “SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills,” 2023. arXiv prefill 分块、decode-maximal batching 与流水线气泡

4. 可形成的论文论点

  1. 把 prefill/decode/postprocess 从服务框架内部阶段提升为可被 RTOS 观测和治理的任务图节点。
  2. 比较固定优先级、EDF、混合优先级和准入控制在双目标场景下的边界。
  3. 以满足 TTFT + TPOT + 关键任务 deadline 的有效吞吐,而不是总 tokens/s,作为调度目标。
  4. 分析推理阶段不可抢占区间、驱动提交和完成中断对 RTA 的附加阻塞项。

5. 对应证据与实验

  • 指标:TTFT、TPOT、端到端时延、有效吞吐、关键任务 P99.9/Max、违约率。
  • 场景:L1、L2、L3、L5、L7。
  • 对照:FCFS/默认批处理、连续批处理、分块 prefill、完整 RTOS 方案及消融。
  • 关键边界:GPU/NPU 内核通常不能被 CPU 调度器直接细粒度抢占,必须实测设备与驱动行为。

6. 不应直接推出的结论

  • 云端 LLM 系统的 SLO 达标不等于硬实时保证。
  • 平均 tokens/s 提升不能说明关键保障任务更可预测。
  • RTA 中的执行时间和阻塞项若未经目标硬件测量,不能作为安全上界。