3.9 KiB
3.9 KiB
推理图任务调度参考
1. 与本项目的关系
本方向连接两类研究:一类是固定优先级、EDF、响应时间分析等经典实时调度理论;另一类是 LLM 服务中的连续批处理、prefill/decode 分离、分块 prefill 和 SLO 感知调度。本项目的增量应落在两者交叉处:把推理图阶段映射为可度量、可准入、可隔离的 RTOS 任务,同时保障关键周期任务。
2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| C. L. Liu, J. W. Layland, “Scheduling Algorithms for Multiprogramming in a Hard-Real-Time Environment,” JACM, 1973. DOI | A | 周期任务、固定优先级与 EDF 的理论基础 | 定义关键保障任务模型和可调度性讨论的起点 |
| N. Audsley et al., “Applying New Scheduling Theory to Static Priority Pre-emptive Scheduling,” 1993. DOI | A | 含阻塞和释放抖动的固定优先级响应时间分析 | 为推理、中断与共享资源干扰进入 RTA 提供基础 |
| W. Yu et al., “Orca: A Distributed Serving System for Transformer-Based Generative Models,” OSDI 2022. USENIX | A | 迭代级调度和连续批处理 | 作为 LLM 服务调度基线,不作为实时保证 |
| W. Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention,” SOSP 2023. arXiv | A/B | 请求调度与 KV 分页耦合、吞吐提升 | 支撑调度与内存联合设计及 vLLM 对照 |
| A. Agrawal et al., “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve,” OSDI 2024. USENIX | A | 分块 prefill、decode 干扰与吞吐—时延权衡 | 支撑 prefill 可分段化和关键任务插入点设计 |
| Y. Zhong et al., “DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving,” OSDI 2024. USENIX | A | TTFT/TPOT 双 SLO、prefill/decode 解耦和 goodput | 对应本项目 TTFT、TPOT 和有效吞吐联合门槛 |
3. 扩展参考
| 资料 | 关注点 |
|---|---|
| A. Gujarati et al., “Serving DNNs like Clockwork: Performance Predictability from the Bottom Up,” OSDI 2020. USENIX | DNN 推理可预测性、受控执行和 deadline-aware 调度 |
| A. Agrawal et al., “SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills,” 2023. arXiv | prefill 分块、decode-maximal batching 与流水线气泡 |
4. 可形成的论文论点
- 把
prefill/decode/postprocess从服务框架内部阶段提升为可被 RTOS 观测和治理的任务图节点。 - 比较固定优先级、EDF、混合优先级和准入控制在双目标场景下的边界。
- 以满足
TTFT + TPOT + 关键任务 deadline的有效吞吐,而不是总 tokens/s,作为调度目标。 - 分析推理阶段不可抢占区间、驱动提交和完成中断对 RTA 的附加阻塞项。
5. 对应证据与实验
- 指标:
TTFT、TPOT、端到端时延、有效吞吐、关键任务P99.9/Max、违约率。 - 场景:L1、L2、L3、L5、L7。
- 对照:FCFS/默认批处理、连续批处理、分块 prefill、完整 RTOS 方案及消融。
- 关键边界:GPU/NPU 内核通常不能被 CPU 调度器直接细粒度抢占,必须实测设备与驱动行为。
6. 不应直接推出的结论
- 云端 LLM 系统的 SLO 达标不等于硬实时保证。
- 平均 tokens/s 提升不能说明关键保障任务更可预测。
- RTA 中的执行时间和阻塞项若未经目标硬件测量,不能作为安全上界。