Files
rtos_llm_opt/说明文档.md
T
2026-09-20 05:46:36 +00:00

133 lines
8.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# SylixOS 大模型推理调度研究逻辑说明
## 1. 文档目的
本文用于解释[整体逻辑流程图](./整体逻辑流程图.md),说明《基础设备.md》《实验设计.md》和《最终稿文章规划.md》如何共同组成一套完整的研究方案。
三份文档承担不同职责:
| 文档 | 回答的问题 | 在研究中的作用 |
|---|---|---|
| [基础设备.md](./基础设备.md) | 在哪些硬件条件下研究? | 定义四层、十一档硬件谱系及现有设备锚点 |
| [实验设计.md](./实验设计.md) | 如何产生可信且可复现的证据? | 定义准入、对照、负载、指标、统计与验收方法 |
| [最终稿文章规划.md](./最终稿文章规划.md) | 如何把证据组织成论文贡献? | 把硬件、方法、结果和分析映射到论文十章结构 |
整个研究的主线是:
> 硬件谱系 → 软件与模型准入 → 公平对照 → 混合负载实验 → 可复现数据 → 跨档位规律 → 论文贡献。
## 2. 核心研究矛盾
实时控制任务通常要求微秒到毫秒级的确定性,大模型推理却会长时间占用 CPU、内存、总线、GPU 或 NPU,并产生排队、模型加载、KV Cache 和中断干扰。两类任务共存时,单纯提高模型吞吐不能说明系统适合实时场景。
因此,本研究不只考察“模型能跑多快”,而是同时回答三个问题:
1. 在 LLM 推理干扰下,1 ms 周期任务是否仍能满足截止期?
2. SylixOS 的资源隔离和调度机制能否改善尾延迟,同时避免过大的推理吞吐损失?
3. 在满足相同实时性和推理服务约束时,系统能否降低每 token 能耗?
## 3. 为什么建立四层硬件谱系
《基础设备.md》以可用内存或显存为主要分级维度,构建端、边、桌面和集群四个层级。这样可以观察系统瓶颈随硬件规模变化的过程:
| 层级 | 主要资源矛盾 | 研究重点 |
|---|---|---|
| T4 端级 | 内存和功耗预算非常紧张 | 极小资源下的实时任务保留能力 |
| T3 边级 | CPU、NPU/GPU 共享统一内存 | 带宽隔离、多模型竞争和功率模式 |
| T2 桌面级 | 多 GPU 共享 CPU、内存与互联 | NVLink 通信、多卡调度和并发公平性 |
| T1 集群级 | 节点内计算与节点间通信耦合 | RDMA/NCCL 抖动及跨节点调度 |
当前最重要的实测锚点是:
- RK3588 16 GB 作为 T3-L 边级平台;
- 同一 RK3588 施加 8 GB 内存预算,作为 T4-H 受限配置;
- 4×V100、128 GB 总显存服务器作为 T2-L 桌面级平台。
其余档位用于后续采购、扩容或云租后的条件扩展。现有设备负责产生核心证据,扩展设备用于验证规律能否跨硬件规模成立。
需要注意,RK3588 的 8 GB 限额配置只能用于研究内存预算变化,不能等同于真实 8 GB 板卡的功耗、物理带宽或热特性。
## 4. 为什么必须先做准入
设备可以启动,不代表加速器、模型和混合负载已经具备可比较条件。因此实验被划分为五个连续门槛:
| 门槛 | 核心检查内容 |
|---|---|
| G0 设备准入 | 启动、SMP、容量、接口和硬件拓扑 |
| G1 测量准入 | 单调时钟、周期任务、日志和功耗仪器 |
| G2 加速器准入 | CUDA、RKLLM、RKNN、驱动和基本算子 |
| G3 模型准入 | 模型转换、加载、正确推理和峰值内存 |
| G4 混合负载准入 | RT 与 LLM 同时稳定运行至少 30 分钟 |
只有通过 G4 的配置才能进入正式对照实验。准入失败本身也是研究结果,应记录为 BSP、驱动、模型格式或容量限制,不能用估计值补齐。
## 5. 如何保证对照公平
主对照包括普通 Linux、Linux PREEMPT_RT、SylixOS 默认配置和 SylixOS 优化配置。比较时需要固定:
- 模型版本、量化格式、tokenizer、输入长度、输出长度和随机种子;
- CPU 核数量、实时优先级、内存预算、加速器数量和频率策略;
- 推理请求到达序列、背景干扰强度、预热时间和测量窗口;
- 环境温度、散热条件、驱动与框架版本。
如果两个系统无法使用等价推理后端,结果应表述为“完整系统方案比较”,不能只归因于操作系统调度器。
## 6. 实验如何逐步展开
实验采用从简单到复杂的顺序:
1. E0 确认设备、测量和空载基线。
2. E1 测量实时任务唤醒、响应、IPC 和物理接口延迟。
3. E2 单独测量模型容量、TTFT、TPOT、吞吐和能耗。
4. E3 运行核心场景,即 1 ms 实时任务与 LLM 推理并发。
5. E4 比较 RK3588 的 16 GB 与 8 GB 预算配置。
6. E5 比较 V100 的 1、2、4 卡运行状态及公平性。
7. E6 分析温度、频率、功耗与性能耦合。
8. E7 逐项移除核隔离、IRQ 亲和、内存预分配、准入控制等机制,确认收益来源。
9. E8 对最终候选配置进行 24 小时长稳与恢复测试。
背景负载从仅实时任务、仅推理逐步增加到 RT+LLM、CPU/内存/I/O 干扰以及突发过载。这样可以确定系统在哪一个压力区间开始出现排队、降频或截止期违约。
## 7. 哪些指标构成核心证据
实时性证据包括 P50、P95、P99、P99.9、观测最大响应时间和截止期违约率。论文中的“实时保号”必须建立在截止期违约统计和完整样本量上,不能只比较平均延迟。
推理服务证据包括 TTFT、TPOT、成功请求吞吐、有效吞吐、成功率、超时率和拒绝率。有效吞吐只统计满足预先冻结服务约束的请求,防止通过拒绝请求或牺牲实时任务获得虚假吞吐优势。
功耗证据使用整机输入端功率测量,计算 J/token 和 tokens/J,并同时记录温度、实际频率和降频时间。GPU/NPU 软件遥测可以用于解释能耗来源,但不能代替整机功率计。
多卡和多节点实验还需要报告强扩展效率、弱扩展吞吐、通信尾延迟和多租户公平性。
## 8. 数据如何转化为论文贡献
实验数据最终对应三项贡献:
| 贡献 | 所需证据 | 对应论文内容 |
|---|---|---|
| C1 四层连续算力谱系评测 | 各档位的容量、功耗、瓶颈与扩展趋势 | 第3章硬件谱系、第7章结果、第8章跨档位分析 |
| C2 混合负载实时保号量化 | RT+LLM 下的尾延迟、违约率、有效吞吐和消融结果 | 第4章调度机制、第5章方法、第7章核心结果 |
| C3 可复现方法与基准对齐 | 统一输入、环境元数据、完整原始数据和外部基准复现 | 第5章方法学、第7章基准结果、第9章有效性威胁 |
文章的论证顺序应保持为:先说明为什么需要四层谱系,再说明 SylixOS 的调度机制和实验方法,然后给出结果,最后讨论优势产生的原因、适用范围和局限性。
## 9. 实测、计划与结论边界
论文中应严格区分以下三类内容:
- **实测结果**:已通过准入并完成实验的数据;
- **候选目标**:正式实验前冻结的服务或性能阈值;
- **扩展计划**:尚未获得设备、驱动或测量条件的实验。
设备标称 TOPS、TFLOPS、TDP 和模型预估 tokens/s 不能写成实验结果。FP16 TFLOPS 与 INT8 TOPS不能直接比较,多卡总显存也不能直接推导模型一定可运行。
24 小时无违约只能表述为“在指定工况和样本量下未观测到违约”,不能证明理论最坏情况。没有温箱数据时,也不能宣称已经验证 RK3588 的完整工业温区。
## 10. 最终闭环
这套研究的最终闭环不是追求某一平台的最高 tokens/s,而是寻找一条可重复验证的关系:
> 随着资源从端级扩展到集群级,SylixOS 的实时调度和资源隔离在什么负载范围内能显著改善实时任务确定性,这种改善需要付出多少吞吐和能耗代价,其优势又会在哪个硬件档位开始减弱。
如果数据支持该关系,就形成四层硬件谱系、混合负载实时保号和统一评测方法三项论文贡献;如果某些档位不支持,也应把适配失败、容量上限和优势消失的边界作为研究结论的一部分。