Files
rtos_llm_opt/最终稿文章规划.md

26 KiB
Raw Permalink Blame History

最终稿文章规划 — SylixOS 大模型推理调度框架研究

版本: v1.0 (最终稿规划)
日期: 2026-09-20
整合来源: 基础设备.md + 方案1.md v1.0 (大模型负载实验设计) + 方案2.md v2.0 (第三方基准复现方法学) +
目标产物: 一篇面向 RTSS/RTAS 级别的系统化研究文章 (含完整实验数据与基准对比)


0. 文章定位与核心贡献

0.1 一句话定位

用业界公认方法学,在四层连续算力硬件谱系 (1 GB → 2 TB / 3 W → 25 kW) 上,首次系统化评测国产 RTOS (SylixOS) 在大模型推理负载下的低延迟、低功耗与实时保号能力,填补 RTOS 在边缘~集群算力评测领域的数据空白。

0.2 三大核心贡献

编号 贡献 来源整合 对标空白
C1 四层连续算力谱系上的 RTOS 调度评测 — 从端级 RK3568 (1 GB/3 W) 到集群级 4×H100 (1.28 TB/25 kW),11 个档位覆盖被动散热→机房液冷全散热形态,首次在连续硬件梯度上刻画 RTOS 调度性能曲线 基础设备.md §0~§5 公开研究仅覆盖单一平台或两档对比,无连续谱系
C2 大模型混合负载下 RTOS 实时保号量化 — LLM 推理 + 1 ms 周期控制并发场景下,SylixOS 的 T_rt_max_under_llm 与 J_rt_under_llm 相对 Linux RT 的尾延迟优势量化 (≤30% = 显著优势) 方案1.md §3, §6, §9 公开基准仅测吞吐 FPS,未测混合负载下的实时任务保号
C3 RTOS 数据与业界公开基准首次横向对齐 — 引入第三方文章 (萤火虫数智笔记) 的 CPU/内存/NPU/功耗实测方法学与数据,在 SylixOS 上复现并对比,使 RTOS 数据首次可对外校验 方案2.md §2, §5, §7 国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失

0.3 目标读者与发表场景

维度 选择
目标会议 RTSS / RTAS (实时系统 Top-Tier) 或 ISLPED (低功耗)
备选 EMSOFT / DAC / MLSys (系统方向)
文章类型 系统评测 + 方法论论文 (非纯算法论文)
核心读者 RTOS 研究者、边缘 AI 系统工程师、国产化选型决策者

1. 文章整体结构 (十章)

第1章  引言 — 问题、动机、贡献概述
第2章  背景与相关工作 — LLM 推理特征 + RTOS 基础 + 差距分析
第3章  四层连续算力硬件谱系 — 11 档位体系设计与现有设备锚点
第4章  SylixOS 调度框架技术架构 — 五层技术栈与六大优化方向
第5章  实验方法学 — 第三方基准复现 + 混合负载场景 + 避坑约束
第6章  大模型负载选型与配置 — 跨档位模型矩阵
第7章  实验结果 — 基准对齐 + 实时性 + 能效 + 温度耦合
第8章  深入分析 — 档位间性能曲线 + RTOS vs Linux RT 差异化
第9章  讨论与威胁有效性 — 适用场景边界 + 局限性
第10章 结论与展望

2. 逐章详细规划

第1章 引言

目标: 300~500 词,点明矛盾、贡献、文章路线图。

小节 内容要点 来源映射
1.1 问题矛盾 RTOS 追求 µsms 级确定性 vs LLM 推理是 GB 级内存、s 级耗时的软实时负载;边缘集群场景中二者必须共存
1.2 研究空白 公开基准 (如萤火虫文章) 全部基于 Linux/Ubuntu,国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失;现有研究无连续硬件谱系 方案2.md §1.1
1.3 本文贡献 C1 (四层谱系评测)、C2 (混合负载保号量化)、C3 (业界基准对齐),一句话概述每个贡献
1.4 文章组织 十章路线图 本规划 §1

关键图表: 无 (引言章通常无图表或仅一张概念图)。


第2章 背景与相关工作

目标: 600~800 词,建立读者所需的 LLM 推理 + RTOS 双重背景。

小节 内容要点 来源映射
2.1 LLM 推理特征 prefill/decode 两阶段;CPU/内存密集;长尾分布;并发争抢;模型加载 IO 抖动 方案1.md §1.1
2.2 RTOS 调度基础 硬优先级 + 优先级继承;内存锁定;tickless;中断线程化;SMP 可预测调度;精简内核路径 方案1.md §1.1 表
2.3 Linux RT 相对短板 cgroup/kswapd 大模型加载停顿;PREEMPT_RT P99.9 仍受内核态长路径限制;tickless 仅 idle 启用 方案1.md §1.1
2.4 相关工作对比 vLLM/TGI (服务器级无实时保证)、Micro-LLM (模型压缩不关注 OS 调度)、NPU SDK (封闭黑箱)、CUDA Stream (无实时分析) FRAMEWORK.md §6, 方案2.md §2.4
2.5 第三方基准方法学 萤火虫文章的 5 维度方法学 (CPU/内存/NPU/功耗/温度) + 5 条避坑清单 方案2.md §2

关键图表:

编号 图表 描述
Fig.1 LLM 推理两阶段时序图 prefill (计算密集, 串行) vs decode (逐 token, KV Cache IO 密集) 的 RTOS 任务映射
Tab.1 SylixOS vs Linux RT 特性对比 6 项 RTOS 特性对应的大模型负载优势 + Linux RT 短板

第3章 四层连续算力硬件谱系

目标: 800~1000 词,这是 C1 的核心展示章,也是本文区别于其他单平台研究的最大差异化。

小节 内容要点 来源映射
3.1 分级维度与分档规则 以「统一内存/显存容量」为第一分类维度;边界值归上界;四层连续无断层 基础设备.md §0.1
3.2 全谱系总表 (11 档位) T4-L→T4-M→T4-H→T3-L→T3-M→T3-H→T2-L→T2-M→T2-H→T1-L→T1-H 的容量/算力/功耗/散热/代表设备/状态 基础设备.md §0.2
3.3 设计原则 容量连续功耗阶跃;CUDA 栈贯通 T1/T2/T3;非 CUDA 端路线 (T4 全档 + T3-L);现有硬件复用 (V100+RK3588 锚点);BSP 最小化 (x86+ARM64 两类) 基础设备.md §0.3
3.4 现有设备与采购计划 P0 零成本起步 (T2-L+T3-L+T4-H);一机两档 (RK3588 16 GB 同时充当 T3-L 与 T4-H);T1/T2-H 云替代 基础设备.md §6
3.5 各层级定位与验证重点 T1 跨节点分布式调度;T2 单机多卡 NVLink;T3 统一内存带宽隔离;T4 极致资源约束保号 基础设备.md T1~T4 各 §.1

关键图表:

编号 图表 描述
Fig.2 四层硬件谱系全景图 横轴=容量 (1 GB→2 TB, log 刻度), 纵轴=功耗 (3 W→25 kW, log 刻度), 11 个档位点标注, 散热形态用颜色分区 (被动/风冷/液冷/机房液冷)
Tab.2 11 档位全规格对比表 容量、算力、功耗、加速器架构、散热、互联、SylixOS BSP 风险、状态 (现有/需扩展)
Tab.3 模型规模梯度表 11 档位 × 代表模型 × 量化 × 显存占用 × 角色 (谱系下界→超大模型分布式)
Tab.4 采购计划表 P0~P4 优先级 + 估算费用 + 降本策略

第4章 SylixOS 调度框架技术架构

目标: 600~800 词,将 FRAMEWORK.md 的五层技术栈和六大优化方向浓缩为文章的技术背景章。

小节 内容要点 来源映射
4.1 核心问题定义 不是让 RTOS "跑大模型",而是用 RTOS 做 "LLM 推理资源的调度与协调" FRAMEWORK.md §0
4.2 五层技术栈 L1 硬件层 → L2 RTOS 调度核 → L3 资源抽象 (加速器驱动/DMA/内存控制器) → L4 运行时 (任务图/流水线/内存池) → L5 模型层 (量化/KV Cache/投机解码) FRAMEWORK.md §2
4.3 LLM 推理阶段 → RTOS 任务映射 Tokenizer→LOW, Embedding→HIGH, Attention→MAX, FFN→HIGH, KV Cache Write→MEDIUM, Sample→LOW;阶段特征矩阵 (计算/IO/延迟敏感/确定性/优先级) 01-inference-scheduling.md §2
4.4 六大优化方向概览 方向1 推理图任务调度 (Hybrid FP+EDF) → 方向2 KV Cache 内存池 → 方向3 加速器协同 → 方向4 量化感知调度 → 方向5 中断与实时 → 方向6 能耗热管理 FRAMEWORK.md §3, 01~06 子文档
4.5 SylixOS BSP 适配要点 x86 BSP (V100/H100 CUDA 驱动, NVLink, RDMA)、ARM64 BSP (RK3588/RK3576/RK3568 NPU 驱动, T234 Jetson BSP)、内存分区限额 (一机两档)、跨核通信 (M0+RPMsg) 基础设备.md §7 (BSP Checklist)

关键图表:

编号 图表 描述
Fig.3 五层技术栈架构图 L1~L5 层叠 + 每层关键组件 + 层间接口
Fig.4 LLM 推理 DAG → RTOS 任务图 推理阶段的有向无环图, 标注每阶段优先级 (MAX/HIGH/MEDIUM/LOW) 和可抢占性
Tab.5 推理阶段特征矩阵 阶段 × (计算密集度/IO 密集度/延迟敏感度/确定性要求/RTOS 优先级)
Tab.6 六大优化方向概览 方向 × (核心问题/关键手段/目标指标/对应章节)

第5章 实验方法学

目标: 800~1000 词,这是 C2 和 C3 的方法论基础,也是本文"可复现"承诺的核心。

小节 内容要点 来源映射
5.1 方法论框架 "基准测量 → 建模 → 算法设计 → 仿真验证 → 原型实现 → 实测对比" 六步循环 07-analysis-methods.md §1
5.2 第三方基准复现方法学 引入萤火虫文章的 5 维度方法 (CPU/内存/NPU/功耗/温度);在 SylixOS 上重跑 sysbench/stress-ng/RKNN,与文章数据对比 方案2.md §5.1~§5.3
5.3 混合负载实验设计四原则 原则1: 混合负载而非孤立;原则2: 看尾延迟不看均值;原则3: 突发场景而非稳态;原则4: 调度精细度而非裸吞吐 方案1.md §3
5.4 功耗真测强制约束 禁止仅靠软件读数;DC 功率计 (Yokogawa WT310) + INA226 采集板强制;采样 ≥1 Hz 方案2.md §5.4
5.5 温度监控强制约束 烤机 1 h 稳态 <75 ℃ 才采样;≥85 ℃ 数据作废;全程温度日志 方案2.md §5.5
5.6 环境元数据强制清单 OS/内核/BSP/固件/驱动/室温/散热/工具/量化/时间戳 10 项强制 方案2.md §5.6
5.7 对照组设计 OS 层: SylixOS vs Ubuntu+PREEMPT_RT vs (KVM/Docker);配置层: C0 默认 → C1 tuned → C2 extreme 方案1.md §7, 方案2.md §7.1

关键图表:

编号 图表 描述
Fig.5 实验方法论流程图 六步循环 + 第三方基准对齐校验门 (±15% 才准入主场景)
Tab.7 业界基准对照表 指标 × (文章基线 / SylixOS 实测 / 偏差 / 评判) — CPU 单核1280、多核7120、YOLOv5s 32 FPS、3B LLM ~90 tok/s
Tab.8 避坑清单映射 5 条避坑点 × (强制约束/验证方式/落实位置)
Tab.9 环境元数据清单模板 10 项元数据 × 示例值

第6章 大模型负载选型与配置

目标: 500~700 词,定义跨 11 档位的模型矩阵。

小节 内容要点 来源映射
6.1 选型原则 国产化优先 (Qwen/MiniCPM);跨架构可比 (x86+CUDA 与 ARM+NPU);量化版本完整 (FP16/INT8/INT4);社区生态成熟 (vLLM/llama.cpp/TensorRT-LLM/RKLLM) 方案1.md §2.1
6.2 跨档位模型矩阵 T4-L: Qwen2.5-0.5B INT4;T4-M: 1.5B INT4;T4-H: 3B/7B INT4;T3-L: 3B/7B INT4 (RKLLM);T3-M: 14B/32B INT4 (TensorRT-LLM);T3-H: 72B INT4;T2-L: 72B INT4/14B FP16;T2-M: 72B FP16;T2-H: DeepSeek-V2 FP16;T1-L: 72B FP16 分布式;T1-H: 671B INT4 基础设备.md §5.2 + 方案1.md §2.2~§2.3
6.3 推理框架与配置 vLLM (T2/T1)、TensorRT-LLM (T2/T3-M/H)、llama.cpp (T2-L/T3-L 退路)、RKLLM (T4/T3-L);batch 1/8/32;上下文 512/2048/8192;并发 1/8/32 方案1.md §2.2~§2.4
6.4 负载生成器 vLLM benchmark / llama-bench / 自研并发客户端 / RKLLM demo / 自研 LLM+RT 混合负载驱动脚本 方案1.md §2.4

关键图表:

编号 图表 描述
Tab.10 跨档位模型矩阵 11 档位 × (代表模型/参数/量化/显存占用/并发实例/推理框架/预期 tok/s)
Tab.11 负载生成器清单 工具 × 平台 × 角色 × SylixOS 可用性

第7章 实验结果

目标: 1500~2000 词,本文篇幅最大的章节,展示全部实验数据。

小节 内容要点 来源映射
7.1 基准对齐结果 (第一层判据) SylixOS 在 RK3588 上的 CPU 单核/多核 (sysbench)、内存带宽、NPU FPS (YOLOv5s/ResNet18/MobileNetV2)、3B LLM tok/s 与文章基线的偏差 (目标 ±10%~±20%) 方案2.md §7.2, §9.3 第一层
7.2 低功耗结果 P_idle / P_prefill / P_decode / E_per_token 分阶段功耗曲线;T2-L (V100) 与 T3-L/T4-H (RK3588) 两平台对照;SylixOS vs Linux RT 能效比 方案1.md §5.1, §6.7, 方案2.md §4.1
7.3 低延迟结果 T_irq / T_sched / T_ctx P50~Max;T_ttft / T_tok 尾延迟分布直方图;SylixOS vs Linux RT P99.9/Max/σ 对比 方案1.md §5.2, §6.5
7.4 混合负载保号结果 (★ 核心) 场景1: LLM 推理 + 1 ms 周期控制并发;T_rt_max_under_llm / J_rt_under_llm;4 变体 (A1 Linux RT 默认 / A2 Linux RT tuned / A3 SylixOS 默认 / A4 SylixOS 极限);30 min 全周期延迟时间序列图 方案1.md §6.1, §5.3, §9.3
7.5 多模型并发与突发场景 场景2: 多模型流水线 P0/P1/P2 优先级公平性;场景3: 突发加载/切换瞬间实时性保持;场景4: GPU/NPU 多请求调度公平性 方案1.md §6.2~§6.4
7.6 温度-功耗-性能耦合 场景8: 25%→100% CPU 逐步加压的三维耦合曲线;SylixOS vs Linux RT 降频触发温度与性能下降斜率 方案2.md §4.4, §6.8
7.7 异构核分配 场景6: RK3588 大核 A76 (LLM) + 小核 A55 (1 ms RT) + M0 (100 µs 控制) 的 SylixOS 异构调度优势 方案1.md §6.6
7.8 跨档位性能曲线 11 档位上 T_sched P99.9 / E_per_token / T_rt_max_under_llm 的连续曲线 (现有 P0 档位实测 + 扩展档位预估) 基础设备.md §5.3, 基础设备.md §5.1~§5.2

关键图表:

编号 图表 描述
Tab.12 业界基准复现对比表 (最终版) 填入 SylixOS 实测值与偏差列
Fig.6 功耗分阶段曲线 prefill 峰值 → decode 稳态 → idle 的 W(t) 曲线, SylixOS vs Linux RT 叠加
Fig.7 混合负载实时任务延迟分布 (★ 核心证据) P50~Max 直方图 + 时间序列, 4 变体叠加, 突出 A4 的"细长尾部"优势
Fig.8 LLM token 延迟直方图 Qwen2.5-7B 1 流 1 h 采集, SylixOS vs Linux RT
Fig.9 突发加载瞬间时间序列 模型加载瞬间实时任务延迟 spike, SylixOS ≤50 µs vs Linux RT 100 µs~1 ms
Fig.10 温度-功耗-性能三维耦合曲线 T_core / P / perf 三轴, 不同 CPU 负载档位
Fig.11 跨档位性能连续曲线 横轴=11 档位 (T4-L→T1-H), 纵轴=P99.9 调度延迟 / E_per_token / T_rt_max, 三条曲线
Tab.13 通过判据三层汇总 第一层基准对齐 + 第二层实时性 + 第三层优越性量化

第8章 深入分析

目标: 800~1000 词,从数据中提炼规律性结论。

小节 内容要点 来源映射
8.1 档位间性能曲线规律 容量每 ×2 时 RTOS 优势的变化趋势;端级 (资源越紧→RTOS 价值越大) vs 集群级 (资源充裕→RTOS 优势收窄) 的拐点分析 基础设备.md §5.3
8.2 SylixOS vs Linux RT 差异化量化 按 §9.4 优越性判据:T_rt_max_under_llm ≤30% = 显著优势 / ≤60% = 可比偏优 / >60% = 未体现;按档位和场景分别判定 方案1.md §9.4
8.3 混合负载下 RTOS 优势的根因 硬优先级 + 优先级继承 → 不被 decode 抢占;内存锁定 → KV Cache 抖动不驱逐关键页;精简内核路径 → 加载大模型不引入额外抖动;中断线程化 + 亲和性 → NPU 中断不污染实时核 方案1.md §1.1 表, 05-irq-realtime.md
8.4 能效分析 每 token 能耗 vs 档位 (V100 集群能效基线 vs H100 能效上限);INT4 vs FP16 的能效拐点;RKLLM NPU vs CUDA GPU 的 J/token 对比 基础设备.md §0.3, 06-power-thermal.md
8.5 BSP 风险与可行性 x86 BSP (低风险, V100 已验证) vs ARM64 RK3588 BSP (极低, 现有) vs T234 Jetson BSP (高, 需翼辉确认) vs RKLLM 移植 (高, 核心风险);档位跳跃验证降本策略 基础设备.md §7, 方案1.md §10

关键图表:

编号 图表 描述
Fig.12 RTOS 优势 vs 硬件档位趋势图 横轴=11 档位, 纵轴=SylixOS 相对 Linux RT 的 P99.9 改善百分比, 标注"显著优势/可比偏优/未体现"区间
Tab.14 优越性量化结论矩阵 场景 × 档位 × (T_rt_max 比值 / 判定结论)
Tab.15 BSP 风险与可行性矩阵 档位 × (BSP 类型/风险等级/状态/降本策略)

第9章 讨论与威胁有效性

目标: 400~600 词,诚实地界定适用边界和局限性。

小节 内容要点 来源映射
9.1 适用场景边界 资源越紧张 (T4) → RTOS 价值越大;资源充裕 (T1-H) → RTOS 优势收窄, 可能"可比偏优";混合负载 (LLM+RT 并发) → RTOS 杀手锏;纯吞吐场景 → 通用 OS 可能更高 方案1.md §3, §9.4
9.2 威胁有效性 (1) RKLLM 移植风险: 若未完成, 退路 llama.cpp CPU 推理但失去 NPU 优势, 需标注; (2) V100 驱动成熟度: 4 卡 NVLink 联用可能受限, 单卡先行; (3) sysbench/stress-ng 移植: POSIX 兼容可行性高但需验证; (4) 量化精度差异: 同模型同量化跨 OS 不变, 已控制; (5) 室温/散热波动: 25±2 ℃ + 液冷恒定 方案1.md §10, 方案2.md §11
9.3 与已有工作的关系 vs vLLM/TGI (服务器级, 无实时保证)、vs NPU SDK (封闭黑箱)、vs CUDA Stream (无实时分析)、vs 第三方文章 (仅 Linux, 仅 RK3588, 未测实时性) FRAMEWORK.md §6, 方案2.md §2.4
9.4 方法论局限 文章仅引用单一第三方来源 (萤火虫文章), 跨平台参照 (昇腾 Qwen-7B) 为非本方案硬件; 消融实验仅在现有 P0 档位可完整执行; 扩展档位 (T1-H/T2-H) 依赖云租替代, 数据可比性需说明 方案2.md §13 后续建议

第10章 结论与展望

目标: 300~400 词,总结贡献并指出未来方向。

小节 内容要点
10.1 结论 重申 C1/C2/C3 三大贡献的量化结果 (基准对齐 ±X%、混合负载 ≤Linux RT X%、能效 ≤Linux RT X%)
10.2 展望 跨平台横向对比 (RK3588 vs Jetson vs 昇腾); 功能安全 SIL2/IEC 61508 关联; 多机分布式推理; 昇腾 Qwen-7B 作为第二业界参照点; 自适应优先级与动态 WCET 估计
10.3 开放研究问题 动态 WCET 在线估计; 运行时自适应优先级; 跨层优化 (调度+量化联合); 预测式调度; 容错恢复调度

3. 来源文档到章节的映射矩阵

来源文档 主要贡献章节 次要贡献章节
基础设备.md §3 (硬件谱系) §4.5 (BSP 适配), §6.2 (模型矩阵), §7.8 (跨档位曲线), §8.1 (档位趋势), §8.5 (BSP 风险)
方案1.md v1.0 §5.3 (四原则), §7.4 (混合负载) §2.1~§2.3 (LLM 推理特征/RTOS 优势/Linux 短板), §5.7 (对照组), §6 (模型选型), §7.2~§7.5 (功耗/延迟/并发/突发), §7.7 (异构), §8.2 (优越性量化), §9.2 (威胁有效性)
方案2.md v2.0 §5.2 (基准复现), §5.4~§5.6 (强制约束) §2.5 (第三方方法学), §7.1 (基准对齐结果), §7.6 (温度耦合), §9.3 (与已有工作关系), §9.4 (方法论局限)
FRAMEWORK.md §4 (技术架构) §1 (核心问题), §2.4 (相关工作), §8.3 (根因分析), §10.3 (开放问题)
01-inference-scheduling.md §4.3 (任务映射) §7.4 (混合负载调度模型), §8.3 (根因)
02-kv-cache-memory.md §4.4 (方向2 概览) §7.4 (KV Cache 对实时任务的影响), §8.4 (能效)
03-accelerator-collab.md §4.4 (方向3 概览) §7.7 (异构核分配), §8.3 (根因)
04-quantization-scheduling.md §4.4 (方向4 概览) §6.2 (量化选型), §8.4 (能效拐点)
05-irq-realtime.md §4.4 (方向5 概览) §7.3 (中断延迟), §8.3 (根因)
06-power-thermal.md §4.4 (方向6 概览) §7.2 (功耗), §7.6 (温度耦合), §8.4 (能效)
07-analysis-methods.md §5.1 (方法论框架) §7 (评估指标体系), §8 (分析方法), §9 (消融实验设计)

4. 关键数据产物清单

编号 产物 类型 优先级 依赖
D1 11 档位硬件规格总表 数据表 P0 基础设备.md 已就绪
D2 跨档位模型矩阵 数据表 P0 基础设备.md + 方案1.md 已就绪
D3 RK3588 上 sysbench/stress-ng 基准复现数据 实测数据 P0 需 SylixOS BSP + sysbench 移植
D4 业界基准对比表 (SylixOS vs 文章基线) 对比表 P0 D3
D5 混合负载 30 min 全周期延迟时间序列 实测数据 P0 需混合负载驱动脚本 + 4 变体
D6 混合负载延迟分布直方图 (4 变体叠加) 图表 P0 D5
D7 功耗分阶段曲线 (prefill/decode/idle) 图表 P0 功率计采集 + LLM 推理
D8 LLM token 延迟直方图 (1 h 采集) 图表 P1 vLLM/RKLLM benchmark
D9 突发加载瞬间实时任务时间序列 图表 P1 混合负载脚本 + 模型切换
D10 温度-功耗-性能三维耦合曲线 图表 P1 stress-ng 逐步加压 + 温度日志
D11 跨档位性能连续曲线 图表 P1 P0 档位实测 + P1~P4 档位预估
D12 优越性量化结论矩阵 分析表 P1 D4+D6+D7
D13 环境元数据清单 (每份数据附) 元数据 P0 方案2.md §5.6 模板

5. 写作优先级与依赖关系

Phase 0: BSP 适配 + 工具移植 (3 周)
  ├─ SylixOS RK3588 BSP 部署
  ├─ sysbench / stress-ng / RKLLM 移植验证
  └─ vLLM / llama.cpp 在 SylixOS 编译运行

Phase 1: 基准复现 + 文章骨架 (1.5 周)
  ├─ D3: RK3588 基准复现 → D4: 业界对比表
  ├─ 撰写: §1 引言 + §2 背景 + §3 硬件谱系 + §4 技术架构 + §5 方法学 + §6 模型选型
  └─ 依赖: D3 通过 ±15% 对齐门 → 准入 Phase 2

Phase 2: 低功耗测试 + 温度耦合 (2 周)
  ├─ D7: 功耗曲线 + D10: 温度耦合曲线
  └─ 撰写: §7.2 + §7.6

Phase 3: 低延迟 + 混合负载测试 (3 周)
  ├─ D5+D6: 混合负载核心证据 + D8: token 延迟直方图 + D9: 突发场景
  └─ 撰写: §7.3 + §7.4 + §7.5

Phase 4: 异构调度测试 (1 周)
  ├─ 场景6: A76+A55+M0 异构分配
  └─ 撰写: §7.7

Phase 5: 数据汇总 + 深入分析 + 全文定稿 (2.5 周)
  ├─ D11: 跨档位曲线 + D12: 优越性矩阵
  ├─ 撰写: §7.8 + §8 深入分析 + §9 讨论 + §10 结论
  └─ 全文校对 + 图表终版

总周期: ~13 周 (Phase 0~5 累计)


6. 章节字数预算

章节 预算字数 占比
§1 引言 400 4%
§2 背景与相关工作 700 7%
§3 四层硬件谱系 900 9%
§4 技术架构 700 7%
§5 实验方法学 900 9%
§6 模型选型 600 6%
§7 实验结果 1800 18%
§8 深入分析 900 9%
§9 讨论 500 5%
§10 结论 350 3%
参考文献 + 附录 ~2000 23%
总计 ~9750 100%

注: 按 RTSS/RTAS 会议论文 1012 页双栏计算, 正文约 800010000 词, 参考文献+附录另计。


7. 核心叙事线 (Storyline)

问题矛盾 (§1)
  → RTOS 确定性 vs LLM 计算密集, 边缘~集群必须共存
  → 空白: 国产 RTOS 在边缘算力上零实测数据

背景铺垫 (§2)
  → LLM 推理的 CPU/内存/长尾特征
  → RTOS 的 6 项调度优势 + Linux RT 的 3 项短板
  → 第三方方法学引入 (5 维度 + 5 避坑)

硬件谱系 (§3) ← C1 差异化
  → 11 档位连续梯度: 1 GB/3 W → 2 TB/25 kW
  → 现有 P0 零成本起步 (V100 + RK3588)
  → 一机两档降本

技术架构 (§4)
  → 五层技术栈 + 六大优化方向
  → LLM 推理 DAG → RTOS 任务映射
  → BSP 适配要点与风险

方法学 (§5) ← C2/C3 基础
  → 第三方基准复现 (先对齐 ±15% 才准入)
  → 混合负载四原则 (杀手锏设计)
  → 功耗真测 + 温度监控 + 元数据强制

模型选型 (§6)
  → 跨 11 档位的 Qwen/LLaMA/MiniCPM/Whisper 矩阵
  → INT4/INT8/FP16 量化梯度

实验结果 (§7) ← 本文核心
  → 7.1 基准对齐 (第一层门)
  → 7.2~7.3 功耗/延迟 (基础指标)
  → 7.4 混合负载保号 (★ 杀手锏证据)
  → 7.5~7.7 并发/突发/异构
  → 7.8 跨档位连续曲线

深入分析 (§8)
  → 档位间趋势: 资源越紧 → RTOS 价值越大
  → 优越性量化: ≤30% 显著优势 / ≤60% 可比偏优
  → 根因: 硬优先级 + 内存锁定 + 精简内核 + 中断亲和
  → 能效: V100 基线 vs H100 上限, INT4 拐点

讨论 (§9)
  → 适用边界: T4 杀手锏, T1-H 可能收窄
  → 威胁有效性: RKLLM 移植/V100 驱动/sysbench 移植
  → 与已有工作: vs vLLM/NPU SDK/CUDA Stream/第三方文章

结论 (§10)
  → 三大贡献量化回顾
  → 跨平台/功能安全/分布式/自适应展望

8. 待确认事项

编号 待确认项 影响章节 当前假设
Q1 SylixOS 在 x86+4×V100 NVLink 的 CUDA 驱动支持度 §4.5, §7.3, §8.5 需翼辉确认; 单卡先行, 4 卡作 stretch
Q2 RK3588 BSP 是否集成 rknn/RKLLM §5.2, §7.1, §9.2 需翼辉确认; 退路 llama.cpp CPU
Q3 sysbench/stress-ng 在 SylixOS 可移植性 §5.2, §7.1 POSIX 兼容, 假设可行
Q4 T234 (Jetson Orin) BSP 是否支持 §3.2 (T3-M/H) 风险高; T3-L 用 RK3588 起步
Q5 RK3588 板卡是否引出 M0 调试接口 §7.7 (场景6) 若未引出, 场景6 需调整
Q6 是否纳入功能安全 SIL2/IEC 61508 章节 §10.2 展望 暂列为展望, 不入正文
Q7 是否纳入昇腾 Qwen-7B 作为第二业界参照 §7.1, §9.4 暂列为后续, 非本方案硬件
Q8 主对照组确认: Ubuntu 22.04+PREEMPT_RT §5.7 与第三方文章配置一致, 可比性最高