最终稿文章规划 — SylixOS 大模型推理调度框架研究
版本: v1.0 (最终稿规划)
日期: 2026-09-20
整合来源: 基础设备.md + 方案1.md v1.0 (大模型负载实验设计) + 方案2.md v2.0 (第三方基准复现方法学) +
目标产物: 一篇面向 RTSS/RTAS 级别的系统化研究文章 (含完整实验数据与基准对比)
0. 文章定位与核心贡献
0.1 一句话定位
用业界公认方法学,在四层连续算力硬件谱系 (1 GB → 2 TB / 3 W → 25 kW) 上,首次系统化评测国产 RTOS (SylixOS) 在大模型推理负载下的低延迟、低功耗与实时保号能力,填补 RTOS 在边缘~集群算力评测领域的数据空白。
0.2 三大核心贡献
| 编号 |
贡献 |
来源整合 |
对标空白 |
| C1 |
四层连续算力谱系上的 RTOS 调度评测 — 从端级 RK3568 (1 GB/3 W) 到集群级 4×H100 (1.28 TB/25 kW),11 个档位覆盖被动散热→机房液冷全散热形态,首次在连续硬件梯度上刻画 RTOS 调度性能曲线 |
基础设备.md §0~§5 |
公开研究仅覆盖单一平台或两档对比,无连续谱系 |
| C2 |
大模型混合负载下 RTOS 实时保号量化 — LLM 推理 + 1 ms 周期控制并发场景下,SylixOS 的 T_rt_max_under_llm 与 J_rt_under_llm 相对 Linux RT 的尾延迟优势量化 (≤30% = 显著优势) |
方案1.md §3, §6, §9 |
公开基准仅测吞吐 FPS,未测混合负载下的实时任务保号 |
| C3 |
RTOS 数据与业界公开基准首次横向对齐 — 引入第三方文章 (萤火虫数智笔记) 的 CPU/内存/NPU/功耗实测方法学与数据,在 SylixOS 上复现并对比,使 RTOS 数据首次可对外校验 |
方案2.md §2, §5, §7 |
国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失 |
0.3 目标读者与发表场景
| 维度 |
选择 |
| 目标会议 |
RTSS / RTAS (实时系统 Top-Tier) 或 ISLPED (低功耗) |
| 备选 |
EMSOFT / DAC / MLSys (系统方向) |
| 文章类型 |
系统评测 + 方法论论文 (非纯算法论文) |
| 核心读者 |
RTOS 研究者、边缘 AI 系统工程师、国产化选型决策者 |
1. 文章整体结构 (十章)
2. 逐章详细规划
第1章 引言
目标: 300~500 词,点明矛盾、贡献、文章路线图。
| 小节 |
内容要点 |
来源映射 |
| 1.1 问题矛盾 |
RTOS 追求 µsms 级确定性 vs LLM 推理是 GB 级内存、s 级耗时的软实时负载;边缘集群场景中二者必须共存 |
|
| 1.2 研究空白 |
公开基准 (如萤火虫文章) 全部基于 Linux/Ubuntu,国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失;现有研究无连续硬件谱系 |
方案2.md §1.1 |
| 1.3 本文贡献 |
C1 (四层谱系评测)、C2 (混合负载保号量化)、C3 (业界基准对齐),一句话概述每个贡献 |
|
| 1.4 文章组织 |
十章路线图 |
本规划 §1 |
关键图表: 无 (引言章通常无图表或仅一张概念图)。
第2章 背景与相关工作
目标: 600~800 词,建立读者所需的 LLM 推理 + RTOS 双重背景。
| 小节 |
内容要点 |
来源映射 |
| 2.1 LLM 推理特征 |
prefill/decode 两阶段;CPU/内存密集;长尾分布;并发争抢;模型加载 IO 抖动 |
方案1.md §1.1 |
| 2.2 RTOS 调度基础 |
硬优先级 + 优先级继承;内存锁定;tickless;中断线程化;SMP 可预测调度;精简内核路径 |
方案1.md §1.1 表 |
| 2.3 Linux RT 相对短板 |
cgroup/kswapd 大模型加载停顿;PREEMPT_RT P99.9 仍受内核态长路径限制;tickless 仅 idle 启用 |
方案1.md §1.1 |
| 2.4 相关工作对比 |
vLLM/TGI (服务器级无实时保证)、Micro-LLM (模型压缩不关注 OS 调度)、NPU SDK (封闭黑箱)、CUDA Stream (无实时分析) |
FRAMEWORK.md §6, 方案2.md §2.4 |
| 2.5 第三方基准方法学 |
萤火虫文章的 5 维度方法学 (CPU/内存/NPU/功耗/温度) + 5 条避坑清单 |
方案2.md §2 |
关键图表:
| 编号 |
图表 |
描述 |
| Fig.1 |
LLM 推理两阶段时序图 |
prefill (计算密集, 串行) vs decode (逐 token, KV Cache IO 密集) 的 RTOS 任务映射 |
| Tab.1 |
SylixOS vs Linux RT 特性对比 |
6 项 RTOS 特性对应的大模型负载优势 + Linux RT 短板 |
第3章 四层连续算力硬件谱系
目标: 800~1000 词,这是 C1 的核心展示章,也是本文区别于其他单平台研究的最大差异化。
| 小节 |
内容要点 |
来源映射 |
| 3.1 分级维度与分档规则 |
以「统一内存/显存容量」为第一分类维度;边界值归上界;四层连续无断层 |
基础设备.md §0.1 |
| 3.2 全谱系总表 (11 档位) |
T4-L→T4-M→T4-H→T3-L→T3-M→T3-H→T2-L→T2-M→T2-H→T1-L→T1-H 的容量/算力/功耗/散热/代表设备/状态 |
基础设备.md §0.2 |
| 3.3 设计原则 |
容量连续功耗阶跃;CUDA 栈贯通 T1/T2/T3;非 CUDA 端路线 (T4 全档 + T3-L);现有硬件复用 (V100+RK3588 锚点);BSP 最小化 (x86+ARM64 两类) |
基础设备.md §0.3 |
| 3.4 现有设备与采购计划 |
P0 零成本起步 (T2-L+T3-L+T4-H);一机两档 (RK3588 16 GB 同时充当 T3-L 与 T4-H);T1/T2-H 云替代 |
基础设备.md §6 |
| 3.5 各层级定位与验证重点 |
T1 跨节点分布式调度;T2 单机多卡 NVLink;T3 统一内存带宽隔离;T4 极致资源约束保号 |
基础设备.md T1~T4 各 §.1 |
关键图表:
| 编号 |
图表 |
描述 |
| Fig.2 |
四层硬件谱系全景图 |
横轴=容量 (1 GB→2 TB, log 刻度), 纵轴=功耗 (3 W→25 kW, log 刻度), 11 个档位点标注, 散热形态用颜色分区 (被动/风冷/液冷/机房液冷) |
| Tab.2 |
11 档位全规格对比表 |
容量、算力、功耗、加速器架构、散热、互联、SylixOS BSP 风险、状态 (现有/需扩展) |
| Tab.3 |
模型规模梯度表 |
11 档位 × 代表模型 × 量化 × 显存占用 × 角色 (谱系下界→超大模型分布式) |
| Tab.4 |
采购计划表 |
P0~P4 优先级 + 估算费用 + 降本策略 |
第4章 SylixOS 调度框架技术架构
目标: 600~800 词,将 FRAMEWORK.md 的五层技术栈和六大优化方向浓缩为文章的技术背景章。
| 小节 |
内容要点 |
来源映射 |
| 4.1 核心问题定义 |
不是让 RTOS "跑大模型",而是用 RTOS 做 "LLM 推理资源的调度与协调" |
FRAMEWORK.md §0 |
| 4.2 五层技术栈 |
L1 硬件层 → L2 RTOS 调度核 → L3 资源抽象 (加速器驱动/DMA/内存控制器) → L4 运行时 (任务图/流水线/内存池) → L5 模型层 (量化/KV Cache/投机解码) |
FRAMEWORK.md §2 |
| 4.3 LLM 推理阶段 → RTOS 任务映射 |
Tokenizer→LOW, Embedding→HIGH, Attention→MAX, FFN→HIGH, KV Cache Write→MEDIUM, Sample→LOW;阶段特征矩阵 (计算/IO/延迟敏感/确定性/优先级) |
01-inference-scheduling.md §2 |
| 4.4 六大优化方向概览 |
方向1 推理图任务调度 (Hybrid FP+EDF) → 方向2 KV Cache 内存池 → 方向3 加速器协同 → 方向4 量化感知调度 → 方向5 中断与实时 → 方向6 能耗热管理 |
FRAMEWORK.md §3, 01~06 子文档 |
| 4.5 SylixOS BSP 适配要点 |
x86 BSP (V100/H100 CUDA 驱动, NVLink, RDMA)、ARM64 BSP (RK3588/RK3576/RK3568 NPU 驱动, T234 Jetson BSP)、内存分区限额 (一机两档)、跨核通信 (M0+RPMsg) |
基础设备.md §7 (BSP Checklist) |
关键图表:
| 编号 |
图表 |
描述 |
| Fig.3 |
五层技术栈架构图 |
L1~L5 层叠 + 每层关键组件 + 层间接口 |
| Fig.4 |
LLM 推理 DAG → RTOS 任务图 |
推理阶段的有向无环图, 标注每阶段优先级 (MAX/HIGH/MEDIUM/LOW) 和可抢占性 |
| Tab.5 |
推理阶段特征矩阵 |
阶段 × (计算密集度/IO 密集度/延迟敏感度/确定性要求/RTOS 优先级) |
| Tab.6 |
六大优化方向概览 |
方向 × (核心问题/关键手段/目标指标/对应章节) |
第5章 实验方法学
目标: 800~1000 词,这是 C2 和 C3 的方法论基础,也是本文"可复现"承诺的核心。
| 小节 |
内容要点 |
来源映射 |
| 5.1 方法论框架 |
"基准测量 → 建模 → 算法设计 → 仿真验证 → 原型实现 → 实测对比" 六步循环 |
07-analysis-methods.md §1 |
| 5.2 第三方基准复现方法学 |
引入萤火虫文章的 5 维度方法 (CPU/内存/NPU/功耗/温度);在 SylixOS 上重跑 sysbench/stress-ng/RKNN,与文章数据对比 |
方案2.md §5.1~§5.3 |
| 5.3 混合负载实验设计四原则 |
原则1: 混合负载而非孤立;原则2: 看尾延迟不看均值;原则3: 突发场景而非稳态;原则4: 调度精细度而非裸吞吐 |
方案1.md §3 |
| 5.4 功耗真测强制约束 |
禁止仅靠软件读数;DC 功率计 (Yokogawa WT310) + INA226 采集板强制;采样 ≥1 Hz |
方案2.md §5.4 |
| 5.5 温度监控强制约束 |
烤机 1 h 稳态 <75 ℃ 才采样;≥85 ℃ 数据作废;全程温度日志 |
方案2.md §5.5 |
| 5.6 环境元数据强制清单 |
OS/内核/BSP/固件/驱动/室温/散热/工具/量化/时间戳 10 项强制 |
方案2.md §5.6 |
| 5.7 对照组设计 |
OS 层: SylixOS vs Ubuntu+PREEMPT_RT vs (KVM/Docker);配置层: C0 默认 → C1 tuned → C2 extreme |
方案1.md §7, 方案2.md §7.1 |
关键图表:
| 编号 |
图表 |
描述 |
| Fig.5 |
实验方法论流程图 |
六步循环 + 第三方基准对齐校验门 (±15% 才准入主场景) |
| Tab.7 |
业界基准对照表 |
指标 × (文章基线 / SylixOS 实测 / 偏差 / 评判) — CPU 单核1280、多核7120、YOLOv5s 32 FPS、3B LLM ~90 tok/s |
| Tab.8 |
避坑清单映射 |
5 条避坑点 × (强制约束/验证方式/落实位置) |
| Tab.9 |
环境元数据清单模板 |
10 项元数据 × 示例值 |
第6章 大模型负载选型与配置
目标: 500~700 词,定义跨 11 档位的模型矩阵。
| 小节 |
内容要点 |
来源映射 |
| 6.1 选型原则 |
国产化优先 (Qwen/MiniCPM);跨架构可比 (x86+CUDA 与 ARM+NPU);量化版本完整 (FP16/INT8/INT4);社区生态成熟 (vLLM/llama.cpp/TensorRT-LLM/RKLLM) |
方案1.md §2.1 |
| 6.2 跨档位模型矩阵 |
T4-L: Qwen2.5-0.5B INT4;T4-M: 1.5B INT4;T4-H: 3B/7B INT4;T3-L: 3B/7B INT4 (RKLLM);T3-M: 14B/32B INT4 (TensorRT-LLM);T3-H: 72B INT4;T2-L: 72B INT4/14B FP16;T2-M: 72B FP16;T2-H: DeepSeek-V2 FP16;T1-L: 72B FP16 分布式;T1-H: 671B INT4 |
基础设备.md §5.2 + 方案1.md §2.2~§2.3 |
| 6.3 推理框架与配置 |
vLLM (T2/T1)、TensorRT-LLM (T2/T3-M/H)、llama.cpp (T2-L/T3-L 退路)、RKLLM (T4/T3-L);batch 1/8/32;上下文 512/2048/8192;并发 1/8/32 |
方案1.md §2.2~§2.4 |
| 6.4 负载生成器 |
vLLM benchmark / llama-bench / 自研并发客户端 / RKLLM demo / 自研 LLM+RT 混合负载驱动脚本 |
方案1.md §2.4 |
关键图表:
| 编号 |
图表 |
描述 |
| Tab.10 |
跨档位模型矩阵 |
11 档位 × (代表模型/参数/量化/显存占用/并发实例/推理框架/预期 tok/s) |
| Tab.11 |
负载生成器清单 |
工具 × 平台 × 角色 × SylixOS 可用性 |
第7章 实验结果
目标: 1500~2000 词,本文篇幅最大的章节,展示全部实验数据。
| 小节 |
内容要点 |
来源映射 |
| 7.1 基准对齐结果 (第一层判据) |
SylixOS 在 RK3588 上的 CPU 单核/多核 (sysbench)、内存带宽、NPU FPS (YOLOv5s/ResNet18/MobileNetV2)、3B LLM tok/s 与文章基线的偏差 (目标 ±10%~±20%) |
方案2.md §7.2, §9.3 第一层 |
| 7.2 低功耗结果 |
P_idle / P_prefill / P_decode / E_per_token 分阶段功耗曲线;T2-L (V100) 与 T3-L/T4-H (RK3588) 两平台对照;SylixOS vs Linux RT 能效比 |
方案1.md §5.1, §6.7, 方案2.md §4.1 |
| 7.3 低延迟结果 |
T_irq / T_sched / T_ctx P50~Max;T_ttft / T_tok 尾延迟分布直方图;SylixOS vs Linux RT P99.9/Max/σ 对比 |
方案1.md §5.2, §6.5 |
| 7.4 混合负载保号结果 (★ 核心) |
场景1: LLM 推理 + 1 ms 周期控制并发;T_rt_max_under_llm / J_rt_under_llm;4 变体 (A1 Linux RT 默认 / A2 Linux RT tuned / A3 SylixOS 默认 / A4 SylixOS 极限);30 min 全周期延迟时间序列图 |
方案1.md §6.1, §5.3, §9.3 |
| 7.5 多模型并发与突发场景 |
场景2: 多模型流水线 P0/P1/P2 优先级公平性;场景3: 突发加载/切换瞬间实时性保持;场景4: GPU/NPU 多请求调度公平性 |
方案1.md §6.2~§6.4 |
| 7.6 温度-功耗-性能耦合 |
场景8: 25%→100% CPU 逐步加压的三维耦合曲线;SylixOS vs Linux RT 降频触发温度与性能下降斜率 |
方案2.md §4.4, §6.8 |
| 7.7 异构核分配 |
场景6: RK3588 大核 A76 (LLM) + 小核 A55 (1 ms RT) + M0 (100 µs 控制) 的 SylixOS 异构调度优势 |
方案1.md §6.6 |
| 7.8 跨档位性能曲线 |
11 档位上 T_sched P99.9 / E_per_token / T_rt_max_under_llm 的连续曲线 (现有 P0 档位实测 + 扩展档位预估) |
基础设备.md §5.3, 基础设备.md §5.1~§5.2 |
关键图表:
| 编号 |
图表 |
描述 |
| Tab.12 |
业界基准复现对比表 (最终版) |
填入 SylixOS 实测值与偏差列 |
| Fig.6 |
功耗分阶段曲线 |
prefill 峰值 → decode 稳态 → idle 的 W(t) 曲线, SylixOS vs Linux RT 叠加 |
| Fig.7 |
混合负载实时任务延迟分布 (★ 核心证据) |
P50~Max 直方图 + 时间序列, 4 变体叠加, 突出 A4 的"细长尾部"优势 |
| Fig.8 |
LLM token 延迟直方图 |
Qwen2.5-7B 1 流 1 h 采集, SylixOS vs Linux RT |
| Fig.9 |
突发加载瞬间时间序列 |
模型加载瞬间实时任务延迟 spike, SylixOS ≤50 µs vs Linux RT 100 µs~1 ms |
| Fig.10 |
温度-功耗-性能三维耦合曲线 |
T_core / P / perf 三轴, 不同 CPU 负载档位 |
| Fig.11 |
跨档位性能连续曲线 |
横轴=11 档位 (T4-L→T1-H), 纵轴=P99.9 调度延迟 / E_per_token / T_rt_max, 三条曲线 |
| Tab.13 |
通过判据三层汇总 |
第一层基准对齐 + 第二层实时性 + 第三层优越性量化 |
第8章 深入分析
目标: 800~1000 词,从数据中提炼规律性结论。
| 小节 |
内容要点 |
来源映射 |
| 8.1 档位间性能曲线规律 |
容量每 ×2 时 RTOS 优势的变化趋势;端级 (资源越紧→RTOS 价值越大) vs 集群级 (资源充裕→RTOS 优势收窄) 的拐点分析 |
基础设备.md §5.3 |
| 8.2 SylixOS vs Linux RT 差异化量化 |
按 §9.4 优越性判据:T_rt_max_under_llm ≤30% = 显著优势 / ≤60% = 可比偏优 / >60% = 未体现;按档位和场景分别判定 |
方案1.md §9.4 |
| 8.3 混合负载下 RTOS 优势的根因 |
硬优先级 + 优先级继承 → 不被 decode 抢占;内存锁定 → KV Cache 抖动不驱逐关键页;精简内核路径 → 加载大模型不引入额外抖动;中断线程化 + 亲和性 → NPU 中断不污染实时核 |
方案1.md §1.1 表, 05-irq-realtime.md |
| 8.4 能效分析 |
每 token 能耗 vs 档位 (V100 集群能效基线 vs H100 能效上限);INT4 vs FP16 的能效拐点;RKLLM NPU vs CUDA GPU 的 J/token 对比 |
基础设备.md §0.3, 06-power-thermal.md |
| 8.5 BSP 风险与可行性 |
x86 BSP (低风险, V100 已验证) vs ARM64 RK3588 BSP (极低, 现有) vs T234 Jetson BSP (高, 需翼辉确认) vs RKLLM 移植 (高, 核心风险);档位跳跃验证降本策略 |
基础设备.md §7, 方案1.md §10 |
关键图表:
| 编号 |
图表 |
描述 |
| Fig.12 |
RTOS 优势 vs 硬件档位趋势图 |
横轴=11 档位, 纵轴=SylixOS 相对 Linux RT 的 P99.9 改善百分比, 标注"显著优势/可比偏优/未体现"区间 |
| Tab.14 |
优越性量化结论矩阵 |
场景 × 档位 × (T_rt_max 比值 / 判定结论) |
| Tab.15 |
BSP 风险与可行性矩阵 |
档位 × (BSP 类型/风险等级/状态/降本策略) |
第9章 讨论与威胁有效性
目标: 400~600 词,诚实地界定适用边界和局限性。
| 小节 |
内容要点 |
来源映射 |
| 9.1 适用场景边界 |
资源越紧张 (T4) → RTOS 价值越大;资源充裕 (T1-H) → RTOS 优势收窄, 可能"可比偏优";混合负载 (LLM+RT 并发) → RTOS 杀手锏;纯吞吐场景 → 通用 OS 可能更高 |
方案1.md §3, §9.4 |
| 9.2 威胁有效性 |
(1) RKLLM 移植风险: 若未完成, 退路 llama.cpp CPU 推理但失去 NPU 优势, 需标注; (2) V100 驱动成熟度: 4 卡 NVLink 联用可能受限, 单卡先行; (3) sysbench/stress-ng 移植: POSIX 兼容可行性高但需验证; (4) 量化精度差异: 同模型同量化跨 OS 不变, 已控制; (5) 室温/散热波动: 25±2 ℃ + 液冷恒定 |
方案1.md §10, 方案2.md §11 |
| 9.3 与已有工作的关系 |
vs vLLM/TGI (服务器级, 无实时保证)、vs NPU SDK (封闭黑箱)、vs CUDA Stream (无实时分析)、vs 第三方文章 (仅 Linux, 仅 RK3588, 未测实时性) |
FRAMEWORK.md §6, 方案2.md §2.4 |
| 9.4 方法论局限 |
文章仅引用单一第三方来源 (萤火虫文章), 跨平台参照 (昇腾 Qwen-7B) 为非本方案硬件; 消融实验仅在现有 P0 档位可完整执行; 扩展档位 (T1-H/T2-H) 依赖云租替代, 数据可比性需说明 |
方案2.md §13 后续建议 |
第10章 结论与展望
目标: 300~400 词,总结贡献并指出未来方向。
| 小节 |
内容要点 |
| 10.1 结论 |
重申 C1/C2/C3 三大贡献的量化结果 (基准对齐 ±X%、混合负载 ≤Linux RT X%、能效 ≤Linux RT X%) |
| 10.2 展望 |
跨平台横向对比 (RK3588 vs Jetson vs 昇腾); 功能安全 SIL2/IEC 61508 关联; 多机分布式推理; 昇腾 Qwen-7B 作为第二业界参照点; 自适应优先级与动态 WCET 估计 |
| 10.3 开放研究问题 |
动态 WCET 在线估计; 运行时自适应优先级; 跨层优化 (调度+量化联合); 预测式调度; 容错恢复调度 |
3. 来源文档到章节的映射矩阵
| 来源文档 |
主要贡献章节 |
次要贡献章节 |
| 基础设备.md |
§3 (硬件谱系) |
§4.5 (BSP 适配), §6.2 (模型矩阵), §7.8 (跨档位曲线), §8.1 (档位趋势), §8.5 (BSP 风险) |
| 方案1.md v1.0 |
§5.3 (四原则), §7.4 (混合负载) |
§2.1~§2.3 (LLM 推理特征/RTOS 优势/Linux 短板), §5.7 (对照组), §6 (模型选型), §7.2~§7.5 (功耗/延迟/并发/突发), §7.7 (异构), §8.2 (优越性量化), §9.2 (威胁有效性) |
| 方案2.md v2.0 |
§5.2 (基准复现), §5.4~§5.6 (强制约束) |
§2.5 (第三方方法学), §7.1 (基准对齐结果), §7.6 (温度耦合), §9.3 (与已有工作关系), §9.4 (方法论局限) |
| FRAMEWORK.md |
§4 (技术架构) |
§1 (核心问题), §2.4 (相关工作), §8.3 (根因分析), §10.3 (开放问题) |
| 01-inference-scheduling.md |
§4.3 (任务映射) |
§7.4 (混合负载调度模型), §8.3 (根因) |
| 02-kv-cache-memory.md |
§4.4 (方向2 概览) |
§7.4 (KV Cache 对实时任务的影响), §8.4 (能效) |
| 03-accelerator-collab.md |
§4.4 (方向3 概览) |
§7.7 (异构核分配), §8.3 (根因) |
| 04-quantization-scheduling.md |
§4.4 (方向4 概览) |
§6.2 (量化选型), §8.4 (能效拐点) |
| 05-irq-realtime.md |
§4.4 (方向5 概览) |
§7.3 (中断延迟), §8.3 (根因) |
| 06-power-thermal.md |
§4.4 (方向6 概览) |
§7.2 (功耗), §7.6 (温度耦合), §8.4 (能效) |
| 07-analysis-methods.md |
§5.1 (方法论框架) |
§7 (评估指标体系), §8 (分析方法), §9 (消融实验设计) |
4. 关键数据产物清单
| 编号 |
产物 |
类型 |
优先级 |
依赖 |
| D1 |
11 档位硬件规格总表 |
数据表 |
P0 |
基础设备.md 已就绪 |
| D2 |
跨档位模型矩阵 |
数据表 |
P0 |
基础设备.md + 方案1.md 已就绪 |
| D3 |
RK3588 上 sysbench/stress-ng 基准复现数据 |
实测数据 |
P0 |
需 SylixOS BSP + sysbench 移植 |
| D4 |
业界基准对比表 (SylixOS vs 文章基线) |
对比表 |
P0 |
D3 |
| D5 |
混合负载 30 min 全周期延迟时间序列 |
实测数据 |
P0 |
需混合负载驱动脚本 + 4 变体 |
| D6 |
混合负载延迟分布直方图 (4 变体叠加) |
图表 |
P0 |
D5 |
| D7 |
功耗分阶段曲线 (prefill/decode/idle) |
图表 |
P0 |
功率计采集 + LLM 推理 |
| D8 |
LLM token 延迟直方图 (1 h 采集) |
图表 |
P1 |
vLLM/RKLLM benchmark |
| D9 |
突发加载瞬间实时任务时间序列 |
图表 |
P1 |
混合负载脚本 + 模型切换 |
| D10 |
温度-功耗-性能三维耦合曲线 |
图表 |
P1 |
stress-ng 逐步加压 + 温度日志 |
| D11 |
跨档位性能连续曲线 |
图表 |
P1 |
P0 档位实测 + P1~P4 档位预估 |
| D12 |
优越性量化结论矩阵 |
分析表 |
P1 |
D4+D6+D7 |
| D13 |
环境元数据清单 (每份数据附) |
元数据 |
P0 |
方案2.md §5.6 模板 |
5. 写作优先级与依赖关系
总周期: ~13 周 (Phase 0~5 累计)
6. 章节字数预算
| 章节 |
预算字数 |
占比 |
| §1 引言 |
400 |
4% |
| §2 背景与相关工作 |
700 |
7% |
| §3 四层硬件谱系 |
900 |
9% |
| §4 技术架构 |
700 |
7% |
| §5 实验方法学 |
900 |
9% |
| §6 模型选型 |
600 |
6% |
| §7 实验结果 |
1800 |
18% |
| §8 深入分析 |
900 |
9% |
| §9 讨论 |
500 |
5% |
| §10 结论 |
350 |
3% |
| 参考文献 + 附录 |
~2000 |
23% |
| 总计 |
~9750 |
100% |
注: 按 RTSS/RTAS 会议论文 1012 页双栏计算, 正文约 800010000 词, 参考文献+附录另计。
7. 核心叙事线 (Storyline)
8. 待确认事项
| 编号 |
待确认项 |
影响章节 |
当前假设 |
| Q1 |
SylixOS 在 x86+4×V100 NVLink 的 CUDA 驱动支持度 |
§4.5, §7.3, §8.5 |
需翼辉确认; 单卡先行, 4 卡作 stretch |
| Q2 |
RK3588 BSP 是否集成 rknn/RKLLM |
§5.2, §7.1, §9.2 |
需翼辉确认; 退路 llama.cpp CPU |
| Q3 |
sysbench/stress-ng 在 SylixOS 可移植性 |
§5.2, §7.1 |
POSIX 兼容, 假设可行 |
| Q4 |
T234 (Jetson Orin) BSP 是否支持 |
§3.2 (T3-M/H) |
风险高; T3-L 用 RK3588 起步 |
| Q5 |
RK3588 板卡是否引出 M0 调试接口 |
§7.7 (场景6) |
若未引出, 场景6 需调整 |
| Q6 |
是否纳入功能安全 SIL2/IEC 61508 章节 |
§10.2 展望 |
暂列为展望, 不入正文 |
| Q7 |
是否纳入昇腾 Qwen-7B 作为第二业界参照 |
§7.1, §9.4 |
暂列为后续, 非本方案硬件 |
| Q8 |
主对照组确认: Ubuntu 22.04+PREEMPT_RT |
§5.7 |
与第三方文章配置一致, 可比性最高 |