3 Commits
Author SHA1 Message Date
eaiadmin feddff6fe4 add leadership analysis for RTOS+LLM+Agent research project
结论:项目框架在问题定义、体系化设计、方法论层面具有明确领先性(预计领先同行3-5年)
- 5项强领先:跨层实时性定义、双路线设计、规则兜底、三层指标、四组对照
- 1项领先:五类部署形态体系
- 2项需补强:实证数据、Agent框架集成
- 主要风险:理论框架需快速产出实证数据
2026-09-23 03:22:10 +08:00
eaiadmin ccf72e32bd add industry research survey on RTOS+LLM+Agent competitors
包含6个文件:
- 总览:7条关键发现摘要
- 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架
- 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI
- 学术文献:14篇论文/文章完整摘要和链接
- 关键研究空白:7个研究空白及与项目框架的对齐
- 文献索引:40+条文献完整列表
2026-09-23 03:12:03 +08:00
eaiadmin f18f9f2fd3 reorganize repository into meeting and project framework structure
Align the repository with the new collaboration workflow by separating meeting records from project framework materials, so discussion outputs and formal research assets can evolve independently.
2026-09-23 01:35:01 +08:00
121 changed files with 8460 additions and 3911 deletions
-10
View File
@@ -1,10 +0,0 @@
# Local assistant and workspace metadata
.claude/
.workbuddy-ai/
# Local Git access notes may contain credentials
git_skills.md
# Microsoft Office temporary lock files
~$*.docx
**/~$*.docx
@@ -0,0 +1,35 @@
# 20260922\_093448 会议主题拆分索引
本次会议可以整理为 5 个相互关联、但可独立推进的主题板块。它们共同围绕人工智能、基础系统、行业落地与合作路径展开,但每个板块的研究对象、交付目标和后续动作并不相同,因此适合拆分为独立文件持续讨论。
## 1. 主题划分
1. [01-医疗AI导航与嵌入式收缩方向.md](01-医疗AI导航与嵌入式收缩方向.md)
- 聚焦手术显微镜 AI 辅助导航、外挂式推理到嵌入式收缩的产品路径。
2. [02-大模型评测优化平台与本地模型社区.md](02-大模型评测优化平台与本地模型社区.md)
- 聚焦服务器侧模型评测、算子优化、量化比较、本地模型社区,以及平台建设、服务外溢和各方分工方式。
3. [03-RTOS与AI实时控制基础系统课题讨论.md](03-RTOS与AI实时控制基础系统课题讨论.md)
- 聚焦翼辉方向、基础系统定位、MCU 与 SoC/Hybrid 路线区分,以及课题推进步骤、责任边界和合作方式。
4. [04-垂直大模型训练框架与代训服务.md](04-垂直大模型训练框架与代训服务.md)
- 聚焦“垂直大模型不等于通用模型加行业语料”的方法论、七要素框架、代训服务步骤和分工合作方式。
5. [05-法律政务数据治理智能体与XAPP平台.md](05-法律政务数据治理智能体与XAPP平台.md)
- 聚焦纪委办案、律师产品、数据治理智能体、XAPP 平台化思路,以及应用到平台的推进路径与合作分工。
## 2. 结构判断
这 5 个主题之间的关系如下:
- `01` 是一个具体行业落地样例,体现 AI 从外挂推理向嵌入式系统收缩的路径;
- `02` 是模型优化和测试平台能力,已经扩展为平台建设、服务输出与社区沉淀的完整工作线;
- `03` 是基础系统方向的课题定义与合作主线,直接对应研究框架、翼辉合作和后续预研组织方式;
- `04` 是大模型产业化的方法论与服务模式,偏研究方法、训练逻辑与代训服务设计;
- `05` 是平台和应用层的产品化实践,展示多模态数据治理、专业应用与 XAPP 平台的落地形态。
## 3. 使用建议
后续讨论可以按两条线推进:
1. **研究主线**:优先阅读 `03` 和 `04`;
2. **落地主线**:优先阅读 `01`、`02` 和 `05`。
这样可以把“研究框架”“平台能力”“具体应用”三类问题拆开处理,不会在同一份会议全文里相互缠绕。
@@ -0,0 +1,45 @@
# 医疗AI导航与嵌入式收缩方向
## 1. 主题定位
这一部分讨论的是一个明确的医疗器械落地样例:围绕手术显微镜场景,为厂商提供 AI 辅助导航能力,并逐步从外挂式主机方案收缩到嵌入式系统方案。
## 2. 当前项目形态
- 合作对象是国内手术显微镜厂商;
- 当前方案是在原有显微镜主显示链路之外增加一块副屏;
- 图像从显微镜链路引出,进入外挂主机完成推理,再把辅助分析结果叠加回显示画面;
- 这一阶段的目标是先完成功能验证和临床辅助价值展示,不直接改动原主屏系统。
## 3. 核心价值
这个方向的价值集中在三点:
1. **医疗场景价值明确**:医生可以在术野中直接看到风险点、角度偏差和操作提示;
2. **商业价值直接**:整套 AI 辅助能力对设备加价能力明显高于其硬件增量成本;
3. **研究价值清晰**:这是一个从服务器式推理向设备内收缩的真实案例,能自然过渡到嵌入式与实时系统问题。
## 4. 后续技术演进
会议里已经明确,当前外挂式主机只是第一阶段。后续方向是:
- 把外挂主机能力收缩进设备本体;
- 把 AI 功能从“旁路叠加”逐步转向“设备内部集成”;
- 由此引出嵌入式系统、资源预算、边缘推理和控制路径协同等问题。
这意味着它不是一个单纯的图像识别项目,而是一个可持续向基础系统问题延展的行业样例。
## 5. 与整体研究的关系
这个主题与整体研究最强的连接点在于:
- 它属于 `T4/T3` 一类的设备端与边缘端样例;
- 它天然涉及“小型化、低功耗、设备内集成”的后续路线;
- 它可以作为“AI 目标负载进入任务关键设备”的现实入口。
## 6. 后续可单独推进的问题
1. 设备内收缩后的算力与功耗预算如何设定;
2. 显微镜主链路、副链路和 AI 推理链路如何协同;
3. 哪些部分继续由外挂主机承担,哪些部分迁移到嵌入式系统;
4. 该场景能否作为 RTOS / 基础系统研究的主样例之一。
@@ -0,0 +1,260 @@
# 大模型评测优化平台与本地模型社区
## 1. 主题定位
这一部分讨论的不是训练一个新的通用大模型,而是建设一套面向服务器、机房、算力中心和本地部署场景的大模型评测与优化平台。它的核心价值不在“再做一个模型”,而在于把模型、量化、算子、运行框架、启动参数和硬件配置之间原本分散、难解释的差异,组织成一套可比较、可复用、可交付的证据体系。
会议进一步给这条线增加了一个更有延展性的方向:在平台能力稳定之后,可以向“本地模型社区”延伸,形成面向区域算力中心、科研团队、行业客户和本地部署需求的模型比较、配置推荐和优化服务能力。
## 2. 会议形成的核心判断
这部分讨论形成了五个稳定判断。
### 2.1 同一套硬件上,运行配置差异足以造成显著性能分化
模型效果和运行表现并不只取决于显卡型号或算力规模。
量化方式、算子开关、容器配置、运行框架、显存组织和启动参数都会显著影响:
- 启动时间;
- 解码速度;
- 稳定性;
- 显存占用;
- 长稳运行效果。
这意味着客户看到的“模型快不快”,很多时候并不是硬件单因素决定的。
### 2.2 平台真正解决的是“不可解释”问题
很多客户当前并不清楚瓶颈到底来自:
- 硬件资源本身;
- 框架选型;
- 算子实现;
- 量化策略;
- 参数配置与部署方式。
平台的价值,是把原本靠经验和试错得出的结果,变成能够重复执行、系统记录和横向比较的证据。
### 2.3 评测平台天然可以外溢为优化服务
一旦平台具备:
- 统一记录;
- 统一对比;
- 统一报告;
- 统一复现实验;
它就不再只是内部工具,而可以外溢成:
- 算力中心选型服务;
- 模型优化服务;
- 部署建议服务;
- 本地模型配置推荐服务。
### 2.4 本地模型社区的重点不是“做大平台”,而是做“高价值局部能力”
会议对“社区化”方向的判断也比较清楚:
- 不必复制一个通用开源社区;
- 不追求以模型数量堆出影响力;
- 更适合聚焦本地部署模型、端侧模型、专业模型和工具化模型;
- 重点放在选型、评测、优化、配置推荐和经验沉淀上。
### 2.5 这条线与实时基础系统研究并不冲突
虽然这部分内容更多发生在服务器和机房侧,但它和整体研究并不割裂,因为它提供了:
- AI 目标负载的运行时证据基础;
- 推理实时性不完全由操作系统决定的实证背景;
- 对端侧、小型化和边缘部署的模型选型依据。
## 3. 这条线真正要做的事情
如果把会议中的想法进一步收束,这条线真正要建设的是一套“四位一体”的能力:
1. **评测平台**
负责统一记录硬件、模型、参数、运行结果和日志证据。
2. **优化工作台**
负责对比量化、算子、框架和启动配置,给出可复现的优化建议。
3. **报告系统**
负责把结果输出成客户能理解、团队能复用的标准报告。
4. **本地模型社区**
负责沉淀模型经验、配置经验、最佳实践和可复用模板。
因此,这条线的本质不是“做个演示平台”,而是形成一套从实验到服务再到社区沉淀的连续能力。
## 4. 建议的工作方式
这条线更适合采用“平台底座 + 优化服务 + 社区沉淀”的工作方式。
### 4.1 先把平台做成证据系统
第一步不是追求界面完整,而是确保每一次实验都能形成可重复、可追溯的证据,包括:
- 硬件环境;
- 模型版本;
- 量化与算子配置;
- 启动参数;
- 运行日志;
- 性能指标;
- 异常记录。
### 4.2 再把平台变成优化工具
在证据系统稳定之后,平台需要进一步承担:
- 多配置对比;
- 自动化基线测试;
- 优化项回归验证;
- 最优组合推荐。
### 4.3 最后向社区和服务产品外溢
只有在前两步稳定之后,才适合把成果外溢为:
- 内部优化知识库;
- 本地模型推荐清单;
- 算力中心服务能力;
- 对外社区或合作平台。
## 5. 建议的推进步骤
### 5.1 第一步:建立最小可用评测底座
目标是先把评测和记录做扎实。
这一阶段应完成:
- 硬件信息采集;
- 模型加载与启动配置记录;
- 解码速度、显存占用、温度和稳定性采集;
- 日志归档与结果可回看。
### 5.2 第二步:建立标准化对比实验
目标是让平台开始具备“比较能力”。
这一阶段应完成:
- 同模型不同量化方案对比;
- 同模型不同框架对比;
- 同模型不同算子开关对比;
- 同一硬件下不同启动参数对比;
- 同一配置长稳运行验证。
### 5.3 第三步:形成优化报告模板
目标是把结果变成可以交付的东西。
这一阶段应完成:
- 统一评测报告模板;
- 统一优化建议模板;
- 面向内部研发和面向客户的双版本输出;
- 典型案例归档。
### 5.4 第四步:形成服务与社区接口
目标是把平台从内部工具推进到合作能力。
这一阶段应完成:
- 模型推荐清单;
- 本地部署配置推荐;
- 算力中心选型建议;
- 模型社区入口与资料组织方式。
## 6. 各方责任与分工方式
这条线适合按四类角色组织。
### 6.1 唐老师团队
适合承担:
- 对外合作牵头;
- 客户问题定义与场景归类;
- 服务模式设计;
- 报告交付结构与对外表达组织。
唐老师团队更适合站在“需求整合、问题转译、合作推进”的位置上。
### 6.2 罗老师团队
适合承担:
- 评测方法学抽象;
- 指标体系设计;
- 对比逻辑与结论边界把关;
- 从个案经验中提炼共性规则。
罗老师团队更适合站在“方法论、评价体系、结果解释”的位置上。
### 6.3 平台与工程团队
适合承担:
- 平台实现;
- 模型部署与运行;
- 评测脚本和自动化任务;
- 数据采集、日志治理与结果可视化;
- 优化项验证与回归测试。
这一角色是平台真正落地的执行核心。
### 6.4 合作方或客户方
适合承担:
- 提供真实模型与场景目标;
- 提供约束条件与验收口径;
- 确认数据权限与部署边界;
- 对优化结果给出业务反馈。
客户方不负责平台方法学设计,但必须负责场景目标与验收边界。
## 7. 工作边界
为了避免这条线失焦,需要明确它不做什么。
### 7.1 不以训练新通用模型为主目标
这条线的重点是评测、优化和配置比较,不是另起炉灶训练新的通用基座模型。
### 7.2 不把平台做成纯展示系统
如果平台没有可重复实验、可复用模板和可解释报告,它就只是演示界面,而不是方法平台。
### 7.3 不把社区做成“模型仓库堆砌”
本地模型社区的重点不在收集尽可能多的模型,而在于形成有用的模型说明、部署建议和优化经验。
### 7.4 不直接替代端侧和基础系统研究
这条线为整体研究提供模型运行证据,但它本身不替代 RTOS、基础系统和嵌入式部署课题。
## 8. 合作推进方式
这条线适合采用“三阶段合作法”。
### 8.1 阶段一:评测平台共建
重点是把实验环境、评测流程和数据记录打通。
交付物以内部工具、基线实验和标准报告模板为主。
### 8.2 阶段二:优化服务协同
重点是围绕真实客户、真实模型和真实部署需求输出优化结果。
交付物以优化报告、配置建议和案例沉淀为主。
### 8.3 阶段三:社区与区域合作扩展
重点是把积累下来的经验沉淀成更稳定的合作能力。
交付物以模型推荐清单、社区入口、合作机制和服务手册为主。
## 9. 当前结论
这条线的真正价值,不是再做一个“模型体验平台”,而是:
> **把模型、量化、算子、框架和硬件之间原本难解释的运行差异,变成一套可比较、可复现、可交付、可沉淀的证据与服务体系。**
如果继续向前推进,它会自然生长出两个方向:
- 一个是面向内部和合作项目的优化工作台;
- 一个是面向区域部署、本地模型与算力中心合作的本地模型社区。
@@ -0,0 +1,401 @@
# RTOS与AI实时控制基础系统课题讨论
## 1. 主题定位
这部分讨论是整场会议中最接近课题主线、研究对象重定义和合作方向重构的核心内容。会议虽然从翼辉与 RTOS 相关问题切入,但最终形成的判断已经明显超出了“RTOS 是否更强”这一层,转向了一个更高层次的问题:
> **当人工智能能力进入实时控制系统之后,真正需要研究和构建的对象,不再只是单一 RTOS,而是面向 AI 的实时控制基础系统。**
这不是一句包装性口号,而是对研究主语、技术路线、合作方式和产业定位的重新组织。
## 2. 会议形成的核心结论
会议中稳定下来的,不是某一个局部技术答案,而是四项根本判断。
### 2.1 大模型实时性不是单一 RTOS 问题
人工智能目标负载进入系统之后,系统面对的问题来自多层要素共同作用,包括:
- 模型结构与量化方式;
- 推理框架与运行时队列;
- RTOS 与 Linux 的角色分工;
- Hypervisor 与资源隔离结构;
- 芯片、总线、内存、DMA、NPU、GPU 等硬件资源形态;
- 规则兜底、异常切换和安全边界机制。
因此,会议给出的更准确判断是:
> **人工智能进入实时控制系统之后,系统需要解决的是跨模型、跨运行时、跨基础软件和跨体系结构的整体实时性问题。**
### 2.2 研究主语要从 RTOS 上移到基础系统
会议没有否定 RTOS 的价值,但明确反对继续把全部实时性问题都压到 RTOS 身上。
RTOS 仍然是关键保障负载的确定性底座,但不再适合作为所有问题的唯一承担者。
更合适的研究对象应当写成:
- 实时基础系统;
- 面向 AI 的实时控制基础系统;
- 面向 AI 的实时控制系统体系结构。
### 2.3 技术路线天然分成 MCU 路线与 SoC / 边侧路线
会议没有把所有场景压成同一套逻辑,而是明确区分了两类问题结构:
- `MCU` 路线:更强调静态资源组织、开发工具链、芯片协同和开发套件;
- `SoC / 边侧` 路线:更强调 Linux、RTOS、Hypervisor 与异构资源共同构成的混合基础系统。
因此,更接近原意的概括不是“MCU 让 RTOS 多做点事、边侧上 Hypervisor”,而是:
> **MCU 路线主要解决静态编排与工具链协同问题,SoC / 边侧路线主要解决 Hybrid、Hypervisor 与系统协同问题,而两条路线共同服务于“面向 AI 的实时控制基础系统”这一更高层次主语。**
### 2.4 翼辉方向需要从 RTOS 产品叙事转向基础系统叙事
会议对翼辉这类公司的建议也比较明确:
- 不再只讲 RTOS 厂商身份;
- 不再把“适配了什么系统”作为核心叙事;
- 转向“面向 AI 的实时控制基础系统供应方”;
- 用 5 到 10 年技术路线替代短周期适配叙事。
## 3. 基础系统视角下的问题结构
为了避免后续再把所有问题混在一起,会议内容更适合被整理成三个层次。
### 3.1 RTOS 直接控制域
这一层对应 RTOS 可以直接施加机制约束的范围,主要包括:
- 周期任务与关键任务调度;
- 中断优先级、抢占关系和关键路径治理;
- CPU 侧线程、同步机制与时钟管理;
- 恢复、隔离和关键任务保护机制;
- 对部分共享资源策略的直接控制接口。
这一层回答的是:
> **RTOS 如何为关键保障负载建立确定性底座。**
### 3.2 推理运行域
这一层主要由模型、量化、算子、框架和运行时共同决定,主要包括:
- 模型大小与数值精度;
- Prefill / Decode 的时延分布;
- KV Cache、工作区和内存组织方式;
- 推理框架队列、批处理与上下文管理;
- GPU/NPU 内部执行与驱动接口行为。
这一层回答的是:
> **人工智能目标负载本身具有什么样的时间行为、资源行为和可优化空间。**
### 3.3 系统协同域
这一层是会议真正抬起来的新重点,主要包括:
- Linux 与 RTOS 的角色分工;
- Hypervisor 的隔离与资源划分;
- 总线、DMA、统一内存、外存和协处理器竞争治理;
- 规则兜底、异常切换与安全边界;
- 关键保障负载与人工智能目标负载之间的优先级结构。
这一层回答的是:
> **在混合系统中,整体实时性如何被建立、维持和验证。**
## 4. MCU 路线与 SoC / 边侧路线的真实含义
### 4.1 MCU 路线
会议对 `MCU` 方向的判断非常集中。
更准确的理解不是“MCU 端让 RTOS 多做一些事”,而是:在极小资源预算场景中,问题本身就不适合按高动态运行时思维组织。
这一方向通常具有以下特点:
- 动态空间极小;
- 内存和算力预算刚性;
- 控制任务和外设链路优先级极高;
- 更适合小模型、小算子和静态工作流;
- 更依赖离线配置、静态分配和代码生成。
因此,会议原意更接近:
> **MCU 路线中 RTOS 的意义更接近静态组织底座、可分析执行环境和开发工具链的一部分,而不是承接高动态推理运行时的主体。**
### 4.2 SoC / 边侧路线
`SoC / 边侧` 路线的判断也需要严格校准。
它并不是一句“边侧用 Hypervisor”就能概括的。会议真正强调的是:设备端 SoC 会天然同时存在 Linux 生态需求和实时控制需求,因此更现实的路径,是构造一个能够治理混合结构的基础系统。
这类场景通常同时具有以下特征:
- 需要 Linux 承接 AI 生态和推理框架;
- 需要 RTOS 承接关键控制与实时保障;
- 需要在同一 `SoC`、同一块板卡上处理统一内存和异构设备竞争;
- 还要同时面对设备级功耗、散热、体积和驱动限制。
会议对 `Hypervisor` 的态度是明确肯定的,但没有把它讲成单独答案。
更准确的理解是:
- `Hypervisor` 首先是一种隔离和资源切分方法;
- 它可以帮助划分 Linux 与 RTOS 的边界;
- 但它本身不能自动消除统一内存、总线、DMA、缓存和协处理器带来的全部竞争问题。
因此,这一路线真正保留并强化的是:
> **面向 AI 实时控制系统的升级版 Hybrid,也就是能够处理分工、隔离、资源仲裁、规则兜底和异常切换的混合基础系统结构。**
## 5. 建议的工作方式
这一主题不适合按“先写论文、再找技术点”的方式推进,而更适合按“先完成问题重定义,再完成路线定义,再组织预研验证”的方式推进。
### 5.1 先做课题重定义
第一步不是急于给出实现方案,而是把以下问题写清楚:
- 研究主语为什么要从 RTOS 上移到基础系统;
- MCU 路线和 SoC / 边侧路线为什么不能混写;
- RTOS 直接控制域、推理运行域、系统协同域如何分层;
- Hybrid、Hypervisor、规则兜底在系统中的位置是什么。
这一阶段的产物应当是:
- 一份课题重定义稿;
- 一份路线分层说明稿;
- 一份面向合作方的概念阐释稿。
### 5.2 再做技术路线分解
在问题定义清楚之后,再把路线拆成两个主方向:
1. `MCU` 路线
重点看静态编排、工具链、开发套件、芯片协同。
2. `SoC / 边侧` 路线
重点看 Linux / RTOS / Hypervisor 分工、Hybrid 升级、统一内存与总线竞争治理。
这一阶段的产物应当是:
- 一份 MCU 路线稿;
- 一份 SoC / Hybrid 路线稿;
- 一份系统协同与规则兜底说明稿。
### 5.3 再组织预研验证
路线分解完成后,再进入原型和预研阶段。
这一阶段不是全面铺开,而应选典型切口验证关键判断,例如:
- 小模型与控制任务的静态编排;
- Linux 与 RTOS 分工下的控制链路保护;
- Hypervisor 隔离下的统一内存竞争;
- 模型输出与规则兜底共同构成的闭环。
### 5.4 最后再回收进主课题框架
只有在以上三步形成稳定判断之后,才适合把内容系统回收到主课题框架、论文规划和合作提案中。
## 6. 建议的推进步骤
### 6.1 第一步:形成概念共识
目标是对内把“RTOS 课题”与“基础系统课题”的边界说清楚。
这一阶段应完成:
- 会议判断整理;
- 原话核对;
- 关键词统一;
- 课题候选命名收敛。
### 6.2 第二步:形成路线稿
目标是把两个方向彻底拆开。
这一阶段应完成:
- MCU 路线稿;
- SoC / 边侧路线稿;
- Hybrid / Hypervisor 路线稿;
- 系统协同域说明稿。
### 6.3 第三步:形成合作版材料
目标是让外部合作方能够看懂“为什么值得做、准备怎么做、各方做什么”。
这一阶段应完成:
- 面向合作方的路线总述;
- 阶段性合作方式说明;
- 预研问题清单;
- 交付物框架。
### 6.4 第四步:组织预研与验证
目标是围绕少数关键问题开展验证。
这一阶段应完成:
- 板级或 SoC 原型验证;
- 小模型与控制任务共存实验;
- 混合系统资源竞争实验;
- 规则兜底与异常切换实验。
## 7. 各方责任与工作的边界
这一主题如果要继续推进,必须把责任和边界说清楚,否则很容易重新落回“谁都在提想法,没人真正推进”的状态。
### 7.1 唐老师团队
适合承担:
- 对外合作牵头;
- 场景与需求整合;
- 课题框架转译;
- 合作节奏把控;
- 外部沟通和阶段汇报组织。
唐老师团队更适合处在“前端牵头、方案整合、合作推进”的位置。
### 7.2 罗老师团队
适合承担:
- 研究主语与问题定义把关;
- 方法论抽象;
- 路线分层与概念边界校准;
- 研究价值、学术表达和系统建模方向的判断。
罗老师团队更适合处在“高层框架、方法论和方向判断”的位置。
### 7.3 翼辉或对应产业团队
适合承担:
- RTOS、工具链、板级环境和基础软件条件说明;
- MCU 路线和 SoC 路线的工程条件提供;
- Hybrid / Hypervisor / 板级验证路径提供;
- 原型实现与工程可行性反馈。
产业团队不负责课题理论抽象,但负责把路线落到真实平台条件上。
### 7.4 项目组或工程支撑团队
适合承担:
- 会议整理与材料撰写;
- 路线稿、合作稿和阶段文档整理;
- 预研验证组织;
- 图表、报告和证据归档。
这一角色更偏执行支撑与资料组织。
## 8. 工作边界
### 8.1 这项工作当前首先是“定义工作”,不是全面工程实现
会议形成的第一价值,是重新定义问题和路线。因此现阶段不宜直接把重点放在“大规模开发”上。
### 8.2 当前重点是“搭框架”,不是“宣称已经解决”
无论是 MCU 路线还是 SoC / Hybrid 路线,当前更适合先形成稳定的问题定义、路线定义和验证问题,而不是过早给出“完整解决方案”叙事。
### 8.3 学术问题与产业问题需要并行,但不能混写
学术上要回答:
- 问题定义是否成立;
- 三层边界如何组织;
- 经典实时理论如何扩展。
产业上要回答:
- 产品路线怎么讲;
- 哪些工程条件已经具备;
- 预研从哪里切入。
这两类问题必须关联,但不能混成一篇只讲口号的材料。
## 9. 合作推进方式
这一主题适合采用“规划先行、预研跟进、原型验证收口”的推进方式。
### 9.1 第一阶段:规划与定义
重点是:
- 统一研究主语;
- 统一路线分层;
- 统一合作表达;
- 形成首轮课题和合作框架稿。
这一阶段的交付物应以定义稿、路线稿和合作稿为主。
### 9.2 第二阶段:预研与技术论证
重点是:
- 抽取少数关键问题做原型验证;
- 形成系统协同和控制闭环的实证材料;
- 把 MCU 路线与 SoC 路线分别落到真实平台。
这一阶段的交付物应以预研报告、实验记录和系统草案为主。
### 9.3 第三阶段:联合课题与对外输出
重点是:
- 回收进正式课题框架;
- 形成面向项目、论文和合作申请的材料;
- 根据需要向白皮书、论文和对外交流稿扩展。
## 10. 对当前研究仓库的直接影响
这场会议对当前仓库至少带来六项直接影响。
### 10.1 研究主语需要继续上移
当前仓库已经从“硬件主语”转到“RTOS 主语”,而会议进一步提示:下一步更值得推进的是从“RTOS 主语”继续上移到“基础系统主语”。
### 10.2 `T5~T1` 验证矩阵仍然有效
会议没有否定验证矩阵,而是强化了一个更清晰的判断:
- `T5/T4/T3` 更适合作为系统研究主窗口;
- `T2/T1` 作为 RTOS 优势主战场的意义较弱;
- 但作为 AI 负载和系统协同的参照窗口仍然有价值。
### 10.3 需要把“系统协同域”单独写出来
当前仓库的五层技术栈已经是很好的起点,但后续需要明确写出:
- RTOS 可控域;
- 模型与运行时域;
- Linux、Hypervisor、芯片与资源治理共同构成的系统协同域。
### 10.4 “实时性”需要从纯 OS 叙事中适度抽离
后续文档更适合写成:
- 实时控制系统中的 AI 能力;
- 引入 AI 后的整体实时性问题;
- 基础系统如何维持控制路径与 AI 路径的统一时间边界。
### 10.5 低功耗、小型化方向会自然进入主线
一旦研究对象上移到基础系统,低功耗、小型化、片上资源预算这些问题就不再只是应用专题,而会自然进入主线。
### 10.6 后续课题命名需要重新评估
如果沿着这次会议的判断继续推进,候选命名更适合向以下方向收敛:
- 面向 AI 的实时控制基础系统;
- 人工智能目标负载进入实时控制系统后的基础系统保障机制;
- 面向 AI 实时控制系统的嵌入式体系结构与基础系统研究。
## 11. 当前结论
这场会议最重要的价值,不是提供了一个立即可落地的单点技术答案,而是把观察视角整体抬高了一层。
会议最终给出的判断可以概括为:
> **人工智能进入实时控制系统之后,真正值得研究和构建的对象,不再只是单一 RTOS,而是一个围绕实时性、控制性、推理性和体系结构协同展开的基础系统。**
如果进一步压缩成最贴近会议原意的一句话,可以写成:
> **MCU 路线主要走静态编排、工具链与芯片协同,SoC / 边侧路线主要走 Linux + RTOS + Hypervisor + 升级版 Hybrid 的系统协同,而两条路线共同服务于“面向 AI 的实时控制基础系统”这一更高层次主语。**
@@ -0,0 +1,321 @@
# 垂直大模型训练框架与代训服务
## 1. 主题定位
这一部分讨论的不是“再训练一个行业版通用模型”这么简单,而是一套更完整的方法论:如何理解垂直大模型训练,为什么“通用模型 + 行业语料”不足以形成真正的垂直能力,以及为什么围绕这一方法论形成的代训服务在产业上是成立的。
这条线本质上站在 AI 上层任务语义、业务结构和训练目标设计这一侧,和基础系统、边缘部署、智能体应用构成上下游关系。它回答的是:
> **行业模型为什么不是简单加语料,而是一整套角色、目标、制度、流程和边界的结构化重建。**
## 2. 会议形成的核心判断
这部分讨论形成了五个稳定判断。
### 2.1 垂直大模型不等于“通用模型 + 行业语料”
会议明确反对把垂直模型简化为:
`垂直大模型 = 通用大模型 + 行业语料`
原因在于,业务差异并不只是语言风格差异,而是更深层的结构差异,包括:
- 角色不同;
- 目标函数不同;
- 制度约束不同;
- 动作空间不同;
- 工作流不同;
- 升级与分流机制不同;
- 业务边界与处理边界不同。
### 2.2 真正决定垂直模型表现的是结构,而不是数据量本身
如果训练目标没有定义清楚,即便不断增加行业语料,也往往只能得到“更像行业说话方式”的模型,而得不到真正能在行业流程里工作的模型。
因此,关键不只是准备更多数据,而是把业务结构编码进训练与后训练过程。
### 2.3 “七要素框架”是会议中最有价值的方法学沉淀
会议中已经形成了一个比较稳定的“七要素”思路:
1. 主体角色;
2. 目标函数;
3. 领域知识;
4. 制度约束;
5. 动作空间;
6. 工作流;
7. 业务边界与处理边界。
这个框架的价值在于,它把“垂直化”从模糊概念变成了可拆解、可设计、可复核的方法问题。
### 2.4 代训服务之所以成立,是因为客户往往缺的不是算力,而是结构化建模能力
很多企业并不具备以下能力:
- 定义训练目标;
- 识别主体角色;
- 拆分制度约束;
- 组织工作流;
- 设计动作空间;
- 区分模型边界与人工边界。
因此,代训服务的真实价值不只是“帮客户训练模型”,而是帮助客户完成一轮业务结构显化与训练目标重构。
### 2.5 这条线本身可以沉淀为独立的方法与服务体系
如果把这一套能力做扎实,它不只是某次项目中的附属服务,而可以形成:
- 方法论材料;
- 咨询服务;
- 联合研发流程;
- 训练与后训练工具链;
- 行业模型开发手册。
## 3. 这条线真正要做的事情
从会议内容看,这条线真正要建设的,不是单一训练流程,而是一套“三层能力”。
### 3.1 业务结构抽象能力
先把客户的业务系统抽象成:
- 谁在工作;
- 为了什么工作;
- 在什么制度约束下工作;
- 有哪些动作空间;
- 哪些流程是固定的;
- 哪些决策需要模型参与;
- 哪些边界必须保留给人。
### 3.2 训练与后训练设计能力
在业务结构清楚之后,再组织:
- 数据准备;
- 监督微调;
- 偏好对齐;
- 工作流约束注入;
- 工具调用结构;
- 边界与拒答策略。
### 3.3 交付与服务能力
最终落到客户侧,需要输出的不只是模型本身,还包括:
- 业务结构说明;
- 训练目标说明;
- 数据与流程边界说明;
- 部署建议;
- 持续优化计划。
## 4. 建议的工作方式
这条线更适合采用“先结构化建模,再训练设计,再联合迭代”的工作方式。
### 4.1 先做业务结构访谈,不急于进训练
第一步不是立刻收数据、开始训,而是先做业务和任务建模。
需要先回答:
- 这个行业里谁是主角色;
- 模型服务的主任务是什么;
- 业务里的目标函数是什么;
- 制度和规则约束是什么;
- 哪些地方允许模型生成,哪些地方必须人工把关。
### 4.2 再做训练框架设计
当业务结构明晰后,再确定:
- 数据如何组织;
- 训练样本如何标注;
- 哪些能力靠训练获得;
- 哪些能力靠后训练或工作流获得;
- 哪些边界不应交给模型。
### 4.3 最后用联合迭代替代“一次性交付”
会议隐含的判断是,垂直模型不会一次训练就稳定成型,更适合:
- 小步迭代;
- 领域专家反馈;
- 规则修正;
- 数据回流;
- 后训练与工作流联调。
## 5. 建议的推进步骤
### 5.1 第一步:完成业务结构建模
这一阶段应完成:
- 角色梳理;
- 目标函数梳理;
- 制度与规则梳理;
- 工作流和动作空间梳理;
- 业务边界和模型边界划分。
这一阶段的产物应当是:
- 结构化访谈纪要;
- 业务框架图;
- 七要素分析表。
### 5.2 第二步:形成训练与后训练设计稿
这一阶段应完成:
- 数据来源清单;
- 训练样本设计;
- 后训练目标设计;
- 工作流与工具调用关系设计;
- 安全边界与人工介入点设计。
这一阶段的产物应当是:
- 训练设计稿;
- 后训练流程稿;
- 数据治理与边界说明。
### 5.3 第三步:组织小规模联合试训
这一阶段不追求一步到位,而应聚焦少量高价值任务。
应完成:
- 小样本试训;
- 关键任务验证;
- 失败案例分析;
- 人工反馈回流;
- 规则与工作流调整。
### 5.4 第四步:形成代训服务包
当试训稳定之后,再将其沉淀为更稳定的服务形态,包括:
- 咨询服务包;
- 数据与训练准备包;
- 联合试训包;
- 交付和持续优化包。
## 6. 各方责任与分工方式
这条线最怕“只有技术团队在训,没人定义业务”,因此责任划分必须非常清楚。
### 6.1 唐老师团队
适合承担:
- 对外需求沟通;
- 业务问题转译;
- 行业合作推进;
- 服务包设计;
- 对外汇报和合作节奏组织。
唐老师团队更适合站在“业务和合作牵引”的位置。
### 6.2 罗老师团队
适合承担:
- 七要素方法论抽象;
- 垂直模型问题定义;
- 训练目标与边界设计把关;
- 从个案中提炼共性框架。
罗老师团队更适合站在“方法论和结构建模”的位置。
### 6.3 训练与工程团队
适合承担:
- 数据处理;
- 训练与后训练实现;
- 评测与失败样例分析;
- 工具调用和工作流联调;
- 交付部署支持。
这一角色负责把方法落到真实模型流程上。
### 6.4 行业客户或业务合作方
适合承担:
- 提供真实业务流程和语料;
- 明确角色、规则和边界;
- 参与效果验收;
- 对失败样例和业务偏差给出反馈。
客户方不负责训练方法设计,但必须负责业务真实性和边界清晰度。
## 7. 工作边界
### 7.1 这条线不等于“做行业语料堆叠”
如果只是追加语料而不重构角色、目标和工作流,就不构成真正的垂直模型训练框架。
### 7.2 这条线不等于“代替客户完成全部业务数字化”
代训服务可以帮助客户显化结构,但不应承担全部业务改造工作。
### 7.3 训练、后训练、智能体工作流必须区分
后续材料中要明确区分:
- 哪些能力靠训练获得;
- 哪些能力靠后训练获得;
- 哪些能力靠工作流、工具和规则系统获得。
### 7.4 这条线不直接替代基础系统研究
它补充的是 AI 任务语义、行业目标和训练结构层,但不替代 RTOS、基础系统和部署层研究。
## 8. 合作推进方式
这条线适合采用“咨询先行、试训跟进、服务沉淀”的推进方式。
### 8.1 第一阶段:方法咨询与结构建模
重点是:
- 业务访谈;
- 七要素建模;
- 训练边界和工作流边界定义;
- 确定适不适合做垂直模型。
### 8.2 第二阶段:联合试训与验证
重点是:
- 选择少量高价值任务;
- 做小规模试训;
- 验证训练、后训练和工作流哪个更有效;
- 形成失败案例和调整机制。
### 8.3 第三阶段:形成代训服务与长期合作
重点是:
- 输出服务包;
- 形成长期优化机制;
- 必要时推进工具链和标准化材料。
## 9. 与整体研究主线的关系
这一主题虽然看上去更偏大模型产业化,但它和整体研究并不冲突,反而补足了上层语义与任务定义层。
它的价值主要体现在:
- 补充 AI 目标负载的任务语义与业务边界;
- 说明系统表现并不只由 OS 决定,训练目标和模型结构同样重要;
- 可以与行业样例、边缘部署、小型化系统和智能体应用形成上下游关系。
## 10. 当前结论
这条线真正值得保留的,不是“代训”这个商业词本身,而是它背后的方法学判断:
> **垂直大模型的核心不是在通用模型上附加行业语料,而是把角色、目标、制度、动作空间、工作流和边界结构编码进训练与后训练过程。**
如果继续向前推进,它最可能沉淀成两类成果:
- 一类是垂直模型方法论和训练框架;
- 一类是围绕这一方法论建立起来的咨询、试训和代训服务体系。
@@ -0,0 +1,330 @@
# 法律政务数据治理智能体与XAPP平台
## 1. 主题定位
这一部分主要来自会议后半段的延伸讨论,内容已经明显脱离 RTOS 研究本身,转向法律、纪委办案、数据治理智能体和平台化产品形态。它是一条非常独立的产品与应用主题,但又和前面几个主题形成上下游关系:上接大模型方法与训练问题,下接具体行业系统和交付方式。
这条线真正关心的,不是“做一个能聊天的法律助手”,而是:
> **如何把复杂的数据治理、关系发现、证据组织和报告生成过程,封装成面向专业人员可直接使用的业务系统。**
## 2. 会议形成的核心判断
这部分讨论形成了五个稳定判断。
### 2.1 政务与法律场景的核心问题不是对话,而是复杂数据治理
会议中提到的多个场景,本质上都在解决同一类问题:
- 多来源、多格式、多模态资料导入困难;
- 原始数据需要清洗、映射、关联、解释和展示;
- 用户不愿意直接操作复杂数据分析工具;
- 用户真正需要的是问题理解、关系发现、证据组织和报告生成。
因此,这一主题的主线不是“做一个聊天机器人”,而是“把复杂数据治理过程封装成可操作的业务系统”。
### 2.2 专业应用不能被压扁成单一聊天窗口
会议对纯对话式工作台给出了明确修正:
- 重交互业务不能只靠聊天界面承载;
- 上传物、工作流、结果区、图谱区和报告区都需要独立存在;
- 专业应用必须保留自己的界面和流程结构。
这意味着平台设计必须尊重业务 UI,而不是试图把一切都压成一个对话框。
### 2.3 法律和政务场景更适合“专业应用 + 平台壳”的结构
会议里出现的多个场景都说明:
- 纪委办案系统需要强数据治理能力;
- 律师产品需要强访谈、证据和报告能力;
- 脱敏工具需要独立的安全工具形态;
- 不同应用之间可以共享工作台和通用能力,但不应失去各自的业务结构。
这就是 `XAPP` 思路出现的原因。
### 2.4 平台价值和应用价值必须分开定义
平台的价值在于:
- 提供统一工作台;
- 提供账号、路由、权限、文件管理、日志和通用模型能力;
- 提供应用接入框架。
应用的价值在于:
- 行业模型;
- 规则系统;
- 数据治理逻辑;
- 具体业务流程与交付物。
如果平台和应用不分,结果往往是平台过空,应用过散。
### 2.5 本地部署和数据安全是这条线的刚性约束
无论是纪委办案还是法律业务,会议都明确指出:
- 数据安全要求高;
- 现场部署需求强;
- 响应稳定性要求高;
- 数据不能随意外流。
因此,这条线天然更适合本地部署或专有环境部署。
## 3. 会议中浮现出的几类产品
### 3.1 纪委办案数据治理智能体
这一方向主要面向:
- 银行流水;
- 通话记录;
- 出行数据;
- 房产信息;
- 保险与其他多源资料。
它的核心不是“自动办案”,而是:
- 导入;
- 清洗;
- 模板映射;
- 关系发现;
- 分析辅助;
- 报告与材料组织。
### 3.2 律师场景产品
会议中提到的律师方向主要包括:
- 婚家咨询访谈整理;
- 证据组织与关系发现;
- 资金分析;
- 脱敏工具。
这一方向说明,法律行业更适合“专业工具 + 专业流程”,而不是通用助手叙事。
### 3.3 XAPP 平台
会议中提出的 `XAPP` 平台思路非常关键。
它的含义不是再造一个“总助手”,而是:
- 共享统一工作台;
- 每个应用保留独立 UI;
- 应用之间共享登录、权限、文件、模型和路由;
- 复杂业务仍然通过界面、表格、流程和产物区组织。
这实际上是对“纯聊天平台”路线的一次重要修正。
## 4. 这条线真正要做的事情
如果把会议内容收束,这条线真正要建设的是“三层产品能力”。
### 4.1 数据治理底层能力
包括:
- 多源数据导入;
- 模板识别与字段映射;
- 清洗与标准化;
- 关系抽取与图谱组织;
- 检索与追踪。
### 4.2 行业应用能力
包括:
- 办案智能体;
- 律师访谈和报告产品;
- 脱敏工具;
- 关系分析和证据整理工具。
### 4.3 XAPP 平台能力
包括:
- 统一工作台;
- 应用路由;
- 权限与账号系统;
- 文件与任务管理;
- 共用模型和公共能力接入。
## 5. 建议的工作方式
这条线更适合采用“先单应用打透,再平台化抽象”的工作方式,而不是一开始就先做大平台。
### 5.1 先用具体高价值场景验证价值
应优先选择最痛、最清楚、最容易形成产物的场景,例如:
- 纪委办案数据治理;
- 婚家咨询整理与报告;
- 脱敏处理工具。
先让单点应用把价值打透。
### 5.2 再抽象可复用的中间层
当单点应用稳定之后,再把其中共性能力抽出来,例如:
- 数据导入;
- 模板映射;
- 关系图谱;
- 报告生成;
- 权限与日志管理。
### 5.3 最后再形成 XAPP 平台壳
只有在多个应用共享同一组共性能力之后,再做平台化抽象,才不会做成空平台。
## 6. 建议的推进步骤
### 6.1 第一步:选择 1 到 2 个高价值场景做应用原型
这一阶段应完成:
- 选定业务场景;
- 梳理数据来源;
- 梳理用户任务;
- 梳理需要生成的产物;
- 明确本地部署和安全要求。
### 6.2 第二步:打通数据治理链路
这一阶段应完成:
- 数据导入;
- 模板映射;
- 清洗与标准化;
- 关系发现;
- 初步报告生成。
### 6.3 第三步:形成应用级交付
这一阶段应完成:
- 独立 UI;
- 工作流组织;
- 上传区、处理中间区、结果区和报告区;
- 用户可操作的专业化界面。
### 6.4 第四步:抽取平台共性能力
当两个以上应用出现后,再抽取:
- 登录权限;
- 文件和任务管理;
- 通用模型调用;
- 公共组件;
- 应用接入标准。
## 7. 各方责任与分工方式
这条线如果要落地,必须明确“谁负责场景、谁负责系统、谁负责方法、谁负责交付”。
### 7.1 唐老师团队
适合承担:
- 行业需求获取与场景梳理;
- 客户沟通;
- 交付方案组织;
- 产品方向和合作节奏把控;
- 对外汇报与合作推进。
### 7.2 罗老师团队
适合承担:
- 方法论抽象;
- 数据治理逻辑与共性框架判断;
- 平台层与应用层边界把关;
- 从个案产品中提炼通用结构。
### 7.3 产品与工程团队
适合承担:
- 数据治理链路实现;
- 应用 UI 与工作流实现;
- 报告和图谱模块;
- 平台共性能力抽取;
- 本地部署与安全实现。
### 7.4 行业合作方或客户方
适合承担:
- 提供真实业务数据与使用流程;
- 明确合规和安全要求;
- 参与验收;
- 对应用效果与流程合理性给出反馈。
## 8. 工作边界
### 8.1 这条线不等于“做个法律聊天机器人”
如果把重点放在聊天入口,而不解决数据治理、图谱、报告和流程问题,这条线就会失焦。
### 8.2 平台不应先于应用存在
没有稳定的应用需求支撑,先做平台很容易变成空壳工程。
### 8.3 专业应用必须保留独立 UI 和工作流
不应把纪委、律师、脱敏工具都压成同一种对话式界面。
### 8.4 这条线不直接纳入 RTOS 主课题
它是独立的应用和产品方向材料,适合作为并行线保留,而不是强行并入基础系统主研究。
## 9. 合作推进方式
这条线适合采用“单应用切入、共性能力抽取、平台化收口”的推进方式。
### 9.1 第一阶段:应用验证
重点是:
- 选具体场景;
- 做原型;
- 证明价值;
- 形成第一批产物。
### 9.2 第二阶段:应用扩展与复用
重点是:
- 增加第二类应用;
- 比较共性与差异;
- 抽取中间层能力;
- 形成通用模块。
### 9.3 第三阶段:平台化与持续合作
重点是:
- 建立 XAPP 平台结构;
- 定义应用接入标准;
- 形成长期合作和产品化路线。
## 10. 与整体研究材料的关系
这一主题虽然不直接属于 RTOS 主线,但对整体项目仍然有两类价值:
- 它说明 AI 应用进入真实行业以后,对数据治理、平台结构、UI 组织和本地部署的要求会非常具体;
- 它可以作为后续讨论“平台层”“XAPP 层”“工作流层”和“专业应用层”的现实参照。
因此,它不应被强行塞进 RTOS 课题,但值得作为独立并行材料长期保留。
## 11. 当前结论
这条线真正值得保留的,不是若干零散行业点子,而是一条更稳定的产品判断:
> **法律政务类智能体的核心,不是对话入口,而是把复杂数据治理、关系分析、业务流程和报告产出封装成专业应用,并在多个应用之上抽象出 XAPP 平台能力。**
如果继续往前推进,这条线最自然的演化方式是:
- 先做高价值行业应用;
- 再抽取共性数据治理能力;
- 最后收口到平台和应用协同的产品结构。
@@ -17,7 +17,6 @@
6. `05-中断与实时性保障.md`
7. `06-能耗与热管理.md`
8. `07-方法论与评估工具链.md`
9. `参考文件/README.md`
### 2. 候选课题框架目录
@@ -43,8 +42,6 @@
- 能耗约束、温度耦合、频率策略与热稳定性
- `07-方法论与评估工具链.md`
- 建模、仿真、原型验证和评估方法学
- `参考文件/`
- 按研究方向整理的论文、标准、官方工程资料及其与本项目的证据映射
## 候选框架说明
@@ -3,6 +3,7 @@
> 版本: v2.1 起草日期: 2026-09-21
> 设计目标: 为“**大型跨平台实时操作系统支撑任务关键系统中人工智能目标负载的实时保障机制研究**”建立完整的验证矩阵,并细化为 **T5~T1 五类部署形态 / 11 个代表实验档位**
> 说明: 文中的 `T5~T1` 是**设备档位/运行形态代码**,用于组织实验与证据,承担验证矩阵角色
> 现有硬件锚点: T2-L(4×V100 SXM 单机多加速器)+ T4-L / T5-H(RK3588 工业盒)| 需新增: T1 集群扩展 + T3/T4 其余档位
---
@@ -7,9 +7,8 @@
1. `01-研究逻辑说明.md`
2. `02-基础设备与算力基础.md`
3. `03-实验设计.md`
4. `metric.md`
5. `04-论文写作规划.md`
6. `05-论文结构总览.png`
4. `04-论文写作规划.md`
5. `05-论文结构总览.png`
## 文件说明
@@ -19,8 +18,6 @@
- T5~T1 五类部署形态、五种算力基础下的十一档设备谱系与分级规则
- `03-实验设计.md`
- 准入条件、对照原则、混合负载场景、指标与验收方法
- `metric.md`
- 三层核心证据指标的统一定义、计算公式、采集要求与报告口径
- `04-论文写作规划.md`
- 论文结构、章节分工、图表规划和证据映射
- `05-论文结构总览.png`
@@ -0,0 +1,59 @@
# 当前研究问题:背景、问题与挑战
## 1. 背景
人工智能能力正在从服务器、云端和通用应用软件,持续进入设备控制、边缘协同、车载平台、工业终端和任务关键系统。系统中的人工智能不再只是离线分析能力,而正在承担识别、规划、诊断、导航、辅助决策和自然交互等面向实时场景的功能。
当人工智能能力进入这些系统后,系统的时间结构发生了明显变化:
- 感知链路、推理链路与控制链路开始耦合;
- CPU、NPU、GPU、DMA、总线和内存带宽竞争明显增强;
- 功耗、散热、体积、统一内存和设备驱动限制直接影响系统行为;
- 关键保障负载与人工智能目标负载开始争夺同一组底层资源。
因此,系统面对的已经不是单纯的“把模型跑起来”问题,而是“如何让人工智能能力进入系统之后,整体时序边界仍然成立”的问题。
## 2. 问题
本框架聚焦的问题是:
> **当人工智能能力进入实时控制系统后,模型、运行时、RTOS、Linux、Hypervisor、芯片、总线、内存和协处理器如何共同决定系统的整体实时边界。**
这里的核心观察有三点:
1. **大模型与智能算法的实时问题不能完全归于 RTOS 单独解决。**
2. **纯粹把问题写成“RTOS 优于 Linux”已经不足以覆盖真实系统问题。**
3. **真正需要研究的是面向 AI 的实时控制基础系统,而不是单一软件层。**
## 3. 挑战
### 3.1 跨层因果交织
人工智能目标负载的时间行为同时受到模型结构、量化方式、算子实现、运行时队列、驱动、芯片资源和操作系统机制影响。单一层面的解释无法完整说明系统实时性。
### 3.2 感知与控制形成闭环
一旦感知、规划、语音理解或推理链路进入控制闭环,推理延迟、链路抖动和异常输出都会直接影响执行效果,系统面对的是认知与控制的一体化问题。
### 3.3 MCU 与 SoC 路线差异显著
MCU 场景更偏向静态资源分配、工具链和芯片协同;SoC 场景更偏向 Linux / RTOS / Hypervisor 协同、统一内存竞争治理和异构设备协作。这两类问题不能被同一套表达简单覆盖。
### 3.4 体系结构成为主要变量
随着 NPU、GPU、DMA、统一内存、总线和缓存结构进入主舞台,问题已经从调度器、中断和线程同步扩展到嵌入式计算机体系结构层。
### 3.5 产业叙事需要升级
如果企业仍然只把自己定义为 RTOS 供应方,就很难完整解释人工智能进入实时控制系统后出现的新问题。更有延展性的定位应当围绕“基础系统”展开。
## 4. 本框架的价值
本框架的目标不是否定 RTOS,而是把 RTOS 放回更准确的位置:
- RTOS 是关键保障负载的确定性底座;
- Linux 与推理运行时承载 AI 生态与计算任务;
- Hypervisor、芯片与资源治理结构承担隔离、边界与整体秩序;
- 规则层与兜底机制承担异常控制与安全边界。
因此,本框架对应的研究价值在于:为“人工智能进入实时控制系统之后的基础系统问题”建立更准确的问题定义、技术路线和实验组织方式。
@@ -0,0 +1,80 @@
# 研究定位与项目边界
## 1. 研究定位
本框架的研究定位是:
> **面向人工智能能力进入实时控制系统后的整体系统问题,研究基础系统如何维持确定性、可预测性与实时边界。**
这里的“基础系统”不是单一软件层,而是由以下部分共同构成:
- 模型与任务语义;
- 推理运行时与负载编排;
- RTOS 与 Linux 的角色分工;
- Hypervisor 与资源隔离;
- 芯片、总线、内存、NPU、GPU、DMA 等硬件资源结构;
- 规则兜底、安全约束与异常切换机制。
## 2. 研究对象
本框架的研究对象是:
> **面向 AI 的实时控制基础系统。**
其中:
- `SylixOS` 仍然可以作为关键实验样例与基础软件样本;
- `QNX`、`VxWorks`、`INTEGRITY`、`LynxOS-178` 等可继续作为参照平台;
- `Linux` 与 `PREEMPT_RT Linux` 继续作为重要对照对象;
- `T5~T1` 继续作为验证矩阵,而不是研究主语。
## 3. 本框架不把什么当作研究主语
### 3.1 不把硬件谱系当作研究主语
`T5~T1` 五类部署形态和各类算力基础承担的是验证矩阵角色,用于组织证据、比较边界和解释场景差异。
### 3.2 不把单一 RTOS 当作全部因果承担者
RTOS 在本框架中承担关键作用,但不再被写成全部实时问题的唯一解决者。模型、运行时、芯片与资源结构同样影响系统边界。
### 3.3 不把纯吞吐优化当作核心目标
本框架关注的是人工智能目标负载、关键保障负载与系统协同三层指标同时成立的条件,而不是单一的吞吐最大化。
## 4. 研究边界
### 4.1 重点覆盖的系统类型
- 控制端 MCU / 控制盒;
- 设备端 SoC;
- 边缘节点;
- 面向任务关键场景的单机高密和集群协同平台。
### 4.2 重点覆盖的问题
- 关键保障负载与人工智能目标负载共存时的整体实时性;
- Linux / RTOS / Hypervisor 的混合协同结构;
- 统一内存、总线和异构协处理器竞争治理;
- 小型化、低功耗和受限部署条件下的系统边界;
- 模型推理与规则兜底共同构成的执行闭环。
### 4.3 暂不作为主线的问题
- 通用大模型训练集群的纯吞吐优化;
- 面向互联网高并发服务的开放式推理平台;
- 单纯以算法精度提升为主的模型研究;
- 不涉及实时控制闭环的普通桌面 AI 应用。
## 5. 与项目框架1的关系
项目框架1把“大型跨平台 RTOS”作为研究主语,重点讨论 RTOS 在五类部署形态中的机制优势。
项目框架2则把研究主语上移到“面向 AI 的实时控制基础系统”,重点讨论:
- RTOS 在整个系统中的位置;
- Linux、RTOS 与 Hypervisor 如何协同;
- 模型推理、资源竞争与控制任务如何共同构成实时边界;
- 企业与平台如何从 RTOS 供应方转向基础系统供应方。
这两套框架可以并行维护,分别服务于不同层次的课题收敛。
@@ -0,0 +1,86 @@
# 总课题与两个子课题的关系
## 1. 决策记录
在对 2026-09-22 会议内容、框架2当前结构和外部相关研究进行综合判断后,当前对框架2的组织方式做出如下决策:
> **框架2继续保留为“面向 AI 的实时控制基础系统研究”这一总课题,不单独再分出框架3;但在框架2内部,明确提升为“一总课题 + 两个子课题 + 一个共享方法层”的结构。**
这一决策的核心依据是:
1. `MCU` 路线与 `边侧 SoC` 路线已经不是同一种技术问题;
2. 但两条路线仍然服务于同一个更高层研究主语,即“面向 AI 的实时控制基础系统”;
3. 三层边界、验证矩阵、评价框架和对照逻辑仍然具有共享性;
4. 目录层级上如果不把两个子课题抬成一级目录,就会削弱其独立研究价值。
## 2. 总课题是什么
总课题回答的是:
> **人工智能能力进入实时控制系统之后,基础系统如何维持系统的确定性、可预测性与整体实时边界。**
这一层负责统一以下内容:
- 研究主语;
- 问题定义;
- 三层边界;
- 验证矩阵;
- 对照方法;
- 总体评价框架;
- 总体论文和课题表达。
## 3. 为什么需要两个子课题
### 3.1 子课题 A:面向 MCU 的静态智能控制基础系统
这一子课题主要回答:
- 极小资源预算下,人工智能能力如何被静态、可分析地纳入控制系统;
- 小模型、小算子、工具链、代码生成与芯片协同如何共同形成系统能力;
- 低功耗、小型化与极小内存预算如何构成主边界。
### 3.2 子课题 B:面向边侧 SoC 的混合实时控制基础系统
这一子课题主要回答:
- Linux、RTOS、Hypervisor 与 Hybrid 结构如何在同一 SoC 上协同;
- 统一内存、总线、DMA、NPU/GPU 竞争如何被治理;
- 控制链路、推理链路与规则兜底如何共同形成整体边界。
## 4. 为什么不现在直接分出框架3
当前不单独再分出框架3,主要基于三点考虑:
1. **研究主语没有分裂**
两个子课题仍然隶属于同一个总课题主语。
2. **方法层高度共享**
三层边界、验证矩阵和评价框架不需要重复建设。
3. **当前阶段更适合内部分流,而不是外部分家**
目前仍处于课题框架优选和收敛阶段,过早拆出框架3会增加主线分散的风险。
## 5. 当前目录组织原则
因此,框架2当前采用以下结构:
- `00-总课题总览`
- `10-共享理论与方法层`
- `20-子课题A-面向MCU的静态智能控制基础系统`
- `30-子课题B-面向边侧SoC的混合实时控制基础系统`
- `40-综合比较与收敛`
这种结构同时满足:
- 总课题不散;
- 子课题不被湮灭;
- 后续可以继续长成独立课题;
- 当前仍可维持统一的研究主线。
## 6. 后续演化条件
只有在以下条件进一步成立时,才考虑把子课题继续外扩为独立框架或独立申报方向:
1. 两个子课题分别对应不同合作方、不同交付物和不同对外课题口径;
2. 两个子课题形成了不再共享的方法层和评价体系;
3. 论文、实验和合作推进已经自然分化为两套完整闭环。
在此之前,框架2保持“一总两子”的结构是当前最稳的组织方式。
@@ -0,0 +1,238 @@
# 面向AI的实时控制基础系统整体研究框架
## 0. 核心问题
本框架围绕“人工智能能力进入实时控制系统之后,基础系统如何维持整体实时边界”展开。核心判断是:
> **当人工智能目标负载进入实时控制系统后,系统需要解决的已经不是单一操作系统问题,而是模型、运行时、RTOS、Linux、Hypervisor、芯片、总线、内存、NPU、GPU、DMA 和规则兜底机制共同构成的整体实时性问题。`SylixOS` 可作为关键实验样例,`QNX`、`VxWorks`、`INTEGRITY`、`LynxOS-178` 等可作为参照平台。**
这里有四个基础判断:
1. **研究对象是面向 AI 的实时控制基础系统**;
2. **人工智能推理在系统中承担目标负载角色**;
3. **RTOS 是关键底座,但不是全部因果的唯一承担者**;
4. **硬件条件以验证矩阵形式组织研究证据。**
本框架评估的是:当人工智能目标负载与关键保障负载共同进入系统时,基础系统如何维持控制路径、推理路径和资源路径的整体边界。
---
## 1. 问题空间:五类部署形态、三类系统负载与跨层实时性
### 1.1 五类部署形态
`T5~T1` 五类部署形态继续作为验证矩阵。
| 部署形态 | 系统角色 | 主要研究关注点 |
|---|---|---|
| T5 控制端 | 极紧资源预算下的控制节点 | 静态分配、低功耗、极小内存预算 |
| T4 设备端 SoC | 设备本体内的异构平台 | Linux/RTOS 协同、统一内存与带宽隔离 |
| T3 边缘节点 | 近源推理与控制协同节点 | 多任务并发、热稳定性、边缘协同 |
| T2 单机工作站 | 单机高密本地推理平台 | 多卡公平性、控制侧保护与资源协同 |
| T1 服务器 / 集群 | 任务关键场景中的分布式协同平台 | 跨节点协同、系统边界与规模扩展 |
这些部署形态回答的是“在哪里验证”,而不是“什么是研究主语”。
### 1.2 三类系统负载
| 负载类型 | 定义 | 典型例子 |
|---|---|---|
| 人工智能目标负载 | 系统要完成的智能功能本身 | LLM 推理、视觉识别、导航规划、故障诊断 |
| 关键保障负载 | 维持安全与执行闭环的关键任务 | 周期控制、联锁、状态采集、执行输出 |
| 伴生竞争负载 | 会争抢资源但不属于主功能的任务 | 日志、更新、模型加载、通信、I/O |
### 1.3 跨层实时性问题
本框架中的“实时性”不再只指调度器和中断路径,而是至少同时涉及:
- 模型与推理阶段时间行为;
- 运行时与队列组织;
- RTOS 的关键任务保障能力;
- Linux 的生态与推理承载能力;
- Hypervisor 的隔离与资源切分;
- 总线、内存、DMA、NPU、GPU 等资源竞争结构;
- 规则兜底与异常切换机制。
---
## 2. 分层边界:三层系统问题
### 2.1 RTOS 直接控制域
这一层是 RTOS 可以直接施加机制约束的部分,包括:
- 关键任务调度;
- 中断优先级与抢占关系;
- CPU 侧线程、同步与时钟机制;
- 恢复、隔离和关键路径治理。
这一层回答的是:
> **RTOS 如何为关键保障负载建立确定性底座。**
### 2.2 推理运行域
这一层主要由模型、量化、算子、运行时和驱动共同决定,包括:
- Prefill / Decode 时延结构;
- 模型大小与量化精度;
- KV Cache、内存组织与队列行为;
- GPU/NPU 内部执行与框架调度。
这一层回答的是:
> **人工智能目标负载本身具有什么样的时间行为和资源行为。**
### 2.3 系统协同域
这一层是本框架的重点,包括:
- Linux 与 RTOS 的角色分工;
- Hypervisor 的隔离与资源划分;
- 总线、DMA、外存、统一内存与协处理器竞争治理;
- 规则兜底、安全约束与异常切换;
- 关键保障负载与人工智能目标负载之间的优先级关系。
这一层回答的是:
> **在混合系统中,整体实时性如何被建立、维持和验证。**
---
## 3. 两条主要技术路线
### 3.1 MCU 路线:静态分配、工具链与芯片协同
MCU 路线重点关注:
- 小模型、小算子与控制任务的静态编排;
- 工具链、代码生成与开发套件;
- 与芯片厂商的协同设计;
- 极小资源预算下的 AI 目标负载纳入方式。
这条路线的关键词是:
`静态分配`、`工具链`、`开发套件`、`芯片协同`
### 3.2 SoC 路线:Hybrid、Hypervisor 与整体确定性
SoC 路线重点关注:
- Linux 侧推理与 RTOS 侧控制的分工;
- Hybrid 结构从“并置”升级为“协同治理”;
- Hypervisor 的隔离、分簇和资源切分;
- 统一内存、总线、DMA、NPU/GPU 竞争治理;
- 控制与 AI 在同一系统中的整体确定性。
这条路线的关键词是:
`Hybrid`、`Hypervisor`、`隔离`、`资源治理`、`系统确定性`
---
## 4. 统一技术体系:五层技术栈与横向治理线
本框架继续保留五层技术栈表达,但其含义从“RTOS 机制展开”进一步上升为“基础系统展开”。
```
┌───────────────────────────────────────────────────────────────┐
│ L5 模型与任务语义层 │
│ 任务语义、模型结构、量化、输出约束、业务边界 │
├───────────────────────────────────────────────────────────────┤
│ L4 运行时与负载编排层 │
│ 队列、准入控制、内存池、流水线、推理框架、规则兜底接口 │
├───────────────────────────────────────────────────────────────┤
│ L3 资源抽象与系统协同层 │
│ CPU/NPU/GPU/DMA/总线/统一内存抽象、Hypervisor、资源治理 │
├───────────────────────────────────────────────────────────────┤
│ L2 基础软件控制层 │
│ RTOS、Linux、中断、调度、同步、恢复、隔离、关键路径保护 │
├───────────────────────────────────────────────────────────────┤
│ L1 硬件与互联层 │
│ MCU、SoC、加速器、缓存、总线、外存、网络互联、时钟源 │
└───────────────────────────────────────────────────────────────┘
```
横向治理线包括:安全、审计、配置版本、日志证据、时间同步、可观测性、规则兜底、异常切换和 OTA / 回滚能力。
---
## 5. 研究主线:整体实时边界的建立与验证
本框架后续所有子方向都服务于同一个主命题:
> **面向 AI 的实时控制基础系统如何在人工智能目标负载进入控制闭环后,维持系统的确定性、可预测性与整体实时边界。**
围绕这个主命题,研究主线可以组织为六个方向:
1. **RTOS 直接控制域的保障机制**
2. **人工智能目标负载的时间行为建模**
3. **系统协同域的资源隔离与治理**
4. **MCU 路线的静态编排与工具链能力**
5. **SoC 路线的 Hybrid / Hypervisor 协同结构**
6. **规则兜底、异常切换与闭环安全边界**
这些方向共同服务于一个判断:
> **人工智能能力进入实时控制系统后,系统是否仍然有边界,以及这个边界由哪些机制共同构成。**
---
## 6. 评价框架:三层指标同时成立
### 6.1 人工智能目标负载指标
- `TTFT`
- `TPOT`
- 端到端响应时间
- 功能有效性
- 长时间稳定性
### 6.2 关键保障负载指标
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 观测最大响应时间
- 外部接口响应时间
### 6.3 系统协同指标
- 有效吞吐
- `E/token` / `tokens/J`
- 温度、热漂移与降频行为
- 资源隔离效果
- 恢复能力与异常切换表现
因此,本框架的成功标准是:
> **人工智能目标负载、关键保障负载与系统协同三层指标同时成立。**
---
## 7. 对照关系:Linux、PREEMPT_RT、RTOS 与混合结构
后续实验与叙事可采用四类对照:
| 对照组 | 含义 | 作用 |
|---|---|---|
| `O0` 普通 Linux | 通用系统基线 | 观察非实时平台的自然行为 |
| `O1` PREEMPT_RT Linux | 实时增强型 Linux | 观察增强型通用 OS 的边界 |
| `O2` RTOS 原生配置 | RTOS 基础路径 | 观察 RTOS 底座能力 |
| `O3` 混合基础系统配置 | Linux + RTOS + Hypervisor 或协同结构 | 观察整体协同路径的收益与代价 |
这条对照线的重点,不再只是比较“谁更快”,而是比较:
- 谁更能维持关键保障负载边界;
- 谁更能承受 AI 目标负载进入后的资源竞争;
- 谁更能形成可解释、可复现、可治理的整体系统秩序。
---
## 8. 预期成果
1. **问题定义层**:人工智能能力进入实时控制系统后的基础系统问题定义;
2. **分析层**:RTOS 直接控制域、推理运行域与系统协同域的边界划分方法;
3. **机制层**:面向 Hybrid / Hypervisor / 资源治理 / 规则兜底的基础系统机制;
4. **方法层**:覆盖 `T5~T1` 的统一验证矩阵与对照方法;
5. **产业层**:从 RTOS 平台叙事上升到基础系统叙事的合作与产品路线;
6. **论文层**:面向实时系统、嵌入式系统和低功耗系统方向的系统化论文与报告。
@@ -0,0 +1,90 @@
# RTOS直接控制域
## 1. 主题定位
在框架2中,RTOS 不再被写成全部系统问题的唯一承担者,但它仍然是关键保障负载确定性底座的核心组成部分。本文件用于明确:哪些问题属于 RTOS 可以直接控制和分析的范围,哪些问题不应继续归因到 RTOS 身上。
## 2. 直接控制域的边界
RTOS 直接控制域主要包括:
- 周期任务、关键任务与后台任务的调度关系;
- 中断优先级、抢占路径和线程化中断机制;
- CPU 侧线程、同步互斥、时钟与定时器;
- 内存锁定、关键缓冲区预分配与恢复机制;
- 关键任务隔离、核心绑定和关键路径保护;
- 对共享资源治理接口的直接约束能力。
这一层回答的是:
> **RTOS 如何在人工智能目标负载进入系统后,持续保护关键保障负载的时间边界。**
## 3. 核心研究问题
### 3.1 关键任务如何不被人工智能目标负载拖垮
当人工智能目标负载与关键保障负载并存时,RTOS 的首要任务不是提高模型吞吐,而是确保:
- 周期控制任务不失去截止期;
- 中断链路不被模型加载、日志、I/O 和推理提交路径污染;
- 恢复路径在异常条件下仍然可触发;
- 控制输出始终保留优先权。
### 3.2 哪些资源竞争能够由 RTOS 直接治理
RTOS 可以直接治理的通常是:
- CPU 时间分配;
- 抢占关系;
- 中断响应顺序;
- 同步冲突;
- 关键路径上的内核对象与内存使用方式。
RTOS 不能单独决定的,则包括 GPU/NPU 内部算子执行、显存流水线、驱动内部队列与片上总线物理冲突。这些内容必须和系统协同域一起讨论。
## 4. 关键机制
### 4.1 调度与抢占
关键保障负载应继续保持硬优先级或等价的刚性优先级结构。人工智能目标负载相关线程、提交路径和后台服务线程必须被限制在不会破坏关键任务的优先级层次中。
### 4.2 中断与关键路径治理
模型加载、设备中断、网络和存储路径都可能拉长关键路径。后续研究应重点观察:
- 哪些中断必须线程化;
- 哪些中断应固定到非关键核;
- 哪些设备中断会污染关键任务核;
- 推理提交和结果回收链路是否会引发优先级倒置。
### 4.3 恢复与隔离
当推理链路失稳、超时或内存耗尽时,RTOS 直接控制域需要承担:
- 关键任务不受波及的隔离;
- 降级模式触发;
- 任务重启与恢复;
- 对控制回路的兜底保持。
## 5. 评价重点
这一层的核心指标包括:
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 观测最大响应时间
- 外部接口响应时间
- 恢复时间与异常切换开销
这些指标构成 RTOS 直接控制域的主证据,不应和 GPU/NPU 内部执行指标混为一体。
## 6. 与其他层的关系
- 与 `推理运行域` 的关系:RTOS 负责保护关键路径,推理运行域负责描述 AI 目标负载本身的时间行为;
- 与 `系统协同域` 的关系:RTOS 负责可直接治理的部分,系统协同域负责 Linux、Hypervisor 和异构资源共同造成的整体边界问题。
## 7. 当前结论
框架2并没有削弱 RTOS 的价值,而是把 RTOS 的价值说得更准确:
> **RTOS 是关键保障负载的确定性底座,是人工智能进入实时控制系统后仍能维持秩序的直接控制层。**
@@ -0,0 +1,85 @@
# 推理运行域
## 1. 主题定位
推理运行域用于解释人工智能目标负载本身的时间行为、资源行为和优化空间。框架2强调,大模型与智能算法的实时问题不能完全归因到 RTOS 身上,原因就在于推理运行域本身已经带有很强的结构性时间特征。
## 2. 推理运行域包含什么
这一层主要包括:
- 模型结构与参数规模;
- 量化方式与数值精度;
- Prefill / Decode 两阶段时间特征;
- KV Cache 生命周期与内存组织;
- 推理框架队列、批处理与上下文管理;
- 算子实现、驱动路径和设备执行接口。
这一层回答的是:
> **人工智能目标负载本身具有什么样的时间行为、内存行为和资源竞争特征。**
## 3. 为什么这一层不能被省略
如果把所有实时性问题都写成 RTOS 问题,就会忽略以下事实:
- 不同模型大小对内存和时延的影响完全不同;
- 量化方式会显著改变推理峰值、稳定性和能效;
- 同一硬件上,不同框架和不同算子组合会带来巨大差异;
- Decode 阶段与 Prefill 阶段的时间结构并不相同;
- 推理框架内部队列策略会直接影响首响应时间与尾延迟。
因此,推理运行域必须被单独分析。
## 4. 核心研究问题
### 4.1 模型时间行为如何进入系统分析
后续研究需要回答:
- 不同模型在 Prefill 与 Decode 阶段分别造成什么样的时间分布;
- 哪些阶段是延迟敏感的;
- 哪些阶段可以延后、限流或降级;
- 哪些阶段会对关键保障负载形成直接冲击。
### 4.2 内存与缓存如何形成主瓶颈
对于设备端 SoC 和边缘节点,KV Cache、统一内存与 DMA 搬运常常比算力本身更早成为主瓶颈。
因此,这一层需要重点分析:
- 权重、KV Cache、工作区和运行时缓冲的占用边界;
- 模型切换、上下文增长和并发请求如何改变内存行为;
- 哪些内存组织方式更适合和关键保障负载并存。
### 4.3 量化与算子如何影响实时边界
量化和算子优化不仅影响吞吐,还影响:
- 首响应时延;
- 长稳阶段的功耗与热状态;
- 设备端资源占用;
- 能否在受限部署条件下持续运行。
## 5. 评价重点
这一层的核心指标包括:
- `TTFT`
- `TPOT`
- 端到端响应时间
- 功能有效性与任务完成率
- 峰值内存、工作区与长稳退化
- 单位任务能耗与热漂移
这些指标构成 AI 目标负载本身的主证据。
## 6. 与其他层的关系
- 与 `RTOS 直接控制域` 的关系:推理运行域描述 AI 目标负载自身行为,RTOS 控制域负责保护关键任务不被这些行为拖垮;
- 与 `系统协同域` 的关系:推理运行域给出负载输入,系统协同域回答这些负载如何与 Linux、Hypervisor 和异构资源共同形成整体边界。
## 7. 当前结论
框架2保留 RTOS 的重要性,但明确要求把推理运行域单独提出,是因为:
> **只有先把人工智能目标负载本身的时间结构说清楚,后续系统边界分析才不会落回单因果叙事。**
@@ -0,0 +1,107 @@
# 系统协同域
## 1. 主题定位
系统协同域是框架2相对框架1最大的变化之一。它不再把问题停留在“RTOS 是否更强”,而是直接讨论:当 Linux、RTOS、Hypervisor、统一内存、总线、DMA、NPU、GPU 和规则兜底机制共同存在时,整体实时性如何被建立、维持和验证。
## 2. 为什么系统协同域是主问题
会议中最关键的判断之一是:人工智能进入实时控制系统后的真实问题,已经超出了单一操作系统边界。原因在于:
- 推理生态通常离不开 Linux;
- 关键保障负载需要 RTOS 或等价实时控制底座;
- 设备端 SoC 常常采用统一内存和异构协处理器;
- Hypervisor 与隔离机制直接影响资源边界;
- 规则兜底与安全约束必须与模型输出共同工作。
因此,系统协同域回答的是:
> **在混合结构中,整体秩序如何形成。**
## 3. 核心问题
### 3.1 Linux 与 RTOS 如何分工
Linux 更适合承担:
- 推理框架与模型生态;
- 容器、服务和工具链支持;
- 非关键路径的 AI 相关运行任务。
RTOS 更适合承担:
- 关键保障负载;
- 控制闭环中的刚性时间边界;
- 关键路径上的确定性治理。
系统协同域的核心,不是让两者彼此替代,而是让两者分工清楚、边界稳定。
### 3.2 Hypervisor 在这里起什么作用
Hypervisor 不是附属选项,而是重要研究对象之一。它至少影响:
- 核心隔离和资源切分;
- 中断路由和设备访问边界;
- 共享内存与通信路径;
- 异常传播与恢复策略。
在设备端 SoC 和边缘节点上,Hypervisor 往往是把“共存”升级为“可治理共存”的关键层。
### 3.3 异构资源竞争如何进入系统分析
在 SoC 和边缘节点上,整体边界往往由以下竞争共同决定:
- CPU 与 NPU/GPU 的统一内存争用;
- DMA 与 CPU 访存冲突;
- 总线与缓存竞争;
- 模型加载与控制 I/O 共享带宽;
- 后台服务与关键任务共享中断和核资源。
这些问题不能只在驱动层或 RTOS 层单独解释,必须进入系统协同域。
## 4. 关键机制
### 4.1 资源隔离
后续研究应重点观察:
- CPU 核和关键任务核是否可隔离;
- 设备中断是否可隔离;
- 共享内存和 DMA 缓冲是否可限定边界;
- 模型提交路径是否会挤占控制路径资源。
### 4.2 协同治理
协同治理关注的是:
- 推理与控制如何分层;
- 哪些事件由 Linux 负责,哪些由 RTOS 负责;
- 资源冲突发生时谁拥有优先权;
- 发生过载和异常时系统如何降级与恢复。
### 4.3 证据组织
系统协同域的证据不能只看某一个线程或某一个服务,而需要同时观察:
- 人工智能目标负载层;
- 关键保障负载层;
- 系统协同层。
只有三层指标同时成立,才能说明协同结构是有效的。
## 5. 对照方式
框架2的主对照建议采用:
- `O0` 普通 Linux
- `O1` PREEMPT_RT Linux
- `O2` RTOS 原生配置
- `O3` 混合基础系统配置
其中 `O3` 不再只是附属架构,而是系统协同域的主实验路径之一。
## 6. 当前结论
框架2真正抬升的,不只是标题口径,而是研究主线本身:
> **系统协同域使项目从“RTOS 机制研究”走向“人工智能进入实时控制系统后的基础系统研究”。**
@@ -0,0 +1,80 @@
# 规则兜底与控制闭环
## 1. 主题定位
人工智能能力进入实时控制系统后,系统不可能只靠模型输出维持闭环。框架2因此把“规则兜底与控制闭环”单独列为一条研究线,用来说明模型推理、控制逻辑、安全约束和异常切换如何共同维持系统边界。
## 2. 为什么必须单独提出这一层
如果只讨论模型推理和操作系统,容易忽略一个关键事实:
- 模型输出可能延迟;
- 模型输出可能不稳定;
- 模型输出可能不满足控制安全边界;
- 系统必须在异常条件下退回到规则与安全约束支撑的路径。
因此,真实系统需要的是“模型驱动 + 规则兜底”的混合闭环。
## 3. 核心研究问题
### 3.1 模型与规则如何分工
模型更适合承担:
- 感知理解;
- 语义识别;
- 规划建议;
- 异常模式发现。
规则层更适合承担:
- 安全边界检查;
- 优先级裁决;
- 异常降级;
- 默认动作触发;
- 恢复条件判定。
### 3.2 闭环如何建立
框架2中的闭环至少包括:
1. 感知输入;
2. 推理与规划;
3. 规则检查;
4. 执行输出;
5. 状态回读;
6. 异常切换与恢复。
只有这条链路完整,系统才是真正的实时控制系统,而不是带 AI 的普通服务系统。
### 3.3 异常切换如何进入系统实验
后续实验不仅要测正常场景,还要测:
- 模型超时;
- 队列过载;
- 设备异常;
- 推理链路中断;
- 控制路径回退。
这些内容构成规则兜底层的核心证据。
## 4. 评价重点
这一层重点观察:
- 异常切换时间;
- 规则触发正确性;
- 降级后的关键任务保持情况;
- 恢复后的系统稳定性;
- 模型与规则共同工作时的整体边界。
## 5. 与其他层的关系
- 与 `RTOS 直接控制域` 的关系:RTOS 负责底层调度与恢复执行;
- 与 `推理运行域` 的关系:模型提供感知和规划能力;
- 与 `系统协同域` 的关系:规则兜底把混合系统真正闭合成可执行的控制系统。
## 6. 当前结论
> **没有规则兜底与异常切换,人工智能进入实时控制系统就只是“把模型接进来了”;只有闭环建立起来,基础系统课题才真正成立。**
@@ -0,0 +1,129 @@
# 面向AI的实时控制基础系统研究逻辑说明
## 1. 文档目的
本文用于解释框架2的研究逻辑,重点回答三个问题:
1. 研究对象从 RTOS 平台上升到基础系统之后,实验如何组织;
2. `T5~T1` 验证矩阵如何继续保留,同时不替代研究主语;
3. Linux、RTOS、Hypervisor 与混合结构如何进入统一对照框架。
## 2. 研究对象
本框架的研究对象是:
> **面向 AI 的实时控制基础系统。**
其核心不是某一个单一软件层,而是下面三层共同构成的系统:
- **RTOS 直接控制域**:关键任务调度、中断、同步、恢复和控制路径保护;
- **推理运行域**:模型、量化、算子、推理框架、驱动与运行时队列;
- **系统协同域**:Linux、RTOS、Hypervisor、统一内存、总线、DMA、NPU/GPU 和资源治理结构。
## 3. T5~T1 验证矩阵的角色
`T5~T1` 五类部署形态继续承担三项作用:
1. **验证矩阵**:在不同资源与系统角色下检验同一问题是否成立;
2. **证据组织框架**:把结论放回统一谱系中观察边界和收窄区间;
3. **产业解释接口**:让不同部署位置都能找到现实对应场景。
在框架2中,`T5~T1` 回答的是“在哪里验证”,而不是“研究对象是什么”。
## 4. 两条技术路线如何进入实验
### 4.1 MCU 路线
MCU 路线更适合围绕以下内容组织实验:
- 小模型与控制任务的静态编排;
- 工具链和开发套件的能力;
- 极小资源预算下的任务边界;
- 与芯片规格、片上资源和开发流程的协同关系。
### 4.2 SoC 路线
SoC 路线更适合围绕以下内容组织实验:
- Linux / RTOS 的角色分工;
- Hybrid 结构与 Hypervisor 的隔离方式;
- 统一内存、总线和异构协处理器竞争;
- 推理链路与控制链路并存时的整体实时性。
## 5. 对照逻辑
框架2的主对照不再只限于“普通 Linux / PREEMPT_RT / RTOS”,而是扩展为:
| 编号 | 配置 | 作用 |
|---|---|---|
| `O0` | 普通 Linux | 通用系统基线 |
| `O1` | PREEMPT_RT Linux | 实时增强 Linux 的边界 |
| `O2` | RTOS 原生配置 | RTOS 底座能力 |
| `O3` | 混合基础系统配置 | Linux + RTOS + Hypervisor 或等价协同结构 |
必要时还可以继续细分 `O3` 的不同协同版本,用于比较不同 Hybrid 结构的收益与代价。
## 6. 核心实验顺序
框架2的实验顺序建议如下:
1. **系统就绪性确认**:设备、驱动、模型、测量链路和基础软件栈可用;
2. **单域基线测试**:分别测试推理运行域与关键保障负载的基础行为;
3. **双域并存测试**:测试人工智能目标负载与关键保障负载共存时的边界;
4. **协同结构测试**:引入 Linux / RTOS / Hypervisor 混合结构,比较不同协同方式;
5. **极限与恢复测试**:引入突发负载、长稳运行、异常切换和规则兜底场景;
6. **跨档位回收分析**:把结论放回 `T5~T1` 观察适用区间与失效边界。
## 7. 核心指标
框架2仍然采用三层指标结构:
### 7.1 人工智能目标负载层
- `TTFT`
- `TPOT`
- 端到端响应时间
- 功能有效性
### 7.2 关键保障负载层
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 观测最大响应时间
- 外部接口响应时间
### 7.3 系统协同层
- 有效吞吐
- 资源隔离效果
- `E/token`
- 温度与热漂移
- 异常切换与恢复能力
## 8. 与框架1的关键差别
框架1的重点是:
- RTOS 作为研究主语;
- 六个 RTOS 机制方向;
- 观察 RTOS 在五类部署形态中的系统优势。
框架2的重点是:
- 基础系统作为研究主语;
- 三层边界与两条技术路线;
- 观察人工智能进入实时控制系统后,整体边界如何成立。
因此,框架2更适合承接 2026-09-22 会议中的重定义判断。
## 9. 当前状态
框架2当前已经形成一条完整的逻辑链:
1. 研究对象上移到“面向 AI 的实时控制基础系统”;
2. 用三层边界划分研究问题;
3. 用 MCU 路线与 SoC 路线组织不同系统结构;
4. 用 `T5~T1` 验证矩阵组织证据;
5. 用 Linux / RTOS / Hypervisor / 混合结构建立统一对照。
在此基础上,后续可以继续向更细的实验子文档、联合研究方材料和正式交付物展开。
@@ -0,0 +1,100 @@
# 面向AI的实时控制基础系统基础设备与算力基础
## 1. 文档目的
本文用于说明框架2中的验证矩阵如何组织。这里继续保留 `T5~T1` 五类部署形态,但其作用是“验证矩阵”,不是研究主语。本文件同时把 `MCU 路线` 与 `SoC 路线` 显式放进设备与算力组织逻辑中。
## 2. 验证矩阵的组织原则
### 2.1 三条组织原则
1. **部署形态优先于硬件型号**
先回答系统在什么位置运行,再回答用什么设备验证。
2. **技术路线优先于单点性能**
先区分 MCU 路线与 SoC 路线,再讨论容量、功耗和算力差异。
3. **基础系统问题优先于纯吞吐问题**
优先选择能暴露控制路径、推理路径与资源竞争关系的设备与场景。
### 2.2 五类部署形态
| 部署形态 | 系统角色 | 主要关注点 |
|---|---|---|
| `T5` 控制端 | 极紧资源预算下的控制节点 | 静态编排、低功耗、极小内存 |
| `T4` 设备端 SoC | 设备本体内的异构平台 | Linux/RTOS/Hypervisor 协同、统一内存竞争 |
| `T3` 边缘节点 | 设备附近的近源协同节点 | 多任务并发、热稳定性、边缘协同 |
| `T2` 单机工作站 | 单机高密本地推理平台 | 多卡公平性、关键任务保护与系统协同 |
| `T1` 服务器 / 集群 | 任务关键场景中的分布式协同平台 | 跨节点边界、编排与规模扩展 |
## 3. 两条技术路线在矩阵中的位置
### 3.1 MCU 路线
MCU 路线主要对应 `T5`,重点设备类型包括:
- MCU 控制器;
- 轻量控制盒;
- 极小资源预算下的端侧控制节点。
它承担的问题是:
- 小模型与控制任务如何静态编排;
- 芯片工具链和开发套件如何支撑部署;
- 极小内存、功耗与外设约束下能否维持闭环。
### 3.2 SoC 路线
SoC 路线主要对应 `T4`,并向 `T3` 延伸。重点设备类型包括:
- 工业 SoC;
- 车规 SoC;
- 设备端 AI 模组;
- 边缘异构平台。
它承担的问题是:
- Linux 与 RTOS 的协同关系;
- Hypervisor 的隔离与资源切分;
- 统一内存、DMA、总线与 NPU/GPU 竞争;
- 设备级功耗、散热与体积约束下的整体确定性。
## 4. 当前设备锚点
### 4.1 已有核心平台
| 平台 | 对应位置 | 当前价值 |
|---|---|---|
| RK3588 16 GB | `T4-L` / 受限配置可模拟 `T5-H` | 设备端 SoC 主样例;同时可承接小型化与低功耗观察 |
| 4×V100 服务器 | `T2-L` | 单机高密推理与关键保障负载保护的对照窗口 |
### 4.2 条件扩展平台
| 平台方向 | 对应位置 | 主要价值 |
|---|---|---|
| RK3568 / 同类控制盒 | `T5-L` | MCU / 轻量控制路线主验证窗口 |
| RK3576 / 同类设备 | `T5-M` 或 `T4-L` 衔接档 | 中间资源档位与工具链观察窗口 |
| Jetson / IGX / 工控边缘节点 | `T3` / `T4-M` | SoC 向边缘协同扩展的窗口 |
| 更高端单机多卡或多节点平台 | `T2-H` / `T1` | 观察规模扩展和协同边界收窄区间 |
## 5. 为什么框架2仍然保留 `T2/T1`
框架2并不把 `T2/T1` 当作 RTOS 优势的天然主战场,但仍保留其验证价值:
- 它们可以暴露 AI 目标负载的运行时复杂性;
- 它们可以观察关键保障负载在高密度 AI 负载下是否仍可被保护;
- 它们可以为系统协同域提供资源竞争、队列行为和规模边界证据。
因此,`T2/T1` 在框架2中的角色更接近“上界参照窗口”,而不是研究主语。
## 6. 当前建议
对框架2而言,最值得优先强化的设备与算力主线是:
1. **`T5` MCU / 控制端路线**
2. **`T4` 设备端 SoC 路线**
3. **`T3` 边缘协同路线**
这三类场景最能体现“基础系统主语”与“系统协同边界”。
## 7. 当前结论
> **框架2中的设备与算力组织方式,不是为了堆出更大的硬件谱系,而是为了在不同资源条件下,把 MCU 路线与 SoC 路线的基础系统问题显式暴露出来。**
@@ -0,0 +1,31 @@
# 共享理论与方法层
本目录用于承载框架2中由总课题统一维护、并由两个子课题共同共享的理论和方法内容。
## 本层内容
1. [00-整体研究框架.md](./00-整体研究框架.md)
2. [01-RTOS直接控制域.md](./01-RTOS直接控制域.md)
3. [02-推理运行域.md](./02-推理运行域.md)
4. [03-系统协同域.md](./03-系统协同域.md)
5. [04-规则兜底与控制闭环.md](./04-规则兜底与控制闭环.md)
6. [05-研究逻辑说明.md](./05-研究逻辑说明.md)
7. [06-基础设备与算力基础.md](./06-基础设备与算力基础.md)
## 本层作用
这一层统一负责:
- 研究主语与问题定义;
- 三层边界;
- 统一验证矩阵;
- 统一评价框架;
- 统一对照逻辑;
- 总体方法论表达。
## 与两个子课题的关系
- 子课题 A 重点继承其中与 `MCU`、静态编排、低功耗和工具链相关的部分;
- 子课题 B 重点继承其中与 `Linux/RTOS/Hypervisor`、资源隔离和系统协同相关的部分。
这意味着两个子课题虽然分别展开,但不需要各自重复建设方法层。
@@ -0,0 +1,26 @@
# 子课题定义
## 1. 子课题名称
面向 MCU 的静态智能控制基础系统
## 2. 子课题主问题
本子课题围绕以下问题展开:
> **在 MCU 级资源预算下,人工智能能力如何通过静态编排、工具链、代码生成和芯片协同,被纳入可分析、可验证、可部署的实时控制系统。**
## 3. 子课题边界
本子课题重点聚焦:
- 小模型、小算子与控制任务的静态共存;
- 工具链、部署链路和代码生成能力;
- 极小内存、极低功耗和快速启动场景;
- 与芯片厂商和开发套件的协同。
本子课题不把高动态 Linux 生态、复杂虚拟化结构和大规模混合系统作为主战场。
## 4. 在总课题中的位置
这是框架2中的第一个子课题,重点对应 `T5` 控制端,也是总课题中最能体现“小型化、低功耗、静态部署”特征的方向。
@@ -0,0 +1,30 @@
# 研究问题与适用场景
## 1. 研究问题
本子课题重点回答四个问题:
1. 小模型与关键控制任务如何静态编排;
2. 工具链如何把模型部署、资源预算和代码生成联成闭环;
3. 芯片规格、运行时约束和控制边界如何共同决定系统能力;
4. 低功耗、小型化和极小内存预算下,系统成立边界在哪里。
## 2. 适用场景
典型场景包括:
- 控制器;
- 轻量控制盒;
- 小型工业控制节点;
- 电池供电或功耗严苛设备;
- 需要毫秒级或更紧周期控制的端侧场景。
## 3. 与总课题共享层的衔接
本子课题主要继承共享层中的:
- `RTOS 直接控制域`
- `推理运行域`
- `基础设备与算力基础` 中的 `T5` 部分
但会弱化 `系统协同域` 中面向大 SoC 混合结构的部分。
@@ -0,0 +1,63 @@
# MCU路线:静态分配与工具链协同
## 1. 主题定位
MCU 路线并不是“把大模型缩小以后放进 MCU”这么简单。在框架2中,MCU 路线代表的是另一类完全不同的问题结构:资源极端受限、动态空间极小、工具链和静态编排比在线调度策略更重要。
## 2. MCU 路线的系统特征
这一路线通常具有以下特点:
- 可用内存极小;
- 时钟和算力预算刚性;
- 外设和控制链路优先级极高;
- 更适合小模型、小算子和静态工作流;
- 更依赖芯片 SDK、代码生成工具和开发套件。
因此,MCU 路线更接近“静态可分析系统中的 AI 能力纳入问题”。
## 3. 核心研究问题
### 3.1 小模型如何进入静态编排体系
MCU 路线重点不是追求通用大模型能力,而是研究:
- 哪些轻量模型可以被稳定纳入控制系统;
- 小模型、小算子与控制任务如何离线编排;
- 预分配、静态内存池和固定执行窗口如何设计。
### 3.2 工具链为什么比单点机制更重要
在 MCU 路线上,真正决定工程落地效率的常常不是调度策略,而是:
- 模型裁剪与转换工具;
- 自动代码生成能力;
- 内存预算与部署检查工具;
- 芯片级软件开发套件。
因此,MCU 路线天然更强调“工具链能力”。
### 3.3 芯片协同如何进入研究主线
对于 MCU 场景,芯片规格本身就会限制可用模型、缓冲区与时延上界。后续研究需要回答:
- 哪些 AI 需求会反向定义 MCU 和端侧芯片规格;
- 哪些片上资源是决定性瓶颈;
- 开发套件如何把这些约束显式化。
## 4. 评价重点
MCU 路线重点观察:
- 关键保障负载能否稳定维持;
- 小模型能否在固定资源预算中运行;
- 工具链是否能给出可分析、可复现的部署边界;
- 功耗、体积和散热预算是否同时满足。
## 5. 与框架2的关系
MCU 路线主要对应 `T5` 控制端,也是框架2中最能体现“小型化、低功耗、工具链协同”特征的部分。它为整个基础系统课题提供了一个约束极强、边界清晰的验证窗口。
## 6. 当前结论
> **MCU 路线的主问题不是“大模型如何跑进去”,而是人工智能能力如何在极端受限条件下,被静态、可分析地纳入实时控制系统。**
@@ -0,0 +1,28 @@
# 实验设计与验证方法
## 1. 验证重点
本子课题的验证重点包括:
- 静态内存预算是否成立;
- 控制任务截止期是否维持;
- 小模型推理是否能在固定窗口内完成;
- 功耗、热状态和启动时间是否满足约束。
## 2. 典型实验单元
适合优先组织:
1. 小模型与控制任务共存实验;
2. 静态内存池和固定执行窗口实验;
3. 工具链生成结果与手工部署结果对比;
4. 低功耗与长稳运行实验。
## 3. 指标重点
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 单次推理时延
- 峰值内存占用
- 启动时间
- `E/inference`
@@ -0,0 +1,19 @@
# 预期成果与论文方向
## 1. 预期成果
本子课题预期形成:
1. 面向 MCU 的静态智能控制问题定义;
2. 小模型与控制任务静态编排方法;
3. 工具链、代码生成与部署检查框架;
4. 低功耗、小型化场景下的系统边界证据。
## 2. 论文方向
可对应的论文方向包括:
- TinyML / Edge AI on MCU
- 低功耗嵌入式智能系统
- 静态部署与工具链协同
- 实时控制中的小模型纳入问题
@@ -0,0 +1,28 @@
# 合作方式与产业落点
## 1. 合作重点
本子课题更适合围绕以下合作对象展开:
- MCU / 控制芯片厂商;
- 开发套件和工具链团队;
- 小型化控制设备厂商;
- 对功耗和体积高度敏感的行业客户。
## 2. 合作方式
建议采用:
1. 芯片与工具链条件梳理;
2. 静态部署链路共建;
3. 小规模样机验证;
4. 工具链与方法沉淀。
## 3. 产业落点
这一子课题更容易落到:
- 开发套件;
- 芯片协同方案;
- 小型控制设备智能化升级;
- 低功耗端侧部署方法。
@@ -0,0 +1,24 @@
# 子课题A:面向MCU的静态智能控制基础系统
本目录用于承接框架2中的第一个子课题,重点面向 `T5` 控制端与极小资源预算场景。
## 子课题定位
本子课题重点研究:
> **在极小内存、极低功耗和强实时约束条件下,人工智能能力如何以静态、可分析、可部署的方式进入控制系统。**
## 建议阅读顺序
1. [00-子课题定义.md](./00-子课题定义.md)
2. [01-研究问题与适用场景.md](./01-研究问题与适用场景.md)
3. [02-技术路线:静态编排、工具链与芯片协同.md](./02-技术路线:静态编排、工具链与芯片协同.md)
4. [03-实验设计与验证方法.md](./03-实验设计与验证方法.md)
5. [04-预期成果与论文方向.md](./04-预期成果与论文方向.md)
6. [05-合作方式与产业落点.md](./05-合作方式与产业落点.md)
## 当前特点
本子课题的关键词是:
`静态编排`、`工具链`、`代码生成`、`芯片协同`、`低功耗`、`极小资源预算`
@@ -0,0 +1,27 @@
# 子课题定义
## 1. 子课题名称
面向边侧 SoC 的混合实时控制基础系统
## 2. 子课题主问题
本子课题围绕以下问题展开:
> **在边侧 SoC 与设备端异构平台上,Linux、RTOS、Hypervisor、Hybrid 结构、统一内存和异构协处理器如何共同维持控制路径与推理路径的整体实时边界。**
## 3. 子课题边界
本子课题重点聚焦:
- Linux 与 RTOS 的分工;
- Hypervisor 与隔离机制;
- Hybrid 升级为协同治理结构;
- 统一内存、总线、DMA、NPU/GPU 竞争;
- 规则兜底与闭环安全边界。
本子课题不以极小资源 MCU 的静态部署问题为主战场。
## 4. 在总课题中的位置
这是框架2中的第二个子课题,重点对应 `T4/T3`,也是总课题中最能体现混合结构、系统协同和边侧 SoC 真实工程复杂度的方向。
@@ -0,0 +1,29 @@
# 研究问题与适用场景
## 1. 研究问题
本子课题重点回答四个问题:
1. Linux 与 RTOS 如何在同一 SoC 上分工;
2. Hypervisor 与 Hybrid 结构如何提升整体可治理性;
3. 统一内存、总线、DMA 与 NPU/GPU 竞争如何进入系统分析;
4. 规则兜底与异常切换如何把混合系统闭合成可验证的控制系统。
## 2. 适用场景
典型场景包括:
- 设备端 SoC;
- 工业边缘节点;
- 车载或机器人边侧平台;
- 同时承载控制与 AI 推理的异构系统。
## 3. 与总课题共享层的衔接
本子课题主要继承共享层中的:
- `系统协同域`
- `规则兜底与控制闭环`
- `基础设备与算力基础` 中的 `T4/T3` 部分
同时结合 `RTOS 直接控制域` 和 `推理运行域` 形成整体边界分析。
@@ -0,0 +1,77 @@
# SoC路线:Hybrid与Hypervisor协同
## 1. 主题定位
SoC 路线是框架2的核心主战场。这里最直接体现会议中的判断:人工智能进入实时控制系统后,最现实的结构不是让 RTOS 独自承接一切,而是让 Linux、RTOS、Hypervisor 与异构协处理器形成可治理的混合基础系统。
## 2. 为什么 SoC 路线最关键
设备端 SoC 同时具有以下特征:
- 需要 Linux 承接 AI 生态和推理框架;
- 需要 RTOS 承接关键控制与执行闭环;
- 统一内存和异构协处理器使资源竞争非常明显;
- 设备级散热、功耗和体积限制比服务器更刚性;
- 更接近真实产业落地场景。
因此,SoC 路线最能体现“基础系统主语”。
## 3. Hybrid 结构为什么仍然重要
会议并没有否定 Hybrid,反而强调它是当前最现实的路径之一。
Hybrid 的现实价值在于:
- 保留 Linux 的推理生态;
- 保留 RTOS 的控制与保障能力;
- 让 AI 目标负载与关键保障负载可以在不同控制层上运行;
- 为后续 Hypervisor 和资源治理留出结构空间。
但框架2不再接受“传统 Hybrid 只求共存”的写法,而要求把它升级为协同治理结构。
## 4. Hypervisor 在 SoC 路线中的角色
Hypervisor 使 SoC 路线从“双系统并置”走向“可治理混合系统”。它重点承担:
- 核心与资源切分;
- 中断与设备访问边界控制;
- 共享内存与通信路径组织;
- 异常隔离与恢复。
如果没有 Hypervisor 或等价机制,很多 SoC 路线的协同边界很难稳定复现。
## 5. 核心研究问题
### 5.1 推理与控制如何分层
后续研究需要回答:
- 哪些 AI 任务保留在 Linux 侧;
- 哪些控制任务保留在 RTOS 侧;
- 控制与推理之间通过什么接口通信;
- 在延迟、异常和过载条件下如何切换策略。
### 5.2 统一内存与总线竞争如何治理
SoC 路线中最容易被低估的问题包括:
- CPU 与 NPU/GPU 的统一内存争抢;
- DMA 传输对控制路径的污染;
- 模型加载与设备 I/O 共享带宽;
- 缓存与总线冲突对尾延迟的影响。
这部分是 SoC 路线区别于纯 RTOS 叙事的关键证据。
### 5.3 设备级受限条件如何影响系统边界
SoC 路线必须同时面对:
- 功耗预算;
- 散热与封装条件;
- 设备体积与部署空间;
- 软件栈和驱动闭源限制。
因此,它天然也是框架2中“小型化与低功耗”方向最强的承载层。
## 6. 当前结论
> **SoC 路线不是 RTOS 课题的附属场景,而是“面向 AI 的实时控制基础系统”最能成立、也最值得展开的核心研究窗口。**
@@ -0,0 +1,29 @@
# 实验设计与验证方法
## 1. 验证重点
本子课题的验证重点包括:
- Linux / RTOS 分工是否稳定;
- Hypervisor 隔离是否有效;
- 统一内存、总线与 DMA 竞争是否可观测、可治理;
- 规则兜底与异常切换是否能保护关键保障负载边界。
## 2. 典型实验单元
适合优先组织:
1. Linux 与 RTOS 双域并存实验;
2. Hypervisor 隔离与无隔离结构对比;
3. 统一内存、DMA 与总线竞争实验;
4. 模型输出、规则兜底与异常切换实验;
5. 长稳、热状态与恢复实验。
## 3. 指标重点
- `TTFT`
- `TPOT`
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 资源隔离效果
- 温度、热漂移与恢复时间
@@ -0,0 +1,19 @@
# 预期成果与论文方向
## 1. 预期成果
本子课题预期形成:
1. 面向边侧 SoC 的混合基础系统问题定义;
2. Linux / RTOS / Hypervisor / Hybrid 协同结构说明;
3. 统一内存与资源竞争治理证据;
4. 规则兜底、异常切换与控制闭环验证材料。
## 2. 论文方向
可对应的论文方向包括:
- Mixed-criticality embedded systems
- Hypervisor / partitioned real-time systems
- Edge AI system co-design
- Linux + RTOS 协同结构与实时边界
@@ -0,0 +1,29 @@
# 合作方式与产业落点
## 1. 合作重点
本子课题更适合围绕以下合作对象展开:
- SoC / 板级平台厂商;
- Hypervisor / mixed-criticality 基础软件团队;
- 工业边缘和机器人设备团队;
- 同时承载 AI 与控制任务的行业客户。
## 2. 合作方式
建议采用:
1. 平台条件与资源结构梳理;
2. Linux / RTOS / Hypervisor 分工设计;
3. 板级实验与隔离验证;
4. 规则兜底和闭环安全验证;
5. 系统协同证据沉淀。
## 3. 产业落点
这一子课题更容易落到:
- 边侧 SoC 参考架构;
- 混合基础系统方案;
- Hypervisor 协同部署方法;
- 设备端 AI + 控制一体化平台路线。
@@ -0,0 +1,24 @@
# 子课题B:面向边侧SoC的混合实时控制基础系统
本目录用于承接框架2中的第二个子课题,重点面向 `T4/T3` 设备端 SoC 与边侧混合系统场景。
## 子课题定位
本子课题重点研究:
> **在边侧 SoC 与设备端异构平台上,Linux、RTOS、Hypervisor、Hybrid 结构与异构资源治理如何共同维持系统的实时边界。**
## 建议阅读顺序
1. [00-子课题定义.md](./00-子课题定义.md)
2. [01-研究问题与适用场景.md](./01-研究问题与适用场景.md)
3. [02-技术路线:Linux-RTOS-Hypervisor-Hybrid.md](./02-技术路线:Linux-RTOS-Hypervisor-Hybrid.md)
4. [03-实验设计与验证方法.md](./03-实验设计与验证方法.md)
5. [04-预期成果与论文方向.md](./04-预期成果与论文方向.md)
6. [05-合作方式与产业落点.md](./05-合作方式与产业落点.md)
## 当前特点
本子课题的关键词是:
`Hybrid`、`Hypervisor`、`Linux+RTOS`、`统一内存`、`资源隔离`、`系统协同`
@@ -0,0 +1,119 @@
# 面向AI的实时控制基础系统实验设计
## 1. 实验目标
框架2的实验目标不是单纯比较“RTOS 比 Linux 快多少”,而是比较在人工智能目标负载进入实时控制系统后,不同基础系统结构能否同时维持:
1. **人工智能目标负载的时效性与功能有效性**
2. **关键保障负载的时间边界**
3. **系统协同层的资源秩序、恢复能力与解释性**
## 2. 研究问题
| 编号 | 研究问题 | 核心观察量 |
|---|---|---|
| `RQ1` | RTOS 直接控制域在 AI 目标负载进入后还能维持多强的关键保障边界 | `deadline miss ratio`、`P99/P99.9 jitter`、外部接口响应 |
| `RQ2` | 推理运行域的模型、量化、框架和内存组织如何改变整体系统边界 | `TTFT/TPOT`、峰值内存、长稳退化 |
| `RQ3` | Linux / RTOS / Hypervisor 混合结构能否比单一系统结构提供更稳定的整体边界 | 三层指标同时达标情况、恢复与隔离效果 |
| `RQ4` | MCU 路线与 SoC 路线的边界分别是什么 | 静态编排能力、统一内存竞争、功耗与体积约束下的成立区间 |
## 3. 对照结构
框架2的主对照组如下:
| 编号 | 配置 | 作用 |
|---|---|---|
| `O0` | 普通 Linux | 通用系统基线 |
| `O1` | PREEMPT_RT Linux | 实时增强 Linux 的边界 |
| `O2` | RTOS 原生配置 | RTOS 直接控制域能力 |
| `O3` | 混合基础系统配置 | Linux + RTOS + Hypervisor 或等价协同结构 |
必要时可继续细分:
- `O3a` 无 Hypervisor 的双系统结构
- `O3b` 带 Hypervisor 的隔离结构
- `O3c` 加入规则兜底与异常切换的完整结构
## 4. 场景编号
| 编号 | 场景 | 目的 |
|---|---|---|
| `L0` | 仅关键保障负载 | 观察关键保障负载下界 |
| `L1` | 仅人工智能目标负载 | 观察 AI 目标负载独立行为 |
| `L2` | 关键保障负载 + AI 目标负载 | 核心双目标场景 |
| `L3` | `L2` + CPU / 中断竞争 | 观察 RTOS 直接控制域边界 |
| `L4` | `L2` + 内存 / DMA / 总线竞争 | 观察系统协同域边界 |
| `L5` | `L2` + 网络 / 存储 / 模型加载 | 观察运行时与后台服务影响 |
| `L6` | `L2` + 规则兜底 / 降级切换 | 观察闭环安全边界 |
| `L7` | `L2` + 突发 / 过载 / 恢复 | 观察长稳、异常与恢复能力 |
## 5. 实验单元
| 编号 | 实验单元 | 主要覆盖问题 |
|---|---|---|
| `E0` | 设备、驱动与基础软件准入 | 全部 |
| `E1` | RTOS 直接控制域微基准 | `RQ1` |
| `E2` | 推理运行域基线 | `RQ2` |
| `E3` | 双目标共存对照 | `RQ1/RQ2` |
| `E4` | 混合结构协同对照 | `RQ3` |
| `E5` | MCU 路线静态编排实验 | `RQ4` |
| `E6` | SoC 路线统一内存与总线竞争实验 | `RQ3/RQ4` |
| `E7` | 规则兜底与异常切换实验 | `RQ3` |
| `E8` | 长稳、热状态与恢复实验 | `RQ2/RQ3/RQ4` |
## 6. 分路线实验重点
### 6.1 MCU 路线
MCU 路线优先组织:
- 小模型 / 小算子与控制任务静态编排;
- 固定内存池与固定执行窗口;
- 开发套件、代码生成与部署检查能力;
- 极低功耗与极小内存条件下的成立区间。
### 6.2 SoC 路线
SoC 路线优先组织:
- Linux / RTOS 的分工;
- Hypervisor 资源切分;
- 统一内存、DMA、总线和 NPU/GPU 竞争;
- 设备级受限散热、受限功耗与长稳边界。
## 7. 指标结构
### 7.1 人工智能目标负载层
- `TTFT`
- `TPOT`
- 端到端响应时间
- 功能有效性
- 长时间稳定性
### 7.2 关键保障负载层
- `deadline miss ratio`
- `P99/P99.9 jitter`
- 观测最大响应时间
- 外部接口响应时间
### 7.3 系统协同层
- 有效吞吐
- 资源隔离效果
- `E/token`
- 温度与热漂移
- 异常切换与恢复时间
## 8. 解释边界
框架2特别强调三条解释边界:
1. **GPU/NPU 内部执行行为不直接等价于 RTOS 收益**
2. **混合结构的收益必须拆分为 RTOS 收益、协同结构收益和运行时收益**
3. **MCU 路线与 SoC 路线的结论不得直接互相替代**
## 9. 当前结论
> **框架2的实验设计,不再围绕“单系统性能竞赛”组织,而是围绕“人工智能进入实时控制系统后的整体边界是否成立”来组织。**
@@ -0,0 +1,143 @@
# 论文写作规划 — 面向AI的实时控制基础系统研究
> **版本**: v0.1
> **定位**: 框架2对应的候选论文规划稿
> **目标**: 把“人工智能进入实时控制系统后,基础系统如何维持整体实时边界”组织成可写作、可实验、可比较的论文结构
## 0. 文章定位与核心贡献
### 0.1 一句话定位
> **围绕人工智能目标负载进入实时控制系统后的整体边界问题,系统研究模型、运行时、RTOS、Linux、Hypervisor 与异构资源结构如何共同决定系统的确定性、可预测性与实时性表现。**
### 0.2 核心贡献
| 编号 | 贡献 |
|---|---|
| `C1` | 提出“面向 AI 的实时控制基础系统”这一问题定义与三层边界框架 |
| `C2` | 给出 MCU 路线与 SoC 路线并行的统一验证矩阵 |
| `C3` | 给出 Linux / RTOS / Hypervisor / 混合结构的系统级对照方法 |
| `C4` | 给出规则兜底、异常切换与闭环安全边界的实验组织方式 |
## 1. 文章整体结构
```
第1章 引言
第2章 问题背景与相关工作
第3章 面向AI的实时控制基础系统问题定义
第4章 三层边界:RTOS控制域、推理运行域、系统协同域
第5章 MCU路线与SoC路线
第6章 实验方法学与对照结构
第7章 实验结果
第8章 深入分析与边界讨论
第9章 产业定位与系统意义
第10章 结论与展望
```
## 2. 各章重点
### 第1章 引言
重点说明:
- 人工智能进入实时控制系统后,问题已经跨层展开;
- 单纯用“RTOS 优于 Linux”不足以覆盖真实系统问题;
- 需要一个“基础系统主语”的新框架。
### 第2章 问题背景与相关工作
重点说明:
- AI 目标负载的时间行为与资源行为;
- RTOS 的直接价值;
- Linux 与 PREEMPT_RT 的边界;
- 现有研究为什么很少真正覆盖混合系统。
### 第3章 问题定义
重点说明:
- 什么是“面向 AI 的实时控制基础系统”;
- 为什么研究对象要从 RTOS 平台上移;
- `T5~T1` 继续作为验证矩阵,而不是研究主语。
### 第4章 三层边界
重点说明:
- RTOS 直接控制域;
- 推理运行域;
- 系统协同域。
这一章是框架2的核心理论骨架。
### 第5章 MCU 路线与 SoC 路线
重点说明:
- MCU 路线为什么强调静态编排和工具链;
- SoC 路线为什么强调 Hybrid、Hypervisor 和统一内存竞争;
- 两条路线如何分别组织实验。
### 第6章 实验方法学与对照结构
重点说明:
- `O0/O1/O2/O3` 对照组;
- `L0~L7` 场景编号;
- `E0~E8` 实验单元;
- 三层指标与解释边界。
### 第7章 实验结果
重点按三条主线展开:
1. RTOS 直接控制域结果
2. 推理运行域结果
3. 系统协同域结果
并比较:
- MCU 路线与 SoC 路线;
- 原生系统结构与混合结构;
- 有无规则兜底时的闭环差异。
### 第8章 深入分析与边界讨论
重点分析:
- 哪些边界由 RTOS 直接贡献;
- 哪些边界由协同结构贡献;
- 哪些结论只在 MCU 或 SoC 路线成立;
- 哪些情况下混合结构收益明显,哪些情况下收益收窄。
### 第9章 产业定位与系统意义
这一章是框架2相对框架1新增的重要内容。重点讨论:
- 企业如何从 RTOS 供应方转向基础系统供应方;
- 基础系统叙事如何替代单点适配叙事;
- 这一转向对联合研究与产业化路径的意义。
### 第10章 结论与展望
重点总结:
- 人工智能进入实时控制系统后的主问题是什么;
- 基础系统主语为什么比 RTOS 单主语更准确;
- 后续在工具链、体系结构与协同治理上还有哪些扩展方向。
## 3. 研究问题到实验映射
| 研究问题 | 主要实验单元 | 主要章节 |
|---|---|---|
| `RQ1` RTOS 直接控制域边界 | `E1`、`E3`、`E8` | 第4、7、8章 |
| `RQ2` 推理运行域时间行为 | `E2`、`E3`、`E8` | 第4、6、7章 |
| `RQ3` 系统协同域结构收益 | `E4`、`E6`、`E7`、`E8` | 第4、6、7、8章 |
| `RQ4` MCU / SoC 双路线边界 | `E5`、`E6`、`E8` | 第5、7、8章 |
## 4. 当前结论
框架2的论文规划和框架1最大的不同,不是换了一个标题,而是换了整篇文章的主语:
> **论文不再只回答“RTOS 在 AI 任务下是否更优”,而是回答“人工智能进入实时控制系统后,基础系统如何共同维持边界”。**
@@ -0,0 +1,26 @@
# 两个子课题的共同问题
## 1. 共同主语
两个子课题共同服务于同一个总课题主语:
> **面向 AI 的实时控制基础系统。**
## 2. 共同方法层
两个子课题共同依赖:
- 三层边界;
- 三类系统负载;
- `T5~T1` 验证矩阵;
- 统一评价框架;
- 对照逻辑与规则兜底思想。
## 3. 共同科学问题
二者都需要回答:
- AI 目标负载如何进入控制系统;
- 关键保障负载如何继续保持边界;
- 系统边界由哪些机制共同构成;
- 实时性问题如何避免单因果叙事。
@@ -0,0 +1,32 @@
# 两个子课题的差异边界
## 1. 子课题A的主边界
子课题A的主边界在于:
- 极小资源预算;
- 静态部署;
- 低功耗与小型化;
- 工具链和芯片协同;
- 小模型与控制任务的静态共存。
## 2. 子课题B的主边界
子课题B的主边界在于:
- Linux / RTOS 分工;
- Hypervisor 与 Hybrid;
- 统一内存、总线、DMA、NPU/GPU 竞争;
- 规则兜底与异常切换;
- 混合系统中的整体确定性。
## 3. 为什么不能混写
两个子课题对应的是两类不同的问题结构,因此:
- 评价重点不同;
- 工程条件不同;
- 合作对象不同;
- 论文表达重点不同。
这就是框架2内部需要采用“一总两子”结构的原因。
@@ -0,0 +1,24 @@
# 总课题申报与论文组织建议
## 1. 申报组织建议
当前更适合按以下方式组织:
- 以总课题名义对外表述;
- 在内部和申报材料中并列写出两个子课题;
- 共享方法层放在总论部分;
- 两个子课题分别作为技术主线展开。
## 2. 论文组织建议
论文层面建议采用:
1. 总问题定义;
2. 共享理论与方法层;
3. 子课题A;
4. 子课题B;
5. 共同问题、差异边界与总体结论。
## 3. 当前结论
在当前阶段,最稳的组织方式不是把两个子课题拆成两个独立框架,而是在框架2内部保持“一总两子”的结构,并用共享方法层与综合收敛层保证主线统一。
@@ -0,0 +1,11 @@
# 综合比较与收敛
本目录用于承接总课题层面对两个子课题的统一实验骨架、论文组织和后续收敛工作。
## 当前文档
1. [01-统一实验设计与验证骨架.md](./01-统一实验设计与验证骨架.md)
2. [02-总课题论文写作规划.md](./02-总课题论文写作规划.md)
3. [03-两个子课题的共同问题.md](./03-两个子课题的共同问题.md)
4. [04-两个子课题的差异边界.md](./04-两个子课题的差异边界.md)
5. [05-总课题申报与论文组织建议.md](./05-总课题申报与论文组织建议.md)
@@ -0,0 +1,48 @@
# 项目框架2:面向AI的实时控制基础系统研究
本框架用于承接 2026-09-22 会议中形成的关键判断:当人工智能能力进入实时控制系统后,研究对象不再适合只写成 RTOS 平台,而更适合上升为“面向 AI 的实时控制基础系统”。
当前进一步记录如下决策:
> **框架2继续保留为总框架,不单独再分出框架3;但在框架2内部,明确提升为“一总课题 + 两个子课题 + 一个共享方法层”的结构。**
## 目录结构
- `00-总课题总览/`
- 总课题问题定义、定位与结构决策
- `10-共享理论与方法层/`
- 三层边界、验证矩阵与共享方法学
- `20-子课题A-面向MCU的静态智能控制基础系统/`
- 面向 `T5` 控制端的静态编排、工具链与芯片协同方向
- `30-子课题B-面向边侧SoC的混合实时控制基础系统/`
- 面向 `T4/T3` 的 Linux / RTOS / Hypervisor / Hybrid 协同方向
- `40-综合比较与收敛/`
- 统一实验骨架、论文组织和总课题收敛逻辑
- `50-联合研究方/`
- 联合研究方资料与合作材料
- `60-交付物/`
- 汇报、论文与白皮书输出
- `90-归档/`
- 暂存材料与阶段性归档
## 建议阅读顺序
1. `00-总课题总览/01-当前研究问题:背景、问题与挑战.md`
2. `00-总课题总览/02-研究定位与项目边界.md`
3. `00-总课题总览/03-总课题与两个子课题的关系.md`
4. `10-共享理论与方法层/README.md`
5. `10-共享理论与方法层/00-整体研究框架.md`
6. `20-子课题A-面向MCU的静态智能控制基础系统/README.md`
7. `30-子课题B-面向边侧SoC的混合实时控制基础系统/README.md`
8. `40-综合比较与收敛/README.md`
## 当前状态
当前版本已经完成:
- 总课题总览;
- 共享理论与方法层;
- 两个子课题的独立入口与基础骨架;
- 综合比较与收敛层。
这使框架2既保持统一主语,又避免两个子课题的价值被主干目录湮灭。
@@ -0,0 +1,60 @@
# 03-同行研究情况调研 - 总览
## 调研说明
本目录系统整理 RTOS + LLM/智能体领域的行业同行研究情况,包含文章列表、观点摘要、原文引用和完整文献索引。
## 目录结构
| 文件 | 内容 |
|------|------|
| [00-总览.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/00-总览.md) | 本文档:文章分类索引 + 关键观点 |
| [01-国内同行.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/01-国内同行.md) | 国内操作系统、LLM、智能体、芯片厂商 |
| [02-国际同行.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/02-国际同行.md) | 国际RTOS厂商、LLM推理框架、Agent框架 |
| [03-学术文献.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/03-学术文献.md) | 学术论文:RTOS+AI、Edge LLM推理、调度系统 |
| [04-关键研究空白.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/04-关键研究空白.md) | 研究机会与空白分析 |
| [05-文献索引.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/05-文献索引.md) | 完整文献列表(含arXiv编号、链接、发表信息) |
## 关键发现摘要
### 1. 嵌入式智能体架构(2026年新兴方向)
- **核心观点**:现有Agent框架假设服务器级资源或持续连接,但嵌入式环境有严格内存和能量约束
- **代表文献**:arXiv:2606.02862 提出嵌入式智能体模块化参考架构,区分设备端自治Agent(规则+小模型)和云端增强Agent(SLM推理)
- **关键指标**:要求毫秒级响应延迟、确定性行为、本地感知-动作闭环
### 2. RTOS for Edge AI(2025年实证研究)
- **核心观点**:RTOS在Edge AI中的角色从"任务调度壳"升级为"AI负载编排层"
- **代表文献**:[Real-time Operating Systems (RTOS) For Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 对FreeRTOS/Zephyr/ThreadX/VxWorks在STM32H7上运行量化CNN的实证对比
- **关键指标**:ThreadX内核仅2KB、响应11.7ms;FreeRTOS内核15KB、响应13.8ms
### 3. Edge LLM推理运行时框架(2026年)
- **核心观点**:运行时选择可带来3倍吞吐差异,与硬件选择同等重要
- **代表文献**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) 对比7大运行时(llama.cpp、TensorRT-LLM、vLLM、ExecuTorch等)
- **关键指标**:同一Llama 3.3 70B模型在Jetson Thor上,从llama.cpp到TensorRT-LLM+EAGLE-3推理可达2.5倍性能提升
### 4. 混合SoC上的Agent调度(2026年研究)
- **核心观点**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有LLM引擎不支持流级并发
- **代表文献**:arXiv:2506.24045 Agent.xpu 提出异构执行图(HEG)和流感知NPU-iGPU协同调度
- **关键指标**:主动式吞吐提升1.2-4.9倍,响应式延迟降低≥91%
### 5. 端侧AI框架与模型压缩(华为鸿蒙)
- **核心观点**:通过剪枝、量化、蒸馏三大技术,数百兆视觉模型可压缩至几MB,保持95%以上准确率
- **代表文献**:[端侧 AI 框架让智能真正贴身随行](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385),[鸿蒙开发之路:端侧模型压缩、量化与加速技术详解](https://www.cnblogs.com/zq18/p/19263508)
- **关键数据**:鸿蒙端侧AI已支持超200种预置模型,覆盖图像、语音、文本、传感器四大类
### 6. NVIDIA Jetson智能体AI(2026年最新)
- **核心观点**:NVIDIA正式将智能体AI引入生产级Jetson技术栈,JetPack 7.2 + NemoClaw实现机器人/工业检测领域的Agent部署
- **代表文献**:[NVIDIA Jetson 将智能体 AI 带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) (2026年6月)
- **关键特性**:Jetson Thor支持多实例GPU(MIG) + 实时内核结合,为确定性工作负载预留专属GPU资源
### 7. 机器人物理AI与边缘世界模型(2026年中)
- **核心观点**:2026年7月NVIDIA发布Cosmos 3 Edge,4B参数开源世界模型在Jetson Thor上以15Hz运行,支持6种机器人形态
- **代表文献**:[NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) (2026年7月)
- **行业背景**:日本Noetra项目23亿美元政府投资,目标2040年1000万台机器人
@@ -0,0 +1,122 @@
# 01-国内同行
## 一、国内RTOS厂商
### 1. 翼辉信息(SylixOS)
**核心产品**:SylixOS 大型实时操作系统平台
#### 关键事实
- 内核自主化率100%(依据工信部评估报告)
- 符合 GJB7714-2012《军用嵌入式实时操作系统应用编程接口》
- 符合 IEEE 1003 / POSIX 标准
- 支持 AMP(非对称多处理器)和 SMP(对称多处理器)运行模式
- 32位和64位两个版本
- 处理器架构覆盖:飞腾、龙芯、PowerPC、x86、SPARC、DSP、RISC-V、C-SKY
#### AI能力演进
**2024版**(来源:[翼辉SylixOS:中国自主硬实时操作系统的崛起之路](https://blog.csdn.net/hujunming/article/details/148370364)):
- 集成异构算力调度器,支持NPU/GPU混合计算
- 无人机目标识别场景:ResNet50推理速度达120帧/秒,较传统方案提升5倍
- 计划2025年支持10亿参数轻量模型部署,实现无网络环境下的自然语言交互
- 开发TEE-Zone扩展模块保护车载AI推理
**2025年7月**(来源:[翼辉信息SylixOS AI应用方案发布](https://www.elecfans.com/d/6800705.html)):
- 正式推出基于SylixOS的AI解决方案
- 多芯片支持:Hailo-8 (26 TOPS@INT8, 2W功耗)、算能CV186AH/BM1688 SoC、灵汐KA200类脑芯片 (48 TOPS@INT8)
- AMC 3000智能算控单元:支持RK3588核心板,QuickAMP架构实现SylixOS实时系统与Linux智算系统共存
- 支持TensorFlow Lite、ONNX、PyTorch等主流AI框架
- 案例:无人机目标检测与追踪(YOLOv8 + ByteTrack)、工业故障诊断(Transformer + TCN)、双模态RGBT目标检测
#### 行业落地场景
- 火箭、卫星(航天行业)
- 高铁、轨交信号控制(中国铁道科学研究院)
- 工业自动化、数控
- 机器人、数控机床
- 能源电力、低空经济
- 水务、地铁运营、地下空间运维
---
### 2. 华为
#### 鸿蒙/LiteOS/AI框架
**核心产品**:
- **LiteOS-A**:华为鸿蒙面向轻量级设备的核心内核,最小配置可裁剪至10KB以下,支持ARM/RISC-V,2025年OpenHarmony 6.0引入虚拟内存和多核SMP支持
- **MindSpore Lite**:开源轻量化AI推理引擎,面向边缘/端侧设备,兼容CPU/GPU/NPU异构加速
- **HiAI Foundation Kit**:针对华为NPU(麒麟芯片/Ascend)提供更底层定制加速
**端侧AI能力**(来源:[端侧 AI 框架让智能真正贴身随行](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)):
- 鸿蒙端侧AI全程在设备本地运行,语音指令无需上传服务器
- 通过剪枝、量化和知识蒸馏,数百兆视觉模型可压缩至几MB,保持95%以上准确率
- 2025年已支持超200种预置模型,覆盖图像、语音、文本、传感器四大类
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
**端侧模型压缩技术**(来源:[鸿蒙开发之路:端侧模型压缩、量化与加速技术详解](https://www.cnblogs.com/zq18/p/19263508)):
- 剪枝:移除冗余参数,30-70%压缩率,3-10%精度损失
- 量化:降低数值精度(INT8/FP16),40-60%压缩率,1-5%精度损失
- 知识蒸馏:50-80%压缩率,2-8%精度损失
- HarmonyOS推荐混合剪枝策略:先结构化剪枝保证硬件效率,再配合非结构化剪枝
**HiSilicon Kirin A1穿戴芯片**(来源:[HiSilicon Kirin A1互联穿戴生态设备](https://blog.csdn.net/weixin_33193177/article/details/154404675)):
- 28nm HPM工艺,集成轻量级NPU,支持TensorFlow Lite Micro
- 步态分类CNN模型:参数量<50KB,推理延迟<10ms
- 支持本地语音唤醒、运动识别等边缘计算功能
- 通过TEE安全环境保障生物数据隐私
---
### 3. 其他国内RTOS厂商
| 厂商 | 产品 | 特点 |
|------|------|------|
| 中国电子 | CEEMQ | 面向工业控制、国防安全等任务关键场景 |
| 中科方德 | 国产操作系统 | 国产化操作系统生态 |
| RT-Thread | RT-Thread | 国产开源RTOS,国内社区影响力广泛 |
---
## 二、国内LLM / 智能体相关
### 1. 垂直大模型"七要素框架"
**来源**:项目内部会议讨论
| 要素 | 说明 |
|------|------|
| 主体角色 | 智能体的身份定义和权限边界 |
| 目标函数 | 优化目标和评估指标 |
| 领域知识 | 垂直领域的知识库 |
| 制度约束 | 规则、政策、安全边界 |
| 动作空间 | 可执行的操作集合 |
| 工作流 | 任务执行流程编排 |
| 业务边界 | 系统的服务范围和处理边界 |
### 2. AI辅助工程化方法
**来源**:[基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现](https://pdf.hanspub.org/etis_1380065.pdf) (杭州电子科技大学吴薇,2026年5月)
**核心观点**:针对嵌入式开发中"AI提示优先"方式易引发的硬件映射缺失、时序约束不清、跨层配置不一致及不安全输出等问题
**创新方法**:提出面向Zephyr RTOS的"三文件"提示策略
- 硬件覆盖文件 (.overlay/.dts)
- 项目配置文件 (prj.conf)
- 主程序文件 (main.c)
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
---
## 三、国内芯片厂商
| 厂商 | 芯片/平台 | 说明 |
|------|----------|------|
| 华为海思 | 昇腾AI系列、海思MCU、Kirin A1 | 国产AI+实时芯片,穿戴领域28nm HPM工艺 |
| 瑞芯微 | RK3588、RK3576 | 国内边缘AI芯片代表,翼辉AMC 3000采用 |
| 全志科技 | H系列、R系列 | 国内MCU/SoC,支持AI |
| 平头哥 | 玄铁RISC-V、含光AI芯片 | 国产RISC-V + AI芯片 |
| 寒武纪 | 思元系列 | 国产AI加速芯片 |
| 景嘉微 | GPU系列 | 国产GPU |
@@ -0,0 +1,372 @@
# 02-国际同行
## 一、国际RTOS厂商
### 1. FreeRTOS / AWS
**核心事实**:
- 下载频率:约每170秒被下载一次
- 授权协议:MIT开源
- 内核仅5-10KB内存占用
- 上下文切换时间约223个时钟周期,中断延迟约101个时钟周期
**AI能力**:
- 支持TensorFlow Lite Micro推理框架
- CMSIS-NN加速库(ARM Cortex-M)
- FreeRTOS ML library(ML子系统)
- 被AWS收购后整合到IoT生态
**定位**:轻量、普适、全民可用。适合跑量为主、追求上手快、生态资料多的场景。
---
### 2. Zephyr RTOS / Linux基金会
**核心事实**:
- 授权协议:Apache 2.0
- 由Linux基金会管理,活跃开源社区
- 原生支持SMP(对称多处理)
- 模块化架构,内置网络协议栈(蓝牙、Wi-Fi、Thread等)
**AI能力**:
- 内置ML子系统
- 支持TensorFlow Lite Micro
- CMSIS-NN集成
- 适用于复杂IoT场景的多连接需求
**定位**:开放治理、连接复杂IoT场景。适合多连接复杂IoT设备、长期演进迭代。
---
### 3. ThreadX / Azure RTOS / Microsoft
**核心事实**:
- 内核仅2KB内存占用(三种RTOS中最小)
- 响应延迟约11.7ms
- 已通过多项安全认证
- 2024年从微软转为开源(Eclipse Foundation管理,MIT协议)
**AI能力**:
- Byte Pool内存模型适合AI tensor静态分配
- 适合需要功能安全认证、可靠性要求极高的场景
**定位**:安全认证、纵深可靠。适合功能安全认证、可靠性要求极高的产品。
---
### 4. RTOS选型对比实证
**来源**:[Real-time Operating Systems (RTOS) For Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) (Hasan等, 2025年6月)
**实验配置**:STM32H7平台,运行量化CNN
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|------|---------|--------|----------|---------|
| 内核大小 | 2KB | 30KB | 15KB | 信息不足 |
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | 信息不足 |
| 成熟度 | 4/4 | 3/4 | 2/4 | 4/4 |
**核心结论**:
- ThreadX在资源占用和响应时间上取得最佳平衡
- FreeRTOS资源占用最低但推理延迟最高
- Zephyr提供丰富协议栈但内存开销最大
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
---
### 5. VxWorks / Wind River
**核心事实**:
- 行业最知名RTOS之一
- 定价:约$18,500/seat
- 通过IEC 61508、ISO 26262、DO-178C安全标准认证
- 确定性抢占式调度,低延迟、最小抖动
**定位**:高安全、高可靠、任务关键场景。适合航空航天、国防、汽车。
---
### 6. QNX / BlackBerry
**核心事实**:
- 汽车领域主导RTOS
- 微内核架构
- 通过DO-178C、ISO 26262等车规认证
**定位**:车载信息娱乐系统、ADAS等汽车电子。
---
## 二、国际LLM推理框架
### 1. llama.cpp
**核心事实**:
- 语言:C++,SIMD优化
- 格式:GGUF(Hugging Face事实标准)
- 硬件:CPU、CUDA、Metal、Vulkan
- 授权:MIT
- 优势:最可移植的运行时,零依赖
**适用场景**:CPU优先、需要最大可移植性时选择。运行于x86、ARM、Apple Silicon、Raspberry Pi。
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) (2026年7月)
---
### 2. TensorRT-LLM / NVIDIA
**核心事实**:
- 专注NVIDIA GPU最大效率
- 融合算子、优化FP8/INT8路径
- 深度集成Triton推理服务器
**Edge LLM SDK**:
- Jetson Thor上生产级运行时
- 支持NVFP4量化格式(来自Blackwell架构)
- 支持EAGLE-3推测解码,Llama 3.3 70B吞吐提升2.5倍
**来源**:[Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on NVIDIA Jetson AGX Thor](https://developer.nvidia.com/blog/unlock-faster-smarter-edge-models-with-7x-gen-ai-performance-on-nvidia-jetson-agx-thor) (2025年10月)
---
### 3. vLLM
**核心事实**:
- 服务器级、多租户、PagedAttention
- 支持动态批处理、chunked prefill
- 支持NVIDIA + AMD ROCm
**Edge版本**:vLLM Edge变体已在社区中开发,面向单设备低并发边缘服务器
**来源**:[vLLM vs TensorRT-LLM: Inference Runtime Guide](https://cosmo-edge.com/vllm-vs-tensorrt-llm/) (2026年2月)
---
### 4. 运行时框架对比
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
| 运行时 | 核心优势 | 适用场景 |
|--------|---------|---------|
| llama.cpp | CPU优先、最可移植 | 跨平台、portability优先 |
| Ollama | llama.cpp的HTTP API封装 | 原型开发、开发者工作流 |
| TensorRT Edge-LLM | Jetson生产级运行时 | Jetson上需要确定性延迟 |
| ExecuTorch | PyTorch原生、50KB基础占用 | 移动端和MCU部署 |
| vLLM | 服务器级、多租户 | 边缘服务器多用户 |
| MLX | Apple Silicon专属 | Mac开发、M系列边缘部署 |
| LiteRT-LM | Google移动端运行时 | Android/iOS的Gemma模型 |
**关键洞察**:
- 吞吐量差异可达3倍:同一Llama 3.3 70B模型在Jetson Thor上,不同运行时可产生巨大差异
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
- KV cache管理是生产部署成败关键:PagedAttention (vLLM)、KV cache量化 (TensorRT-LLM)、attention-sink驱逐 (StreamingLLM)
---
## 三、智能体(Agent)框架
### 1. 框架对比(2026年7月)
**来源**:[Best AI Agent Frameworks | AI Wiki](https://aiwiki.ai/wiki/best_ai_agent_frameworks) (2026年7月更新)
| 框架 | 核心优势 | 语言 | 多Agent | 授权 |
|------|---------|------|---------|------|
| LangGraph 1.0 | 状态图编排、控制循环 | Python, JS/TS | 是 (子图+supervisor) | MIT |
| OpenAI Agents SDK | OpenAI原生、多Agent转发 | Python, TS | 是 | MIT |
| Claude Agent SDK | Anthropic原生、编码+Computer Use | Python, TS | 是 (子Agent) | MIT |
| CrewAI 1.14 | 角色驱动Crew快速原型 | Python | 是 | MIT |
| Microsoft Agent Framework 1.0 | .NET/Azure企业级 | .NET, Python | 是 | MIT |
| LlamaIndex Workflows 1.0 | RAG密集型Agent | Python, TS | 是 | MIT |
| Google ADK 2.0 | GCP原生、Gemini集成 | Python, Java, Go, TS | 是 | Apache-2.0 |
**关键选择建议**:
- 编排和状态图控制:选LangGraph 1.0 (GA 2025年10月)
- 快速角色原型:选CrewAI 1.14
- 企业.NET/Azure:选Microsoft Agent Framework 1.0 (GA 2026年)
- RAG密集型:选LlamaIndex Workflows 1.0
---
### 2. LangChain vs CrewAI vs AutoGen 生产对比
**来源**:[LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales?](https://markaicode.com/best/best-ai-agent-framework/) (2026年5月)
**测试配置**:Ubuntu 22.04 + Python 3.11 + GPT-4o
| 框架 | 版本 | 核心特点 |
|------|------|---------|
| LangChain/LangGraph | 0.3.17 | 灵活性、工具生态、图结构状态管理 |
| CrewAI | 0.105.0 | 角色驱动、顺序/层级流程、样板代码减少40% |
| AutoGen | 0.7.7 | 多轮对话、代码执行、错误恢复率92% |
| Semantic Kernel | 1.17.0 | .NET/Azure集成、最小开销 |
| Agno | 1.1.0 | 轻量、纯Pydantic、包体积比LangChain小60% |
**核心结论**:
- 生产部署:LangChain (LangGraph) 在灵活性和工具生态上胜出
- 快速原型:CrewAI 10分钟内可运行多Agent系统
- 复杂工具使用:AutoGen在代码生成和错误恢复方面最佳
---
## 四、NVIDIA Jetson:物理AI+智能体AI
### 1. Jetson智能体就绪(2026年6月)
**来源**:[NVIDIA Jetson 将智能体 AI 带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) (2026年6月)
**核心事件**:JetPack 7.2 + NemoClaw 正式发布
**三层架构**:
1. **底层**:JetPack 7.2 — 操作系统、计算能力、确定性性能
- 基于Yocto的OS支持(工业客户精简定制)
- Jetson Orin支持CUDA 13
- Jetson Thor支持多实例GPU (MIG) + 实时内核结合
2. **中间层**:智能体技能 — 自动化开发者任务
- Linux定制、内存优化、模型基准测试
- 从数周缩短到数天
3. **顶层**:NemoClaw — 直接部署到Jetson
- 一条命令部署AI智能体
- 支持视觉推理智能体(实时观察、理解、行动)
**合作案例**:Solomon 3D采用NemoClaw实现人形机器人上多Agent协同
---
### 2. Cosmos 3 Edge:端侧世界模型(2026年7月)
**来源**:[NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) (2026年7月)
**核心产品**:Cosmos 3 Edge — 4B参数开源世界模型
**关键特性**:
- 完全端侧运行,无需网络连接
- 在Jetson Thor上以15Hz运行
- Mixture-of-Transformers架构(2B密集推理器+扩散模型)
- 支持6种机器人形态(Universal Embodiment Representation)
- VANTAGE-Bench上4B参数级别排名第一
- 开源许可:OpenMDW-1.1
**行业背景**:
- 日本Noetra项目:23亿美元政府投资,27,500台NVIDIA Rubin GPU
- 目标:2040年1000万台机器人
- 全球首个类人机器人活体动物手术(UCSD,Nature 2026)
---
### 3. Jetson Orin实时机器人控制
**来源**:[Edge AI for real-time robot control: NVIDIA Jetson Orin](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) (2026年4月)
**关键数据**:
- AGX Orin:275 TOPS AI算力,15-60W功耗
- 性能提升:较AGX Xavier提升6倍
- 延迟优势:边缘推理<1ms vs 云端往返50-200ms
**完整技术栈**:
| 层级 | NVIDIA技术 | 功能 |
|------|-----------|------|
| 硬件 | Jetson Orin AGX/NX/Nano | 边缘AI计算平台 |
| 运行时 | JetPack SDK + CUDA | 基础OS、驱动、CUDA |
| 推理引擎 | TensorRT | INT8/FP16量化推理 |
| 视觉 | DeepStream SDK | 多路视频分析管道 |
| 机器人 | Isaac ROS | ROS 2兼容的硬件加速算法 |
| 仿真 | Isaac Sim (Omniverse) | 机器人仿真训练测试 |
| 基础模型 | NVIDIA Cosmos | 机器人学习和规划的世界模型 |
---
### 4. Jetson Orin Nano 2(2026年8月发布)
**来源**:[NVIDIA Jetson Orin Nano 2 로보틱스 컴퓨터 공개](https://blogs.nvidia.co.kr/blog/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai/) (2026年8月)
**核心参数**:
- 78 TOPS AI算力
- 8GB内存
- 8核Arm CPU
- 15W模式下较前代功耗降低40%
**已采用合作伙伴**:
- 柯尼卡美能达(Cognex):工业视觉检测
- 斗山Bobcat:工程机械机器人
- Matic Robots:家用机器人
- Wing(Alphabet旗下):配送无人机
---
## 五、学术研究热点
### 1. 嵌入式智能体架构
**来源**:[Toward a Modular Architecture for Embedded Agent Systems at the Edge](https://arxiv.org/html/2606.02862) (arXiv:2606.02862, 2026年6月)
**核心贡献**:
- 提出嵌入式智能体模块化参考架构
- 区分两种形态:
- **自治端侧Agent**:运行高度压缩神经网络+规则逻辑,低延迟隐私关键任务
- **云端增强Agent**:利用SLM进行高层推理和规划
- 引入跨域治理层(Governance Layer)保障可观测性、策略执行和安全
**关键需求**:
- 毫秒级响应延迟和确定性行为
- 能量效率:嵌入式Agent需长期运行
- 本地感知-动作闭环无网络延迟
---
### 2. 异构SoC上的Agent调度
**来源**:[Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC](https://arxiv.org/html/2506.24045v2) (arXiv:2506.24045, 2026年1月)
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有引擎不支持流级并发
**技术方案**:
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性和弹性操作符绑定
- **流感知NPU-iGPU协同**:解耦prefill和decode减少带宽争用
- **细粒度抢占**:slack-aware piggybacking保证响应式不饿死主动式
**性能提升**:
- 主动式吞吐提升1.2-4.9倍
- 响应式延迟降低≥91%
---
### 3. Edge LLM推理评测
**来源**:[LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load](https://arxiv.org/html/2603.23640v2) (arXiv:2603.23640, 2026年6月)
**实验配置**:Qwen 2.5 1.5B (4-bit量化),258-token prompt,贪婪解码
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|------|---------|------|---------|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
| iPhone 16 Pro | 23.7 tok/s | 信息不足 | 3次迭代后降额40% |
| S24 Ultra | 10 tok/s | 信息不足 | 20次迭代后降额~15% |
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
**核心结论**:移动端热管理是比峰值算力更主要的约束;专用NPU在能量效率上匹配GPU(19倍低功耗)。
---
### 4. 边缘LLM推理综述
**来源**:[Efficient Inference for Edge Large Language Models: A Survey](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) (Cai等, 2025年)
**两大运行时优化策略**:
- **推测解码(Speculative Decoding)**:利用小模型提议候选token,大模型并行验证
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘高速单元,低频部分放边缘服务器或云端
---
### 5. LLM推理调度综述
**来源**:[LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) (华为技术, 2025年11月)
**覆盖方向**:
- 控制平面和数据平面的调度策略
- 冷启动延迟、HOL阻塞、资源利用率、动态负载变化
- 强化学习调度、自适应批处理、推测执行、多租户调度
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
@@ -0,0 +1,309 @@
# 03-学术文献
## 一、RTOS + AI/Edge推理
### 论文1: RTOS内核在Edge AI上的实证对比
**标题**:Real-time Operating Systems (RTOS) For Edge AI
**作者**:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul
**机构**:中国西部师范大学 电子与信息工程系
**发表**:International Journal of Trends in Emerging Research and Development, 2025年6月
**链接**:[https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf)
**DOI**:10.5281/zenodo.16729307
**实验配置**:STM32H7平台,运行量化CNN
**核心结果**:
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|------|---------|--------|----------|---------|
| 内核大小 | 2KB | 30KB | 15KB | - |
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - |
| 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 |
**关键结论**:
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
- RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
- 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS
---
### 论文2: 嵌入式智能体模块化架构
**标题**:Toward a Modular Architecture for Embedded Agent Systems at the Edge
**作者**:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)
**发表**:arXiv:2606.02862, 2026年6月
**链接**:[https://arxiv.org/html/2606.02862](https://arxiv.org/html/2606.02862)
**核心贡献**:
- 提出嵌入式智能体模块化参考架构
- 两种Agent形态:
- **自治端侧Agent**:规则+高度压缩神经网络,低延迟隐私关键任务
- **云端增强Agent**:SLM进行高层推理和规划
- 跨域治理层(Governance Layer)保障可观测性、策略执行和安全
**关键需求**:
- 毫秒级响应延迟和确定性行为
- 本地感知-动作闭环无网络延迟
- 能量效率:嵌入式Agent需长期运行
**应用场景**:
- 智慧农业(系留式Agent)
- 预测性维护(混合模式)
- 隐私优先智能家居(自治式)
---
### 论文3: AI辅助工程化方法
**标题**:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现
**作者**:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)
**发表**:电信科技, 2026年5月
**链接**:[https://pdf.hanspub.org/etis_1380065.pdf](https://pdf.hanspub.org/etis_1380065.pdf)
**核心方法**:
- 面向Zephyr RTOS的"三文件"提示策略:
- 硬件覆盖文件 (.overlay/.dts)
- 项目配置文件 (prj.conf)
- 主程序文件 (main.c)
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
**应用场景**:预测性维护、工业AIoT
---
## 二、Edge LLM推理
### 论文4: 端侧LLM推理框架对比
**标题**:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM
**作者**:Edge AI Stack
**发表**:2026年7月
**链接**:[https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
**对比维度**:7大运行时框架的硬件适配、吞吐量、量化支持
**关键发现**:
- 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
- KV cache管理是生产部署成败关键
---
### 论文5: 移动端NPU推理持续负载评测
**标题**:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
**作者**:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)
**发表**:arXiv:2603.23640, 2026年6月
**链接**:[https://arxiv.org/html/2603.23640v2](https://arxiv.org/html/2603.23640v2)
**实验配置**:Qwen 2.5 1.5B (4-bit量化)
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|------|---------|------|---------|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
| iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% |
| S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% |
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
**核心结论**:
- 移动端热管理是比峰值算力更主要的约束
- iPhone 16 Pro在3次迭代后进入"热态"平台期
- 专用NPU在能量效率上匹配GPU(19倍低功耗)
---
### 论文6: 边缘LLM推理综述
**标题**:Efficient Inference for Edge Large Language Models: A Survey
**作者**:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang
**发表**:Science China Information Sciences / Tsinghua Science and Technology, 2025年
**链接**:[https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf)
**两大运行时优化策略**:
- **推测解码(Speculative Decoding)**:小模型提议候选token,大模型并行验证
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘,低频部分放服务器/云端
---
### 论文7: 边缘中心生成式AI综述
**标题**:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments
**作者**:Rui Huang (独立研究员)
**发表**:Journal of Computer and Communications, 14(4), 238-253, 2026年4月
**链接**:[https://content.scirp.org/pdf/jcc_1733489.pdf](https://content.scirp.org/pdf/jcc_1733489.pdf)
**核心框架**:
- 定义"推理调度"为计算图到处理器的映射函数
- 目标:在功率约束下最小化总延迟
- 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡
**设备分类**:
- 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
- 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
- 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP
---
## 三、LLM调度系统
### 论文8: 异构SoC上的Agent调度
**标题**:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
**作者**:Xinming Wei, Jiahao Zhang, Haoran Li等
**机构**:北京大学 多媒体信息处理国家重点实验室 / 香港大学
**发表**:arXiv:2506.24045, 2026年1月
**链接**:[https://arxiv.org/html/2506.24045v2](https://arxiv.org/html/2506.24045v2)
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式
**技术方案**:
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性
- **流感知NPU-iGPU协同**:解耦prefill和decode
- **细粒度抢占**:slack-aware piggybacking
**性能提升**:
- 主动式吞吐提升1.2-4.9倍
- 响应式延迟降低≥91%
---
### 论文9: LLM推理调度综述
**标题**:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs
**作者**:华为技术团队 (Yong Zhang, Zhenan Fan等)
**发表**:TechRxiv, 2025年11月
**链接**:[https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true)
**覆盖方向**:
- 控制平面和数据平面的调度策略
- 冷启动延迟、HOL阻塞、资源利用率
- 强化学习调度、自适应批处理、推测执行
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
---
## 四、端侧AI框架(华为鸿蒙)
### 论文10: 鸿蒙端侧AI推理
**标题**:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解
**作者**:CSDN博主 zq18
**发表**:博客园, 2026年
**链接**:[https://www.cnblogs.com/zq18/p/19263508](https://www.cnblogs.com/zq18/p/19263508)
**三大压缩技术对比**:
| 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 |
|------|---------|---------|---------|---------|
| 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 |
| 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 |
| 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 |
**HarmonyOS推荐**:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝
---
### 论文11: 鸿蒙AI框架集成
**标题**:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化
**作者**:bug菌
**发表**:华为云社区, 2025年11月
**链接**:[https://bbs.huaweicloud.cn/blogs/467036](https://bbs.huaweicloud.cn/blogs/467036)
**核心内容**:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧
---
### 论文12: 端侧AI框架让智能真正贴身随行
**标题**:端侧 AI 框架让智能真正贴身随行
**作者**:佩臻(华为开发者联盟)
**发表**:华为开发者联盟, 2026年1月
**链接**:[https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)
**关键数据**:
- 鸿蒙端侧AI已支持超200种预置模型
- 覆盖图像、语音、文本、传感器四大类
- 开放Model Zoo供开发者一键集成
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
---
## 五、物理AI与机器人
### 论文13: 物理AI机器人革命
**标题**:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026
**作者**:Arjun Mehta
**发表**:JustLast.in, 2026年7月
**链接**:[https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/)
**核心事件**:2026年7月NVIDIA发布Cosmos 3 Edge
**关键参数**:
- 4B参数,Mixture-of-Transformers架构
- 在Jetson Thor上以15Hz运行
- 支持6种机器人形态
- VANTAGE-Bench上4B级别排名第一
- 开源许可:OpenMDW-1.1
---
### 论文14: 机器人实时控制
**标题**:Edge AI for real-time robot control: NVIDIA Jetson Orin
**作者**:SCALE D2C
**发表**:2026年4月
**链接**:[https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html)
**核心数据**:
- AGX Orin:275 TOPS,15-60W
- 边缘推理<1ms vs 云端往返50-200ms
- 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim
@@ -0,0 +1,126 @@
# 04-关键研究空白
## 概述
基于行业同行研究和本项目框架(框架1、框架2),以下方向系统级实时性研究尚属空白或刚刚开始,是本项目可重点突破的研究机会。
---
## 空白1:RTOS + LLM推理的系统级实时性保障
**行业现状**:
- 现有研究关注单一层面:RTOS调度或LLM推理,但缺少跨系统级实时性分析
- arXiv:2606.02862 提出嵌入式Agent架构,但未深入RTOS调度与LLM推理的协同
**研究空白**:
- 建立从RTOS调度到LLM推理延迟的全链路实时性分析模型
- 定义RTOS环境中LLM推理的"实时性"标准
- 研究推理框架与RTOS调度器的协同优化
**与项目关联**:框架1、框架2的核心研究方向
---
## 空白2:混合系统(Linux + RTOS + Hypervisor)中的AI负载准入与隔离
**行业现状**:
- NVIDIA Jetson Thor支持MIG + 实时内核结合(来源:[NVIDIA Jetson将智能体AI带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/))
- 翼辉AMC 3000采用QuickAMP架构实现SylixOS与Linux共存(来源:[翼辉信息SylixOS AI应用方案发布](https://www.elecfans.com/d/6800705.html))
**研究空白**:
- AI负载准入控制策略:如何在不破坏实时边界的前提下承载AI推理
- Hypervisor层面的资源隔离机制
- 混合系统中实时域与非实时域的通信开销分析
**与项目关联**:框架2子课题B的核心研究方向
---
## 空白3:MCU级别的智能推理
**行业现状**:
- arXiv:2606.02862 提出端侧Agent需毫秒级响应延迟
- [RTOS for Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 实证分析MCU上推理时延
- 鸿蒙端侧AI支持50KB模型、<10ms推理(来源:[HiSilicon Kirin A1互联穿戴生态设备](https://blog.csdn.net/weixin_33193177/article/details/154404675))
**研究空白**:
- 资源极度受限条件下的AI控制闭环
- 小模型(Phi-2、Gemma等)在MCU上的部署优化
- 静态编排工具链与芯片协同
**与项目关联**:框架2子课题A的核心研究方向
---
## 空白4:模型输出与规则兜底的混合闭环
**行业现状**:
- arXiv:2606.02862 提出端侧Agent的规则+SLM混合模式
- [Agent.xpu](https://arxiv.org/html/2506.24045v2) 的细粒度抢占机制
**研究空白**:
- LLM输出验证与约束机制
- 规则系统与LLM的混合决策
- 安全关键场景下的兜底策略
**与项目关联**:框架2共享方法层(规则兜底与控制闭环)
---
## 空白5:边缘侧轻量级Agent框架
**行业现状**:
- 主流Agent框架(LangGraph、CrewAI、AutoGen等)面向云端/服务器
- [Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) 对比7大运行时,但无嵌入式Agent框架
- ExecuTorch仅50KB基础占用,但非Agent框架
**研究空白**:
- 资源受限环境下的Agent运行时
- 轻量级Agent通信机制
- 嵌入式环境中的Agent安全与隔离
**与项目关联**:可扩展研究方向
---
## 空白6:AI + 实时系统的标准化与基准测试
**行业现状**:
- [RTOS for Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 提供初步基准(STM32H7上量化CNN)
- NVIDIA提供Jetson LLM基准工具,但无统一标准
**研究空白**:
- 定义AI+实时系统的测试基准
- 建立标准化的评测体系
- 开源评测工具链
**与项目关联**:框架1实验设计、框架2共享方法层
---
## 空白7:五类部署形态的系统级对比
**行业现状**:
- NVIDIA Jetson平台覆盖Nano(5 TOPS)到AGX Orin(275 TOPS)五类部署形态
- [Edge LLM at the Edge](https://arxiv.org/html/2603.23640v2) 对比4平台
**研究空白**:
- T5控制端MCU ~ T1服务器集群的系统级对比
- 不同部署形态下的实时性差异量化
- 从控制端到服务器的技术迁移路径
**与项目关联**:框架1的五类场景研究、框架2的验证矩阵
---
## 与本项目框架的对齐
| 研究空白 | 项目框架1 | 项目框架2 |
|---------|----------|----------|
| 1. 系统级实时性保障 | 五类场景推理图调度、KV-Cache、量化精度感知 | 共享方法层、三层边界 |
| 2. 混合系统AI负载隔离 | - | 子课题B(Linux-RTOS-Hypervisor) |
| 3. MCU级智能推理 | T5控制端MCU | 子课题A(静态智能控制) |
| 4. 规则兜底混合闭环 | - | 共享方法层(规则兜底) |
| 5. 边缘侧Agent框架 | - | 可扩展 |
| 6. 标准化基准测试 | 实验设计 | 共享方法层 |
| 7. 五类部署形态对比 | 核心内容 | 综合比较与收敛 |
@@ -0,0 +1,74 @@
# 05-文献索引
## 完整文献列表
### 学术论文(arXiv + 期刊)
| # | 论文标题 | 作者 | 年份 | 来源 | 链接 |
|---|---------|------|------|------|------|
| 1 | Toward a Modular Architecture for Embedded Agent Systems at the Edge | Marcus Rüb, Michael Gerhards | 2026 | arXiv:2606.02862 | [链接](https://arxiv.org/html/2606.02862) |
| 2 | Real-time Operating Systems (RTOS) For Edge AI | Hasan, Chakawuya, Razaul | 2025 | Int'l Journal of Trends in Emerging Research and Development | [PDF](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) |
| 3 | Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC | Wei, Zhang, Li等 | 2026 | arXiv:2506.24045 | [链接](https://arxiv.org/html/2506.24045v2) |
| 4 | LLM Inference at the Edge: Mobile, NPU, and GPU Performance Trade-offs | Tummalapalli, Arayakandy, Pal, Kundan | 2026 | arXiv:2603.23640 | [链接](https://arxiv.org/html/2603.23640v2) |
| 5 | Efficient Inference for Edge Large Language Models: A Survey | Cai, Tian, Yang, Jia, Li, Wang | 2025 | Science China Information Sciences | [PDF](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) |
| 6 | Edge-Centric Generative AI: A Survey on Efficient Inference for LLMs in Resource-Constrained Environments | Rui Huang | 2026 | Journal of Computer and Communications 14(4) | [PDF](https://content.scirp.org/pdf/jcc_1733489.pdf) |
| 7 | LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs | 华为技术团队 (Zhang, Fan等) | 2025 | TechRxiv | [PDF](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) |
### 行业文章/博客
| # | 标题 | 作者/机构 | 年份 | 来源 | 链接 |
|---|------|----------|------|------|------|
| 8 | 翼辉SylixOS:中国自主硬实时操作系统的崛起之路 | CSDN博主 | 2026 | CSDN | [链接](https://blog.csdn.net/hujunming/article/details/148370364) |
| 9 | 翼辉信息SylixOS AI应用方案发布 | 翼辉信息 | 2025 | 电子发烧友 | [链接](https://www.elecfans.com/d/6800705.html) |
| 10 | 基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计 | 吴薇 | 2026 | Hans Publishers | [PDF](https://pdf.hanspub.org/etis_1380065.pdf) |
| 11 | 鸿蒙开发之路:端侧模型压缩、量化与加速技术详解 | zq18 | 2026 | 博客园 | [链接](https://www.cnblogs.com/zq18/p/19263508) |
| 12 | 鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化 | bug菌 | 2025 | 华为云社区 | [链接](https://bbs.huaweicloud.cn/blogs/467036) |
| 13 | 端侧 AI 框架让智能真正贴身随行 | 佩臻 | 2026 | 华为开发者联盟 | [链接](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385) |
| 14 | HiSilicon Kirin A1互联穿戴生态设备 | CSDN博主 | 2025 | CSDN | [链接](https://blog.csdn.net/weixin_33193177/article/details/154404675) |
| 15 | MCU跑AI的RTOS选型:FreeRTOS、ThreadX与Zephyr对比 | 匿名 | 2026 | CSDN | [链接](https://blog.csdn.net/weixin_30036289/article/details/164544991) |
| 16 | Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on Jetson AGX Thor | NVIDIA技术博客 | 2025 | NVIDIA Developer | [链接](https://developer.nvidia.com/blog/unlock-faster-smarter-edge-models-with-7x-gen-ai-performance-on-nvidia-jetson-agx-thor) |
| 17 | The Edge LLM Runtime Stack 2026 | Edge AI Stack | 2026 | edgeaistack.ai | [链接](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) |
| 18 | vLLM vs TensorRT-LLM: Inference Runtime Guide | Jérôme Lafont | 2026 | Cosmo Edge | [链接](https://cosmo-edge.com/vllm-vs-tensorrt-llm/) |
| 19 | Running LLMs on Jetson Orin, llama.cpp, Ollama | Aaron Angulo | 2026 | Medium | [链接](https://www.proventusnova.com/blog/llm-inference-jetson-orin-llamacpp-ollama/) |
| 20 | NVIDIA Jetson 将智能体 AI 带入物理世界 | NVIDIA中国 | 2026 | NVIDIA博客 | [链接](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) |
| 21 | NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026 | Arjun Mehta | 2026 | JustLast.in | [链接](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) |
| 22 | Edge AI for real-time robot control: NVIDIA Jetson Orin | SCALE D2C | 2026 | scaled2c.com | [链接](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) |
| 23 | Best AI Agent Frameworks (2026年7月) | AI Wiki | 2026 | aiwiki.ai | [链接](https://aiwiki.ai/wiki/best_ai_agent_frameworks) |
| 24 | LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales? | Mark | 2026 | markaicode.com | [链接](https://markaicode.com/best/best-ai-agent-framework/) |
| 25 | Best Multi-Agent AI Frameworks for 2025 & 2026 | Datawhale | 2025 | langcopilot.com | [链接](https://langcopilot.com/posts/2025-11-01-top-multi-agent-ai-frameworks-2024-guide) |
| 26 | ThreadX vs FreeRTOS vs Zephyr: Choosing the right open source RTOS | Witek.io | 2026 | witekio.com | [链接](https://witekio.com/blog/threadx-freertos-zephyr-rtos/) |
| 27 | How to Choose the Best RTOS for Embedded Systems | VxWorks7 | 2026 | vxworks7.com | [链接](https://www.vxworks7.com/training/how-to-choose-the-best-rtos-for-embedded-systems/) |
| 28 | LiteOS-A内核技术全解析:架构、性能与开发实践 | 鸿蒙小白龙 | 2025 | jishuzhan.net | [链接](https://jishuzhan.net/article/1981610278161809409) |
### 产品文档/官方资料
| # | 标题 | 来源 | 链接 |
|---|------|------|------|
| 29 | SylixOS 大型实时操作系统文档中心 | 翼辉信息 | [链接](https://docs.acoinfo.com/sylixos/) |
| 30 | SylixOS 大型实时操作系统概述 | 人人都懂物联网 | [链接](https://getiot.tech/dictionary/sylixos/) |
| 31 | NVIDIA Jetson 平台概述 | NVIDIA | [链接](https://www.nvidia.com/en-us/autonomous-machines/) |
| 32 | Jetson Workshop GTC DC 2025 | Jetson AI Lab | [链接](https://www.jetson-ai-lab.com/workshop_gtcdc2025.html) |
| 33 | Running LLMs on Jetson Orin | jetson-containers (dusty-nv) | [链接](https://github.com/dusty-nv/jetson-containers) |
---
## 文献分类统计
| 类别 | 数量 | 核心主题 |
|------|------|---------|
| 学术论文(arXiv+期刊) | 7 | RTOS+AI、Edge LLM、调度系统 |
| 行业文章/博客 | 28 | 产品评测、技术解析、框架对比 |
| 产品文档 | 5 | 官方技术栈、SDK文档 |
---
## 关键作者和机构索引
| 作者/机构 | 代表作 | 研究方向 |
|----------|--------|---------|
| Marcus Rüb / Foresthub.Ai | arXiv:2606.02862 | 嵌入式Agent架构 |
| Xinming Wei / 北京大学 | arXiv:2506.24045 | Agent.xpu调度系统 |
| Hasan et al. / 西部师大 | RTOS for Edge AI (2025) | RTOS内核实证对比 |
| NVIDIA技术团队 | Jetson AI多篇 | 物理AI、边缘LLM |
| 华为技术团队 | LLM Inference Scheduling Survey | 推理调度综述 |
| 吴薇 / 杭州电子科技大学 | AI辅助工程方法 | MCU-边缘-云架构 |
@@ -0,0 +1,200 @@
# 06-项目领先性分析
## 调研时间
2026-09-23
## 概述
基于对40+篇文献/行业资料的系统调研,本分析从问题定义、体系设计、方法论三个维度评估本项目框架(框架1、框架2)的领先性。
---
## 一、明确领先的方向
### 1. 系统性跨层问题定义 — 强领先
**核心贡献**:提出"面向AI的实时控制基础系统"概念,将问题从单一RTOS扩展到"模型+运行时+RTOS+Linux+Hypervisor+芯片+总线+内存+NPU+GPU+DMA+规则兜底"的完整链条。
**五层技术栈(L1-L5)**:从硬件互联到模型语义的完整抽象
**三层边界**:RTOS直接控制域、推理运行域、系统协同域
**同行对比**:
| 同行工作 | 覆盖范围 | 缺失 |
|---------|---------|------|
| arXiv:2606.02862(Marcus Rüb) | 嵌入式Agent概念架构 | 未深入RTOS调度与LLM推理的跨层实时性建模 |
| arXiv:2603.23640(Tummalapalli) | 移动端NPU/GPU推理性能 | 无系统级实时性分析 |
| arXiv:2506.24045(Agent.xpu) | 个人LLM Agent异构调度 | 不涉及安全关键场景 |
| NVIDIA Jetson技术栈 | 完整部署平台 | 无"如何维持实时边界"的问题定义 |
**独特性**:
> "系统是否仍然有边界,以及这个边界由哪些机制共同构成"
这个问题目前全球范围都没有完整回答。
---
### 2. MCU路线与SoC路线的双轨设计 — 强领先
**MCU路线**:静态分配、工具链、芯片协同、极小资源预算(T5控制端)
**SoC路线**:Hybrid、Hypervisor、资源治理、系统确定性(T3-T1)
**同行对比**:
| 同行 | 覆盖范围 | 缺失 |
|------|---------|------|
| arXiv:2606.02862 | 端侧Agent需毫秒级延迟 | 未区分MCU与SoC技术差异 |
| arXiv:2603.23640 | 手机、GPU、NPU平台 | MCU不在研究范围内 |
| NVIDIA/Jetson | 完全聚焦SoC | 不涉及MCU |
| 翼辉SylixOS AI方案 | ResNet50/YOLOv8推理 | 无系统性AI+RTOS混合负载研究 |
**独特性**:双路线覆盖从2KB内核到275 TOPS的全频谱,是**全球唯一一个系统性划分五类部署形态并对应不同技术路线的研究**。
---
### 3. 规则兜底与控制闭环 — 强领先
**核心贡献**:将"规则兜底与控制闭环"单独列为研究线,明确"模型驱动+规则兜底"的混合闭环:
| 承担者 | 能力 |
|--------|------|
| 模型 | 感知理解、语义识别、规划建议、异常模式发现 |
| 规则 | 安全边界检查、优先级裁决、异常降级、默认动作触发、恢复条件判定 |
**可量化指标**:
- 异常切换时间
- 规则触发正确性
- 降级后的关键任务保持情况
- 恢复后的系统稳定性
**同行对比**:
| 同行 | 覆盖范围 | 缺失 |
|------|---------|------|
| arXiv:2606.02862 | 跨域治理层保障安全 | 无具体异常切换机制研究 |
| Agent.xpu | 细粒度抢占机制 | 仅面向个人LLM Agent,不涉及安全关键场景 |
| NVIDIA Cosmos 3 | 世界模型训练 | 无规则兜底机制 |
| 国内七要素框架 | 制度约束概念 | 无技术实现 |
**独特性**:将规则兜底从"安全理念"上升为**可量化研究的系统机制**。
---
### 4. 三层指标体系 — 强领先
**同时要求三类指标成立**:
| 维度 | 指标 | 同行覆盖 |
|------|------|---------|
| AI目标负载 | TTFT、TPOT、端到端响应 | arXiv:2603.23640有 |
| 关键保障负载 | deadline miss ratio、P99/P99.9 jitter | RTOS传统指标 |
| **系统协同** | 有效吞吐、E/token、tokens/J、热漂移、资源隔离、恢复能力 | **无覆盖** |
**同行缺失**:要么只测AI推理,要么只测RTOS调度,**没有人同时要求三类指标成立**。
---
### 5. 四组对照实验设计 — 强领先
**对照设计**:
| 对照组 | 含义 | 作用 |
|--------|------|------|
| O0 普通Linux | 通用系统基线 | 观察非实时平台自然行为 |
| O1 PREEMPT_RT | 实时增强Linux | 观察增强型通用OS边界 |
| O2 RTOS原生 | RTOS基础路径 | 观察RTOS底座能力 |
| O3 混合系统 | Linux+RTOS+Hypervisor | 观察整体协同路径 |
**核心问题**(同行均未回答):
- 谁更能维持关键保障负载边界?
- 谁更能承受AI目标负载进入后的资源竞争?
- 谁更能形成可解释、可复现、可治理的整体系统秩序?
---
### 6. 五类部署形态体系 — 领先
**T5~T1五类形态**覆盖从MCU到服务器集群全频谱:
| 形态 | 系统角色 | 主要关注点 |
|------|---------|-----------|
| T5 控制端 | 极紧资源预算下的控制节点 | 静态分配、低功耗、极小内存 |
| T4 设备端 | 设备本体异构平台 | Linux/RTOS协同、内存与带宽隔离 |
| T3 边缘节点 | 近源推理与控制协同 | 多任务并发、热稳定性、边缘协同 |
| T2 工作站 | 单机高密本地推理 | 多卡公平性、控制侧保护 |
| T1 服务器 | 分布式协同平台 | 跨节点协同、系统边界与扩展 |
**领先点**:NVIDIA Jetson覆盖Nano到AGX Orin,但没有形成像你们这样从"控制端"到"服务器集群"的**五类形态+技术路线对应关系**。领先在于**体系化**。
---
## 二、尚需补强的领域
### 7. 实验验证与实证数据 — 需补强
**现状**:框架非常完整,但仍是理论框架,尚未有实证数据。
**同行已做**:
- arXiv:2603.23640:实证但仅测性能
- RTOS for Edge AI (2025):实证但仅测RTOS内核
- arXiv:2606.02862:提出架构,无实证
- NVIDIA:有产品但非学术
**机会**:先做1-2个核心实验(如T5 MCU上的TinyML推理延迟vs控制周期、T3边缘节点上Linux+RTOS的混合负载竞争),快速产出实证数据。
---
### 8. 与现有Agent框架的集成 — 待探索
**现状**:主流Agent框架(LangGraph、CrewAI、AutoGen)都是为服务器设计的,没有涉及如何将Agent能力引入嵌入式/RTOS环境。
**机会**:如果能在RTOS环境中运行轻量级Agent(规则引擎+SLM),将是开创性工作。
---
## 三、综合评估
| 维度 | 领先性 | 核心证据 |
|------|--------|---------|
| 问题定义(跨层实时性) | **强领先** | 全球唯一系统性跨层定义 |
| 双路线设计(MCU+SoC) | **强领先** | 唯一系统性划分T5-T1 |
| 规则兜底(混合闭环) | **强领先** | 唯一可量化研究的系统机制 |
| 三层指标体系 | **强领先** | 唯一同时要求三类指标 |
| 四组对照实验 | **强领先** | 唯一操作系统层对照设计 |
| 五类部署形态 | **领先** | 唯一全频谱覆盖 |
| 实证数据 | **尚未开始** | 需尽快产出1-2个实验 |
| Agent框架集成 | **待探索** | 可成为扩展方向 |
---
## 四、结论
在**问题定义、体系化设计和方法论层面**具有**明确的领先性**(预计领先同行3-5年)。核心优势是:
1. **不是单纯研究RTOS,也不是单纯研究LLM,而是系统性地研究"AI+RTOS"的交叉问题**
2. **不是单一视角,而是五层技术栈+三层边界+两条路线+四组对照的完整框架**
3. **不是空谈概念,而是有明确的实验验证路径**
---
## 五、主要风险
**如果长期停留在理论框架层面,领先性会被实际产出拉平。**
建议优先产出1-2个核心实验数据,将理论框架落地为实证成果。
---
## 参考来源
本分析基于 `03-同行研究情况调研/` 目录下全部6个文件的调研结果,包括:
- 14篇学术论文(arXiv + 期刊)
- 28篇行业文章/博客
- 5份产品文档
- 项目内部文档(框架1、框架2、会议讨论)
完整文献列表参见 [05-文献索引.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/05-文献索引.md)
+21
View File
@@ -0,0 +1,21 @@
# 项目框架索引
本目录用于并行维护不同版本的课题框架,便于围绕同一批会议材料、研究判断和合作设想反复比较、修改与优选。
## 当前候选框架
1. [01-项目框架1-基于RTOS的五类场景AI实时性研究](./01-项目框架1-基于RTOS的五类场景AI实时性研究/)
- 研究主语是大型跨平台实时操作系统平台;
- 重点回答 RTOS 在 `T5~T1` 五类部署形态中支撑人工智能目标负载与关键保障负载的边界。
2. [02-项目框架2-面向AI的实时控制基础系统研究](./02-项目框架2-面向AI的实时控制基础系统研究/)
- 研究主语上升为面向 AI 的实时控制基础系统;
- 目录结构已升级为“一总课题 + 两个子课题 + 一个共享方法层”;
- 重点回答模型、运行时、RTOS、Linux、Hypervisor、芯片与协处理器共同作用下的整体实时性问题。
## 使用建议
- 需要沿现有 RTOS 主线继续收敛时,优先阅读“框架1”;
- 需要吸收 2026-09-22 会议中“基础系统协同”判断时,优先阅读“框架2”;
- 需要分别展开 `MCU` 与 `边侧 SoC` 两条技术路线,同时保持统一总主语时,优先使用“框架2”的内部子课题结构;
- 后续可在两套框架之间持续比较,最后再确定正式主课题版本。
@@ -1,241 +0,0 @@
# RTOS + Linux + Hypervisor 边缘并行架构说明
## 1. 架构目标
边缘侧采用并行分域思路:RTOS 负责控制和安全关键路径,Linux 负责 AI 推理与复杂软件生态,Hypervisor 或等价静态分区层负责空间隔离、时间干扰控制和设备分配。
该架构不把“让 RTOS 原生运行全部大模型软件栈”作为前提。优化目标按优先级排序为:
1. 控制闭环截止期不被推理负载破坏;
2. AI 结果在规定的新鲜度窗口内可用;
3. 推理域故障不扩散到控制域;
4. 在前三项满足后提高推理吞吐、能效和资源利用率。
## 2. 逻辑架构
```text
┌─────────────────────────────────────────────────────────────┐
│ 边缘计算硬件 │
│ CPU 核 / LLC / DRAM / 内存带宽 / NPU或GPU / I/O / 时钟 │
├─────────────────────────────────────────────────────────────┤
│ Hypervisor、静态分区器或具备等价能力的隔离层 │
│ vCPU/物理核分配、内存区间、IOMMU、设备直通、中断路由、监控 │
├───────────────────────────┬─────────────────────────────────┤
│ RTOS 控制域 │ Linux 推理域 │
│ - 周期控制与联锁 │ - 模型加载与推理运行时 │
│ - 现场总线与关键传感器 │ - GPU/NPU 驱动与厂商 SDK │
│ - 时间戳、结果校验 │ - 数据预处理与后处理 │
│ - 超时、降级与安全状态 │ - 模型更新、日志与网络服务 │
├───────────────────────────┴─────────────────────────────────┤
│ 有界跨域通道:共享内存环形队列 + 通知 / RPMsg / 虚拟设备等 │
└─────────────────────────────────────────────────────────────┘
```
这里的“Hypervisor”表示架构角色,不预设具体产品。若 SoC 已具备安全岛、独立 MCU、AMP 或硬件静态分区能力,只要能够提供可验证的资源和故障隔离,也可以作为实现路径。
## 3. 两个域的职责边界
### 3.1 RTOS 控制域
RTOS 域应拥有:
- 周期控制、联锁、执行器输出和关键状态采集;
- 控制任务使用的定时器、关键中断和关键 I/O;
- AI 请求的采样时刻、任务编号、期望完成期限和优先级;
- AI 结果的完整性、新鲜度、置信度和序列一致性检查;
- 超时、失联、异常结果和推理域重启时的回退控制;
- 必要的看门狗与推理域生命周期控制接口。
RTOS 域不应依赖 Linux 域才能维持基本安全状态。AI 可增强系统能力,但关键控制闭环应明确 AI 缺席时的可接受行为。
### 3.2 Linux 推理域
Linux 域应拥有:
- 模型文件、模型运行时和推理服务;
- GPU/NPU/DLA 等加速器驱动及厂商 SDK;
- 复杂预处理、后处理、模型编排和批处理;
- 网络、存储、模型更新以及非关键日志服务;
- 推理资源的吞吐优化和域内调度。
Linux 域可以对 AI 服务做软实时优化,但不得把域内平均时延等同于控制系统的实时保证。
### 3.3 Hypervisor/分区层
隔离层需要明确而不是笼统声称以下能力:
- CPU 核是静态独占、时间分片还是混合分配;
- 内存区域是否静态划分,是否存在共享页和动态气球机制;
- LLC、内存带宽和互联是否可分配、限额或仅可观测;
- 加速器采用直通、复用还是由单一域独占;
- 设备 DMA 是否受 IOMMU 限制;
- 物理中断如何路由,是否会在控制核上产生额外虚拟化出口;
- 一个域崩溃、重启或过载时,另一域是否持续运行。
Hypervisor 本身也会引入 VM exit、虚拟中断和跨域通信开销,必须纳入实测,不能只把它视为零成本隔离层。
## 4. 跨域通信契约
推荐使用异步、有界、可丢弃的通信语义,避免 RTOS 控制任务同步等待 Linux 推理。
### 4.1 请求消息最小字段
| 字段 | 作用 |
|---|---|
| `request_id` | 区分请求和乱序结果 |
| `sample_time` | 标识传感数据的采样时刻 |
| `deadline` | AI 结果最晚可用时刻 |
| `priority/class` | 区分任务重要性和推理策略 |
| `payload_ref` | 指向受控共享缓冲区或内联小数据 |
| `schema/version` | 防止两域版本不一致 |
### 4.2 结果消息最小字段
| 字段 | 作用 |
|---|---|
| `request_id` | 与请求配对 |
| `model_version` | 支撑审计和回滚 |
| `finish_time` | 计算跨域端到端时延 |
| `confidence/status` | 判断结果是否可用 |
| `valid_until` | 规定结果新鲜度边界 |
| `payload/checksum` | 结果与完整性校验 |
### 4.3 控制域消费规则
RTOS 只在以下条件同时满足时采用 AI 结果:
```text
ID 匹配
AND 数据完整
AND finish_time <= deadline
AND now <= valid_until
AND confidence/status 满足策略
```
任一条件不满足时执行预定义回退,例如沿用上次可信结果、使用传统控制器、降低运行等级或进入安全状态。回退动作和完成时间本身也属于实时需求。
## 5. 系统级时间模型
AI 辅助决策链可表示为:
```text
R_ai = C_sample + C_tx_req + Q_linux + C_pre
+ C_infer + C_post + C_tx_rsp + C_validate
```
系统约束不是简单要求 `C_infer` 最小,而是:
```text
R_control <= D_control
AI 结果被采用时:R_ai <= D_ai 且 age(result) <= A_max
AI 结果未按时到达时:R_fallback <= D_fallback
```
其中,控制闭环约束为硬优先级;AI 时效约束通常为任务相关的软实时或固实时约束;回退路径必须有独立期限。
## 6. 资源并行与隔离策略
### 6.1 CPU 和中断
- 为 RTOS 域保留独立物理核,避免与 Linux vCPU 时间复用;
- 将关键定时器和现场总线中断直达 RTOS 域;
- 将网卡、存储和加速器完成中断尽量路由到 Linux 域;
- 若共享 LLC,测量 Linux 推理对控制任务缓存行为的干扰;
- 记录 SMT、动态迁核和电源管理对分区确定性的影响。
### 6.2 内存、带宽和 DMA
- 两域使用静态内存区间,共享区保持最小化;
- 共享缓冲区预分配,禁止关键路径动态扩容;
- 使用 IOMMU 或硬件访问控制限制 DMA 范围;
- 对 DRAM 带宽、内存控制器和互联竞争进行压力实验;
- 若硬件不支持带宽限额,必须把“核隔离”和“内存隔离”分开表述。
### 6.3 加速器
推荐由 Linux 推理域独占 GPU/NPU,以保留成熟驱动和运行时生态。RTOS 通过请求契约使用推理服务,而不是直接进入厂商运行时。
若控制域也需访问同一加速器,则必须额外解决队列仲裁、DMA 隔离、不可抢占执行段和故障复位归属。这种共享模式风险更高,应作为扩展方案而非默认主线。
### 6.4 功耗和热
分域不自动消除芯片级功耗和温度耦合。Linux 域的持续推理可能触发全芯片功耗限制或降频,进而改变 RTOS 域执行时间。因此需要:
- 固定或记录各域频率和功率模式;
- 同步采集控制延迟、推理负载、温度和实际频率;
- 对推理域设置负载准入或功耗上限;
- 验证热稳态而非只测短时冷机性能。
## 7. 故障与降级状态机
```text
正常增强控制
│ AI 超时/低置信度
▼
传统控制或保持模式
│ 连续超时/通信故障
▼
推理域隔离与重启
│ 控制风险上升
▼
受限运行或安全状态
```
需要验证的故障至少包括:
- Linux 推理进程崩溃;
- Linux 域卡死或重启;
- 加速器驱动错误或设备复位;
- 跨域队列堆满、消息乱序或数据损坏;
- 推理持续超时;
- Linux 域 CPU、内存、网络或存储过载。
每种故障都要记录检测时间、隔离时间、回退完成时间、控制任务违约数和恢复后首个有效 AI 结果时间。
## 8. 可比较的架构组
| 组别 | 架构 | 用途 |
|---|---|---|
| A0 | 单 Linux,控制与推理同域 | 通用部署基线 |
| A1 | PREEMPT_RT Linux,控制与推理同域 | 实时增强 Linux 基线 |
| A2 | RTOS 同域承载控制与可运行的 AI | 适用于 MCU/小模型,不强求大模型生态 |
| A3 | RTOS 控制域 + Linux 推理域 + 分区层 | 边缘并行主方案 |
| A4 | A3 加入通信、带宽、故障和热治理机制 | 完整优化方案 |
比较时必须固定硬件、控制任务语义、AI 模型、输入到达序列和功率策略。A2 与 A3 若使用不同推理后端,应明确这是“系统方案比较”,不能仅归因为内核差异。
## 9. 核心评价指标
### 控制域
- 周期任务响应时间、抖动和 deadline miss ratio;
- 外部输入到执行器输出的物理链路延迟;
- AI 过载与故障期间的观测最大响应时间;
- 回退路径完成时间。
### AI 链路
- 从 RTOS 发起请求到结果验证完成的端到端延迟;
- 结果按期率、新鲜度合格率、超时率和丢弃率;
- 吞吐、TTFT/TPOT 或任务特定推理时延;
- 推理域重启后的恢复时间。
### 隔离与代价
- 空载和推理满载时控制延迟之差;
- CPU、内存带宽、I/O、DMA 和热干扰敏感度;
- 跨域 IPC 延迟、抖动、拷贝次数和 CPU 开销;
- 静态资源预留造成的推理吞吐及能效损失。
## 10. 架构结论边界
本架构旨在证明“系统可以在 AI 负载不确定的情况下保护关键控制路径,并对 AI 结果实施有期限的安全消费”。它不自动证明:
- Linux 域中的大模型具备硬实时性;
- Hypervisor 消除了所有共享硬件干扰;
- 一个硬件平台的分区结果可直接迁移到另一 SoC;
- 只要控制域未违约,AI 功能就一定满足任务需求。
最终结论必须同时报告控制保障效果、AI 结果可用性以及隔离带来的资源代价。
@@ -1,207 +0,0 @@
# 调整后研究问题与验证建议
## 1. 调整目的
本文将最新方向意见转化为可执行的研究问题和验证建议。它不替换现有实验设计,而用于指导下一轮方案收敛:主线从覆盖 `T1~T5` 的 RTOS 大模型统一评测,转向 MCU/资源受限 SoC 的 AI 实时干扰,以及边缘侧 RTOS/Linux 分域系统的整体实时保障。
## 2. 建议的研究范围
### 2.1 核心范围
- MCU 或资源受限 SoC 上,AI 与周期控制、采集和通信共存;
- 边缘平台上,RTOS 控制域与 Linux 推理域并行运行;
- CPU、内存、缓存、总线、中断、DMA、加速器、功耗和热形成的系统级干扰;
- AI 结果的期限、新鲜度、超时、降级与故障恢复。
### 2.2 条件扩展
- 更大模型、更高并发和多加速器用于增加 Linux 推理域压力;
- 不同 Hypervisor、静态分区或 AMP 实现之间的隔离开销比较;
- 多边缘节点之间的协同推理。
### 2.3 暂不作为主线
- `T1` 多节点大模型集群的 RTOS 部署;
- `T2` 多 GPU 工作站上的统一 RTOS 推理栈;
- 以“容量从 MCU 连续扩展到集群”为核心贡献;
- 将模型量化、KV Cache 或分布式推理优化直接归为 RTOS 成果。
## 3. 研究问题
| 编号 | 研究问题 | 核心输出 |
|---|---|---|
| RQ1 | AI 进入 MCU/SoC 后,通过哪些资源路径破坏控制实时性? | 干扰来源排序、响应时间与违约边界 |
| RQ2 | RTOS 的优先级、预算、隔离、预分配和准入机制能扩大多少安全运行区间? | 无违约容量曲线与机制消融 |
| RQ3 | RTOS 控制域 + Linux 推理域 + Hypervisor 是否优于单域共存? | 控制保护、AI 结果按期率与资源代价 |
| RQ4 | 跨域通信与静态资源预留带来多大开销? | IPC 延迟/抖动、吞吐和能效损失 |
| RQ5 | 推理超时、Linux 域崩溃或加速器故障时能否按时降级? | 故障检测、隔离、回退和恢复时间 |
## 4. 分阶段实验路线
### 阶段 P0:需求与时间契约冻结
先定义而不是从设备档位反推:
- 控制任务周期 `T_control` 和截止期 `D_control`;
- AI 结果期限 `D_ai` 和最大新鲜度 `A_max`;
- AI 缺席时的回退动作和期限 `D_fallback`;
- 可接受的 AI 完成率、结果质量和能耗预算;
- 需要保护的关键 I/O、中断、内存和设备。
完成标志是形成一张“任务—资源—期限—失败处理”表。
### 阶段 P1:MCU/SoC 干扰确认
在真实可运行 AI 的最小平台上建立下列负载:
| 负载 | 内容 | 目的 |
|---|---|---|
| M0 | 仅控制任务 | 控制实时性下界 |
| M1 | 仅 AI | AI 执行、内存、功耗基线 |
| M2 | 控制 + AI | 确认同域干扰 |
| M3 | M2 + 内存/总线压力 | 定位共享资源瓶颈 |
| M4 | M2 + I/O/中断压力 | 定位中断与 DMA 干扰 |
| M5 | M2 + 热稳态运行 | 识别降频导致的时间漂移 |
| M6 | AI 过载与突发 | 找到准入和降级阈值 |
AI 模型按硬件实际能力选择,不要求 MCU 运行大语言模型。小模型同样可以有效暴露系统级资源竞争。
### 阶段 P2:RTOS 机制验证
逐项加入并消融以下机制:
1. 控制任务固定优先级与核/执行上下文隔离;
2. AI 任务预算或服务器机制;
3. 内存预分配、缓冲区限额和禁止关键路径动态分配;
4. 中断亲和性和关键设备优先级;
5. AI 请求队列上限、限流和拒绝策略;
6. 模型降级、跳帧或降低推理频率;
7. 超时后回退到非 AI 控制路径。
每次只改变一个机制,输出控制任务违约率、AI 完成率和吞吐代价,避免只给出“优化前后”黑盒比较。
### 阶段 P3:边缘分域基线
至少比较:
| 组别 | 配置 |
|---|---|
| E0 | 普通 Linux:控制与推理同域 |
| E1 | PREEMPT_RT Linux:控制与推理同域 |
| E2 | RTOS 控制域 + Linux 推理域,最小静态分区 |
| E3 | E2 + 中断、内存、通信和准入优化 |
如硬件不支持其中某组,应明确记录缺失原因,不用不同硬件数据替代同平台对照。
### 阶段 P4:共享资源压力扫描
在 Linux 推理域逐步增加:
- CPU 利用率和线程数量;
- 模型请求到达率、batch 和上下文长度;
- DRAM 带宽与 LLC 压力;
- 网络、存储和摄像头 I/O;
- GPU/NPU 占用和完成中断频率;
- 持续功耗与温度。
横轴使用相同绝对负载或相同到达序列,纵轴联合展示控制 deadline miss ratio、AI 结果按期率和有效吞吐。目标是找到“控制仍安全、AI 仍有用”的二维可行区,而不是只比较单个平均值。
### 阶段 P5:跨域通信实验
比较可实现的通信方式,例如共享内存环形队列、通知机制、RPMsg 或虚拟设备。统一消息大小和到达序列,测量:
- 单向和往返时延;
- P99/P99.9 与观测最大抖动;
- 拷贝次数和 CPU 占用;
- 队列满时的丢弃、覆盖或背压行为;
- 域重启后的通道恢复时间;
- 旧结果、乱序结果和损坏结果是否被 RTOS 拒绝。
### 阶段 P6:故障注入与恢复
建议故障集:
| 故障 | 必测结果 |
|---|---|
| 推理进程退出 | 检测时间、控制违约、服务恢复时间 |
| Linux 域重启 | RTOS 是否持续运行、回退完成时间 |
| 推理请求永久阻塞 | 超时是否生效、队列是否泄漏 |
| 加速器错误/复位 | 故障是否跨域传播、恢复路径 |
| 共享队列溢出 | 丢弃策略、内存安全、控制影响 |
| 消息乱序/校验失败 | 错误结果是否被消费 |
| Linux 域 CPU/内存/I/O 过载 | 控制尾延迟和隔离上限 |
仅在具备安全恢复路径时执行设备级故障注入;否则先用软件故障和仿真通道验证状态机。
## 5. 指标体系调整
### 5.1 第一优先级:控制实时性
- 释放到完成的响应时间;
- deadline miss ratio;
- P99/P99.9 和观测最大抖动;
- GPIO、CAN、RS485 或工业以太网的端到端物理响应;
- AI 满载、热稳态和故障期间的控制表现。
### 5.2 第二优先级:AI 结果可用性
- 请求发出到 RTOS 验证结果完成的端到端时延;
- 结果按期率和新鲜度合格率;
- 超时、拒绝、丢弃、乱序和错误率;
- 任务质量或置信度;
- 回退发生比例。
### 5.3 第三优先级:系统代价
- 分给 RTOS 的 CPU、内存和设备资源;
- Hypervisor 与 IPC 开销;
- 推理吞吐损失、能耗和热影响;
- 静态预留导致的资源利用率变化;
- 故障恢复和长稳运行开销。
TTFT、TPOT、tokens/s 和 `E/token` 可以继续使用,但它们属于 Linux 推理域或系统服务指标,不能替代控制实时性与结果新鲜度指标。
## 6. 推荐图表
1. 单域与分域架构职责图;
2. AI 负载强度—控制违约率—AI 按期率三维或等高线图;
3. CPU、内存、I/O、热干扰的控制尾延迟对比;
4. 跨域请求—推理—返回—验证的时序分解图;
5. RTOS 机制逐项消融图;
6. 推理域故障期间控制响应时间序列;
7. 静态资源预留与推理有效吞吐的 Pareto 曲线;
8. AI 结果超时、回退、恢复状态机图。
## 7. 阶段验收标准
| 层次 | 验收条件 |
|---|---|
| 数据有效 | 时钟、负载、版本、拓扑和原始事件可追踪;失败样本未被静默删除 |
| 控制保障 | 在冻结的运行区间内满足控制期限,并报告样本数和观测最大值 |
| AI 可用 | 在冻结质量门槛下达到规定的按期率和新鲜度合格率 |
| 隔离有效 | 推理负载或故障对控制域的影响显著小于单域基线 |
| 代价可接受 | 同时报告资源预留、IPC、吞吐、能耗和热代价 |
| 降级有效 | AI 不可用时在 `D_fallback` 内进入预定义状态,且不依赖推理域恢复 |
“未观测到违约”仍不能代替理论最坏界;Hypervisor 分域结果也只能在已验证的硬件、配置和压力范围内成立。
## 8. 对现有设备的使用建议
- 现有 RK3588 更适合作为边缘分域或资源受限 SoC 的核心验证平台,而不是同时承担多个容量档位以构造连续谱系;
- 现有 V100 平台可作为 Linux 推理域的高压力源、吞吐参照或跨域服务端,但不需要证明其属于 RTOS 主线;
- MCU 平台应根据真实 AI 运行能力和工业 I/O 条件选取,优先验证控制期限和资源干扰,而非模型参数规模;
- 新增设备采购应由研究问题和分域实现需求驱动,不再为了补齐 `T1~T5` 档位而采购。
## 9. 建议的最小可发表闭环
在一个 MCU/SoC 同域平台和一个边缘分域平台上完成以下闭环即可形成聚焦的系统研究:
1. 证明 AI 负载会通过可识别的资源路径干扰控制实时性;
2. 给出 RTOS 预算、隔离、准入和降级机制;
3. 实现 RTOS 控制域与 Linux 推理域的有界异步通信;
4. 与普通 Linux、PREEMPT_RT 或单域方案进行同平台比较;
5. 在过载、热稳态和故障注入下验证控制保护;
6. 同时报告 AI 结果按期率和资源代价;
7. 明确结论只覆盖 MCU/SoC 与边缘任务关键系统,不外推到 T1/T2 集群。
这一闭环比覆盖全部硬件档位更容易建立清晰的因果关系,也更直接回应“AI 引入后,任务关键系统如何保持实时”的核心问题。
-740
View File
@@ -1,740 +0,0 @@
# 基础设备配置(四层级 × 三档算力分级)
> 版本: v2.0 起草日期: 2026-09-18
> 设计目标: 为翼辉 SylixOS 调度框架研究建立 **集群→桌面→边→端** 四级硬件体系,每级内再按 **低/中/高** 三档细分
> 现有硬件全覆盖: T2-L(4×V100 SXM)+ T3-L / T4-H(RK3588 工业盒)| 需新增: T1 集群扩展 + 其余档位
---
## 0. 分级体系总览
### 0.1 分级维度与分档规则
**分级维度**: 以「统一内存 / 显存容量」为第一分类维度——容量直接决定可承载的模型规模,且与功耗、散热、互联架构强相关,四个层级可连续衔接、无断层。
**分档规则**: 相邻两档的边界值归入**上界一侧**
| 层级 | 代码 | 低级 | 中级 | 高级 |
| -------- | --- | --------------- | ---------------- | ---------------- |
| **端级** | T4 | **1~2 G** | **2~4 G** | **4~8 G** |
| **边级** | T3 | **8~16 G** | **16~32 G** | **32~64 G** |
| **桌面级** | T2 | **64~128 G** | **128~256 G** | **256~512 G** |
| **集群级** | T1 | **512 G~1 T** | —(不设中档) | **1 T~2 T** |
> 边界值归属示例: 8 GB → 端-高;16 GB → 边-低;64 GB → 边-高;128 GB → 桌-低;512 GB → 桌-高;1 TB → 集-低。
### 0.2 全谱系总表(11 个档位)
> 算力单位统一约定: **NVIDIA GPU 用 FP16 Tensor Core TFLOPS(dense)**,**NPU 用 INT8 TOPS**;两者不可直接换算。
| 档位 | 容量 | 算力(峰值) | 功耗 | 算力/供电架构 | 代表设备 | 状态 |
| -------- | ------------ | -------------------------- | ------------- | ---------------------------------- | ----------------------------- | ------- |
| **T4-L** | 1~2 G | 0.8~1 TOPS (INT8) | 3~5 W | ARM A55 + 小 NPU;DC 5V/12V 被动散热 | RK3568 1~2GB 核心板 | |
| **T4-M** | 2~4 G | 6 TOPS (INT8) | 5~10 W | ARM A72+A53 + NPU;DC 12V 被动散热 | RK3576 4GB | |
| **T4-H** | 4~8 G | 6~32 TOPS (INT8) | 7~21 W | ARM A76+A55 + M0 + NPU;DC 12V 被动 | **RK3588 8GB** / Jetson Orin Nano 8GB | 现有(16G 板降配) |
| **T3-L** | 8~16 G | 32~100 TOPS (INT8) | 10~30 W | ARM SoC 统一内存 + NPU/GPU;DC 12~24V 被动/小风扇 | **RK3588 16GB 工业盒** / Orin NX 16GB | 现有 |
| **T3-M** | 16~32 G | 275 TOPS (INT8) | 15~60 W | ARM A78AE + Ampere GPU + 2×DLA;DC 19V 主动风冷 | Jetson AGX Orin 32GB | |
| **T3-H** | 32~64 G | 275 TOPS / 91 TFLOPS (FP16) | 60~600 W | ARM 统一内存 或 x86+单卡 CUDA;风冷/液冷 | Jetson AGX Orin 64GB / 边缘工控机 + RTX 6000 Ada 48GB | |
| **T2-L** | 64~128 G | 500 TFLOPS (FP16) | 600~1.65 kW | x86 + 4×V100 SXM NVLink;双电源 + 360 液冷 | **4×V100 32GB SXM 塔式** | 现有 |
| **T2-M** | 128~256 G | 1000 TFLOPS (FP16) | 3.0~3.3 kW | x86 + 8×V100 SXM NVLink;双电源 + 液冷 | 8×V100 32GB SXM 整机 | 需扩展 |
| **T2-H** | 256~512 G | ~4000 TFLOPS (FP16) | 4.5~6.5 kW | x86 + 4×H100 SXM5 NVLink;高压供电 + 强制液冷 | 4×H100 80GB SXM5 工作站 | |
| **T1-L** | 512 G~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × x86+4×V100,100GbE RoCE/IB;机房风冷/液冷 | 4×(T2-L 节点)+ IB 交换机 | 需扩展 |
| **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | 20~25 kW | 4 节点 × x86+4×H100,NDR 400G IB;机房级液冷 | 4×(T2-H 节点)+ NDR 交换机 | |
### 0.3 设计原则
1. **容量连续、功耗阶跃**: 从 1 GB / 3 W 到 2 TB / 25 kW,容量每上一档约 ×2,功耗随架构变化阶跃(被动散热 → 主动风冷 → 液冷 → 机房级液冷),形成天然的性能/能效对比曲线。
2. **CUDA 栈贯通 T1/T2/T3**: 集群/桌面/边级全部或大部分走 NVIDIA CUDA 生态(V100 / Ampere / Hopper),模型与推理框架(vLLM / TensorRT-LLM)可跨档位无缝迁移,变量只有规模。
3. **非 CUDA 端路线**: T4 全档位与 T3-L 走 RKNN/RKLLM NPU 栈,代表极致资源约束端点,是 RTOS 调度隔离价值最大化的场景。
4. **现有硬件复用**: **4×V100 SXM(T2-L)** 与 **RK3588 工业盒(T3-L 16GB / T4-H 8GB 两用)** 为零采购成本基线,整条谱系以此为锚点向两侧扩展。
5. **BSP 最小化**: 全谱系仅需两类 BSP——x86(T1/T2)与 ARM64(T3/T4),档位差异靠设备树与驱动裁剪吸收,不新增架构分支。
---
## T1. 集群级 — 512 G ~ 2 T
### T1.1 定位
大规模分布式 LLM 推理与多模型并发服务。验证 SylixOS 在**多节点分布式调度**下的实时性——跨节点 RDMA 延迟、NCCL 集合通信抖动、分布式推理框架(vLLM+Ray / TensorRT-LLM+MPI)与实时控制任务的混合负载隔离。
### T1.2 档位对比
| 维度 | T1-L 集群-低 | T1-H 集群-高 |
| ----------- | --------------------- | --------------------------- |
| **容量** | 512 GB(4 × 128 GB) | 1.28 TB(4 × 320 GB) |
| **节点数** | 4 节点 | 4 节点 |
| **单节点加速器** | 4 × V100 32GB SXM | 4 × H100 80GB SXM5 |
| **集群算力** | ~2000 TFLOPS (FP16) | ~16 PFLOPS (FP16) |
| **节点内互联** | NVLink 300 GB/s | NVLink 900 GB/s |
| **节点间互联** | 100GbE RoCE / IB | NDR 400G IB |
| **整机功耗** | ~6.6 kW | 20~25 kW |
| **散热架构** | 每节点 360 液冷 + 机房风冷 | 机房级液冷(CDU / 后门换热器) |
| **主要模型** | 72B FP16 / 多实例 14B | 671B INT4 / 多实例 72B FP16 |
#### T1.2.1 T1-L 集群-低 — 4 节点 × 4×V100 = 512 GB(本方案主线)
| 项目 | 规格 | 数量 | 备注 |
| --------- | ------------------------------------------------ | ------------- | --------------------------- |
| **计算节点** | 同 T2-L 桌面级配置 | **4 台** | 每节点 4×V100 32GB SXM = 128GB |
| 节点内 GPU | NVIDIA V100 32GB SXM (NVLink 全互联) | 4×4 = 16 卡 | 每节点 NVLink 全互联 |
| 节点内 CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2GHz) | 4 | 每节点 1 颗 |
| 节点内内存 | 128GB DDR4-2133 ECC | 4×128 = 512GB | 每节点 128GB |
| **节点间互联** | Mellanox ConnectX-6 100GbE / IB | 4 卡 | 每节点 1 卡,RoCE 或原生 IB |
| 节点间交换机 | 100GbE/IB 交换机 (Mellanox SN2700 或同档) | 1 | 32 端口 |
| 存储 | 共享 NFS / NVMe-oF (每节点 1TB NVMe 本地 + 共享存储) | — | 模型权重共享池 |
| 散热 | 每节点 360 一体液冷 ×2 | — | 同 T2-L |
| 电源 | 每节点 长城 1650W + 1250W 双电源 | 4 套 | 单节点 ~1.65 kW,集群 ~6.6 kW |
| 功率采集 | PDU + Yokogawa WT310 (整机) + nvidia-smi dmon (单卡) | — | 每节点独立采集 |
**显存与算力**
| 指标 | 值 |
| --------------- | ---------------------------------- |
| **总显存** | **512 GB** (4 × 128GB) |
| 单卡 FP16 算力 | 125 TFLOPS |
| 集群总算力 (FP16) | ~2000 TFLOPS (NVLink 节点内 + IB 节点间) |
| NVLink 带宽 (节点内) | 300 GB/s (GPU↔GPU) |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | ------- | ----- | ------------------ |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 3+ | vLLM + Ray 分布式 |
| Qwen2.5-72B | INT4 (AWQ) | ~36 GB | 14+ | vLLM + Ray |
| **DeepSeek-V2-Chat** | FP16 | ~210 GB | 2 | TensorRT-LLM + MPI |
| Qwen2.5-14B | FP16 | ~28 GB | 18+ | vLLM (可单节点) |
| LLaMA-3-70B | FP16 | ~140 GB | 3+ | vLLM + Ray |
> 注: 若已有 1 台 T2-L 节点,仅需追加 3 台。V100 SXM 为二手市场/拆机渠道,价格波动大。也可租用云上 V100 实例替代自建集群。
#### T1.2.2 T1-H 集群-高 — 4 节点 × 4×H100 = 1.28 TB(扩展档)
| 项目 | 规格 | 数量 | 备注 |
| ------- | ----------------------------------------- | --------- | --------------------- |
| 计算节点 | 同 T2-H 桌面级配置 | 4 台 | 每节点 4×H100 80GB SXM5 |
| 节点内 GPU | NVIDIA H100 80GB SXM5 (NVLink 4 卡全互联) | 16 卡 | NVLink 900 GB/s |
| 节点内 CPU | AMD EPYC 9654 (96C/192T) 或 Intel Xeon 8468 | 4 | 每节点 1~2 颗 |
| 节点内内存 | 512GB DDR5-4800 ECC | 4 × 512GB | 每节点 512GB |
| 节点间互联 | NVIDIA ConnectX-7 NDR 400Gb/s IB | 4~8 卡 | 每节点 1~2 卡 |
| 节点间交换机 | NDR 400G IB 交换机 (Quantum-2 / SN5600) | 1 | 32 端口 |
| 存储 | 并行文件系统 (GPFS/Lustre) + 每节点 4TB NVMe | — | 671B 级模型权重池 |
| 散热 | 机房级液冷 (CDU + 冷板) | — | 风冷不可行 |
| 电源 | 每节点 4~6 kW 冗余电源 | 4 套 | 集群 ~20~25 kW |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | -------- | ----- | -------------------- |
| **DeepSeek-V3 / R1-671B** | INT4 (AWQ) | ~400 GB | 3+ | vLLM + Ray / SGLang |
| **Qwen2.5-72B** | FP16 | ~144 GB | 8+ | vLLM + TensorRT-LLM |
| LLaMA-3-405B | INT4 | ~230 GB | 5+ | TensorRT-LLM + MPI |
| Qwen2.5-32B | FP16 | ~64 GB | 20+ | vLLM |
### T1.3 SylixOS 要求(T1 通用)
| 要求项 | 描述 | 风险 |
| ------------------ | ------------------------------- | ------------------------------ |
| x86 BSP | 每节点运行 SylixOS x86 LTS | 低(T2-L 已验证) |
| **RDMA / RoCE 驱动** | ConnectX-6 / ConnectX-7 在 SylixOS 上的 RDMA 驱动 | **中-高**(需验证 Mellanox OFED 兼容性) |
| NCCL / MPI | 分布式集合通信库在 SylixOS 移植 | 中(NCCL 依赖 CUDA + POSIX) |
| Ray / 分布式框架 | vLLM + Ray 的 SylixOS 适配 | 中(Python + Ray 依赖链) |
| 分布式调度器 | SylixOS 跨节点实时任务调度原型 | **研究贡献点** |
### T1.4 研究角度
- **跨节点调度延迟**: 分布式推理时,1ms 实时任务在跨节点 NCCL all-reduce 期间的尾延迟
- **RDMA bypass 内核**: SylixOS 是否能利用 RDMA bypass kernel path 降低跨节点通信延迟
- **分布式公平性**: 多节点并发请求时,高优先级实时任务的跨节点响应稳定性
- **能效**: 分布式推理的每 token 能耗 vs 单节点(通信开销 vs 并行收益)
- **档位对照**: T1-L 与 T1-H 的**每 token 能耗比**——V100 集群(能效基线)vs H100 集群(能效上限)
---
## T2. 桌面级 — 64 G ~ 512 G
### T2.1 定位
单节点多 GPU 大模型推理。验证 SylixOS 在**单机多卡 NVLink 拓扑**下的 GPU 命令调度延迟、显存管理实时性、多模型并发流水线调度。
### T2.2 档位对比
| 维度 | T2-L 桌面-低 | T2-M 桌面-中 | T2-H 桌面-高 |
| ----------- | ---------------------- | --------------------------- | --------------------------- |
| **容量** | 128 GB(4 × 32 GB) | 256 GB(8 × 32 GB) | 320 GB(4 × 80 GB) |
| **加速器** | 4 × V100 32GB SXM | 8 × V100 32GB SXM | 4 × H100 80GB SXM5 |
| **算力** | 500 TFLOPS (FP16) | 1000 TFLOPS (FP16) | ~4000 TFLOPS (FP16) |
| **互联** | NVLink 300 GB/s ×4 | NVLink 300 GB/s ×8 | NVLink 900 GB/s ×4 |
| **整机功耗** | ~1.65 kW | ~3.0~3.3 kW | ~4.5~6.5 kW |
| **散热架构** | 360 液冷 ×2 + 塔式风道 | 360 液冷 ×2 + 双路风冷 | 强制液冷 (冷板),风冷不可行 |
| **电源架构** | 1650W + 1250W 双电源 | 2× 2000W 冗余 / 220V 单相 | 2× 3000W 冗余 / 220V 双相 |
| **形态** | 塔式一体定制机箱 | 4U 机架式 / 塔式 | 4U~5U 机架式液冷 |
| **可运行模型** | 72B INT4 / 14B FP16 | 72B FP16 / 多实例 32B | 671B INT4 / 72B FP16 多并发 |
| **状态** | 现有 | 需扩展(现有平台加卡) | 需 |
#### T2.2.1 T2-L 桌面-低 — 4×V100 SXM = 128 GB(现有设备,谱系锚点)
| # | 部件 | 型号 / 规格 | 数量 | 备注 |
| -- | ------- | ---------------------------------------------- | ----- | --------------------------- |
| 1 | 主板 | H12D-8D(双路 EPYC 服务器板) | 1 | |
| 2 | CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2 GHz, TDP 180W) | 1 | |
| 3 | 硬盘 | 长城 M.2 NVMe 1TB | 1 | 系统盘 |
| 4 | 内存 | 三星 DDR4-32G-2133 | 4 | 共 128 GB DDR4 |
| 5 | 散热系统 | 360 一体液冷散热套装 | 2 | 主机 + GPU |
| 6 | 转接卡 | ROHSTNS-2SXM2-2P54E | 2 | |
| 7 | 信号线 | V100 32G × 2 | 4 | NVLink 桥接 |
| 8 | 机箱 | 塔式一体定制机箱 | 1 | |
| 9 | 主电源 | 长城全模组 1650W | 1 | |
| 10 | 副电源 | 长城 1250W 全模组 | 1 | SXM 平台用 |
| 11 | 散热器 | SP3 高性能散热器 | 1 | |
| 12 | SXM 平台 | 300G NVLink 4 卡直连底板 | 1 | |
| 13 | **GPU** | **NVIDIA V100 32GB SXM** | **4** | **NVLink 全互联,共 128GB HBM2** |
**显存与算力**
| 指标 | 值 |
| ---------- | --------------------------- |
| **总显存** | **128 GB** (4 × 32GB HBM2) |
| 单卡显存 | 32 GB HBM2 |
| 单卡 FP16 算力 | 125 TFLOPS |
| 总算力 (FP16) | ~500 TFLOPS |
| NVLink 带宽 | 300 GB/s (GPU↔GPU 全互联) |
| 内存带宽 | DDR4-2133 ~170 GB/s (CPU 侧) |
| **整机功耗** | **~1650 W** (满载) |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | ------ | ----- | ------------------- |
| **Qwen2.5-7B-Instruct** | FP16 | ~14 GB | 8+ | vLLM / TensorRT-LLM |
| **Qwen2.5-14B-Instruct** | INT4 (AWQ) | ~8 GB | 14+ | vLLM |
| Qwen2.5-14B | FP16 | ~28 GB | 4 | vLLM |
| **Qwen2.5-72B-Instruct** | INT4 (AWQ) | ~36 GB | 3 | vLLM (张量并行 TP=4) |
| LLaMA-3-8B | FP16 | ~16 GB | 7 | vLLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | 20+ | llama.cpp |
| Whisper-Large-v3 | FP16 | ~3 GB | 40+ | faster-whisper |
#### T2.2.2 T2-M 桌面-中 — 8×V100 SXM = 256 GB
在 T2-L 平台基础上**加卡扩容**,是「同一代硬件纵向扩展」的对照档位,最贴近现有设备、改造成本最低。
| 项目 | 规格 | 变更点 |
| --------- | ----------------------------------------------- | ------------------ |
| **GPU** | NVIDIA V100 32GB SXM **× 8** | 4 → 8 卡 |
| **SXM 平台** | 300G NVLink **8 卡直连底板** | 更换底板 |
| **转接卡** | ROHSTNS-2SXM2-2P54E | 2 → 4 |
| **NVLink** | 全互联 8 卡,300 GB/s | 拓扑扩展 |
| 主板 / CPU | H12D-8D + EPYC 7402(双路可升级 EPYC 7742 64C) | 建议升双路以喂满 8 卡 |
| 内存 | 128 GB → **256 GB** DDR4-2133 | 8 卡需更大 pinned memory |
| 电源 | 2 × 2000W 冗余(或 220V 单相 16A 回路) | 1650W+1250W 不足 |
| 散热 | 360 液冷 ×2 + 机箱风道强化 | — |
| **整机功耗** | **~3.0~3.3 kW** | +100% |
| **总算力** | **~1000 TFLOPS (FP16)** | +100% |
**可运行模型(新增/提升)**
| 模型 | 量化 | 显存占用 | 并发实例数 | 说明 |
| ------------------------ | ---------- | ------ | ----- | ------------------ |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 1~2 | TP=8 张量并行,无需量化 |
| **Qwen2.5-32B-Instruct** | FP16 | ~64 GB | 3+ | TP=4 |
| DeepSeek-V2-Lite | FP16 | ~31 GB | 8+ | — |
| Qwen2.5-14B | FP16 | ~28 GB | 9+ | 单卡可容,多实例并发 |
> **备选方案**: 4 × RTX 6000 Ada 48GB = 192 GB,364 TFLOPS (FP16),整机 ~2.4 kW,风冷即可。优势是无 NVLink 但单卡能效高、显存快;劣势是跨卡走 PCIe Gen5。
#### T2.2.3 T2-H 桌面-高 — 4×H100 SXM5 = 320 GB
| 项目 | 规格 |
| ------- | ---------------------------------------- |
| **GPU** | NVIDIA H100 80GB SXM5 **× 4**(NVLink 全互联) |
| 单卡算力 | ~989 TFLOPS (FP16 Tensor Core, dense) |
| 单卡显存 | 80 GB HBM3 |
| NVLink | 900 GB/s (GPU↔GPU) |
| CPU | AMD EPYC 9654 (96C/192T) ×1~2 |
| 内存 | 512 GB DDR5-4800 ECC |
| 底板 | HGX H100 4-GPU 或 8-GPU 底板(留 4 卡空位) |
| 存储 | 4 TB NVMe RAID0(模型权重加载) |
| 散热 | **强制液冷(冷板式)**,风冷不可行 |
| 电源 | 2 × 3000W 冗余 / 220V |
| **整机功耗** | **~4.5~6.5 kW** |
| **总算力** | **~4000 TFLOPS (FP16)**,稀疏 ~8000 TFLOPS |
**备选方案**: 8 × RTX 6000 Ada 48GB = 384 GB,728 TFLOPS (FP16),~4.0 kW,风冷可行——容量更大、功耗更低,代价是无 NVLink 与算力密度。
**可运行模型(新增/提升)**
| 模型 | 量化 | 显存占用 | 并发实例数 | 说明 |
| ------------------------ | ---------- | ------- | ----- | ----------------- |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 2 | TP=4,H100 下 TTFT 极低 |
| LLaMA-3-70B | FP16 | ~140 GB | 2 | — |
| **DeepSeek-V2-Chat** | FP16 | ~210 GB | 1 | 单机可跑 |
| Mixtral-8x7B | FP16 | ~93 GB | 3 | MoE 专家并行 |
### T2.3 SylixOS 要求(T2 三档通用)
| 要求项 | 描述 | 风险 |
| ----------------- | ----------------------------- | ------------------- |
| x86 BSP | SylixOS 2.x LTS x86 | 低 |
| **CUDA 驱动** | V100 SXM / H100 SXM 在 SylixOS 的 CUDA 驱动 | **中**(需翼辉确认) |
| NVLink 支持 | 4 卡 / 8 卡 NVLink 拓扑在 SylixOS 可用 | 中 |
| vLLM / llama.cpp | Python + CUDA 推理框架适配 | 中(llama.cpp 优先,依赖少) |
| nvidia-smi / DCGM | GPU 监控 + 功耗采集 | 低 |
| 8 卡 / 4 卡拓扑切换 | 同一 BSP 支持 T2-L/M/H 不同卡数 | 低(设备树 + 枚举) |
### T2.4 对照组 OS
- **主对照**: Ubuntu 22.04 LTS + `linux-image-rt` (PREEMPT_RT) + vLLM
- **辅助对照**: CentOS Stream 9 + RT 内核(可选)
---
## T3. 边级 — 8 G ~ 64 G
### T3.1 定位
边缘 AI 推理与工业控制并发。验证 SylixOS 在**统一内存架构**(CPU+加速器共享 LPDDR)下的实时性——推理任务与实时控制任务共享内存带宽时的隔离能力。
### T3.2 档位对比
| 维度 | T3-L 边-低 | T3-M 边-中 | T3-H 边-高 |
| --------- | ---------------------------- | -------------------------- | ----------------------------- |
| **容量** | 16 GB 统一内存 | 32 GB 统一内存 | 64 GB 统一内存 / 48 GB 独立显存 |
| **加速器** | RK3588 NPU 6+26 TOPS / Ampere | Ampere GPU + 2×DLA | AGX Orin 64GB / RTX 6000 Ada |
| **算力** | 32 TOPS / 100 TOPS (INT8) | 275 TOPS (INT8) | 275 TOPS / 91 TFLOPS (FP16) |
| **功耗** | 10~30 W | 15~60 W | 60~600 W |
| **供电架构** | DC 12~24 V,无风扇/小风扇 | DC 19 V,主动风冷 | DC 19 V 或 ATX,风冷/液冷 |
| **工作温度** | -40~60 ℃ 工业级 | -25~80 ℃ | -25~80 ℃ / 0~50 ℃ |
| **SylixOS 风险** | **极低**(RK3588 BSP 复用 T4) | **高**(T234 BSP 需验证) | 高 / 中 |
| **状态** | (RK3588 16GB 工业盒) | | |
#### T3.2.1 T3-L 边-低 — RK3588 16GB 工业盒(现有设备)
**这是现有 RK3588 设备的标准归属档位**(16 GB 统一内存落在边级区间内),也是唯一可零成本立即开展研究的边级档位。
| 项目 | 规格 | 备注 |
| --------- | --------------------------------------- | --------------------- |
| SoC | Rockchip RK3588(同 T4-H) | SylixOS BSP 与 T4 共用 |
| 内存 | **16 GB LPDDR4X**(统一内存) | -40~60 ℃ 工业宽温 |
| NPU | 6 TOPS 原生 + **26 TOPS 算力棒扩展 = 32 TOPS** | 算力棒走 M.2 2280 |
| 功耗 | ~21~30 W(含算力棒) | 被动散热,可选小风扇 |
| 内存带宽 | ~51.2 GB/s (128-bit LPDDR4X) | 与 T4 相同,是带宽瓶颈点 |
| 模型 | Qwen2.5-3B/7B INT4(RKLLM) | 比 T4-H 内存翻倍,可跑更大模型 |
**备选方案(同档位、CUDA 路线)**: NVIDIA Jetson Orin NX 16GB — 100 TOPS (INT8, sparse),1024 CUDA + 32 Tensor Core,16 GB LPDDR5 / 102.4 GB/s,10~25 W,**CUDA 生态与 T1/T2 打通**。代价是 SylixOS T234 BSP 风险高。
#### T3.2.2 T3-M 边-中 — NVIDIA Jetson AGX Orin 32GB
| 项目 | 规格 |
| --------- | -------------------------------------------------- |
| **SoC** | NVIDIA T234(Grace 系列衍生) |
| **CPU** | 12× ARM Cortex-A78AE @ 2.0 GHz(64-bit) |
| **GPU** | NVIDIA Ampere 架构,2048 CUDA cores + 64 Tensor cores |
| **DLA** | 2× DLA v2.0(深度学习加速器,可异步推理) |
| **AI 算力** | **275 TOPS** (INT8) / 137.5 TOPS (INT8+INT8 双精度) |
| **内存** | **32 GB LPDDR5**(统一内存,CPU/GPU 共享) |
| 内存带宽 | 204.8 GB/s |
| **功耗** | **15 W ~ 60 W**(可配置功率模式:15W/30W/50W/60W) |
| 工作温度 | -25 ~ 80°C(工业级,但不如 RK3588 的 -40~60°C 宽) |
| 存储 | 64GB eMMC + M.2 NVMe(可扩展) |
| 网络 | 2× 10GbE(RJ45)+ 1× 千兆 |
| 视频接口 | HDMI 2.1 + DP 1.4a |
| USB | 4× USB 3.2 + 2× USB 2.0 |
| PCIe | PCIe Gen4 ×4(可扩展外设) |
| MIPI CSI | 4 通道(可接工业相机) |
| 尺寸 | 100mm × 87mm(核心模块) |
| **出厂 OS** | Ubuntu 20.04 LTS (L4T) |
| 价格 | ~$2,000-4,000(~15,000-28,000 RMB) |
**选择 Jetson AGX Orin 的理由**
1. **CUDA 生态统一**: 与 T1/T2 同为 NVIDIA GPU,vLLM / TensorRT / llama.cpp 可直接移植,无需切换到 RKLLM 栈
2. **统一内存架构**: CPU 和 GPU 共享 32GB LPDDR5,无独立显存——LLM 推理和实时控制任务**争抢同一内存带宽**,是验证内存带宽管控(RQ2)的理想平台
3. **DLA 异步推理**: 2 个 DLA 可在 GPU/CPU 不介入时执行推理,适合"LLM 推理让出 CPU/GPU 给实时任务"的调度策略验证
4. **功率可配置**: 15W/30W/50W/60W 多档功率模式,可在不同功耗预算下测试
5. **丰富 I/O**: 10GbE + MIPI CSI + PCIe Gen4,可接工业相机、高速网络、扩展卡
#### T3.2.3 T3-H 边-高 — 64 GB 档(两条路线)
| 路线 | 主推 A: Jetson AGX Orin 64GB | 主推 B: 边缘工控机 + RTX 6000 Ada 48GB |
| ---------- | -------------------------------- | -------------------------------- |
| **架构** | ARM A78AE + Ampere GPU(统一内存) | x86 (Xeon/Core) + 独立 CUDA 显卡 |
| **容量** | 64 GB LPDDR5(统一内存) | 48 GB GDDR6 ECC(独立显存) |
| **算力** | 275 TOPS (INT8) | 91 TFLOPS (FP16) / 182 TFLOPS 稀疏 |
| **功耗** | 15~60 W | 整机 ~600 W |
| **散热** | 被动/主动风冷 | 主动风冷或液冷 |
| **生态** | CUDA + DLA,与 T3-M 同 BSP | 完整 CUDA + NVLink 可选 |
| **优势** | 能效极高、宽温、无风扇可行 | 算力密度高、显存带宽大、生态完整 |
| **劣势** | 统一内存带宽仅 204.8 GB/s,带宽受限 | 功耗/体积/散热不适合现场部署 |
| **适用场景** | 边缘现场、宽温环境、低功耗 | 边缘机柜、算力下沉、多模型并发 |
**可运行模型(T3 三档合并)**
| 模型 | 量化 | 显存占用 | 预期 tokens/s | 适用档位 | 推理框架 |
| ------------------------ | ------------ | ------- | ----------- | ------------- | ------------------------ |
| **Qwen2.5-1.5B-Instruct** | INT4 | ~1.2 GB | ~40-60 | T3-L | RKLLM |
| **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~50-80 | T3-L / T3-M | TensorRT-LLM / RKLLM |
| **Qwen2.5-7B-Instruct** | INT4 (W4A16) | ~5 GB | ~30-50 | T3-L / T3-M | TensorRT-LLM / llama.cpp |
| **Qwen2.5-14B-Instruct** | INT4 | ~8 GB | ~20-35 | T3-M | TensorRT-LLM |
| **Qwen2.5-32B-Instruct** | INT4 | ~18 GB | ~12-20 | T3-M / T3-H | TensorRT-LLM |
| **Qwen2.5-72B-Instruct** | INT4 (AWQ) | ~36 GB | ~5-8 | T3-H | TensorRT-LLM / vLLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | T3-L 以上 | llama.cpp |
| Whisper-Large-v3 | INT8/FP16 | ~1.5 GB | 流式 ASR | T3-L 以上 | faster-whisper |
| YOLOv8n | INT8 | ~0.1 GB | 200+ FPS | T3 全档 | TensorRT / RKNN |
### T3.3 SylixOS 要求(T3)
| 要求项 | 描述 | 风险 |
| -------------------- | --------------------------------------- | ---------------------------- |
| **ARM64 BSP (T234)** | SylixOS 需提供 NVIDIA T234 SoC 的 ARM64 BSP | **高**(需翼辉确认是否支持 Jetson Orin) |
| **RK3588 BSP(T3-L)** | 与 T4-H 共用同一 BSP,零额外风险 | **极低** |
| CUDA 驱动 | Jetson 专用 CUDA(L4T 驱动栈)在 SylixOS 适配 | 高 |
| DLA 驱动 | DLA 异步推理在 SylixOS 的可用性 | 高 |
| 功率模式 API | 15W/30W/50W/60W 切换在 SylixOS 的实现 | 中 |
| 内存监控 | 统一内存架构下的内存带宽监控(PMU 计数器) | 中 |
| 独立显存管理(T3-H B 路线) | x86 + 独显的显存分配与实时性 | 中 |
> **取舍**: Jetson 路线优势在 CUDA 生态统一 + 275 TOPS + DLA;RK3588-16GB(T3-L)优势在 SylixOS BSP 风险极低 + -40~60℃ 工业级宽温。**建议 T3-L 直接用现有 RK3588 起步,T3-M/H 待 Jetson BSP 确认后再采购。**
### T3.4 对照组 OS
| 档位 | 主对照 | 辅助对照 |
| ---- | -------------------------------- | ----------------------------- |
| T3-L | Ubuntu 22.04 + PREEMPT_RT(RK3588) | OpenHarmony 4.x + RT patch(可选) |
| T3-M | Ubuntu 20.04 LTS (L4T) + PREEMPT_RT | Ubuntu 22.04 + Docker(容器隔离方案) |
| T3-H | Ubuntu 22.04 + PREEMPT_RT(x86/ARM) | Docker + KVM |
### T3.5 功率采集
| 设备 | 用途 | 适用档位 |
| ----------------------------- | --------------------- | ----------- |
| DC 功率计(USB 接口型) | 整机 DC 输入端功耗 | T3-L / T3-M |
| INA226 采集板 | SoC 主电源轨(若可接入) | 全档 |
| `jetson_stats` / tegrastats | 内部功耗代理(辅助,非主报) | T3-M / T3-H |
| 交流功率计(PZEM / 智能插座) | 边缘工控机整机功耗 | T3-H B 路线 |
---
## T4. 端级 — 1 G ~ 8 G
### T4.1 定位
工业端点超低功耗 LLM 推理与硬实时控制。验证 SylixOS 在**极致资源约束**(3~21 W / 1~8 GB / 0.8~32 TOPS)下的 LLM + 1ms 实时控制并发能力。这是 RTOS 杀手锏场景——资源越紧张,RTOS 调度隔离的价值越大。
### T4.2 档位对比
| 维度 | T4-L 端-低 | T4-M 端-中 | T4-H 端-高 |
| ----------- | ---------------------- | -------------------- | ------------------------------ |
| **容量** | 1~2 GB LPDDR4X | 2~4 GB LPDDR5 | 4~8 GB LPDDR4X / LPDDR5 |
| **SoC** | RK3568 (4×A55) | RK3576 (4×A72+4×A53) | RK3588 (4×A76+4×A55+M0) / Orin Nano |
| **NPU 算力** | 0.8~1 TOPS (INT8) | 6 TOPS (INT8) | 6~32 TOPS / 40~67 TOPS (INT8) |
| **功耗** | 3~5 W | 5~10 W | 7~21 W |
| **散热架构** | 无风扇被动 | 无风扇被动 | 无风扇被动(可选小风扇) |
| **供电** | DC 5V / 12V | DC 12V | DC 12V |
| **工作温度** | -40~85 ℃ 工业级 | -40~85 ℃ 工业级 | -40~60 ℃ / 0~50 ℃ |
| **可运行模型** | 0.5B INT4 / Whisper-Tiny | 1.5B INT4 / YOLO 系列 | 3B~7B INT4 / MiniCPM-V |
| **状态** | | | ✅ 现有(RK3588 16GB 降配) |
#### T4.2.1 T4-L 端-低 — RK3568 核心板(1~2 GB)
| 项目 | 规格 |
| --------- | -------------------------------------- |
| SoC | Rockchip RK3568 (22nm) |
| CPU | 4× Cortex-A55 @ 2.0 GHz |
| **NPU** | **0.8~1 TOPS (INT8)**(RKNN 原生栈) |
| **内存** | **1~2 GB LPDDR4X**(统一内存,板贴) |
| 内存带宽 | ~25.6 GB/s |
| GPU | Mali-G52(仅辅助显示) |
| 存储 | 8~16 GB eMMC |
| 网络 | 1× 千兆 + 可选 WiFi |
| 工业接口 | CAN ×2 / RS485 ×2 / GPIO(典型核心板引出) |
| **功耗** | **3~5 W**(无风扇被动散热) |
| 工作温度 | -40 ~ 85 ℃ 工业级 |
| 出厂 OS | Buildroot / Ubuntu 20.04(可换 SylixOS) |
| 参考价格 | ~300~800 RMB(核心板/开发板) |
**可运行模型**: Qwen2.5-0.5B INT4(~0.5 GB)、Whisper-Tiny INT8(~0.2 GB)、YOLOv5n INT8。
**定位价值**: 谱系最低档,用于测出「LLM 推理到底能把实时性压到多差」的**下界**,以及 RTOS 在极小内存下能否守住 1ms。
#### T4.2.2 T4-M 端-中 — RK3576 核心板(2~4 GB)
| 项目 | 规格 |
| --------- | ---------------------------------------- |
| SoC | Rockchip RK3576 (8nm) |
| CPU | 4× Cortex-A72 + 4× Cortex-A53(异构大小核) |
| **NPU** | **6 TOPS (INT8)** + 可扩展算力棒 |
| **内存** | **2~4 GB LPDDR5**(统一内存) |
| 内存带宽 | ~40 GB/s |
| **功耗** | **5~10 W**(无风扇被动) |
| 工作温度 | -40 ~ 85 ℃ 工业级 |
| 参考价格 | ~600~1,500 RMB |
**可运行模型**: Qwen2.5-1.5B INT4(~1.2 GB,~15-25 tok/s)、Qwen2.5-0.5B INT4 多实例、YOLOv8s INT8。
**定位价值**: 端级主力档,算力是 T4-L 的 6 倍而功耗仅翻倍,是**能效拐点**档位。
#### T4.2.3 T4-H 端-高 — RK3588 8GB(现有设备降配)/ Jetson Orin Nano 8GB
**路线 A(现有设备,零成本): RK3588 工业盒 8GB 配置**
| 项目 | 规格 | 说明 |
| --------- | --------------------------------------------------- | ------------------------ |
| SoC | Rockchip RK3588 (8nm) | 与现有 16GB 工业盒**同板同 BSP** |
| CPU | 4×A76 @2.4 GHz + 4×A55 @1.8 GHz | 异构大小核 |
| MCU | Cortex-M0 @200 MHz(协处理,可选) | 跨核通信验证 |
| GPU | Mali-G610 MC4 | 仅辅助显示 |
| **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) | 两档可切换 |
| **内存** | **4~8 GB LPDDR4X**(统一内存) | 现有 16GB 板通过**内存分区限额**降配运行 |
| 内存带宽 | ~51.2 GB/s (128-bit) | 与 T3-L 同 |
| **功耗** | **7~21 W**(无风扇被动散热) | 6 TOPS 档 ~12W / 32 TOPS 档 ~21W |
| 工作温度 | -40 ~ 60 ℃ 工业级 | 宽温优势 |
| 出厂 OS | Ubuntu 22.04 | 换 SylixOS BSP |
> **现有 16GB 工业盒的双档位用法**: 同一台设备既可作为 **T3-L(16 GB 全量)** 也可作为 **T4-H(分区限额 8 GB)** 运行,通过 SylixOS 内存分区 / cgroup 限额切换,一台设备覆盖两个档位的对照实验,是本方案的成本关键。
**路线 B(CUDA 生态): NVIDIA Jetson Orin Nano 8GB**
| 项目 | 规格 |
| --------- | --------------------------------------------------- |
| SoC | NVIDIA T234(Ampere 1024 CUDA + 32 Tensor Core) |
| **AI 算力** | **40 TOPS (INT8, 稀疏)**(Super 模式 67 TOPS) |
| **内存** | **8 GB LPDDR5**(统一内存,102.4 GB/s) |
| **功耗** | **7~25 W**(可配置 7W/15W/25W) |
| 优势 | **T4 档内唯一 CUDA 路线**,TensorRT-LLM 与 T1/T2/T3-M 同栈 |
| 劣势 | SylixOS T234 BSP 风险高,宽温不如 RK3588 |
| 参考价格 | ~$249(开发套件) |
**可运行模型(T4-H)**
| 模型 | 量化 | 显存占用 | 预期 tokens/s | 推理框架 |
| ------------------------- | ---- | ------- | ----------- | ----- |
| **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~40-60 | RKLLM |
| **Qwen2.5-7B-Instruct** | INT4 | ~5 GB | ~20-30 | RKLLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | RKLLM |
| Whisper-Large-v3 | INT8 | ~1.5 GB | 流式 ASR | RKLLM |
#### T4.2.4 硬件配置明细(RK3588 工业级边缘计算盒子,现有设备)
**系统 (System)**
| 项目 | 规格 |
| ------- | ---------------------------------------------------- |
| SoC | Rockchip RK3588 (8nm) |
| CPU | 4×Cortex-A76 @2.4 GHz + 4×Cortex-A55 @1.8 GHz(异构大小核) |
| MCU | Cortex-M0 @200 MHz(协处理,可选) |
| GPU | Mali-G610 MC4 |
| **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) |
| **内存** | **16 GB LPDDR4X**(板贴,不可升级)→ 可按 8 GB 分区用作 T4-H |
| **显存** | 统一内存(NPU 与 CPU 共享) |
**存储 / 扩展**
- EMMC 64 GB(系统盘)
- 1× TF 卡槽(存储扩展)
- 1× M.2 2280 NVMe(可扩展 SSD / 算力棒)
**出厂软件**
- 操作系统: **Ubuntu 22.04**(出厂预装)
- 验证方案: 替换为 SylixOS BSP for RK3588,保留 Ubuntu 22.04 作为对照组
**算力与功耗(T4-H 档)**
| 指标 | 值 |
| ------------------ | ------------------------------- |
| **可用显存** | **8 GB**(16 GB 板分区限额) |
| NPU 算力 (6 TOPS 档) | 6 TOPS (INT8) |
| NPU 算力 (32 TOPS 档) | 32 TOPS (INT8, 含 26 TOPS 扩展) |
| GPU 算力 | Mali-G610 MC4(仅辅助,非主推理路径) |
| 内存带宽 | LPDDR4X ~51.2 GB/s (128-bit) |
| **TDP** | **7~21 W**(无风扇被动散热) |
### T4.3 SylixOS 要求(T4)
| 要求项 | 描述 | 风险 | 适用档位 |
| ---------------------- | --------------------------------------- | -------------------- | --------- |
| **RK3588 BSP** | SylixOS BSP for RK3588(A76+A55 大小核 SMP) | 中(需翼辉提供) | T4-H |
| **RK3576 BSP** | SylixOS BSP for RK3576 | 中-高(需翼辉确认) | T4-M |
| **RK3568 BSP** | SylixOS BSP for RK3568 | 中(RK3568 生态成熟,风险低于 T234) | T4-L |
| **rknn / RKLLM 驱动** | NPU 驱动在 SylixOS 移植 | **高**(平台B 模型适配核心风险) | T4 全档 |
| 板贴 26 TOPS 算力芯片驱动 | 算力棒 SDK | 高(厂商支持度) | T4-H |
| M0 核 BSP + RPMsg | 跨核通信 | 高(需翼辉 + 板卡引出 M0 调试口) | T4-H |
| **内存分区限额机制** | 16 GB 板按 8 GB 分区运行(T3-L/T4-H 切换) | 中(需 SylixOS 内存域支持) | T4-H |
| CAN ×2 驱动 | 工业现场总线 | 中 | T4 全档 |
| RS485 ×2 + RS232 ×1 | 串口 | 低 | T4 全档 |
| 双千兆 + WiFi + 4G/5G | 网络 | 中 | T4-H |
| 看门狗 / RTC | 工业可靠性 | 低 | T4 全档 |
| Jetson Orin Nano BSP | T234 低配版 BSP(路线 B) | 高 | T4-H 路线B |
### T4.4 对照组 OS
- **主对照**: Ubuntu 22.04(RK3588 出厂预装,完美匹配,直接对照)
- **辅助对照**: OpenHarmony 4.x + RT patch(可选)
- T4-L / T4-M: Buildroot + PREEMPT_RT
---
## 5. 跨档位对比总表
### 5.1 全档位硬件规格对比
| 档位 | 容量 | 算力 | 功耗 | 加速器架构 | 散热架构 | 互联 | SylixOS BSP 风险 |
| -------- | ---------- | ------------------- | ----------- | ------------------ | ----------- | ---------------- | ------------- |
| **T4-L** | 1~2 GB | 0.8~1 TOPS | 3~5 W | ARM A55 + NPU | 被动无风扇 | GPIO/CAN/RS485 | 中 |
| **T4-M** | 2~4 GB | 6 TOPS | 5~10 W | ARM A72+A53 + NPU | 被动无风扇 | 千兆 + CAN | 中-高 |
| **T4-H** | 4~8 GB | 6~32 TOPS | 7~21 W | ARM A76+A55+M0+NPU | 被动无风扇 | 双千兆 + CAN + M.2 | 中 / 高(路线B) |
| **T3-L** | 8~16 GB | 32~100 TOPS | 10~30 W | ARM 统一内存 + NPU/GPU | 被动/小风扇 | 双千兆 + M.2 | **极低**(现有) |
| **T3-M** | 16~32 GB | 275 TOPS | 15~60 W | A78AE + Ampere + DLA | 主动风冷 | 10GbE + PCIe Gen4 | **高** |
| **T3-H** | 32~64 GB | 275 TOPS / 91 TFLOPS | 60~600 W | ARM 统一内存 / x86+独显 | 风冷 / 液冷 | 10GbE + PCIe | 高 / 中 |
| **T2-L** | 64~128 GB | 500 TFLOPS (FP16) | ~1.65 kW | x86 + 4×V100 NVLink | 360 液冷 + 风道 | NVLink | 低(现有) |
| **T2-M** | 128~256 GB | 1000 TFLOPS (FP16) | ~3.0~3.3 kW | x86 + 8×V100 NVLink | 360 液冷 + 风道 | NVLink | 低 |
| **T2-H** | 256~512 GB | ~4000 TFLOPS (FP16) | ~4.5~6.5 kW | x86 + 4×H100 NVLink | 强制液冷 | NVLink + PCIe | 中 |
| **T1-L** | 512 GB~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × 4×V100 | 机房风冷 + 液冷 | NVLink + 100GbE | 中-高 |
| **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | ~20~25 kW | 4 节点 × 4×H100 | 机房级液冷 | NVLink + NDR 400G | 中-高 |
### 5.2 模型规模梯度
| 档位 | 代表模型 | 量化 | 显存占用 | 角色 |
| -------- | --------------------------- | ---------- | ------- | -------------- |
| T4-L | Qwen2.5-0.5B / Whisper-Tiny | INT4/INT8 | 0.5 GB | 谱系下界,实时性基准 |
| T4-M | Qwen2.5-1.5B | INT4 | 1.2 GB | 端级能效拐点 |
| T4-H | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 端点可跑 7B |
| T3-L | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 边缘推理 + 工业控制 |
| T3-M | Qwen2.5-14B / 32B | INT4 | 8 / 18 GB | 边缘多模型并发 |
| T3-H | Qwen2.5-72B | INT4 (AWQ) | 36 GB | 边缘可跑 72B |
| T2-L | Qwen2.5-72B / 14B | INT4 / FP16 | 36 / 28 GB | 桌面多模型并发 |
| T2-M | Qwen2.5-72B | FP16 | 144 GB | 桌面单机无量化 72B |
| T2-H | DeepSeek-V2 / 72B | FP16 | 210 / 144 GB | 桌面单机超大模型 |
| T1-L | Qwen2.5-72B / DeepSeek-V2 | FP16 | 144 / 210 GB | 多节点分布式推理 |
| T1-H | DeepSeek-V3/R1 671B | INT4 | ~400 GB | 超大模型分布式服务 |
### 5.3 SylixOS 调度框架验证重点
| 档位 | 验证重点 | 核心实时指标 | 核心吞吐指标 |
| ----- | ----------- | ---------------------------------- | -------------------------- |
| T4-L | 极小内存下保号 | 1ms RT 任务延迟(1GB 内存约束下) | 0.5B tokens/s、内存占用上限 |
| T4-M | 能效拐点 | 1ms RT 任务 P99.9、CPU 频率调节影响 | 1.5B tokens/s、E_per_token |
| T4-H | 极致资源约束下保号 | **1ms RT 任务最大延迟 + CAN/RS485 延迟** | 3B/7B tokens/s、E_per_token |
| T3-L | 统一内存带宽隔离(NPU) | NPU 推理 + 实时任务共享 51.2 GB/s 带宽时 RT 抖动 | 7B INT4 tokens/s |
| T3-M | 统一内存带宽隔离(GPU) | LLM+RT 共享内存带宽时 RT 任务 P99.9 | 14B tokens/s、DLA 异步收益 |
| T3-H | 大容量边缘并发 | 72B 推理与 RT 任务共存时的优先级反转 | 72B INT4 tokens/s、多模型 QPS |
| T2-L | 单机多卡 NVLink 调度 | GPU 命令端到端延迟、多模型并发公平性 | 14B/72B tokens/s、TTFT P99.9 |
| T2-M | 8 卡拓扑调度 | 8 卡 NVLink 全互联下的集合通信抖动 | 72B FP16 tokens/s |
| T2-H | 高算力密度下的隔离 | H100 满负载时 RT 任务 P99.9 | 72B FP16 TTFT、671B 分片吞吐 |
| T1-L | 跨节点分布式调度隔离 | RDMA 延迟、NCCL all-reduce 期间 RT 任务抖动 | 72B 模型 tokens/s、多模型 QPS |
| T1-H | 超大规模分布式调度 | NDR IB 延迟、671B 推理期间 RT 抖动 | 671B tokens/s、能效比 |
### 5.4 基线 OS 对照
| 档位 | SylixOS 实验组 | 主对照 (Linux RT) | 虚拟化对照 | 容器对照 |
| ------- | ---------------------- | --------------------- | -------------- | --------- |
| T4-L | SylixOS ARM64 (RK3568) | Buildroot + RT | — | Docker |
| T4-M | SylixOS ARM64 (RK3576) | Buildroot + RT | — | Docker |
| T4-H | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T3-L | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T3-M | SylixOS ARM64 (T234) | L4T Ubuntu 20.04 + RT | KVM (RT VM) | Docker |
| T3-H | SylixOS ARM64 / x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T2-L/M | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T2-H | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T1-L | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 |
| T1-H | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 |
---
## 6. 采购与获取计划
| 优先级 | 档位 | 设备 | 估算费用 (RMB) | 备注 |
| ------ | ------- | ----------------------------- | -------------------- | ---------------------- |
| **P0** | T3-L | **RK3588 16GB 工业盒**(现有) | **0** | 现有设备,立即可用 |
| **P0** | T2-L | **4×V100 SXM 塔式整机**(现有) | **0** | 现有设备,谱系锚点 |
| **P0** | T4-H | **RK3588 工业盒 8GB 分区**(现有) | **0** | 与 T3-L 同机双档位 |
| **P1** | T4-L | RK3568 1~2GB 核心板 | ~300-800 | 谱系下界,必做 |
| **P1** | T4-M | RK3576 4GB 核心板 | ~600-1,500 | 端级能效拐点 |
| **P1** | T3-M | Jetson AGX Orin 32GB | ~15,000-28,000 | 需尽早确认 SylixOS T234 BSP |
| **P2** | T3-M 备选 | RK3588 32GB 工业盒 + 26 TOPS 算力棒 | ~3,000-5,000 | 若 Jetson BSP 不支持 |
| **P2** | T3-H | Jetson AGX Orin 64GB | ~30,000-50,000 | 边缘可跑 72B |
| **P2** | T4-H 备选 | Jetson Orin Nano 8GB 开发套件 | ~1,800-2,500 | CUDA 路线对照 |
| **P3** | T2-M | 4× V100 32GB SXM + 8 卡底板 + 电源 | ~70,000-100,000 | 现有平台加卡扩容 |
| **P3** | T2-H | 4× H100 80GB SXM5 工作站 | ~800,000-1,200,000 | 可租云实例替代 |
| **P3** | T1-L | 3× 计算节点 + 12× V100 + IB | ~270,000 | 可用云实例替代 |
| **P4** | T1-H | 4 节点 × 4×H100 + NDR IB | ~3,000,000+ | 强烈建议云租替代 |
| — | 仪器 | DC 功率计 ×2 (T3+T4) | ~6,000 | T4 强制 |
| — | 仪器 | INA226 采集板 ×2 | ~500 | T3+T4 |
| — | 仪器 | 交流功率计 / 智能插座 | ~1,000 | T3-H / T2 档 |
| — | 仪器 | 示波器 (Tektronix MDO34) | ~30,000 | GPIO 环回延迟(可借用) |
| — | 仪器 | 红外测温枪 ×2 | ~1,000 | 被动散热档位 |
| — | 仪器 | CANalyzer | ~20,000 | T4 CAN 总线延迟(可借用) |
| **合计** | | **P0~P2 必做项** | **~55,000-95,000** | 不含 T1/T2 扩展 |
### 降本策略
1. **P0 零成本起步**: T2-L + T3-L + T4-H 三个档位由现有硬件直接覆盖,可立即启动 SylixOS 适配与基线数据采集,无需等待采购。
2. **一机两档**: RK3588 16GB 工业盒通过内存分区同时充当 T3-L(16 GB)与 T4-H(8 GB),省去一台设备与一套 BSP 验证成本。
3. **档位跳跃验证**: 若某档位 SylixOS BSP 不可行,可直接跳过该档(如 T4-M 若 RK3576 BSP 不可用,用 T4-H 降配替代),谱系不断。
4. **T1/T2-H 云替代**: H100 集群强烈建议租用云实例(阿里云 GN7 / AWS p5),按需付费,避免百万级 CAPEX 与机房改造。
5. **T3-M Jetson**: 可先用 NVIDIA 开发者板(约 $2,000)验证 SylixOS BSP 可行性后再采购工业级版本。
6. **仪器借用**: 示波器和 CANalyzer 可从实验室借用,不必专门采购。
---
## 7. SylixOS BSP 适配 Checklist(跨档位汇总)
### 7.1 x86 BSP(T2 全档 + T1 全档)
- [ ] SylixOS 2.x LTS x86 在 H12D-8D 主板可启动
- [ ] AMD EPYC 7402 / 9654 多核 SMP 调度
- [ ] **4× V100 SXM CUDA 驱动**(T2-L,核心)
- [ ] **8× V100 SXM CUDA 驱动 + 8 卡拓扑**(T2-M)
- [ ] **4× H100 SXM5 CUDA 驱动 + NVLink 900GB/s**(T2-H)
- [ ] NVLink 4 卡 / 8 卡全互联拓扑枚举
- [ ] nvidia-smi / DCGM 监控
- [ ] vLLM / llama.cpp 在 SylixOS x86 编译运行
- [ ] **Mellanox ConnectX-6 RDMA 驱动**(T1-L 专属)
- [ ] **ConnectX-7 NDR 400G RDMA 驱动**(T1-H 专属)
- [ ] NCCL / MPI 分布式通信库(T1 专属)
- [ ] IPMI / BMC 功耗采集
- [ ] tickless + CPU 隔离 + 中断亲和性
- [ ] 高功耗档位热管理(H100 液冷温度阈值联动降频)
### 7.2 ARM64 BSP — T234 / Ampere(T3-M / T3-H-A / T4-H 路线B)
- [ ] **SylixOS ARM64 在 NVIDIA T234 SoC 可启动**(核心,需翼辉确认)
- [ ] 12× Cortex-A78AE SMP 调度(AGX Orin)/ 6× A78AE(Orin NX / Nano)
- [ ] Jetson Ampere GPU CUDA 驱动
- [ ] **DLA v2.0 驱动**(异步推理,AGX Orin 专属)
- [ ] 16/32/64 GB LPDDR5 统一内存管理
- [ ] 功率模式切换 API (7W/15W/25W/30W/50W/60W)
- [ ] 10GbE 网络驱动
- [ ] MIPI CSI 工业相机接口
- [ ] PCIe Gen4 扩展
- [ ] 温度传感器 + 降频阈值
### 7.3 ARM64 BSP — RK3588(T4-H / T3-L)
- [ ] SylixOS BSP for RK3588(A76+A55 大小核 SMP)
- [ ] CPU 频率独立调节 (governor)
- [ ] **内存分区限额机制**(16 GB 板按 8 GB 运行,T3-L ↔ T4-H 切换)
- [ ] tickless / idle hook
- [ ] 看门狗驱动
- [ ] **rknn / RKLLM NPU 驱动**(核心)
- [ ] **板贴 26 TOPS 算力芯片驱动**(32 TOPS 档位)
- [ ] **M0 核 BSP + RPMsg 跨核通信**(若用 M0)
- [ ] 双千兆 + WiFi 6 + 4G/5G 驱动
- [ ] CAN ×2 驱动
- [ ] RS485 ×2 + RS232 ×1 驱动
- [ ] GPIO 子系统
- [ ] HDMI 输出(调试)
- [ ] **Ubuntu 22.04 与 SylixOS 双系统引导**
### 7.4 ARM64 BSP — RK3576(T4-M)
- [ ] SylixOS BSP for RK3576(A72+A53 大小核 SMP)
- [ ] 6 TOPS NPU 驱动(RKNN 栈)
- [ ] 2~4 GB LPDDR5 内存管理
- [ ] CAN / RS485 / 千兆网络驱动
- [ ] 低功耗被动散热下的频率/温度联动
### 7.5 ARM64 BSP — RK3568(T4-L)
- [ ] SylixOS BSP for RK3568(4×A55 SMP)
- [ ] 0.8~1 TOPS NPU 驱动(RKNN 栈)
- [ ] **1~2 GB 极小内存下的内核裁剪与内存域划分**(核心难点)
- [ ] CAN / RS485 / 千兆网络驱动
- [ ] 1ms 实时任务在 1 GB 内存约束下的可行性验证
-282
View File
@@ -1,282 +0,0 @@
# SylixOS 混合实时任务与 AI 推理实验设计
> 更新日期:2026-09-20。依据:[基础设备配置 v2.0](../基础设备.md),扩展自[原实验设计](../实验设计.md)。
> 本文给出待执行方案,不代表已有测试结果。设备标称参数、模型容量估计和性能目标均须通过实机准入验证。
## 1. 研究目标与实验范围
研究问题是:在端、边、桌面、集群不同资源条件下,SylixOS 的调度与资源隔离能否在保持实时任务截止期的同时,提高 AI 推理服务的有效吞吐和能效?
| 研究问题 | 自变量 | 主要观测量 | 支持结论所需证据 |
|---|---|---|---|
| RQ1:混合负载下的实时性 | OS、调度策略、干扰强度 | 唤醒延迟、响应时间、截止期违约率 | 同硬件同负载的配对对照 |
| RQ2:隔离机制的代价与收益 | CPU/IRQ 亲和性、内存限额、推理准入 | P99.9 延迟、有效吞吐、拒绝率 | 默认、完整方案与逐项消融 |
| RQ3:功耗预算下的运行能力 | 频率、空闲策略、推理并发 | J/token、温度、违约率 | 满足同一服务质量约束的配置比较 |
| RQ4:规模扩展后的瓶颈 | GPU 数、节点数、模型规模 | 扩展效率、通信尾延迟、公平性 | 同模型强扩展与固定单节点负载弱扩展 |
执行分为两层:**核心实验使用现有 T2-L、T3-L 和 T4-H 内存受限配置;其他八档属于条件扩展**。核心结论不依赖新增集群、Jetson 或 H100 到位。LLM 是主负载,YOLO 检测和语音识别是可选混合负载;训练不纳入主实验。
## 2. 设备分层与实验平台
### 2.1 四层级、十一档实验映射
沿用设备文档的档位标签,实际容量单列。设备文档中“512 GB 边界归桌面高档”与“512 GB 集群标为 T1-L”存在口径差异;本文按多节点架构将该集群记为 T1-L,不据容量边界推导性能。
| 层级与档位 | 拟用设备 / 容量 | 状态 | 对应实验重点 |
|---|---|---|---|
| T4-L 端低 | RK3568,1~2 GB | 待获取、待适配 | 极小内存、轻量模型、实时任务保留资源 |
| T4-M 端中 | RK3576,4 GB | 待获取、待适配 | 小模型能效、频率与实时性关系 |
| T4-H 端高 | 现有 RK3588 16 GB 板限额至 8 GB | 可开展限额配置验证 | 内存压力、GPIO/CAN/RS485 混合负载 |
| T3-L 边低 | 现有 RK3588,16 GB 统一内存 | 核心平台 B | NPU/CPU 共享资源干扰、多模型并发 |
| T3-M 边中 | Jetson AGX Orin 32 GB | BSP 与驱动准入后开展 | GPU 共享内存、可用时加入 DLA |
| T3-H 边高 | AGX Orin 64 GB 或 x86 + RTX 6000 Ada 48 GB | 二选一,分别标识架构 | 大模型并发与容量上限 |
| T2-L 桌面低 | 现有 4×V100 SXM 32 GB,总显存 128 GB | 核心平台 A | 多卡推理、NVLink 通信与实时隔离 |
| T2-M 桌面中 | 8×V100 32 GB,总显存 256 GB | 待扩容 | 同代 GPU 数量扩展 |
| T2-H 桌面高 | 4×H100 80 GB,总显存 320 GB | 待获取或租用 | 高算力密度、跨代对照 |
| T1-L 集群低 | 4 节点×4×V100,总显存 512 GB | 待扩展 | 跨节点通信与分布式推理 |
| T1-H 集群高 | 4 节点×4×H100,总显存 1.28 TB | 远期扩展 | 大模型分布式服务与能效 |
GPU 显存、主机内存和 SoC 统一内存分别记录,不加总为单一可分配空间。多卡总容量不能代替每卡分片可行性验证;FP16 TFLOPS 与 INT8 TOPS 不直接换算,也不作为实测吞吐。
### 2.2 平台 A:现有 V100 服务器
依设备清单配置 H12D-8D 主板、单颗 EPYC 7402(24 核/48 线程)、128 GB DDR4、1 TB NVMe、4×V100 SXM 32 GB、NVLink 底板、双电源及液冷。完整 BOM 见设备文档 T2.2.1。
实验前采集 CPU/NUMA 拓扑、实际内存通道、PCIe 链路、逐对 GPU 互联与带宽、各卡温度和功率上限。4 卡互联形态以枚举和通信测试为准。双电源输入均纳入整机能耗,不把额定电源瓦数当作运行功耗。
分别测试 1、2、4 卡;单卡先完成模型与采样链路验证,再加入多卡并行。CPU 实时任务使用固定物理核,记录其 SMT 同胞核的使用方式,避免不同组的物理资源分配不一致。
### 2.3 平台 B:现有 RK3588 工业盒
依设备清单采用 4×A76 + 4×A55、16 GB 统一内存、64 GB eMMC,以及实际引出的 GPIO、CAN、RS485 和网络接口。原生 NPU 与外接加速器分开登记。
- B16:全量 16 GB,记为 T3-L。
- B8:同板施加 8 GB 限额,记为 T4-H 受限配置;两种配置顺序运行。
- 原生 NPU 是首轮路径;所谓“6+26 TOPS”仅为设备文档中的组合标称。扩展芯片型号、连接方式、模型格式和任务拆分能力通过后,才增加独立对照,不假定两者能共同加速同一 LLM。
- 可选 M0、CAN 和 RS485 必须先核对实物与 BSP;缺失的接口实验登记为未开展。
**内存限额口径**:优先采用能覆盖 OS 可见内存及加速器保留区的启动配置,并记录实际可用容量。若只能限制应用进程,则标为“8 GB 应用预算”,不能称为整机 8 GB。核对驱动缓冲区、DMA/CMA、页缓存、共享内存与交换空间是否受限;禁止将限额实验解释为真实 8 GB 板卡的功耗或带宽结论。
### 2.4 测量设备
| 测量对象 | 工具与接线 | 要求 |
|---|---|---|
| RK3588 整机功耗 | DC 输入端功率计;INA226 仅在量程和接线适配时使用 | 包含加速器和约定外设;保存电压、电流与采样率 |
| V100 整机功耗 | 覆盖两路电源的交流功率计 / PDU | 单卡遥测仅作归因,不能替代整机读数 |
| 物理实时响应 | 示波器或逻辑分析仪,GPIO 输入到输出环回 | 记录探头、触发方式、分辨率及环回空载值 |
| 工业接口 | CAN 分析仪、RS485 对端或回环装置 | 固定波特率、帧长、总线负载和时间戳位置 |
| 热状态 | 可用片上传感器,辅以外部温度测量 | 分别记录环境温度、芯片温度、频率和降频事件 |
传感器不能读取的指标记为 N/A,不以零代替;不得预设所有平台都有 `npu-smi`、DCGM 或相同性能接口。
## 3. 软件与模型准入
### 3.1 分阶段准入门槛
| 门槛 | 验证内容 | 通过证据 | 失败后的处理 |
|---|---|---|---|
| G0 设备识别 | 启动、SMP、容量、接口、时钟 | 硬件清单和启动日志 | 修复平台配置,暂停性能比较 |
| G1 实时与采样 | 周期任务、单调时钟、优先级、日志缓冲 | 空载时间序列、计时校验 | 仅记录功能适配结果 |
| G2 加速器 | 驱动加载、内存分配、最小算子、结果回读 | 运行日志、正确性结果 | 保留 CPU 路径,单独标识后端 |
| G3 完整模型 | 转换、加载、推理、释放、重复运行 | 模型校验值、输出、峰值内存 | 缩小模型或更换已验证后端 |
| G4 混合负载 | RT + 推理稳定运行至少 30 分钟 | 无崩溃、采样完整、失败可追踪 | 排查后再进入正式批次 |
SylixOS 能启动不等于 CUDA、RKLLM、RKNN、NCCL、Ray 或 RDMA 已可用。设备文档列出的软件栈均按候选路线处理,冻结实际 OS/BSP、驱动、SDK、编译器和框架版本后再比较。
若仅能采用“SylixOS 实时域 + Linux 推理域”,应作为单独的异构系统架构组,注明核分配、通信和内存共享方式。该结果不能写成 SylixOS 原生 GPU/NPU 推理结论。
### 3.2 模型梯度与用途
| 平台 | 首轮候选 | 扩展候选 | 后端准入检查 |
|---|---|---|---|
| T4-L/M | Qwen2.5-0.5B / 1.5B,候选 INT4 | 轻量视觉或语音模型 | 对应芯片实际支持的模型、算子及量化格式 |
| B8 / B16 | Qwen2.5-0.5B / 1.5B / 3B,候选 INT4 | 7B;YOLOv8-n/s INT8 | RKLLM 与 RKNN 分别验证;不可混用兼容性结论 |
| T2-L | Qwen2.5-7B FP16,先单卡 | 14B FP16;72B 量化多卡 | V100 的驱动、内核、量化算子和并行支持 |
| T3-M/H | 7B / 14B,容量适配后运行 | 32B / 72B 量化 | 精确到所选设备和软件版本 |
| T2-M/H、T1-L | 同一 7B/14B 基准;72B FP16 作为容量实验 | 多实例与更长上下文 | 每卡显存、通信路径和框架支持 |
| T1-H | 72B 作为跨规模桥接模型 | 671B 量化模型 | 完整权重、运行时、KV cache 和分片均可容纳 |
模型占用按“权重 + KV cache + 激活/工作区 + 运行时 + 保留余量”评估;不按权重大小直接计算并发实例数。每个候选先完成并发 1 的峰值测量,再逐级增加上下文和并发。原稿中的 tokens/s、FPS、内存估计作为待验证参考,不作为已知性能。
### 3.3 输入与正确性控制
LLM 固定模型修订、tokenizer、量化文件校验值、随机种子、解码参数和输入 token 序列。首轮使用输入长度 128/512/2048、目标输出 128 token;受限平台不能完成的单元记录容量失败。性能用固定长度合成输入,任务质量用独立固定题集;提前结束的请求记录实际输出长度,不补造 token。
YOLO 可选使用固定 640×640 输入、同一验证集和相同预处理,报告 mAP、帧处理延迟和丢帧率。量化实验同时比较任务质量与速度;不同后端若算子或数值格式不同,只能归为整套软件栈比较。
## 4. 指标定义与采集口径
### 4.1 实时性与系统开销
对第 i 次周期任务记录计划释放时刻 r_i、就绪时刻 q_i、实际开始时刻 s_i 和完成时刻 f_i,周期为 T,相对截止期为 D。
| 指标 | 定义 | 汇总 |
|---|---|---|
| 唤醒延迟 | s_i − r_i,包含定时释放与调度影响 | P50/P95/P99/P99.9、观测最大值 |
| 就绪后调度延迟 | s_i − q_i,仅在两系统均可取得等价就绪事件时使用 | 同上,独立于唤醒延迟 |
| 响应时间 | f_i − r_i | 分位数、观测最大值 |
| 截止期违约率 | count(f_i > r_i + D) / 计划释放次数 | 分子、分母、丢失/跳过次数 |
| 完成抖动 | 相邻完成间隔减去 T | 分布与时间序列 |
| 上下文切换 / IPC | 固定线程数和消息大小的往返测量 | µs;说明是否含系统调用和拷贝 |
| 外部响应 | 外部触发到 GPIO 翻转或回包的时间 | µs/ms,说明物理链路边界 |
缺失的周期不能直接从分母移除;需追踪其完成状态,否则该批实时性数据判为不完整。Linux 可使用 cyclictest 等作为辅助,跨 OS 主比较使用相同任务语义的测试程序,不假定 Linux 工具可直接运行于 SylixOS。
### 4.2 推理服务
在负载发生器的单调时钟上记录计划到达、实际发送、首 token 和最后 token 到达时间。
- TTFT:首 token 到达 − 实际发送,包含排队、传输与 prefill;同时记录发送滞后,防止负载发生器饱和掩盖排队。
- TPOT:对输出 token 数 n > 1,使用(末 token 到达 − 首 token 到达)/(n−1);逐 token 间隔另行汇总。
- 总输出吞吐:测量窗口内收到的输出 token 数 / 窗口时长;另报成功完成请求吞吐和请求成功率。
- 有效吞吐:仅统计满足预先冻结的 TTFT、完成期限及质量要求的成功请求,其输出 token 数 / 窗口时长;同时报告拒绝、超时和错误,避免只靠丢弃请求改善尾延迟。
- CPU→加速器端到端延迟:主机提交到结果可用;设备事件计时只作执行阶段分解,不代替完整链路。
### 4.3 能耗与热状态
在与负载一致的窗口 [t0,t1] 内积分:E_total = ∫P(t)dt;E_token = E_total / N_output,单位 J/token;tokens/J = N_output / E_total。固定窗口包含排队及已执行失败请求消耗的电能,并另外报告完成率。
同时可报告 E_dynamic = E_total − P_idle×(t1−t0),但不得与整机总能耗混用。N_output=0 时能效记为不可计算。混合视觉与 LLM 负载的总能耗不能全部归因于 LLM;应单列场景或增加独立负载对照。
报告平均功率、仪器采样峰值、空载功率、温度、实际频率和降频时间比例。**21 W 等设备标称值不直接定义实测整机峰值上限**;工程功耗预算由测量边界、具体硬件及项目需求在试运行后冻结。
## 5. 对照组与变量控制
### 5.1 OS 与部署组
| 编号 | 配置 | 作用 |
|---|---|---|
| O0 | 板卡支持的普通 Linux,固定发行版与内核 | 通用系统基线 |
| O1 | 同硬件可用的 Linux PREEMPT_RT,记录补丁与驱动兼容性 | 主要实时对照 |
| O2 | SylixOS 默认配置 | 原生系统基线 |
| O3 | SylixOS 调度、隔离与推理准入优化 | 主实验组 |
| O4 | Linux RT 等预算调优 | 避免仅一侧调优造成偏差 |
| O5(可选) | KVM 实时虚拟机 / 容器部署,分别记录 | 部署开销;不能视为独立内核类型 |
平台 B 原稿列出的出厂 Ubuntu 22.04 先核对镜像;扩展平台选择实际受支持的 OS 镜像。无法提供同一推理后端时,明确区分“OS 调度效应”与“系统方案效应”。
### 5.2 配置控制与消融
所有对照固定核心数量、RT 优先级、内存预算、模型输入、加速器数量、功率策略、后台服务和日志方式。B8/B16 对照只改变内存预算;频率策略作为独立实验变量,记录各 OS 的实际频率,不仅记录策略名称。
完整方案逐项去除:①CPU 核隔离;②IRQ 亲和性;③预分配/内存限额;④推理队列限长与准入;⑤功耗感知策略。每次只去除一个机制,并保留默认配置;不支持的机制注明不可用,不伪造等效实现。
## 6. 负载设计
### 6.1 实时任务
主任务周期 T=1 ms,D=1 ms;扩展周期 0.5/5/10 ms。任务体采用确定性计算或内存访问,在每台机器固定参考频率下校准至约 100 µs,再冻结迭代次数;后续频率实验不重新校准工作量。另测试 20%/40% 参考 CPU 占用预算,记录实测执行时间。
任务使用绝对时间周期释放,预分配日志缓冲,测试窗口内避免同步磁盘写入。GPIO/总线回环作为独立端到端任务。LLM 负责命令解析时与周期控制解耦,推理超时走模拟默认动作,先在回环或仿真环境验证。
### 6.2 背景干扰与推理到达
| 场景 | 内容 | 目的 |
|---|---|---|
| L0 | 仅 RT | 实时性下界与测量开销 |
| L1 | 仅推理 | 最大可持续服务能力与独立能耗 |
| L2 | RT + LLM | 核心混合场景 |
| L3 | L2 + CPU 干扰 | 参考占用 25/50/75/100%,注明施加核心 |
| L4 | L2 + 内存流式读写 | 实测带宽压力与容量压力分别扫描 |
| L5 | L2 + 网络/存储 I/O | IRQ、DMA 与系统服务干扰 |
| L6 | RT + LLM + YOLO(可选) | 多模型竞争与优先级影响 |
| L7 | L2 + 突发/过载 | 队列、拒绝与恢复行为 |
推理先以并发 1/2/4 做容量筛选,再以开放到达过程测试。每种硬件与模型固定一个参考基线的可持续请求率 λ_ref,所有 OS 使用同一绝对到达序列,测试 0.25/0.5/0.75/1.0/1.25×λ_ref。不得各组按自身吞吐重新归一化后声称承受相同负载。
突发模式使用相同种子:稳态运行后每 60 秒施加持续 10 秒的 2×基础到达率,记录队列峰值和恢复时间。负载发生器尽量位于独立机器;共机时记录其 CPU 开销。
## 7. 实验矩阵与具体步骤
### 7.1 核心实验
| 实验 | 平台 / 变量 | 操作与输出 | 关联问题 |
|---|---|---|---|
| E0 准入与空载 | A、B16、B8;G0~G4 | 固定版本、拓扑和功耗边界;输出准入表 | 全部 |
| E1 微基准 | O0~O4;L0、CPU/内存/I/O 干扰 | 测周期任务、IPC、物理环回;输出 CDF 与最大值 | RQ1 |
| E2 推理基线 | A 单卡 7B;B 从 0.5B 起;L1 | 扫输入长度、并发,测正确性、容量、吞吐、能耗 | RQ2/3 |
| E3 混合负载 | 各平台准入模型;L2~L5、L7 | 固定到达流比较 OS;绘制违约率与有效吞吐曲线 | RQ1/2 |
| E4 内存限额 | B16 与 B8;固定模型和频率 | 分别增加上下文、并发和内存干扰,测失败点及 RT 影响 | RQ2 |
| E5 多卡竞争 | A 的 1/2/4 卡 | 同模型并行扩展和多实例分别测试;采通信时间与公平性 | RQ4 |
| E6 能耗与热 | A、B;已验证频率/空闲模式 | 固定服务负载与环境,测能效、降频和违约率 | RQ3 |
| E7 消融 | O3 完整方案及逐项去除 | 使用 E3 中固定中载与过载单元重复测试 | RQ2 |
| E8 长稳与恢复 | A、B 的最终候选配置 | 连续 24 小时混合负载,注入推理进程重启、队列过载 | RQ1/3 |
E5 中,同一 7B 模型只有在所有 GPU 数配置均支持相同后端及并行机制时才计算强扩展;多实例吞吐增长单列,不冒充单请求加速。多租户公平性可使用各租户相对独占吞吐 x_i,计算 Jain 指数 (Σx_i)²/(kΣx_i²),同时报告每租户 TTFT 和服务等级。
E8 记录重启时间、请求丢失、RT 违约、内存增长及恢复到稳定吞吐的时间。驱动重置和热环境测试仅在存在可恢复测试路径和相应设备时增加;没有温箱数据不能宣称覆盖 −40~60℃ 全温域。
### 7.2 条件扩展
| 扩展 | 前提 | 实验内容 | 结论边界 |
|---|---|---|---|
| X1 T4-L/M | 板卡、BSP、模型准入 | 复用 E1~E4、E6,小模型与容量下限 | 不能用 RK3588 限额替代新 SoC 的功耗结果 |
| X2 T3-M/H | GPU/DLA 与 OS 路径明确 | 共享内存、多模型干扰、功率模式 | ARM 与 x86 路线分组,不只按容量归因 |
| X3 T2-M/H | 拓扑、供电和散热可用 | 4→8 卡、V100→H100 | 数量扩展与架构更换分开比较 |
| X4 T1-L | 至少 2 节点,网络和集合通信准入 | 1/2/4 节点,通信微基准与 RT + 分布式推理 | 单节点不可容纳模型时,以最小可运行节点数作参考 |
| X5 T1-H | 大模型分片、网络和测量资源齐备 | 固定 72B 对照后增加超大模型 | 云租环境若无物理功耗或 OS 控制,则相应指标不报告 |
T1 强扩展固定总模型及工作量,速度提升以参考节点数 n0 的完成时间为基准,效率 = 加速比/(n/n0);弱扩展固定每节点请求负载,报告总有效吞吐和尾延迟。网络协议、交换机、MTU、拥塞配置和进程布局冻结。RDMA/NCCL 不可用时,TCP 回退单独成组。
跨节点单向延迟需记录时钟同步方法与误差;误差不能满足精度要求时改测往返时间,不将其一半无条件当作单向延迟。
### 7.3 控制实验数量
不一次展开全部档位、OS、模型、长度、干扰和功率的笛卡尔积。首轮使用 A 单卡 7B、B 的已准入小模型、512 输入/128 输出、并发 1 和固定频率,完成 E0~E3;随后围绕出现干扰或资源瓶颈的单元展开 E4~E7。最终确认实验使用提前冻结的配置与新运行批次,避免只报告探索阶段的最佳结果。
## 8. 运行流程与统计方法
1. 保存硬件清单和配置快照;核对时钟、仪器连接、数据目录及剩余空间。
2. 重启进入指定配置,先测空载;模型预热至少 5 分钟,并记录温度是否稳定。冷启动时间单独测量。
3. 按随机顺序执行对照;同一设备采用配对批次,保持相同输入、种子及环境条件。
4. 普通性能单元至少独立运行 5 次、每次稳态窗口 10 分钟;RT 以 1 ms 周期可每次得到约 60 万次计划释放。长稳实验独立运行 24 小时。
5. 尾延迟按指标各自样本量判断。请求级 P99.9 以每单元至少 10 万个有效请求为采样目标,数量不足时标为探索性估计,报告样本数并延长采集或改报 P99;不能用 RT 周期样本数充当请求数。
6. 保存原始失败、超时和 OOM;测试程序、仪器或配置失效的批次标记无效并说明原因,保留原文件后重跑。
7. 输出每次运行的分位数、最大值和违约率;跨运行报告中位数与区间,使用按运行/时间块重采样的 bootstrap,保留随机种子。不给时间相关的百万周期样本套用独立样本假设。
观测最大值是本次时长与负载下的最大值,不是理论最坏执行时间。零违约只表述为“在 N 次计划释放和指定工况下未观测到违约”,不能证明硬实时安全上界。能耗差异还需考虑仪器精度、采样频率与环境漂移。
## 9. 验收与结果判断
验收分为“数据可用”“系统约束满足”和“研究假设得到支持”,避免将目标写成已取得结果。
| 类型 | 判据 | 说明 |
|---|---|---|
| 数据可用 | G0~G4 通过,原始数据与配置完整,重复运行可复现 | 必须项 |
| 实时约束 | 核心 1 ms 任务在预定负载范围内,观测违约数为 0 | 同时报告样本量、最大响应时间和过载结果 |
| 推理服务 | 达到预先冻结的 TTFT、质量、吞吐和完成率要求 | 按模型与输入长度分别制定 |
| 调度收益 | 对 O1/O4 的配对比较改善尾延迟或扩大无违约负载范围 | 同时报有效吞吐代价和置信区间 |
| 能耗收益 | 满足相同实时和推理约束时降低 J/token | 不以降低完成率换取能效结论 |
| 长稳 | 完成 24 小时,无不可恢复故障、日志失效或持续内存增长 | 任何故障均保留并分析 |
原稿的“0.5B ≥25 token/s、1.5B ≥12 token/s、7B ≥20 token/s、TTFT P99.9 ≤500 ms、吞吐偏差 ≤15%”仅保留为历史候选目标。E2 试运行后依据指定模型、长度、并发及任务需求决定采用与否,正式实验前冻结,不能看完正式结果再下调阈值。原有 8/15/21 W 数值同样不直接作为跨配置统一验收值。
## 10. 数据产物与论文图表
建议按 `results/<experiment>/<platform>/<os>/<config>/<run_id>/` 保存数据,每次运行至少包含:
| 文件 | 内容 |
|---|---|
| manifest.json | 档位、实物编号、容量口径、OS/BSP/驱动、模型校验值、核心/IRQ/频率配置、输入与种子、测试程序版本 |
| rt.csv | 计划释放、就绪(如可用)、开始、完成、CPU ID、违约与丢样状态 |
| requests.csv | 请求 ID、计划到达、发送、首/末 token、输出数、质量/成功状态、超时和拒绝原因 |
| power.csv / thermal.csv | 时间戳、功率、电压电流(如可用)、温度、实际频率、传感器来源 |
| events.log | OOM、驱动错误、降频、重启、网络异常和测量故障 |
| summary.json | 样本量、分位数、最大值、吞吐、能耗、配置有效性及异常说明 |
不同机器的时钟域及对齐方式写入 manifest;保留原始时间戳,汇总脚本不得静默删除异常值。
最终图表包括:①平台与准入状态表;②各负载下 RT 延迟 CDF/尾部放大图;③到达率—违约率—有效吞吐曲线;④B8/B16 内存占用与失败边界;⑤多卡/多节点扩展效率;⑥实时约束内的能耗—吞吐散点图;⑦消融效应及区间;⑧24 小时温度、频率、内存和违约时间序列。未执行的扩展档明确标为计划,不混入实测图。
## 11. 实施顺序与停止条件
| 阶段 | 工作 | 完成标志 |
|---|---|---|
| P0-1 | 清点 A/B,仪器校准,OS 与加速器准入 | 准入表明确通过项与阻塞项 |
| P0-2 | 完成 E1/E2,冻结正式配置和阈值 | 微基准、模型容量、基线数据齐全 |
| P0-3 | 完成 E3~E7 核心对照 | 能回答 RQ1~RQ3 及单机 RQ4 |
| P0-4 | E8 长稳、复核与图表 | 可复现数据包与结论边界完整 |
| P1/P2 | 小内存板卡、边级扩展与必要仪器 | 在准入后复用核心实验流程 |
| P3/P4 | 多卡升级与集群扩展 | 硬件、通信、OS 和功耗采集均满足对应实验条件 |
设备文档的采购优先级用于安排依赖,本实验设计不要求先采购全谱系设备。扩展驱动无可用实现时停止该路线的原生性能测试,输出适配缺口;内存不足时记录最大可运行配置;仪器缺失时保留性能实验并将能耗记为未测。最终报告分别陈述已实测结论、适配结果和后续计划。
Binary file not shown.

Before

Width:  |  Height:  |  Size: 324 KiB

-421
View File
@@ -1,421 +0,0 @@
# 最终稿文章规划 — SylixOS 大模型推理调度框架研究
> **版本**: v1.0 (最终稿规划)
> **日期**: 2026-09-20
> **整合来源**: 基础设备.md + 方案1.md v1.0 (大模型负载实验设计) + 方案2.md v2.0 (第三方基准复现方法学) +
> **目标产物**: 一篇面向 RTSS/RTAS 级别的系统化研究文章 (含完整实验数据与基准对比)
---
## 0. 文章定位与核心贡献
### 0.1 一句话定位
> **用业界公认方法学,在四层连续算力硬件谱系 (1 GB → 2 TB / 3 W → 25 kW) 上,首次系统化评测国产 RTOS (SylixOS) 在大模型推理负载下的低延迟、低功耗与实时保号能力,填补 RTOS 在边缘~集群算力评测领域的数据空白。**
### 0.2 三大核心贡献
| 编号 | 贡献 | 来源整合 | 对标空白 |
|------|------|----------|----------|
| C1 | **四层连续算力谱系上的 RTOS 调度评测** — 从端级 RK3568 (1 GB/3 W) 到集群级 4×H100 (1.28 TB/25 kW),11 个档位覆盖被动散热→机房液冷全散热形态,首次在连续硬件梯度上刻画 RTOS 调度性能曲线 | 基础设备.md §0~§5 | 公开研究仅覆盖单一平台或两档对比,无连续谱系 |
| C2 | **大模型混合负载下 RTOS 实时保号量化** — LLM 推理 + 1 ms 周期控制并发场景下,SylixOS 的 T_rt_max_under_llm 与 J_rt_under_llm 相对 Linux RT 的尾延迟优势量化 (≤30% = 显著优势) | 方案1.md §3, §6, §9 | 公开基准仅测吞吐 FPS,未测混合负载下的实时任务保号 |
| C3 | **RTOS 数据与业界公开基准首次横向对齐** — 引入第三方文章 (萤火虫数智笔记) 的 CPU/内存/NPU/功耗实测方法学与数据,在 SylixOS 上复现并对比,使 RTOS 数据首次可对外校验 | 方案2.md §2, §5, §7 | 国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失 |
### 0.3 目标读者与发表场景
| 维度 | 选择 |
|------|------|
| 目标会议 | RTSS / RTAS (实时系统 Top-Tier) 或 ISLPED (低功耗) |
| 备选 | EMSOFT / DAC / MLSys (系统方向) |
| 文章类型 | 系统评测 + 方法论论文 (非纯算法论文) |
| 核心读者 | RTOS 研究者、边缘 AI 系统工程师、国产化选型决策者 |
---
## 1. 文章整体结构 (十章)
```
第1章 引言 — 问题、动机、贡献概述
第2章 背景与相关工作 — LLM 推理特征 + RTOS 基础 + 差距分析
第3章 四层连续算力硬件谱系 — 11 档位体系设计与现有设备锚点
第4章 SylixOS 调度框架技术架构 — 五层技术栈与六大优化方向
第5章 实验方法学 — 第三方基准复现 + 混合负载场景 + 避坑约束
第6章 大模型负载选型与配置 — 跨档位模型矩阵
第7章 实验结果 — 基准对齐 + 实时性 + 能效 + 温度耦合
第8章 深入分析 — 档位间性能曲线 + RTOS vs Linux RT 差异化
第9章 讨论与威胁有效性 — 适用场景边界 + 局限性
第10章 结论与展望
```
---
## 2. 逐章详细规划
### 第1章 引言
**目标**: 300~500 词,点明矛盾、贡献、文章路线图。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 1.1 问题矛盾 | RTOS 追求 µs~ms 级确定性 vs LLM 推理是 GB 级内存、s 级耗时的软实时负载;边缘~集群场景中二者必须共存 | |
| 1.2 研究空白 | 公开基准 (如萤火虫文章) 全部基于 Linux/Ubuntu,国产 RTOS 在边缘算力 SoC 上的实测数据严重缺失;现有研究无连续硬件谱系 | 方案2.md §1.1 |
| 1.3 本文贡献 | C1 (四层谱系评测)、C2 (混合负载保号量化)、C3 (业界基准对齐),一句话概述每个贡献 | |
| 1.4 文章组织 | 十章路线图 | 本规划 §1 |
**关键图表**: 无 (引言章通常无图表或仅一张概念图)。
---
### 第2章 背景与相关工作
**目标**: 600~800 词,建立读者所需的 LLM 推理 + RTOS 双重背景。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 2.1 LLM 推理特征 | prefill/decode 两阶段;CPU/内存密集;长尾分布;并发争抢;模型加载 IO 抖动 | 方案1.md §1.1 |
| 2.2 RTOS 调度基础 | 硬优先级 + 优先级继承;内存锁定;tickless;中断线程化;SMP 可预测调度;精简内核路径 | 方案1.md §1.1 表 |
| 2.3 Linux RT 相对短板 | cgroup/kswapd 大模型加载停顿;PREEMPT_RT P99.9 仍受内核态长路径限制;tickless 仅 idle 启用 | 方案1.md §1.1 |
| 2.4 相关工作对比 | vLLM/TGI (服务器级无实时保证)、Micro-LLM (模型压缩不关注 OS 调度)、NPU SDK (封闭黑箱)、CUDA Stream (无实时分析) | FRAMEWORK.md §6, 方案2.md §2.4 |
| 2.5 第三方基准方法学 | 萤火虫文章的 5 维度方法学 (CPU/内存/NPU/功耗/温度) + 5 条避坑清单 | 方案2.md §2 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Fig.1 | LLM 推理两阶段时序图 | prefill (计算密集, 串行) vs decode (逐 token, KV Cache IO 密集) 的 RTOS 任务映射 |
| Tab.1 | SylixOS vs Linux RT 特性对比 | 6 项 RTOS 特性对应的大模型负载优势 + Linux RT 短板 |
---
### 第3章 四层连续算力硬件谱系
**目标**: 800~1000 词,这是 C1 的核心展示章,也是本文区别于其他单平台研究的最大差异化。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 3.1 分级维度与分档规则 | 以「统一内存/显存容量」为第一分类维度;边界值归上界;四层连续无断层 | 基础设备.md §0.1 |
| 3.2 全谱系总表 (11 档位) | T4-L→T4-M→T4-H→T3-L→T3-M→T3-H→T2-L→T2-M→T2-H→T1-L→T1-H 的容量/算力/功耗/散热/代表设备/状态 | 基础设备.md §0.2 |
| 3.3 设计原则 | 容量连续功耗阶跃;CUDA 栈贯通 T1/T2/T3;非 CUDA 端路线 (T4 全档 + T3-L);现有硬件复用 (V100+RK3588 锚点);BSP 最小化 (x86+ARM64 两类) | 基础设备.md §0.3 |
| 3.4 现有设备与采购计划 | P0 零成本起步 (T2-L+T3-L+T4-H);一机两档 (RK3588 16 GB 同时充当 T3-L 与 T4-H);T1/T2-H 云替代 | 基础设备.md §6 |
| 3.5 各层级定位与验证重点 | T1 跨节点分布式调度;T2 单机多卡 NVLink;T3 统一内存带宽隔离;T4 极致资源约束保号 | 基础设备.md T1~T4 各 §.1 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Fig.2 | 四层硬件谱系全景图 | 横轴=容量 (1 GB→2 TB, log 刻度), 纵轴=功耗 (3 W→25 kW, log 刻度), 11 个档位点标注, 散热形态用颜色分区 (被动/风冷/液冷/机房液冷) |
| Tab.2 | 11 档位全规格对比表 | 容量、算力、功耗、加速器架构、散热、互联、SylixOS BSP 风险、状态 (现有/需扩展) |
| Tab.3 | 模型规模梯度表 | 11 档位 × 代表模型 × 量化 × 显存占用 × 角色 (谱系下界→超大模型分布式) |
| Tab.4 | 采购计划表 | P0~P4 优先级 + 估算费用 + 降本策略 |
---
### 第4章 SylixOS 调度框架技术架构
**目标**: 600~800 词,将 FRAMEWORK.md 的五层技术栈和六大优化方向浓缩为文章的技术背景章。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 4.1 核心问题定义 | 不是让 RTOS "跑大模型",而是用 RTOS 做 "LLM 推理资源的调度与协调" | FRAMEWORK.md §0 |
| 4.2 五层技术栈 | L1 硬件层 → L2 RTOS 调度核 → L3 资源抽象 (加速器驱动/DMA/内存控制器) → L4 运行时 (任务图/流水线/内存池) → L5 模型层 (量化/KV Cache/投机解码) | FRAMEWORK.md §2 |
| 4.3 LLM 推理阶段 → RTOS 任务映射 | Tokenizer→LOW, Embedding→HIGH, Attention→MAX, FFN→HIGH, KV Cache Write→MEDIUM, Sample→LOW;阶段特征矩阵 (计算/IO/延迟敏感/确定性/优先级) | 01-inference-scheduling.md §2 |
| 4.4 六大优化方向概览 | 方向1 推理图任务调度 (Hybrid FP+EDF) → 方向2 KV Cache 内存池 → 方向3 加速器协同 → 方向4 量化感知调度 → 方向5 中断与实时 → 方向6 能耗热管理 | FRAMEWORK.md §3, 01~06 子文档 |
| 4.5 SylixOS BSP 适配要点 | x86 BSP (V100/H100 CUDA 驱动, NVLink, RDMA)、ARM64 BSP (RK3588/RK3576/RK3568 NPU 驱动, T234 Jetson BSP)、内存分区限额 (一机两档)、跨核通信 (M0+RPMsg) | 基础设备.md §7 (BSP Checklist) |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Fig.3 | 五层技术栈架构图 | L1~L5 层叠 + 每层关键组件 + 层间接口 |
| Fig.4 | LLM 推理 DAG → RTOS 任务图 | 推理阶段的有向无环图, 标注每阶段优先级 (MAX/HIGH/MEDIUM/LOW) 和可抢占性 |
| Tab.5 | 推理阶段特征矩阵 | 阶段 × (计算密集度/IO 密集度/延迟敏感度/确定性要求/RTOS 优先级) |
| Tab.6 | 六大优化方向概览 | 方向 × (核心问题/关键手段/目标指标/对应章节) |
---
### 第5章 实验方法学
**目标**: 800~1000 词,这是 C2 和 C3 的方法论基础,也是本文"可复现"承诺的核心。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 5.1 方法论框架 | "基准测量 → 建模 → 算法设计 → 仿真验证 → 原型实现 → 实测对比" 六步循环 | 07-analysis-methods.md §1 |
| 5.2 第三方基准复现方法学 | 引入萤火虫文章的 5 维度方法 (CPU/内存/NPU/功耗/温度);在 SylixOS 上重跑 sysbench/stress-ng/RKNN,与文章数据对比 | 方案2.md §5.1~§5.3 |
| 5.3 混合负载实验设计四原则 | 原则1: 混合负载而非孤立;原则2: 看尾延迟不看均值;原则3: 突发场景而非稳态;原则4: 调度精细度而非裸吞吐 | 方案1.md §3 |
| 5.4 功耗真测强制约束 | 禁止仅靠软件读数;DC 功率计 (Yokogawa WT310) + INA226 采集板强制;采样 ≥1 Hz | 方案2.md §5.4 |
| 5.5 温度监控强制约束 | 烤机 1 h 稳态 <75 ℃ 才采样;≥85 ℃ 数据作废;全程温度日志 | 方案2.md §5.5 |
| 5.6 环境元数据强制清单 | OS/内核/BSP/固件/驱动/室温/散热/工具/量化/时间戳 10 项强制 | 方案2.md §5.6 |
| 5.7 对照组设计 | OS 层: SylixOS vs Ubuntu+PREEMPT_RT vs (KVM/Docker);配置层: C0 默认 → C1 tuned → C2 extreme | 方案1.md §7, 方案2.md §7.1 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Fig.5 | 实验方法论流程图 | 六步循环 + 第三方基准对齐校验门 (±15% 才准入主场景) |
| Tab.7 | 业界基准对照表 | 指标 × (文章基线 / SylixOS 实测 / 偏差 / 评判) — CPU 单核~1280、多核~7120、YOLOv5s 32 FPS、3B LLM ~90 tok/s |
| Tab.8 | 避坑清单映射 | 5 条避坑点 × (强制约束/验证方式/落实位置) |
| Tab.9 | 环境元数据清单模板 | 10 项元数据 × 示例值 |
---
### 第6章 大模型负载选型与配置
**目标**: 500~700 词,定义跨 11 档位的模型矩阵。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 6.1 选型原则 | 国产化优先 (Qwen/MiniCPM);跨架构可比 (x86+CUDA 与 ARM+NPU);量化版本完整 (FP16/INT8/INT4);社区生态成熟 (vLLM/llama.cpp/TensorRT-LLM/RKLLM) | 方案1.md §2.1 |
| 6.2 跨档位模型矩阵 | T4-L: Qwen2.5-0.5B INT4;T4-M: 1.5B INT4;T4-H: 3B/7B INT4;T3-L: 3B/7B INT4 (RKLLM);T3-M: 14B/32B INT4 (TensorRT-LLM);T3-H: 72B INT4;T2-L: 72B INT4/14B FP16;T2-M: 72B FP16;T2-H: DeepSeek-V2 FP16;T1-L: 72B FP16 分布式;T1-H: 671B INT4 | 基础设备.md §5.2 + 方案1.md §2.2~§2.3 |
| 6.3 推理框架与配置 | vLLM (T2/T1)、TensorRT-LLM (T2/T3-M/H)、llama.cpp (T2-L/T3-L 退路)、RKLLM (T4/T3-L);batch 1/8/32;上下文 512/2048/8192;并发 1/8/32 | 方案1.md §2.2~§2.4 |
| 6.4 负载生成器 | vLLM benchmark / llama-bench / 自研并发客户端 / RKLLM demo / 自研 LLM+RT 混合负载驱动脚本 | 方案1.md §2.4 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Tab.10 | 跨档位模型矩阵 | 11 档位 × (代表模型/参数/量化/显存占用/并发实例/推理框架/预期 tok/s) |
| Tab.11 | 负载生成器清单 | 工具 × 平台 × 角色 × SylixOS 可用性 |
---
### 第7章 实验结果
**目标**: 1500~2000 词,本文篇幅最大的章节,展示全部实验数据。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 7.1 基准对齐结果 (第一层判据) | SylixOS 在 RK3588 上的 CPU 单核/多核 (sysbench)、内存带宽、NPU FPS (YOLOv5s/ResNet18/MobileNetV2)、3B LLM tok/s 与文章基线的偏差 (目标 ±10%~±20%) | 方案2.md §7.2, §9.3 第一层 |
| 7.2 低功耗结果 | P_idle / P_prefill / P_decode / E_per_token 分阶段功耗曲线;T2-L (V100) 与 T3-L/T4-H (RK3588) 两平台对照;SylixOS vs Linux RT 能效比 | 方案1.md §5.1, §6.7, 方案2.md §4.1 |
| 7.3 低延迟结果 | T_irq / T_sched / T_ctx P50~Max;T_ttft / T_tok 尾延迟分布直方图;SylixOS vs Linux RT P99.9/Max/σ 对比 | 方案1.md §5.2, §6.5 |
| 7.4 混合负载保号结果 (★ 核心) | 场景1: LLM 推理 + 1 ms 周期控制并发;T_rt_max_under_llm / J_rt_under_llm;4 变体 (A1 Linux RT 默认 / A2 Linux RT tuned / A3 SylixOS 默认 / A4 SylixOS 极限);30 min 全周期延迟时间序列图 | 方案1.md §6.1, §5.3, §9.3 |
| 7.5 多模型并发与突发场景 | 场景2: 多模型流水线 P0/P1/P2 优先级公平性;场景3: 突发加载/切换瞬间实时性保持;场景4: GPU/NPU 多请求调度公平性 | 方案1.md §6.2~§6.4 |
| 7.6 温度-功耗-性能耦合 | 场景8: 25%→100% CPU 逐步加压的三维耦合曲线;SylixOS vs Linux RT 降频触发温度与性能下降斜率 | 方案2.md §4.4, §6.8 |
| 7.7 异构核分配 | 场景6: RK3588 大核 A76 (LLM) + 小核 A55 (1 ms RT) + M0 (100 µs 控制) 的 SylixOS 异构调度优势 | 方案1.md §6.6 |
| 7.8 跨档位性能曲线 | 11 档位上 T_sched P99.9 / E_per_token / T_rt_max_under_llm 的连续曲线 (现有 P0 档位实测 + 扩展档位预估) | 基础设备.md §5.3, 基础设备.md §5.1~§5.2 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Tab.12 | 业界基准复现对比表 (最终版) | 填入 SylixOS 实测值与偏差列 |
| Fig.6 | 功耗分阶段曲线 | prefill 峰值 → decode 稳态 → idle 的 W(t) 曲线, SylixOS vs Linux RT 叠加 |
| Fig.7 | 混合负载实时任务延迟分布 (★ 核心证据) | P50~Max 直方图 + 时间序列, 4 变体叠加, 突出 A4 的"细长尾部"优势 |
| Fig.8 | LLM token 延迟直方图 | Qwen2.5-7B 1 流 1 h 采集, SylixOS vs Linux RT |
| Fig.9 | 突发加载瞬间时间序列 | 模型加载瞬间实时任务延迟 spike, SylixOS ≤50 µs vs Linux RT 100 µs~1 ms |
| Fig.10 | 温度-功耗-性能三维耦合曲线 | T_core / P / perf 三轴, 不同 CPU 负载档位 |
| Fig.11 | 跨档位性能连续曲线 | 横轴=11 档位 (T4-L→T1-H), 纵轴=P99.9 调度延迟 / E_per_token / T_rt_max, 三条曲线 |
| Tab.13 | 通过判据三层汇总 | 第一层基准对齐 + 第二层实时性 + 第三层优越性量化 |
---
### 第8章 深入分析
**目标**: 800~1000 词,从数据中提炼规律性结论。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 8.1 档位间性能曲线规律 | 容量每 ×2 时 RTOS 优势的变化趋势;端级 (资源越紧→RTOS 价值越大) vs 集群级 (资源充裕→RTOS 优势收窄) 的拐点分析 | 基础设备.md §5.3 |
| 8.2 SylixOS vs Linux RT 差异化量化 | 按 §9.4 优越性判据:T_rt_max_under_llm ≤30% = 显著优势 / ≤60% = 可比偏优 / >60% = 未体现;按档位和场景分别判定 | 方案1.md §9.4 |
| 8.3 混合负载下 RTOS 优势的根因 | 硬优先级 + 优先级继承 → 不被 decode 抢占;内存锁定 → KV Cache 抖动不驱逐关键页;精简内核路径 → 加载大模型不引入额外抖动;中断线程化 + 亲和性 → NPU 中断不污染实时核 | 方案1.md §1.1 表, 05-irq-realtime.md |
| 8.4 能效分析 | 每 token 能耗 vs 档位 (V100 集群能效基线 vs H100 能效上限);INT4 vs FP16 的能效拐点;RKLLM NPU vs CUDA GPU 的 J/token 对比 | 基础设备.md §0.3, 06-power-thermal.md |
| 8.5 BSP 风险与可行性 | x86 BSP (低风险, V100 已验证) vs ARM64 RK3588 BSP (极低, 现有) vs T234 Jetson BSP (高, 需翼辉确认) vs RKLLM 移植 (高, 核心风险);档位跳跃验证降本策略 | 基础设备.md §7, 方案1.md §10 |
**关键图表**:
| 编号 | 图表 | 描述 |
|------|------|------|
| Fig.12 | RTOS 优势 vs 硬件档位趋势图 | 横轴=11 档位, 纵轴=SylixOS 相对 Linux RT 的 P99.9 改善百分比, 标注"显著优势/可比偏优/未体现"区间 |
| Tab.14 | 优越性量化结论矩阵 | 场景 × 档位 × (T_rt_max 比值 / 判定结论) |
| Tab.15 | BSP 风险与可行性矩阵 | 档位 × (BSP 类型/风险等级/状态/降本策略) |
---
### 第9章 讨论与威胁有效性
**目标**: 400~600 词,诚实地界定适用边界和局限性。
| 小节 | 内容要点 | 来源映射 |
|------|----------|----------|
| 9.1 适用场景边界 | 资源越紧张 (T4) → RTOS 价值越大;资源充裕 (T1-H) → RTOS 优势收窄, 可能"可比偏优";混合负载 (LLM+RT 并发) → RTOS 杀手锏;纯吞吐场景 → 通用 OS 可能更高 | 方案1.md §3, §9.4 |
| 9.2 威胁有效性 | (1) RKLLM 移植风险: 若未完成, 退路 llama.cpp CPU 推理但失去 NPU 优势, 需标注; (2) V100 驱动成熟度: 4 卡 NVLink 联用可能受限, 单卡先行; (3) sysbench/stress-ng 移植: POSIX 兼容可行性高但需验证; (4) 量化精度差异: 同模型同量化跨 OS 不变, 已控制; (5) 室温/散热波动: 25±2 ℃ + 液冷恒定 | 方案1.md §10, 方案2.md §11 |
| 9.3 与已有工作的关系 | vs vLLM/TGI (服务器级, 无实时保证)、vs NPU SDK (封闭黑箱)、vs CUDA Stream (无实时分析)、vs 第三方文章 (仅 Linux, 仅 RK3588, 未测实时性) | FRAMEWORK.md §6, 方案2.md §2.4 |
| 9.4 方法论局限 | 文章仅引用单一第三方来源 (萤火虫文章), 跨平台参照 (昇腾 Qwen-7B) 为非本方案硬件; 消融实验仅在现有 P0 档位可完整执行; 扩展档位 (T1-H/T2-H) 依赖云租替代, 数据可比性需说明 | 方案2.md §13 后续建议 |
---
### 第10章 结论与展望
**目标**: 300~400 词,总结贡献并指出未来方向。
| 小节 | 内容要点 |
|------|----------|
| 10.1 结论 | 重申 C1/C2/C3 三大贡献的量化结果 (基准对齐 ±X%、混合负载 ≤Linux RT X%、能效 ≤Linux RT X%) |
| 10.2 展望 | 跨平台横向对比 (RK3588 vs Jetson vs 昇腾); 功能安全 SIL2/IEC 61508 关联; 多机分布式推理; 昇腾 Qwen-7B 作为第二业界参照点; 自适应优先级与动态 WCET 估计 |
| 10.3 开放研究问题 | 动态 WCET 在线估计; 运行时自适应优先级; 跨层优化 (调度+量化联合); 预测式调度; 容错恢复调度 | 01-inference-scheduling.md §8 |
---
## 3. 来源文档到章节的映射矩阵
| 来源文档 | 主要贡献章节 | 次要贡献章节 |
|----------|------------|------------|
| **基础设备.md** | §3 (硬件谱系) | §4.5 (BSP 适配), §6.2 (模型矩阵), §7.8 (跨档位曲线), §8.1 (档位趋势), §8.5 (BSP 风险) |
| **方案1.md v1.0** | §5.3 (四原则), §7.4 (混合负载) | §2.1~§2.3 (LLM 推理特征/RTOS 优势/Linux 短板), §5.7 (对照组), §6 (模型选型), §7.2~§7.5 (功耗/延迟/并发/突发), §7.7 (异构), §8.2 (优越性量化), §9.2 (威胁有效性) |
| **方案2.md v2.0** | §5.2 (基准复现), §5.4~§5.6 (强制约束) | §2.5 (第三方方法学), §7.1 (基准对齐结果), §7.6 (温度耦合), §9.3 (与已有工作关系), §9.4 (方法论局限) |
| **FRAMEWORK.md** | §4 (技术架构) | §1 (核心问题), §2.4 (相关工作), §8.3 (根因分析), §10.3 (开放问题) |
| **01-inference-scheduling.md** | §4.3 (任务映射) | §7.4 (混合负载调度模型), §8.3 (根因) |
| **02-kv-cache-memory.md** | §4.4 (方向2 概览) | §7.4 (KV Cache 对实时任务的影响), §8.4 (能效) |
| **03-accelerator-collab.md** | §4.4 (方向3 概览) | §7.7 (异构核分配), §8.3 (根因) |
| **04-quantization-scheduling.md** | §4.4 (方向4 概览) | §6.2 (量化选型), §8.4 (能效拐点) |
| **05-irq-realtime.md** | §4.4 (方向5 概览) | §7.3 (中断延迟), §8.3 (根因) |
| **06-power-thermal.md** | §4.4 (方向6 概览) | §7.2 (功耗), §7.6 (温度耦合), §8.4 (能效) |
| **07-analysis-methods.md** | §5.1 (方法论框架) | §7 (评估指标体系), §8 (分析方法), §9 (消融实验设计) |
---
## 4. 关键数据产物清单
| 编号 | 产物 | 类型 | 优先级 | 依赖 |
|------|------|------|--------|------|
| D1 | 11 档位硬件规格总表 | 数据表 | P0 | 基础设备.md 已就绪 |
| D2 | 跨档位模型矩阵 | 数据表 | P0 | 基础设备.md + 方案1.md 已就绪 |
| D3 | RK3588 上 sysbench/stress-ng 基准复现数据 | 实测数据 | P0 | 需 SylixOS BSP + sysbench 移植 |
| D4 | 业界基准对比表 (SylixOS vs 文章基线) | 对比表 | P0 | D3 |
| D5 | 混合负载 30 min 全周期延迟时间序列 | 实测数据 | P0 | 需混合负载驱动脚本 + 4 变体 |
| D6 | 混合负载延迟分布直方图 (4 变体叠加) | 图表 | P0 | D5 |
| D7 | 功耗分阶段曲线 (prefill/decode/idle) | 图表 | P0 | 功率计采集 + LLM 推理 |
| D8 | LLM token 延迟直方图 (1 h 采集) | 图表 | P1 | vLLM/RKLLM benchmark |
| D9 | 突发加载瞬间实时任务时间序列 | 图表 | P1 | 混合负载脚本 + 模型切换 |
| D10 | 温度-功耗-性能三维耦合曲线 | 图表 | P1 | stress-ng 逐步加压 + 温度日志 |
| D11 | 跨档位性能连续曲线 | 图表 | P1 | P0 档位实测 + P1~P4 档位预估 |
| D12 | 优越性量化结论矩阵 | 分析表 | P1 | D4+D6+D7 |
| D13 | 环境元数据清单 (每份数据附) | 元数据 | P0 | 方案2.md §5.6 模板 |
---
## 5. 写作优先级与依赖关系
```
Phase 0: BSP 适配 + 工具移植 (3 周)
├─ SylixOS RK3588 BSP 部署
├─ sysbench / stress-ng / RKLLM 移植验证
└─ vLLM / llama.cpp 在 SylixOS 编译运行
Phase 1: 基准复现 + 文章骨架 (1.5 周)
├─ D3: RK3588 基准复现 → D4: 业界对比表
├─ 撰写: §1 引言 + §2 背景 + §3 硬件谱系 + §4 技术架构 + §5 方法学 + §6 模型选型
└─ 依赖: D3 通过 ±15% 对齐门 → 准入 Phase 2
Phase 2: 低功耗测试 + 温度耦合 (2 周)
├─ D7: 功耗曲线 + D10: 温度耦合曲线
└─ 撰写: §7.2 + §7.6
Phase 3: 低延迟 + 混合负载测试 (3 周)
├─ D5+D6: 混合负载核心证据 + D8: token 延迟直方图 + D9: 突发场景
└─ 撰写: §7.3 + §7.4 + §7.5
Phase 4: 异构调度测试 (1 周)
├─ 场景6: A76+A55+M0 异构分配
└─ 撰写: §7.7
Phase 5: 数据汇总 + 深入分析 + 全文定稿 (2.5 周)
├─ D11: 跨档位曲线 + D12: 优越性矩阵
├─ 撰写: §7.8 + §8 深入分析 + §9 讨论 + §10 结论
└─ 全文校对 + 图表终版
```
**总周期: ~13 周** (Phase 0~5 累计)
---
## 6. 章节字数预算
| 章节 | 预算字数 | 占比 |
|------|---------|------|
| §1 引言 | 400 | 4% |
| §2 背景与相关工作 | 700 | 7% |
| §3 四层硬件谱系 | 900 | 9% |
| §4 技术架构 | 700 | 7% |
| §5 实验方法学 | 900 | 9% |
| §6 模型选型 | 600 | 6% |
| §7 实验结果 | 1800 | 18% |
| §8 深入分析 | 900 | 9% |
| §9 讨论 | 500 | 5% |
| §10 结论 | 350 | 3% |
| 参考文献 + 附录 | ~2000 | 23% |
| **总计** | **~9750** | 100% |
> 注: 按 RTSS/RTAS 会议论文 10~12 页双栏计算, 正文约 8000~10000 词, 参考文献+附录另计。
---
## 7. 核心叙事线 (Storyline)
```
问题矛盾 (§1)
→ RTOS 确定性 vs LLM 计算密集, 边缘~集群必须共存
→ 空白: 国产 RTOS 在边缘算力上零实测数据
背景铺垫 (§2)
→ LLM 推理的 CPU/内存/长尾特征
→ RTOS 的 6 项调度优势 + Linux RT 的 3 项短板
→ 第三方方法学引入 (5 维度 + 5 避坑)
硬件谱系 (§3) ← C1 差异化
→ 11 档位连续梯度: 1 GB/3 W → 2 TB/25 kW
→ 现有 P0 零成本起步 (V100 + RK3588)
→ 一机两档降本
技术架构 (§4)
→ 五层技术栈 + 六大优化方向
→ LLM 推理 DAG → RTOS 任务映射
→ BSP 适配要点与风险
方法学 (§5) ← C2/C3 基础
→ 第三方基准复现 (先对齐 ±15% 才准入)
→ 混合负载四原则 (杀手锏设计)
→ 功耗真测 + 温度监控 + 元数据强制
模型选型 (§6)
→ 跨 11 档位的 Qwen/LLaMA/MiniCPM/Whisper 矩阵
→ INT4/INT8/FP16 量化梯度
实验结果 (§7) ← 本文核心
→ 7.1 基准对齐 (第一层门)
→ 7.2~7.3 功耗/延迟 (基础指标)
→ 7.4 混合负载保号 (★ 杀手锏证据)
→ 7.5~7.7 并发/突发/异构
→ 7.8 跨档位连续曲线
深入分析 (§8)
→ 档位间趋势: 资源越紧 → RTOS 价值越大
→ 优越性量化: ≤30% 显著优势 / ≤60% 可比偏优
→ 根因: 硬优先级 + 内存锁定 + 精简内核 + 中断亲和
→ 能效: V100 基线 vs H100 上限, INT4 拐点
讨论 (§9)
→ 适用边界: T4 杀手锏, T1-H 可能收窄
→ 威胁有效性: RKLLM 移植/V100 驱动/sysbench 移植
→ 与已有工作: vs vLLM/NPU SDK/CUDA Stream/第三方文章
结论 (§10)
→ 三大贡献量化回顾
→ 跨平台/功能安全/分布式/自适应展望
```
---
## 8. 待确认事项
| 编号 | 待确认项 | 影响章节 | 当前假设 |
|------|---------|---------|---------|
| Q1 | SylixOS 在 x86+4×V100 NVLink 的 CUDA 驱动支持度 | §4.5, §7.3, §8.5 | 需翼辉确认; 单卡先行, 4 卡作 stretch |
| Q2 | RK3588 BSP 是否集成 rknn/RKLLM | §5.2, §7.1, §9.2 | 需翼辉确认; 退路 llama.cpp CPU |
| Q3 | sysbench/stress-ng 在 SylixOS 可移植性 | §5.2, §7.1 | POSIX 兼容, 假设可行 |
| Q4 | T234 (Jetson Orin) BSP 是否支持 | §3.2 (T3-M/H) | 风险高; T3-L 用 RK3588 起步 |
| Q5 | RK3588 板卡是否引出 M0 调试接口 | §7.7 (场景6) | 若未引出, 场景6 需调整 |
| Q6 | 是否纳入功能安全 SIL2/IEC 61508 章节 | §10.2 展望 | 暂列为展望, 不入正文 |
| Q7 | 是否纳入昇腾 Qwen-7B 作为第二业界参照 | §7.1, §9.4 | 暂列为后续, 非本方案硬件 |
| Q8 | 主对照组确认: Ubuntu 22.04+PREEMPT_RT | §5.7 | 与第三方文章配置一致, 可比性最高 |
---
-132
View File
@@ -1,132 +0,0 @@
# SylixOS 大模型推理调度研究逻辑说明
## 1. 文档目的
本文用于解释[整体逻辑流程图](./整体逻辑流程图.md),说明《基础设备.md》《实验设计.md》和《最终稿文章规划.md》如何共同组成一套完整的研究方案。
三份文档承担不同职责:
| 文档 | 回答的问题 | 在研究中的作用 |
|---|---|---|
| [基础设备.md](./基础设备.md) | 在哪些硬件条件下研究? | 定义四层、十一档硬件谱系及现有设备锚点 |
| [实验设计.md](./实验设计.md) | 如何产生可信且可复现的证据? | 定义准入、对照、负载、指标、统计与验收方法 |
| [最终稿文章规划.md](./最终稿文章规划.md) | 如何把证据组织成论文贡献? | 把硬件、方法、结果和分析映射到论文十章结构 |
整个研究的主线是:
> 硬件谱系 → 软件与模型准入 → 公平对照 → 混合负载实验 → 可复现数据 → 跨档位规律 → 论文贡献。
## 2. 核心研究矛盾
实时控制任务通常要求微秒到毫秒级的确定性,大模型推理却会长时间占用 CPU、内存、总线、GPU 或 NPU,并产生排队、模型加载、KV Cache 和中断干扰。两类任务共存时,单纯提高模型吞吐不能说明系统适合实时场景。
因此,本研究不只考察“模型能跑多快”,而是同时回答三个问题:
1. 在 LLM 推理干扰下,1 ms 周期任务是否仍能满足截止期?
2. SylixOS 的资源隔离和调度机制能否改善尾延迟,同时避免过大的推理吞吐损失?
3. 在满足相同实时性和推理服务约束时,系统能否降低每 token 能耗?
## 3. 为什么建立四层硬件谱系
《基础设备.md》以可用内存或显存为主要分级维度,构建端、边、桌面和集群四个层级。这样可以观察系统瓶颈随硬件规模变化的过程:
| 层级 | 主要资源矛盾 | 研究重点 |
|---|---|---|
| T4 端级 | 内存和功耗预算非常紧张 | 极小资源下的实时任务保留能力 |
| T3 边级 | CPU、NPU/GPU 共享统一内存 | 带宽隔离、多模型竞争和功率模式 |
| T2 桌面级 | 多 GPU 共享 CPU、内存与互联 | NVLink 通信、多卡调度和并发公平性 |
| T1 集群级 | 节点内计算与节点间通信耦合 | RDMA/NCCL 抖动及跨节点调度 |
当前最重要的实测锚点是:
- RK3588 16 GB 作为 T3-L 边级平台;
- 同一 RK3588 施加 8 GB 内存预算,作为 T4-H 受限配置;
- 4×V100、128 GB 总显存服务器作为 T2-L 桌面级平台。
其余档位用于后续采购、扩容或云租后的条件扩展。现有设备负责产生核心证据,扩展设备用于验证规律能否跨硬件规模成立。
需要注意,RK3588 的 8 GB 限额配置只能用于研究内存预算变化,不能等同于真实 8 GB 板卡的功耗、物理带宽或热特性。
## 4. 为什么必须先做准入
设备可以启动,不代表加速器、模型和混合负载已经具备可比较条件。因此实验被划分为五个连续门槛:
| 门槛 | 核心检查内容 |
|---|---|
| G0 设备准入 | 启动、SMP、容量、接口和硬件拓扑 |
| G1 测量准入 | 单调时钟、周期任务、日志和功耗仪器 |
| G2 加速器准入 | CUDA、RKLLM、RKNN、驱动和基本算子 |
| G3 模型准入 | 模型转换、加载、正确推理和峰值内存 |
| G4 混合负载准入 | RT 与 LLM 同时稳定运行至少 30 分钟 |
只有通过 G4 的配置才能进入正式对照实验。准入失败本身也是研究结果,应记录为 BSP、驱动、模型格式或容量限制,不能用估计值补齐。
## 5. 如何保证对照公平
主对照包括普通 Linux、Linux PREEMPT_RT、SylixOS 默认配置和 SylixOS 优化配置。比较时需要固定:
- 模型版本、量化格式、tokenizer、输入长度、输出长度和随机种子;
- CPU 核数量、实时优先级、内存预算、加速器数量和频率策略;
- 推理请求到达序列、背景干扰强度、预热时间和测量窗口;
- 环境温度、散热条件、驱动与框架版本。
如果两个系统无法使用等价推理后端,结果应表述为“完整系统方案比较”,不能只归因于操作系统调度器。
## 6. 实验如何逐步展开
实验采用从简单到复杂的顺序:
1. E0 确认设备、测量和空载基线。
2. E1 测量实时任务唤醒、响应、IPC 和物理接口延迟。
3. E2 单独测量模型容量、TTFT、TPOT、吞吐和能耗。
4. E3 运行核心场景,即 1 ms 实时任务与 LLM 推理并发。
5. E4 比较 RK3588 的 16 GB 与 8 GB 预算配置。
6. E5 比较 V100 的 1、2、4 卡运行状态及公平性。
7. E6 分析温度、频率、功耗与性能耦合。
8. E7 逐项移除核隔离、IRQ 亲和、内存预分配、准入控制等机制,确认收益来源。
9. E8 对最终候选配置进行 24 小时长稳与恢复测试。
背景负载从仅实时任务、仅推理逐步增加到 RT+LLM、CPU/内存/I/O 干扰以及突发过载。这样可以确定系统在哪一个压力区间开始出现排队、降频或截止期违约。
## 7. 哪些指标构成核心证据
实时性证据包括 P50、P95、P99、P99.9、观测最大响应时间和截止期违约率。论文中的“实时保号”必须建立在截止期违约统计和完整样本量上,不能只比较平均延迟。
推理服务证据包括 TTFT、TPOT、成功请求吞吐、有效吞吐、成功率、超时率和拒绝率。有效吞吐只统计满足预先冻结服务约束的请求,防止通过拒绝请求或牺牲实时任务获得虚假吞吐优势。
功耗证据使用整机输入端功率测量,计算 J/token 和 tokens/J,并同时记录温度、实际频率和降频时间。GPU/NPU 软件遥测可以用于解释能耗来源,但不能代替整机功率计。
多卡和多节点实验还需要报告强扩展效率、弱扩展吞吐、通信尾延迟和多租户公平性。
## 8. 数据如何转化为论文贡献
实验数据最终对应三项贡献:
| 贡献 | 所需证据 | 对应论文内容 |
|---|---|---|
| C1 四层连续算力谱系评测 | 各档位的容量、功耗、瓶颈与扩展趋势 | 第3章硬件谱系、第7章结果、第8章跨档位分析 |
| C2 混合负载实时保号量化 | RT+LLM 下的尾延迟、违约率、有效吞吐和消融结果 | 第4章调度机制、第5章方法、第7章核心结果 |
| C3 可复现方法与基准对齐 | 统一输入、环境元数据、完整原始数据和外部基准复现 | 第5章方法学、第7章基准结果、第9章有效性威胁 |
文章的论证顺序应保持为:先说明为什么需要四层谱系,再说明 SylixOS 的调度机制和实验方法,然后给出结果,最后讨论优势产生的原因、适用范围和局限性。
## 9. 实测、计划与结论边界
论文中应严格区分以下三类内容:
- **实测结果**:已通过准入并完成实验的数据;
- **候选目标**:正式实验前冻结的服务或性能阈值;
- **扩展计划**:尚未获得设备、驱动或测量条件的实验。
设备标称 TOPS、TFLOPS、TDP 和模型预估 tokens/s 不能写成实验结果。FP16 TFLOPS 与 INT8 TOPS不能直接比较,多卡总显存也不能直接推导模型一定可运行。
24 小时无违约只能表述为“在指定工况和样本量下未观测到违约”,不能证明理论最坏情况。没有温箱数据时,也不能宣称已经验证 RK3588 的完整工业温区。
## 10. 最终闭环
这套研究的最终闭环不是追求某一平台的最高 tokens/s,而是寻找一条可重复验证的关系:
> 随着资源从端级扩展到集群级,SylixOS 的实时调度和资源隔离在什么负载范围内能显著改善实时任务确定性,这种改善需要付出多少吞吐和能耗代价,其优势又会在哪个硬件档位开始减弱。
如果数据支持该关系,就形成四层硬件谱系、混合负载实时保号和统一评测方法三项论文贡献;如果某些档位不支持,也应把适配失败、容量上限和优势消失的边界作为研究结论的一部分。
@@ -1,43 +0,0 @@
# 推理图任务调度参考
## 1. 与本项目的关系
本方向连接两类研究:一类是固定优先级、EDF、响应时间分析等经典实时调度理论;另一类是 LLM 服务中的连续批处理、prefill/decode 分离、分块 prefill 和 SLO 感知调度。本项目的增量应落在两者交叉处:把推理图阶段映射为可度量、可准入、可隔离的 RTOS 任务,同时保障关键周期任务。
## 2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| C. L. Liu, J. W. Layland, “Scheduling Algorithms for Multiprogramming in a Hard-Real-Time Environment,” JACM, 1973. [DOI](https://doi.org/10.1145/321738.321743) | A | 周期任务、固定优先级与 EDF 的理论基础 | 定义关键保障任务模型和可调度性讨论的起点 |
| N. Audsley et al., “Applying New Scheduling Theory to Static Priority Pre-emptive Scheduling,” 1993. [DOI](https://doi.org/10.1049/sej.1993.0034) | A | 含阻塞和释放抖动的固定优先级响应时间分析 | 为推理、中断与共享资源干扰进入 RTA 提供基础 |
| W. Yu et al., “Orca: A Distributed Serving System for Transformer-Based Generative Models,” OSDI 2022. [USENIX](https://www.usenix.org/conference/osdi22/presentation/yu) | A | 迭代级调度和连续批处理 | 作为 LLM 服务调度基线,不作为实时保证 |
| W. Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention,” SOSP 2023. [arXiv](https://arxiv.org/abs/2309.06180) | A/B | 请求调度与 KV 分页耦合、吞吐提升 | 支撑调度与内存联合设计及 vLLM 对照 |
| A. Agrawal et al., “Taming Throughput-Latency Tradeoff in LLM Inference with Sarathi-Serve,” OSDI 2024. [USENIX](https://www.usenix.org/conference/osdi24/presentation/agrawal) | A | 分块 prefill、decode 干扰与吞吐—时延权衡 | 支撑 prefill 可分段化和关键任务插入点设计 |
| Y. Zhong et al., “DistServe: Disaggregating Prefill and Decoding for Goodput-optimized Large Language Model Serving,” OSDI 2024. [USENIX](https://www.usenix.org/conference/osdi24/presentation/zhong-yinmin) | A | TTFT/TPOT 双 SLO、prefill/decode 解耦和 goodput | 对应本项目 TTFT、TPOT 和有效吞吐联合门槛 |
## 3. 扩展参考
| 资料 | 关注点 |
|---|---|
| A. Gujarati et al., “Serving DNNs like Clockwork: Performance Predictability from the Bottom Up,” OSDI 2020. [USENIX](https://www.usenix.org/conference/osdi20/presentation/gujarati) | DNN 推理可预测性、受控执行和 deadline-aware 调度 |
| A. Agrawal et al., “SARATHI: Efficient LLM Inference by Piggybacking Decodes with Chunked Prefills,” 2023. [arXiv](https://arxiv.org/abs/2308.16369) | prefill 分块、decode-maximal batching 与流水线气泡 |
## 4. 可形成的论文论点
1. 把 `prefill/decode/postprocess` 从服务框架内部阶段提升为可被 RTOS 观测和治理的任务图节点。
2. 比较固定优先级、EDF、混合优先级和准入控制在双目标场景下的边界。
3. 以满足 `TTFT + TPOT + 关键任务 deadline` 的有效吞吐,而不是总 tokens/s,作为调度目标。
4. 分析推理阶段不可抢占区间、驱动提交和完成中断对 RTA 的附加阻塞项。
## 5. 对应证据与实验
- 指标:`TTFT`、`TPOT`、端到端时延、有效吞吐、关键任务 `P99.9/Max`、违约率。
- 场景:L1、L2、L3、L5、L7。
- 对照:FCFS/默认批处理、连续批处理、分块 prefill、完整 RTOS 方案及消融。
- 关键边界:GPU/NPU 内核通常不能被 CPU 调度器直接细粒度抢占,必须实测设备与驱动行为。
## 6. 不应直接推出的结论
- 云端 LLM 系统的 SLO 达标不等于硬实时保证。
- 平均 tokens/s 提升不能说明关键保障任务更可预测。
- RTA 中的执行时间和阻塞项若未经目标硬件测量,不能作为安全上界。
@@ -1,41 +0,0 @@
# KV Cache 与内存管理参考
## 1. 与本项目的关系
KV Cache 同时影响容量、内存带宽、请求并发和尾延迟。在 RTOS 场景中,研究重点不是单纯提高缓存命中率,而是控制动态分配、换入换出、DMA 和回收行为对关键任务造成的不可预测干扰。
## 2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| W. Kwon et al., “Efficient Memory Management for Large Language Model Serving with PagedAttention,” SOSP 2023. [arXiv](https://arxiv.org/abs/2309.06180) | A/B | 块式 KV 分配、碎片控制、共享与调度耦合 | 作为分页池设计和 vLLM 基线 |
| Y. Sheng et al., “FlexGen: High-Throughput Generative Inference of Large Language Models with a Single GPU,” ICML 2023. [PMLR](https://proceedings.mlr.press/v202/sheng23a.html) | A | GPU/CPU/存储分层放置与 I/O 调度 | 支撑分层 KV/权重放置,但需强调其吞吐导向 |
| Z. Zhang et al., “H2O: Heavy-Hitter Oracle for Efficient Generative Inference of Large Language Models,” NeurIPS 2023. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2023/hash/6ceefa7b15572587b78ecfcebb2827f8-Abstract.html) | A | 基于重要 token 的 KV 淘汰及质量影响 | 用于“容量—质量—时延”三目标实验 |
| W. Lee et al., “InfiniGen: Efficient Generative Inference of Large Language Models with Dynamic KV Cache Management,” OSDI 2024. [USENIX](https://www.usenix.org/conference/osdi24/presentation/lee) | A | KV 预取、CPU offload、动态池管理 | 对应 CPU—加速器带宽与预取干扰研究 |
| P. Patel et al., “vAttention: Dynamic Memory Management for Serving LLMs without PagedAttention,” 2024. [arXiv](https://arxiv.org/abs/2405.04437) | B | 利用虚拟内存保持逻辑连续、比较分页内核复杂度 | 作为 PagedAttention 的替代路线和消融参考 |
## 3. 研究问题映射
| 本项目问题 | 参考资料启发 | 必须补充的 RTOS 证据 |
|---|---|---|
| 内存池预分配是否减少尾延迟 | PagedAttention 的块式管理 | 分配路径时延、关键任务 `P99.9/Max`、碎片率 |
| KV 换出是否可控 | FlexGen、InfiniGen | DMA/内存带宽竞争、外部接口响应和违约率 |
| KV 淘汰如何影响可用性 | H2O | 固定题集质量、输出可用率、恢复到全量 KV 的开销 |
| 多请求是否相互污染 | 分页与共享机制 | 每租户上限、OOM 隔离、Jain 指数和逐租户 SLO |
| B8/B16 容量边界 | 各类压缩/分页工作 | 峰值驻留集、KV 增长曲线、首次失败点和错误类型 |
## 4. 建议实验变量
- KV 块大小、内存池大小、预分配比例和保留余量;
- 上下文长度、并发度、输出长度和突发到达;
- GPU/NPU 本地、主存和存储三级放置;
- 淘汰策略:LRU、近期 token、重要 token、固定配额;
- 是否锁页、是否异步预取、DMA 并发数和带宽限额。
输出至少包括峰值内存、碎片率、分配失败率、KV 迁移字节数、带宽、`TTFT/TPOT`、质量、关键任务尾延迟和 OOM 恢复行为。
## 5. 不应直接推出的结论
- 内存占用减少不必然降低端到端时延;压缩、索引和搬移可能增加尾延迟。
- 论文中的 perplexity 或准确率保持不代表任务关键应用输出可用。
- Linux/CUDA 的虚拟内存和 UVM 机制不能假定在 SylixOS、NPU SDK 或受限 SoC 上等价存在。
@@ -1,54 +0,0 @@
# 加速器协同调度参考
## 1. 与本项目的关系
本方向研究 CPU 调度、驱动提交、DMA、GPU/NPU 执行和完成中断组成的完整链路。核心是识别哪些环节受 RTOS 控制,哪些环节只受厂商运行时或固件控制,并通过端到端时间戳验证协同效果。
## 2. 核心资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| NVIDIA, “CUDA Programming Guide: Asynchronous Execution, Streams and Events.” [官方文档](https://docs.nvidia.com/cuda/cuda-programming-guide/02-basics/asynchronous-execution.html) | A | 流、事件、同步、并发和优先级语义 | 定义 CUDA 路线中的提交和同步边界 |
| NVIDIA, “CUDA Programming Guide: Unified Memory.” [官方文档](https://docs.nvidia.com/cuda/cuda-programming-guide/04-special-topics/unified-memory.html) | A | CPU/GPU 统一内存、迁移及流关联 | 解释缺页/迁移引入的不确定性,不能替代实测 |
| Z. Bai et al., “PipeSwitch: Fast Pipelined Context Switching for Deep Learning Applications,” OSDI 2020. [USENIX](https://www.usenix.org/conference/osdi20/presentation/bai) | A | GPU 应用切换、模型传输与执行流水化 | 支撑多模型共享和切换开销研究 |
| A. Gujarati et al., “Serving DNNs like Clockwork,” OSDI 2020. [USENIX](https://www.usenix.org/conference/osdi20/presentation/gujarati) | A | 可预测 GPU 推理、执行时间建模和准入 | 作为加速器可预测性相邻工作 |
| Y. Choi, M. Rhu, “PREMA: A Predictive Multi-task Scheduling Algorithm for Preemptible Neural Processing Units,” HPCA 2020. [DOI](https://doi.org/10.1109/HPCA47549.2020.00030) | A | 可抢占 NPU 多任务预测调度 | 支撑 NPU 细粒度抢占的研究假设,需检查实际硬件支持 |
| MLCommons, “MLPerf Inference.” [官方文档](https://docs.mlcommons.org/inference/index_gh/) | A | Edge/Datacenter 场景、负载发生和准确率约束 | 用于外部性能方法对齐,不替代双目标测试 |
## 3. 硬件路线需单独核对的官方资料
- NVIDIA:CUDA Toolkit、驱动、MPS/MIG、DCGM 与 NCCL 对应版本文档;
- Rockchip:RKNN Toolkit2、RKLLM、RKNPU2 Runtime 与对应芯片技术参考;
- 其他 NPU/GPU:运行时队列、优先级、超时、复位、DMA 和性能计数器文档;
- SylixOS:BSP、中断、DMA、一致性、IOMMU 和驱动接口资料。
闭源资料若不能公开引用,应在论文中描述可复现的外部行为,不披露受限内容。
## 4. 建议链路分解
```text
请求到达
→ CPU 预处理
→ 驱动/运行时提交
→ DMA/内存迁移
→ 加速器排队
→ kernel/NPU task 执行
→ 完成中断
→ CPU 后处理
→ 外部输出
```
每段都应有时间戳或外部观测点。设备事件只能衡量设备域执行,不能替代 CPU 到结果可用的端到端时延。
## 5. 可形成的论文论点
1. RTOS 可通过 CPU/IRQ 亲和性、队列限长、预分配和准入减少主机侧不确定性。
2. 加速器运行时不提供硬优先级保证时,RTOS 的收益会受设备不可抢占区间限制。
3. 异步流水可能提高吞吐,但需要同时检查关键任务尾延迟、内存带宽和中断干扰。
4. 多加速器扩展需分开报告单请求并行、多实例吞吐与通信开销。
## 6. 不应直接推出的结论
- CUDA stream priority 是调度提示,不是硬实时保证。
- GPU 支持并发 kernel 不代表特定工作负载必然并发执行。
- 加速器利用率高不等于有效吞吐高,也不等于关键任务 deadline 达标。
@@ -1,44 +0,0 @@
# 量化与精度感知调度参考
## 1. 与本项目的关系
本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。
## 2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. [OpenReview](https://openreview.net/forum?id=tcbBPnfwxS) | A | 基于近似二阶信息的低比特权重量化 | 作为 3/4-bit PTQ 方法基线 |
| G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. [PMLR](https://proceedings.mlr.press/v202/xiao23c.html) | A | W8A8、激活离群值平滑、硬件效率 | 作为 INT8 权重—激活量化基线 |
| J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2024/hash/42a452cbafa9dd64e9ba4aa95cc1ef21-Abstract-Conference.html) | A | 面向端侧的激活感知权重量化 | 对应 T5/T4/T3 设备端路线 |
| T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2022/hash/c3ba4962c05c49636d4c6206a97e9c8a-Abstract-Conference.html) | A | 激活离群值与混合精度分解 | 支撑异常通道和精度保持讨论 |
| T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1feb87871436031bdc0f2beaa62a049b-Abstract.html) | A | NF4、双重量化和分页优化器 | 主要用于背景;本项目若不训练,不作为主实验 |
| Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2025/hash/fbe2b2f74a2ece8070d8fb073717bda6-Abstract-Conference.html) | A | 权重、激活和 KV 联合低比特系统设计 | 支撑量化与内存/内核协同研究 |
## 3. 精度感知调度应补足的研究空白
现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答:
- 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值;
- 动态切换期间关键保障负载是否出现尾延迟峰值;
- 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小;
- 质量门槛、实时门槛和功耗门槛能否同时满足;
- 对不同风险等级请求,能否采用不同的可接受精度下限。
## 4. 建议实验矩阵
| 维度 | 建议取值 |
|---|---|
| 精度 | FP16/BF16、INT8、INT4;仅测试后端真实支持项 |
| 模型变量 | 同一模型修订、同一 tokenizer、同一输入与解码参数 |
| 质量 | 固定题集、perplexity/准确率/F1/任务判分、输出可用率 |
| 性能 | TTFT、TPOT、端到端时延、有效吞吐 |
| 系统 | 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟 |
| 调度 | 静态精度、基于 deadline 的精度、基于热/功耗预算的精度 |
## 5. 不应直接推出的结论
- 权重压缩比不能替代整机内存、速度或能效实测。
- perplexity 接近不等于所有任务质量和安全性等价。
- 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。
- 动态精度调度若未测切换开销,不能宣称适合实时路径。
@@ -1,54 +0,0 @@
# 中断与实时性保障参考
## 1. 与本项目的关系
本方向为论文的“可保障性”提供理论和系统基础,覆盖固定优先级响应时间、共享资源阻塞、优先级倒置、中断线程化、CPU/IRQ 亲和性以及外部闭环测量。
## 2. 经典理论资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| C. L. Liu, J. W. Layland, “Scheduling Algorithms for Multiprogramming in a Hard-Real-Time Environment,” 1973. [DOI](https://doi.org/10.1145/321738.321743) | A | RMS/EDF 与周期任务基础 | 建立基本任务模型 |
| L. Sha, R. Rajkumar, J. P. Lehoczky, “Priority Inheritance Protocols: An Approach to Real-Time Synchronization,” IEEE TC, 1990. [DOI](https://doi.org/10.1109/12.57058) | A | 优先级继承、优先级上限与有界阻塞 | 支撑锁竞争和优先级倒置分析 |
| N. Audsley et al., “Applying New Scheduling Theory to Static Priority Pre-emptive Scheduling,” 1993. [DOI](https://doi.org/10.1049/sej.1993.0034) | A | 含阻塞和抖动的精确固定优先级分析 | 构建含 IRQ/驱动阻塞的 RTA |
| K. Tindell, A. Burns, A. Wellings, “An Extendible Approach for Analyzing Fixed Priority Hard Real-Time Tasks,” Real-Time Systems, 1994. [DOI](https://doi.org/10.1007/BF01088593) | A | 固定优先级分析扩展 | 用于更复杂任务和通信分析 |
## 3. 内核与测量资料
| 资料 | 等级 | 可支撑内容 |
|---|---|---|
| Linux Kernel, “PREEMPT_RT Theory of Operation.” [官方文档](https://docs.kernel.org/core-api/real-time/theory.html) | A | 可抢占锁、rtmutex、优先级继承和线程化中断 |
| Linux Kernel, “How realtime kernels differ.” [官方文档](https://docs.kernel.org/core-api/real-time/differences.html) | A | 普通 Linux 与 PREEMPT_RT 的内核语义差异 |
| Linux Foundation Real-Time Linux, “Cyclictest.” [官方文档](https://wiki.linuxfoundation.org/realtime/documentation/howto/tools/cyclictest/start) | A/B | 唤醒延迟工具、参数、限制和最大值解释 |
| Linux `rt-tests` 项目. [kernel.org](https://git.kernel.org/pub/scm/utils/rt-tests/rt-tests.git/) | B | cyclictest、hwlatdetect 等实现与版本记录 |
## 4. 本项目分析框架
关键任务响应时间可写为:
```text
R_i = C_i + B_i + I_irq,i + I_sched,i
+ sum(ceil((R_i + J_h) / T_h) * C_h)
```
其中 `C_i` 是自身执行时间,`B_i` 是共享资源阻塞,`I_irq,i` 是中断与驱动干扰,`I_sched,i` 是调度器和不可抢占区间干扰,求和项是高优先级任务干扰。该式只用于组织分析;每个项的取值和适用假设必须单独验证。
实测至少覆盖:
- 计划释放、就绪、开始和完成时间;
- 唤醒延迟、响应时间、完成抖动、违约率和观测最大值;
- IRQ 数量、处理时间、CPU 亲和性和最长关中断区间;
- 推理提交、DMA 和完成中断与关键任务峰值的时间关联;
- GPIO/CAN/RS485/网络外部回路端到端时延。
## 5. 对照与消融
- O0 普通 Linux、O1 PREEMPT_RT、O2 SylixOS 默认、O3 SylixOS 优化、必要时 O4 等预算调优;
- 逐项去除 CPU 隔离、IRQ 亲和性、优先级继承、内存预分配和推理准入;
- 同时报人工智能有效吞吐代价,避免通过饿死推理任务获得低抖动。
## 6. 不应直接推出的结论
- cyclictest 测得的是特定路径的唤醒延迟,通常不等于业务任务完整响应时间。
- 实测最大值不是 WCET;零违约不是硬实时证明。
- PREEMPT_RT 和专用 RTOS 的机制差异必须通过等价任务语义比较,不能只比较工具默认输出。
@@ -1,51 +0,0 @@
# 能耗与热管理参考
## 1. 与本项目的关系
本方向关注满足人工智能和关键实时约束时的能效,而不是脱离任务完成质量的最低功率。功率、温度、频率、有效吞吐和违约必须使用对齐的时间窗口联合分析。
## 2. 核心资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| MLCommons, “MLPerf Inference Power Measurement.” [官方文档](https://docs.mlcommons.org/inference/power/) | A | 外部功率分析仪、PTDaemon、测量窗口和配置 | 设计整机功耗采集链路 |
| MLCommons, “MLPerf Inference Benchmark Suite.” [官方文档](https://docs.mlcommons.org/inference/index_gh/) | A | Edge/Datacenter 场景、性能与准确率约束 | 对齐负载发生和结果报告方法 |
| SPEC, “SPECpower_ssj2008.” [官方资料](https://www.spec.org/osg/power_ssj2008/) | A | AC 输入功率—性能联合测量、负载档位 | 借鉴整机边界和多负载点报告 |
| W. Huang et al., “HotSpot: A Compact Thermal Modeling Methodology for Early-Stage VLSI Design,” IEEE TVLSI, 2006. [DOI](https://doi.org/10.1109/TVLSI.2006.876103) | A | 热 RC 模型、瞬态与稳态温度 | 支撑热动态建模背景,不替代板级传感器实测 |
| NVIDIA, “DCGM Field Identifiers.” [官方文档](https://docs.nvidia.com/datacenter/dcgm/latest/dcgm-api/dcgm-api-field-ids.html) | A | GPU 功率、能量、温度、频率和降频原因 | V100/H100 路线的设备侧归因数据 |
## 3. 统一计算口径
```text
E_total = integral(P(t), t0, t1)
E/token = E_total / N_output
effective_E/token = E_total / N_qualified_output
tokens/J = N_output / E_total
throttling_ratio = throttled_time / valid_measurement_time
```
主结果使用整机输入端测量。设备遥测只作归因;TDP、标称功耗和电源额定值不能替代实测。`N_output=0` 时能效不可计算。
## 4. 建议实验
1. 空闲、prefill、decode 和混合负载分阶段功率曲线;
2. 25/50/75/100% 负载下的温度—频率—性能耦合;
3. 不同固定频率/DVFS/功耗上限下的 `E/token` 与 deadline miss;
4. 冷态、热稳态和 24 h 后的 TTFT/TPOT、吞吐与关键任务尾延迟;
5. 降频前后同一到达流的有效吞吐变化;
6. O0~O4 在相同双目标门槛下的能效比较。
每次运行记录环境温度、散热方式、风扇策略、功率计型号、量程、精度和采样率。
## 5. 可形成的论文论点
- RTOS 的准入、空闲管理和频率策略可能降低无效执行和失败请求的能耗。
- 更低精度或更高并发可能降低 `J/token`,但热饱和后可能扩大尾延迟和违约率。
- 应寻找满足双目标约束的 Pareto 前沿,而不是独立最小化功率或最大化吞吐。
## 6. 不应直接推出的结论
- 芯片遥测功率不能代表整机功率。
- 短时冷态跑分不能代表热稳态或 24 h 性能。
- 更低平均功率不等于更低任务能耗;运行时间延长可能提高总能量。
- 未取得温箱数据时不能宣称覆盖全温域。
@@ -1,66 +0,0 @@
# 方法论与评估工具链参考
## 1. 与本项目的关系
本方向决定实验结果能否复现、能否公平比较,以及能否从“跑分差异”上升为“RTOS 双目标保障边界”的研究结论。
## 2. 核心资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| J. Dean, L. A. Barroso, “The Tail at Scale,” CACM, 2013. [Google Research](https://research.google/pubs/the-tail-at-scale/) | A | 大规模系统尾延迟的来源和重要性 | 支撑 P99/P99.9 而非均值作为核心证据 |
| V. J. Reddi et al., “MLPerf Inference Benchmark,” 2019. [arXiv](https://arxiv.org/abs/1911.02549) | A/B | 标准负载发生、场景、准确率与性能方法 | 作为 AI 基准方法学参照 |
| MLCommons, “MLPerf Inference Submission Guide.” [官方文档](https://docs.mlcommons.org/inference/submission/) | A | LoadGen、系统描述、Closed/Open division 和可比性 | 设计外部基准对齐和 manifest |
| ACM, “Artifact Review and Badging.” [官方政策](https://www.acm.org/publications/policies/artifact-review-and-badging-current) | A | 可用、可运行、可复用与结果复现 | 规划代码、数据和复现包 |
| Linux Foundation Real-Time Linux, “Cyclictest.” [官方文档](https://wiki.linuxfoundation.org/realtime/documentation/howto/tools/cyclictest/start) | A/B | RT 延迟测试设计、参数和限制 | 作为 Linux 辅助基线及测量避坑依据 |
| R. Jain, D.-M. Chiu, W. Hawe, “A Quantitative Measure of Fairness and Discrimination,” DEC TR-301, 1984. [PDF](https://www.cse.wustl.edu/~jain/papers/ftp/fairness.pdf) | A/B | Jain 公平指数 | 多租户相对独占吞吐公平性 |
## 3. 本项目最低方法要求
### 3.1 公平对照
冻结模型修订、tokenizer、量化文件、输入/输出、到达序列、随机种子、硬件、核心数、内存预算、加速器数、功耗策略和散热条件。无法使用同一推理后端时,区分“OS 调度效应”和“整套软件栈效应”。
### 3.2 样本与重复
- 普通性能单元至少 5 次独立运行;
- 请求级 P99.9 以至少 10 万有效请求为目标,样本不足则降级为 P99 或标为探索性;
- 1 ms 周期任务记录计划释放数、缺失数和全部违约;
- 长稳运行 24 h,保留完整时间序列;
- 跨运行使用中位数、区间及按运行/时间块 bootstrap。
### 3.3 失败处理
拒绝、超时、OOM、重启、日志中断和测量失败必须保留并分类。只有仪器、程序或配置失效的批次可标为无效,且需保留原文件和原因。
### 3.4 三层证据
```text
AI 目标负载:TTFT/TPOT/端到端/质量/可用性
关键保障负载:违约率/P99.9/Max/外部闭环
系统协同:有效吞吐/E-token/热/公平/恢复/24 h
```
任何“更优”结论都必须说明另外两层是否仍达标。
## 4. 工具链建议
| 目的 | 工具或方式 | 注意事项 |
|---|---|---|
| OS 跟踪 | SylixOS trace、ftrace、perf、事件日志 | 统一事件语义,不直接比较工具自身字段 |
| RT 辅助测试 | rt-tests/cyclictest、GPIO 打点 | cyclictest 不等于业务端到端响应 |
| 加速器分析 | CUDA profiler/DCGM、RKNN/RKLLM 日志 | 版本固定;设备事件只作阶段分解 |
| 外部时序 | 示波器、逻辑分析仪、CAN/RS485 分析仪 | 保存探头、触发、分辨率和空回路基线 |
| 功率与热 | 外部功率计/PDU、板载温度与频率 | 时间窗口对齐,遥测不替代整机功率 |
| 分析 | R/Python、bootstrap、CDF/ECDF、时间序列 | 不静默删异常,不把相关样本当独立样本 |
## 5. 推荐数据结构
每次运行保留 `manifest.json`、`requests.csv`、`rt.csv`、`power.csv`、`thermal.csv`、`events.log` 和 `summary.json`。原始数据只读保存,图表和摘要由版本化脚本生成。
## 6. 不应直接推出的结论
- 统计显著不等于工程差异重要,应同时报告效应量与阈值。
- 单次最佳结果不能代表配置能力。
- 公开基准与本项目负载语义不同,只能用于方法对齐或外部锚点。
- 未完成的 T5~T1 档位必须标为计划,不能与实测数据连成“连续规律”。
@@ -1,57 +0,0 @@
# 标准与工程资料参考
## 1. 文档定位
本文件列出论文方向可能涉及但不应与学术论文混为一谈的标准、官方工程文档和安全边界资料。标准是否适用取决于最终行业场景、系统边界和认证目标。
## 2. 功能安全与任务关键系统
| 标准/资料 | 适用范围 | 本项目可能的关系 |
|---|---|---|
| IEC 61508, *Functional safety of electrical/electronic/programmable electronic safety-related systems* | 通用功能安全 | 定义安全生命周期、SIL 和证据要求;本项目不应在未认证时宣称合规 |
| ISO 26262, *Road vehicles — Functional safety* | 道路车辆 | 若落到车载控制与 AI 辅助功能,可用于场景和安全目标分解 |
| ISO/PAS 8800, *Road vehicles — Safety and artificial intelligence* | 车载 AI 安全 | 用于 AI 输出不确定性、数据和安全论证背景 |
| DO-178C | 航空机载软件 | 若研究航空部署,可参考软件保证等级和验证独立性 |
| ARINC 653 | 航空综合模块化系统分区 | 支撑时间/空间分区的相邻工程背景 |
| IEC 62443 系列 | 工业自动化与控制系统安全 | 涉及联网工业控制时补充网络安全边界 |
正式引用应从 IEC、ISO、RTCA、EUROCAE、SAE 或 ARINC 的标准目录核对版本与访问权限。标准通常受版权保护,本仓库只保存条目和适用性说明,不复制正文。
## 3. 实时通信与时间同步
| 标准/资料 | 作用 | 使用边界 |
|---|---|---|
| IEEE 802.1AS | 广义精确时间协议 | 跨设备单向时延需要同步精度证据 |
| IEEE 802.1Qbv | 时间感知整形 | 可用于 TSN 周期流量窗口规划 |
| IEEE 802.1Qbu / IEEE 802.3br | 帧抢占 | 分析关键流量受大帧阻塞的边界 |
| IEEE 1588 | 精确时间协议 | 记录 grandmaster、硬件时间戳和误差 |
| CAN/CAN FD、RS-485 对应规范 | 工业接口 | 固定波特率、帧长、总线负载和时间戳位置 |
## 4. 操作系统与处理器接口资料
- Linux PREEMPT_RT 官方文档:[Real-time preemption](https://docs.kernel.org/core-api/real-time/index.html)。
- POSIX 实时扩展:线程调度、时钟、定时器、内存锁定和优先级协议;需按目标 OS 支持集核对。
- Arm 架构、GIC、SMMU 和缓存一致性官方手册:用于解释中断路由、DMA 和共享内存边界。
- PCIe、IOMMU、NVLink、NCCL 等规范或官方文档:用于多加速器/多节点通信路径。
- SylixOS BSP/API/驱动资料:用于确认优先级、中断、内存、设备复位和追踪接口的实际能力。
## 5. 基准与测量规范
| 资料 | 可借鉴内容 |
|---|---|
| [MLPerf Inference](https://docs.mlcommons.org/inference/index_gh/) | 场景、负载发生、准确率约束、系统描述与结果合规 |
| [MLPerf Power](https://docs.mlcommons.org/inference/power/) | 外部仪器、时间同步、测量窗口与功率记录 |
| [SPECpower_ssj2008](https://www.spec.org/osg/power_ssj2008/) | 整机 AC 功率、多个负载档位与功效比 |
| [ACM Artifact Review and Badging](https://www.acm.org/publications/policies/artifact-review-and-badging-current) | 可用、可运行、可复用和结果复现证据 |
## 6. 论文中的合规表述
建议使用:
> 本研究借鉴相关标准中的任务关键性、时间/空间隔离和测量原则,但实验平台与研究原型未经过相应行业认证,因此结果不构成功能安全等级、适航或产品合规声明。
避免使用:
- “满足 SIL2/SIL3”——除非完成规定流程并取得正式证据;
- “达到航空级/车规级”——除非硬件、软件、流程和环境均符合对应标准;
- “证明硬实时安全”——除非有完整时序模型、可信 WCET、可调度性证明和覆盖充分的验证证据。

Some files were not shown because too many files have changed in this diff Show More