forked from eaiadmin/rtos_llm_opt
docs: add alternative real-time research frameworks
This commit is contained in:
@@ -0,0 +1,67 @@
|
||||
# 实验设计
|
||||
|
||||
## 1. 对照组
|
||||
|
||||
| 编号 | 系统配置 | 作用 |
|
||||
|---|---|---|
|
||||
| A0 | 普通 Linux:控制与大脑负载同域 | 通用基线 |
|
||||
| A1 | PREEMPT_RT Linux:控制与大脑负载同域 | 实时 Linux 基线 |
|
||||
| A2 | RTOS 小脑 + Linux 大脑,基础分区 | 分域基线 |
|
||||
| A3 | A2 + CPU/IRQ/内存/IPC 治理 | 完整方案 |
|
||||
| A4 | A3 + 超时、降级和故障恢复 | 安全协同方案 |
|
||||
|
||||
对照固定机器人控制任务、AI 模型、输入到达序列、硬件频率和功率策略。若推理后端不同,结果表述为系统方案比较,不单独归因于内核。
|
||||
|
||||
## 2. 负载场景
|
||||
|
||||
| 场景 | 内容 | 目的 |
|
||||
|---|---|---|
|
||||
| L0 | 仅小脑控制 | 实时性下界 |
|
||||
| L1 | 仅大脑推理 | 推理容量与功耗基线 |
|
||||
| L2 | 控制 + 感知/大模型 | 核心共存场景 |
|
||||
| L3 | L2 + CPU/内存压力 | 共享资源干扰 |
|
||||
| L4 | L2 + 摄像头/网络/存储 I/O | IRQ 与 DMA 干扰 |
|
||||
| L5 | L2 + 突发请求和过载 | 队列与准入边界 |
|
||||
| L6 | L2 长时间运行至热稳态 | 功耗和降频耦合 |
|
||||
| L7 | 进程、域、加速器和通信故障 | 隔离、降级与恢复 |
|
||||
|
||||
## 3. 控制任务
|
||||
|
||||
至少包含:
|
||||
|
||||
- 高频周期控制任务;
|
||||
- 状态估计或轨迹跟踪任务;
|
||||
- 关键 I/O 或 GPIO 回环;
|
||||
- 安全监控与回退任务。
|
||||
|
||||
无真实机器人时,先使用硬件在环、倒立摆、电机台架或确定性控制负载;不得仅用空循环替代全部控制语义。
|
||||
|
||||
## 4. 大脑任务
|
||||
|
||||
按平台能力选择视觉、VLM、VLA 或 LLM。大脑输出必须转换为结构化技能命令。分别扫描:
|
||||
|
||||
- 请求率和突发强度;
|
||||
- 模型规模、输入长度和输出长度;
|
||||
- batch、队列长度与并发;
|
||||
- GPU/NPU 利用率;
|
||||
- 感知数据大小和通信频率。
|
||||
|
||||
## 5. 故障注入
|
||||
|
||||
依次实施:推理进程退出、请求永久阻塞、消息乱序或损坏、队列溢出、Linux 域重启、加速器错误。设备级故障只在具备可恢复路径时开展。
|
||||
|
||||
记录故障发生、检测、回退、隔离、重启和首个恢复结果的完整时间线。
|
||||
|
||||
## 6. 实施顺序
|
||||
|
||||
1. 冻结控制 deadline、大脑结果期限和回退期限。
|
||||
2. 完成 A0/A1 的同域基线。
|
||||
3. 建立 A2 基础分域和最小 IPC。
|
||||
4. 扫描 CPU、内存、I/O 和热干扰。
|
||||
5. 加入 A3 治理机制并逐项消融。
|
||||
6. 加入 A4 故障状态机并开展故障注入。
|
||||
7. 进行长稳实验和独立确认批次。
|
||||
|
||||
## 7. 最小闭环
|
||||
|
||||
一台具备 RTOS/Linux 分域条件的边缘平台、一个可测量的控制任务和一个真实 AI 大脑负载,即可形成最小验证闭环,不要求扩展到工作站或集群。
|
||||
@@ -0,0 +1,60 @@
|
||||
# 指标与证据
|
||||
|
||||
## 1. 小脑控制实时性
|
||||
|
||||
- 周期任务释放、开始和完成时间;
|
||||
- 响应时间与完成抖动;
|
||||
- P50/P95/P99/P99.9 和观测最大值;
|
||||
- deadline miss ratio,报告分子与分母;
|
||||
- 外部输入到执行器输出的物理链路时延;
|
||||
- 过载、热稳态和故障期间的控制表现。
|
||||
|
||||
## 2. 大脑结果可用性
|
||||
|
||||
- 大小脑端到端决策时延;
|
||||
- deadline-hit ratio;
|
||||
- 结果新鲜度合格率;
|
||||
- 超时、过期、乱序、损坏和拒绝率;
|
||||
- 模型任务质量与置信度;
|
||||
- 大脑不可用时的回退发生率。
|
||||
|
||||
## 3. 跨域与隔离代价
|
||||
|
||||
- IPC 单向/往返延迟及尾部;
|
||||
- 拷贝次数、CPU 开销和队列占用;
|
||||
- 静态保留的 CPU、内存和设备资源;
|
||||
- 分域前后的推理有效吞吐和能效;
|
||||
- Linux 满载相对小脑空载的控制延迟增量;
|
||||
- LLC、DRAM、I/O 和热压力的敏感度。
|
||||
|
||||
## 4. 故障与恢复
|
||||
|
||||
- 故障检测时间;
|
||||
- 回退完成时间;
|
||||
- 域隔离和重启时间;
|
||||
- 故障窗口内控制违约数;
|
||||
- 恢复后首个有效大脑结果时间;
|
||||
- 是否出现不可恢复故障或错误动作。
|
||||
|
||||
## 5. 联合判定
|
||||
|
||||
系统配置只有同时满足下列条件才算有效:
|
||||
|
||||
```text
|
||||
控制任务满足期限
|
||||
AND 大脑结果达到规定的按期率与质量
|
||||
AND 超时结果不会进入执行路径
|
||||
AND 故障时在期限内完成回退
|
||||
AND 资源和能耗代价可接受
|
||||
```
|
||||
|
||||
平均推理时延降低但控制违约增加,不构成系统实时性改善;控制零违约但所有 AI 请求都被拒绝,也不构成有效协同。
|
||||
|
||||
## 6. 推荐核心图表
|
||||
|
||||
1. 大脑负载强度—控制违约率—结果按期率可行域;
|
||||
2. 单域与分域方案的控制尾延迟对比;
|
||||
3. CPU、内存、I/O 和热干扰消融图;
|
||||
4. 跨域时序分解图;
|
||||
5. 大脑故障期间控制时间序列;
|
||||
6. 静态资源预留与推理有效吞吐 Pareto 曲线。
|
||||
Reference in New Issue
Block a user