Files

2.6 KiB

实验设计

1. 对照组

编号 系统配置 作用
A0 普通 Linux:控制与大脑负载同域 通用基线
A1 PREEMPT_RT Linux:控制与大脑负载同域 实时 Linux 基线
A2 RTOS 小脑 + Linux 大脑,基础分区 分域基线
A3 A2 + CPU/IRQ/内存/IPC 治理 完整方案
A4 A3 + 超时、降级和故障恢复 安全协同方案

对照固定机器人控制任务、AI 模型、输入到达序列、硬件频率和功率策略。若推理后端不同,结果表述为系统方案比较,不单独归因于内核。

2. 负载场景

场景 内容 目的
L0 仅小脑控制 实时性下界
L1 仅大脑推理 推理容量与功耗基线
L2 控制 + 感知/大模型 核心共存场景
L3 L2 + CPU/内存压力 共享资源干扰
L4 L2 + 摄像头/网络/存储 I/O IRQ 与 DMA 干扰
L5 L2 + 突发请求和过载 队列与准入边界
L6 L2 长时间运行至热稳态 功耗和降频耦合
L7 进程、域、加速器和通信故障 隔离、降级与恢复

3. 控制任务

至少包含:

  • 高频周期控制任务;
  • 状态估计或轨迹跟踪任务;
  • 关键 I/O 或 GPIO 回环;
  • 安全监控与回退任务。

无真实机器人时,先使用硬件在环、倒立摆、电机台架或确定性控制负载;不得仅用空循环替代全部控制语义。

4. 大脑任务

按平台能力选择视觉、VLM、VLA 或 LLM。大脑输出必须转换为结构化技能命令。分别扫描:

  • 请求率和突发强度;
  • 模型规模、输入长度和输出长度;
  • batch、队列长度与并发;
  • GPU/NPU 利用率;
  • 感知数据大小和通信频率。

5. 故障注入

依次实施:推理进程退出、请求永久阻塞、消息乱序或损坏、队列溢出、Linux 域重启、加速器错误。设备级故障只在具备可恢复路径时开展。

记录故障发生、检测、回退、隔离、重启和首个恢复结果的完整时间线。

6. 实施顺序

  1. 冻结控制 deadline、大脑结果期限和回退期限。
  2. 完成 A0/A1 的同域基线。
  3. 建立 A2 基础分域和最小 IPC。
  4. 扫描 CPU、内存、I/O 和热干扰。
  5. 加入 A3 治理机制并逐项消融。
  6. 加入 A4 故障状态机并开展故障注入。
  7. 进行长稳实验和独立确认批次。

7. 最小闭环

一台具备 RTOS/Linux 分域条件的边缘平台、一个可测量的控制任务和一个真实 AI 大脑负载,即可形成最小验证闭环,不要求扩展到工作站或集群。