docs: add alternative real-time research frameworks

This commit is contained in:
Mo1s
2026-09-22 16:26:37 +08:00
parent 60e0d2e46b
commit b7863721fe
16 changed files with 1290 additions and 0 deletions
@@ -0,0 +1,90 @@
# 整体研究框架
## 1. 系统架构
```text
操作员/任务系统
│
▼
┌────────────────────────────────────────────┐
│ Linux 大脑域 │
│ 感知、LLM/VLM/VLA、任务规划、技能选择 │
│ GPU/NPU、ROS 2、模型运行时 │
└──────────────────┬─────────────────────────┘
│ 有界异步命令
│ 序号/时间戳/期限/有效期
┌──────────────────▼─────────────────────────┐
│ RTOS 小脑域 │
│ 安全校验、状态估计、轨迹跟踪、关节控制 │
│ 现场总线、联锁、超时回退、安全状态 │
└──────────────────┬─────────────────────────┘
│ 周期控制量
▼
执行器与机器人本体
Hypervisor / AMP / IOMMU / 静态资源分区
```
传感数据按需求分别进入大小脑:高频本体反馈优先直达小脑,图像、语音和复杂环境信息主要进入大脑。关键安全传感器不得仅通过 Linux 域转发。
## 2. 三层时间模型
| 层次 | 典型任务 | 时间属性 | 主要指标 |
|---|---|---|---|
| L1 控制闭环 | 关节控制、姿态稳定、联锁 | 硬实时/严格固实时 | deadline、jitter、最大响应时间 |
| L2 技能与决策窗口 | 轨迹片段、目标位姿、避障决策 | 固实时 | 按期率、新鲜度、回退率 |
| L3 认知与交互 | 语言理解、长任务规划、解释 | 软实时 | TTFT、端到端延迟、任务成功率 |
基本约束为:
```text
R_control <= D_control
采用大脑结果时:
R_brain <= D_brain AND age(result) <= A_max
大脑不可用时:
R_fallback <= D_fallback
```
## 3. 三条研究主线
### 主线一:时间契约
- 规定大脑输出的期限、有效期和更新频率;
- 把大脑输出转换为结构化技能或轨迹约束;
- 对迟到、乱序、重复和低置信度结果定义统一处理;
- 保证小脑在没有新命令时仍能连续控制。
### 主线二:资源与故障隔离
- 为小脑保留 CPU 核、内存、定时器和关键 I/O;
- 路由关键中断到 RTOS 域;
- 限制 Linux 和加速器 DMA 范围;
- 测量 LLC、DRAM、互联、功耗和热等残余共享干扰;
- 验证一个域崩溃或重启时另一域的持续运行能力。
### 主线三:联合评价
不能只报告控制延迟,也不能只报告大模型速度。结论必须联合回答:
- 小脑控制是否按时;
- 大脑结果是否按期且有效;
- 分域使用了多少静态资源;
- 推理吞吐和能效付出了多少代价;
- 故障与恢复期间机器人是否保持受控。
## 4. 研究假设
- H1:大脑负载会通过共享资源显著扩大控制尾延迟。
- H2:RTOS/Linux 分域能够降低调度、中断和故障传播影响,但不能自动消除内存带宽与热耦合。
- H3:有界异步时间契约能够避免小脑等待大脑,并降低过期决策进入执行路径的风险。
- H4:准入、限流和故障降级可扩大“控制无违约且 AI 结果仍有用”的运行区域。
## 5. 研究成果形态
- 原型系统:RTOS 小脑域、Linux 大脑域与隔离层;
- 跨域协议:请求、响应、心跳、超时和版本管理;
- 实验工具:时间戳、压力发生、故障注入和物理链路测量;
- 数据集:控制周期、大脑请求、功耗热状态和故障事件的对齐时间序列;
- 论文结论:适用边界、收益来源和残余风险。
@@ -0,0 +1,80 @@
# 大小脑时间契约与跨域通信
## 1. 接口原则
大小脑之间采用异步、有界、可超时和可丢弃的消息通道。小脑控制线程不得执行无限等待、动态扩容或不可控的大块数据复制。
大脑输出应从开放文本收敛为受约束结构:
```text
任务目标 → 白名单技能 → 参数与约束 → 小脑验证 → 执行
```
## 2. 消息模型
### 请求
| 字段 | 含义 |
|---|---|
| `request_id` | 唯一序号 |
| `sample_time` | 输入数据采样时刻 |
| `deadline` | 最晚可用时刻 |
| `task_class` | 感知、规划、诊断或交互类别 |
| `priority` | 域内服务优先级提示 |
| `payload_ref` | 受控共享缓冲区引用 |
| `schema_version` | 接口版本 |
### 响应
| 字段 | 含义 |
|---|---|
| `request_id` | 请求匹配 |
| `finish_time` | 推理完成时刻 |
| `valid_until` | 结果失效时刻 |
| `model_version` | 模型版本和审计信息 |
| `confidence/status` | 结果质量与错误状态 |
| `skill_id` | 白名单技能编号 |
| `constraints` | 速度、力、空间和持续时间约束 |
| `checksum` | 完整性校验 |
## 3. 小脑消费条件
```text
accept(result) =
id_match
AND schema_valid
AND checksum_valid
AND finish_time <= deadline
AND now <= valid_until
AND confidence >= threshold
AND skill_is_whitelisted
AND constraints_passed
```
拒绝结果后,小脑执行保持、传统控制、减速、停车或其他预定义回退,不等待大脑重新计算。
## 4. 通信实现候选
| 方式 | 优点 | 风险 | 适用场景 |
|---|---|---|---|
| 共享内存环形队列 + 通知 | 低复制、可控队列 | 缓存一致性和内存访问权限 | 同 SoC 分域主方案 |
| RPMsg/邮箱 | SoC 生态常见、域间明确 | 消息大小和驱动能力受限 | MCU + 应用核 |
| 虚拟设备 | 与 Hypervisor 集成 | VM exit 和虚拟中断开销 | 虚拟机分区 |
| 以太网/TSN | 物理隔离、易扩展 | 网络栈与同步误差 | 双机大小脑 |
## 5. 队列策略
- 队列必须有固定容量;
- 状态类消息可采用“只保留最新值”;
- 事务类技能命令不得静默覆盖;
- 大脑过载时优先拒绝低价值请求;
- 小脑记录丢弃、超时、覆盖和回退原因;
- 域重启后通过 epoch 或会话号拒绝旧消息。
## 6. 验证重点
- IPC 单向、往返、P99.9 和观测最大时延;
- 消息大小、频率和队列深度的影响;
- 队列满、乱序、重复、损坏和版本不一致;
- 大脑域重启后的旧消息隔离;
- 通信线程是否影响控制核和关键中断。
@@ -0,0 +1,67 @@
# Hypervisor 隔离、故障与降级
## 1. 隔离对象
| 资源 | 推荐归属 | 验证问题 |
|---|---|---|
| 控制 CPU 核 | RTOS 独占 | Linux 满载时是否发生调度干扰 |
| 关键内存 | RTOS 静态分区 | Linux OOM、换页或内存压力是否影响控制 |
| 电机/编码器/现场总线 | RTOS 直通 | 中断和 DMA 是否经过 Linux |
| GPU/NPU/摄像头 | Linux 独占 | 设备复位是否影响 RTOS |
| 共享内存 | 最小固定区域 | 越界、缓存一致性和拥塞 |
| 网络/存储 | Linux 为主 | 高频 IRQ 是否污染控制核 |
## 2. 残余共享干扰
分核和虚拟化不能自动消除:
- LLC 和缓存互联竞争;
- DRAM 带宽及内存控制器竞争;
- SoC 总线与 DMA 拥塞;
- 芯片级功耗限制;
- 温度升高与全局降频;
- 固件、系统管理中断和共享时钟源影响。
因此需要分别实施 CPU、缓存、内存、I/O 和热压力实验,不能用“已使用 Hypervisor”代替隔离证据。
## 3. 故障模型
- 大脑推理进程崩溃或永久阻塞;
- Linux 域卡死、内核错误或重启;
- GPU/NPU 驱动错误和设备复位;
- 共享队列溢出、损坏或失联;
- 大脑持续产生过期或不安全命令;
- Linux 域 CPU、内存、网络和存储过载;
- 热降频导致推理与控制执行时间漂移。
## 4. 降级状态机
```text
智能增强运行
│ 单次超时/低置信度
▼
保持当前安全技能或传统控制
│ 连续超时/通信故障
▼
隔离并重启大脑域
│ 本体风险上升
▼
减速、停车或安全状态
```
每个状态必须规定进入条件、最大驻留时间、控制策略、可用传感器、允许执行器动作和恢复条件。
## 5. 安全监控职责
安全监控器位于 RTOS 小脑域或独立安全核,至少负责:
- 大脑心跳与期限监控;
- 命令白名单和参数范围检查;
- 速度、力矩、工作空间和碰撞约束;
- 过期结果拒绝;
- 大脑域隔离与重启请求;
- 本地停车和安全状态执行。
## 6. 核心结论边界
实验可以证明指定平台和压力范围内的隔离效果,但不能自动证明形式化的最坏情况边界。若要宣称硬实时或功能安全,还需要可信 WCET、可调度性分析、硬件干扰上界和相应安全生命周期证据。