docs: add alternative real-time research frameworks
This commit is contained in:
@@ -0,0 +1,90 @@
|
||||
# 整体研究框架
|
||||
|
||||
## 1. 系统架构
|
||||
|
||||
```text
|
||||
操作员/任务系统
|
||||
│
|
||||
▼
|
||||
┌────────────────────────────────────────────┐
|
||||
│ Linux 大脑域 │
|
||||
│ 感知、LLM/VLM/VLA、任务规划、技能选择 │
|
||||
│ GPU/NPU、ROS 2、模型运行时 │
|
||||
└──────────────────┬─────────────────────────┘
|
||||
│ 有界异步命令
|
||||
│ 序号/时间戳/期限/有效期
|
||||
┌──────────────────▼─────────────────────────┐
|
||||
│ RTOS 小脑域 │
|
||||
│ 安全校验、状态估计、轨迹跟踪、关节控制 │
|
||||
│ 现场总线、联锁、超时回退、安全状态 │
|
||||
└──────────────────┬─────────────────────────┘
|
||||
│ 周期控制量
|
||||
▼
|
||||
执行器与机器人本体
|
||||
|
||||
Hypervisor / AMP / IOMMU / 静态资源分区
|
||||
```
|
||||
|
||||
传感数据按需求分别进入大小脑:高频本体反馈优先直达小脑,图像、语音和复杂环境信息主要进入大脑。关键安全传感器不得仅通过 Linux 域转发。
|
||||
|
||||
## 2. 三层时间模型
|
||||
|
||||
| 层次 | 典型任务 | 时间属性 | 主要指标 |
|
||||
|---|---|---|---|
|
||||
| L1 控制闭环 | 关节控制、姿态稳定、联锁 | 硬实时/严格固实时 | deadline、jitter、最大响应时间 |
|
||||
| L2 技能与决策窗口 | 轨迹片段、目标位姿、避障决策 | 固实时 | 按期率、新鲜度、回退率 |
|
||||
| L3 认知与交互 | 语言理解、长任务规划、解释 | 软实时 | TTFT、端到端延迟、任务成功率 |
|
||||
|
||||
基本约束为:
|
||||
|
||||
```text
|
||||
R_control <= D_control
|
||||
|
||||
采用大脑结果时:
|
||||
R_brain <= D_brain AND age(result) <= A_max
|
||||
|
||||
大脑不可用时:
|
||||
R_fallback <= D_fallback
|
||||
```
|
||||
|
||||
## 3. 三条研究主线
|
||||
|
||||
### 主线一:时间契约
|
||||
|
||||
- 规定大脑输出的期限、有效期和更新频率;
|
||||
- 把大脑输出转换为结构化技能或轨迹约束;
|
||||
- 对迟到、乱序、重复和低置信度结果定义统一处理;
|
||||
- 保证小脑在没有新命令时仍能连续控制。
|
||||
|
||||
### 主线二:资源与故障隔离
|
||||
|
||||
- 为小脑保留 CPU 核、内存、定时器和关键 I/O;
|
||||
- 路由关键中断到 RTOS 域;
|
||||
- 限制 Linux 和加速器 DMA 范围;
|
||||
- 测量 LLC、DRAM、互联、功耗和热等残余共享干扰;
|
||||
- 验证一个域崩溃或重启时另一域的持续运行能力。
|
||||
|
||||
### 主线三:联合评价
|
||||
|
||||
不能只报告控制延迟,也不能只报告大模型速度。结论必须联合回答:
|
||||
|
||||
- 小脑控制是否按时;
|
||||
- 大脑结果是否按期且有效;
|
||||
- 分域使用了多少静态资源;
|
||||
- 推理吞吐和能效付出了多少代价;
|
||||
- 故障与恢复期间机器人是否保持受控。
|
||||
|
||||
## 4. 研究假设
|
||||
|
||||
- H1:大脑负载会通过共享资源显著扩大控制尾延迟。
|
||||
- H2:RTOS/Linux 分域能够降低调度、中断和故障传播影响,但不能自动消除内存带宽与热耦合。
|
||||
- H3:有界异步时间契约能够避免小脑等待大脑,并降低过期决策进入执行路径的风险。
|
||||
- H4:准入、限流和故障降级可扩大“控制无违约且 AI 结果仍有用”的运行区域。
|
||||
|
||||
## 5. 研究成果形态
|
||||
|
||||
- 原型系统:RTOS 小脑域、Linux 大脑域与隔离层;
|
||||
- 跨域协议:请求、响应、心跳、超时和版本管理;
|
||||
- 实验工具:时间戳、压力发生、故障注入和物理链路测量;
|
||||
- 数据集:控制周期、大脑请求、功耗热状态和故障事件的对齐时间序列;
|
||||
- 论文结论:适用边界、收益来源和残余风险。
|
||||
@@ -0,0 +1,80 @@
|
||||
# 大小脑时间契约与跨域通信
|
||||
|
||||
## 1. 接口原则
|
||||
|
||||
大小脑之间采用异步、有界、可超时和可丢弃的消息通道。小脑控制线程不得执行无限等待、动态扩容或不可控的大块数据复制。
|
||||
|
||||
大脑输出应从开放文本收敛为受约束结构:
|
||||
|
||||
```text
|
||||
任务目标 → 白名单技能 → 参数与约束 → 小脑验证 → 执行
|
||||
```
|
||||
|
||||
## 2. 消息模型
|
||||
|
||||
### 请求
|
||||
|
||||
| 字段 | 含义 |
|
||||
|---|---|
|
||||
| `request_id` | 唯一序号 |
|
||||
| `sample_time` | 输入数据采样时刻 |
|
||||
| `deadline` | 最晚可用时刻 |
|
||||
| `task_class` | 感知、规划、诊断或交互类别 |
|
||||
| `priority` | 域内服务优先级提示 |
|
||||
| `payload_ref` | 受控共享缓冲区引用 |
|
||||
| `schema_version` | 接口版本 |
|
||||
|
||||
### 响应
|
||||
|
||||
| 字段 | 含义 |
|
||||
|---|---|
|
||||
| `request_id` | 请求匹配 |
|
||||
| `finish_time` | 推理完成时刻 |
|
||||
| `valid_until` | 结果失效时刻 |
|
||||
| `model_version` | 模型版本和审计信息 |
|
||||
| `confidence/status` | 结果质量与错误状态 |
|
||||
| `skill_id` | 白名单技能编号 |
|
||||
| `constraints` | 速度、力、空间和持续时间约束 |
|
||||
| `checksum` | 完整性校验 |
|
||||
|
||||
## 3. 小脑消费条件
|
||||
|
||||
```text
|
||||
accept(result) =
|
||||
id_match
|
||||
AND schema_valid
|
||||
AND checksum_valid
|
||||
AND finish_time <= deadline
|
||||
AND now <= valid_until
|
||||
AND confidence >= threshold
|
||||
AND skill_is_whitelisted
|
||||
AND constraints_passed
|
||||
```
|
||||
|
||||
拒绝结果后,小脑执行保持、传统控制、减速、停车或其他预定义回退,不等待大脑重新计算。
|
||||
|
||||
## 4. 通信实现候选
|
||||
|
||||
| 方式 | 优点 | 风险 | 适用场景 |
|
||||
|---|---|---|---|
|
||||
| 共享内存环形队列 + 通知 | 低复制、可控队列 | 缓存一致性和内存访问权限 | 同 SoC 分域主方案 |
|
||||
| RPMsg/邮箱 | SoC 生态常见、域间明确 | 消息大小和驱动能力受限 | MCU + 应用核 |
|
||||
| 虚拟设备 | 与 Hypervisor 集成 | VM exit 和虚拟中断开销 | 虚拟机分区 |
|
||||
| 以太网/TSN | 物理隔离、易扩展 | 网络栈与同步误差 | 双机大小脑 |
|
||||
|
||||
## 5. 队列策略
|
||||
|
||||
- 队列必须有固定容量;
|
||||
- 状态类消息可采用“只保留最新值”;
|
||||
- 事务类技能命令不得静默覆盖;
|
||||
- 大脑过载时优先拒绝低价值请求;
|
||||
- 小脑记录丢弃、超时、覆盖和回退原因;
|
||||
- 域重启后通过 epoch 或会话号拒绝旧消息。
|
||||
|
||||
## 6. 验证重点
|
||||
|
||||
- IPC 单向、往返、P99.9 和观测最大时延;
|
||||
- 消息大小、频率和队列深度的影响;
|
||||
- 队列满、乱序、重复、损坏和版本不一致;
|
||||
- 大脑域重启后的旧消息隔离;
|
||||
- 通信线程是否影响控制核和关键中断。
|
||||
@@ -0,0 +1,67 @@
|
||||
# Hypervisor 隔离、故障与降级
|
||||
|
||||
## 1. 隔离对象
|
||||
|
||||
| 资源 | 推荐归属 | 验证问题 |
|
||||
|---|---|---|
|
||||
| 控制 CPU 核 | RTOS 独占 | Linux 满载时是否发生调度干扰 |
|
||||
| 关键内存 | RTOS 静态分区 | Linux OOM、换页或内存压力是否影响控制 |
|
||||
| 电机/编码器/现场总线 | RTOS 直通 | 中断和 DMA 是否经过 Linux |
|
||||
| GPU/NPU/摄像头 | Linux 独占 | 设备复位是否影响 RTOS |
|
||||
| 共享内存 | 最小固定区域 | 越界、缓存一致性和拥塞 |
|
||||
| 网络/存储 | Linux 为主 | 高频 IRQ 是否污染控制核 |
|
||||
|
||||
## 2. 残余共享干扰
|
||||
|
||||
分核和虚拟化不能自动消除:
|
||||
|
||||
- LLC 和缓存互联竞争;
|
||||
- DRAM 带宽及内存控制器竞争;
|
||||
- SoC 总线与 DMA 拥塞;
|
||||
- 芯片级功耗限制;
|
||||
- 温度升高与全局降频;
|
||||
- 固件、系统管理中断和共享时钟源影响。
|
||||
|
||||
因此需要分别实施 CPU、缓存、内存、I/O 和热压力实验,不能用“已使用 Hypervisor”代替隔离证据。
|
||||
|
||||
## 3. 故障模型
|
||||
|
||||
- 大脑推理进程崩溃或永久阻塞;
|
||||
- Linux 域卡死、内核错误或重启;
|
||||
- GPU/NPU 驱动错误和设备复位;
|
||||
- 共享队列溢出、损坏或失联;
|
||||
- 大脑持续产生过期或不安全命令;
|
||||
- Linux 域 CPU、内存、网络和存储过载;
|
||||
- 热降频导致推理与控制执行时间漂移。
|
||||
|
||||
## 4. 降级状态机
|
||||
|
||||
```text
|
||||
智能增强运行
|
||||
│ 单次超时/低置信度
|
||||
▼
|
||||
保持当前安全技能或传统控制
|
||||
│ 连续超时/通信故障
|
||||
▼
|
||||
隔离并重启大脑域
|
||||
│ 本体风险上升
|
||||
▼
|
||||
减速、停车或安全状态
|
||||
```
|
||||
|
||||
每个状态必须规定进入条件、最大驻留时间、控制策略、可用传感器、允许执行器动作和恢复条件。
|
||||
|
||||
## 5. 安全监控职责
|
||||
|
||||
安全监控器位于 RTOS 小脑域或独立安全核,至少负责:
|
||||
|
||||
- 大脑心跳与期限监控;
|
||||
- 命令白名单和参数范围检查;
|
||||
- 速度、力矩、工作空间和碰撞约束;
|
||||
- 过期结果拒绝;
|
||||
- 大脑域隔离与重启请求;
|
||||
- 本地停车和安全状态执行。
|
||||
|
||||
## 6. 核心结论边界
|
||||
|
||||
实验可以证明指定平台和压力范围内的隔离效果,但不能自动证明形式化的最坏情况边界。若要宣称硬实时或功能安全,还需要可信 WCET、可调度性分析、硬件干扰上界和相应安全生命周期证据。
|
||||
Reference in New Issue
Block a user