forked from eaiadmin/rtos_llm_opt
3.4 KiB
3.4 KiB
研究问题、定位与边界
1. 工业背景
机器人同时包含两类时间尺度显著不同的任务:
- 感知、语言理解、任务规划和大模型推理计算量大、运行时间动态,通常属于软实时或固实时;
- 姿态稳定、关节控制、力控、现场总线和安全联锁按固定周期运行,通常属于硬实时或严格固实时。
把两类任务简单部署在同一 Linux 系统中,会产生调度、中断、内存带宽、DMA、功耗和故障传播问题;把完整 AI 软件栈迁入 RTOS,又会面临驱动、运行时、模型生态和不可控加速器执行路径问题。
2. 研究对象
本项目研究的是机器人大小脑异构系统,而不是单独研究 RTOS 或大模型:
| 子系统 | 工程角色 | 主要软件 |
|---|---|---|
| 大脑域 | 环境理解、模型推理、任务规划、技能选择 | Linux、ROS 2、LLM/VLM/VLA、GPU/NPU 运行时 |
| 技能与安全接口 | 命令结构化、白名单技能、期限和约束检查 | 跨域协议、安全监控器、行为管理器 |
| 小脑域 | 状态估计、轨迹跟踪、关节控制、联锁和降级 | RTOS、控制算法、关键设备驱动 |
| 隔离层 | CPU、内存、设备、中断和故障域分区 | Hypervisor、AMP、IOMMU 或静态硬件分区 |
3. 核心研究问题
在机器人大小脑异构平台中,如何建立跨域时间契约和资源隔离机制,使动态、不可完全预测的大脑负载不会破坏小脑控制的实时边界,并使大脑输出能够被安全、按期地使用?
分解为五个问题:
- 大脑负载通过哪些 CPU、缓存、内存、I/O、中断、DMA 和热路径干扰小脑控制?
- 静态分核与 Hypervisor 分域能够隔离哪些干扰,仍有哪些共享硬件干扰无法消除?
- 大小脑之间应采用什么时间契约、消息语义和队列策略?
- 大脑输出迟到、过期、错误或低置信度时,小脑如何在规定时间内回退?
- 大脑域、加速器或通信通道故障时,机器人能否持续受控并完成隔离和恢复?
4. 研究边界
纳入范围
- 机器人本体或近端边缘计算平台;
- RTOS 小脑与 Linux 大脑并行运行;
- 控制任务 deadline、AI 结果期限和新鲜度;
- 跨域通信、共享资源干扰、故障隔离和安全降级;
- 大模型、视觉或规划作为大脑压力负载。
不作为主线
- 大模型训练;
- T1 多节点集群吞吐优化;
- 证明大模型本身具备硬实时性;
- 用平均推理时延替代机器人控制实时性;
- 让自然语言输出直接控制电机力矩。
5. 基本原则
- 小脑不依赖大脑即可维持基本稳定和安全状态。
- 大脑输出的是目标、技能或受约束轨迹,不直接绕过控制器驱动执行器。
- 小脑不得同步阻塞等待大脑推理完成。
- 所有大脑输出必须携带时间戳、序号、有效期、状态和必要的安全约束。
- Hypervisor 只是一种隔离手段,隔离效果必须通过压力和故障实验验证。
6. 预期贡献
- 一套面向大小脑系统的多时间尺度任务模型;
- 一套有期限、有新鲜度、有回退语义的跨域通信契约;
- 一套 RTOS/Linux/Hypervisor 资源和故障隔离机制;
- 一套覆盖正常、过载、热稳态和故障状态的实验方法;
- 大脑智能能力、控制实时性和资源代价之间的适用边界。