Files
rtos_llm_opt/项目框架2-面向机器人大小脑异构系统的实时保障研究/00-项目总览/01-研究问题、定位与边界.md
T

3.4 KiB

研究问题、定位与边界

1. 工业背景

机器人同时包含两类时间尺度显著不同的任务:

  • 感知、语言理解、任务规划和大模型推理计算量大、运行时间动态,通常属于软实时或固实时;
  • 姿态稳定、关节控制、力控、现场总线和安全联锁按固定周期运行,通常属于硬实时或严格固实时。

把两类任务简单部署在同一 Linux 系统中,会产生调度、中断、内存带宽、DMA、功耗和故障传播问题;把完整 AI 软件栈迁入 RTOS,又会面临驱动、运行时、模型生态和不可控加速器执行路径问题。

2. 研究对象

本项目研究的是机器人大小脑异构系统,而不是单独研究 RTOS 或大模型:

子系统 工程角色 主要软件
大脑域 环境理解、模型推理、任务规划、技能选择 Linux、ROS 2、LLM/VLM/VLA、GPU/NPU 运行时
技能与安全接口 命令结构化、白名单技能、期限和约束检查 跨域协议、安全监控器、行为管理器
小脑域 状态估计、轨迹跟踪、关节控制、联锁和降级 RTOS、控制算法、关键设备驱动
隔离层 CPU、内存、设备、中断和故障域分区 Hypervisor、AMP、IOMMU 或静态硬件分区

3. 核心研究问题

在机器人大小脑异构平台中,如何建立跨域时间契约和资源隔离机制,使动态、不可完全预测的大脑负载不会破坏小脑控制的实时边界,并使大脑输出能够被安全、按期地使用?

分解为五个问题:

  1. 大脑负载通过哪些 CPU、缓存、内存、I/O、中断、DMA 和热路径干扰小脑控制?
  2. 静态分核与 Hypervisor 分域能够隔离哪些干扰,仍有哪些共享硬件干扰无法消除?
  3. 大小脑之间应采用什么时间契约、消息语义和队列策略?
  4. 大脑输出迟到、过期、错误或低置信度时,小脑如何在规定时间内回退?
  5. 大脑域、加速器或通信通道故障时,机器人能否持续受控并完成隔离和恢复?

4. 研究边界

纳入范围

  • 机器人本体或近端边缘计算平台;
  • RTOS 小脑与 Linux 大脑并行运行;
  • 控制任务 deadline、AI 结果期限和新鲜度;
  • 跨域通信、共享资源干扰、故障隔离和安全降级;
  • 大模型、视觉或规划作为大脑压力负载。

不作为主线

  • 大模型训练;
  • T1 多节点集群吞吐优化;
  • 证明大模型本身具备硬实时性;
  • 用平均推理时延替代机器人控制实时性;
  • 让自然语言输出直接控制电机力矩。

5. 基本原则

  1. 小脑不依赖大脑即可维持基本稳定和安全状态。
  2. 大脑输出的是目标、技能或受约束轨迹,不直接绕过控制器驱动执行器。
  3. 小脑不得同步阻塞等待大脑推理完成。
  4. 所有大脑输出必须携带时间戳、序号、有效期、状态和必要的安全约束。
  5. Hypervisor 只是一种隔离手段,隔离效果必须通过压力和故障实验验证。

6. 预期贡献

  • 一套面向大小脑系统的多时间尺度任务模型;
  • 一套有期限、有新鲜度、有回退语义的跨域通信契约;
  • 一套 RTOS/Linux/Hypervisor 资源和故障隔离机制;
  • 一套覆盖正常、过载、热稳态和故障状态的实验方法;
  • 大脑智能能力、控制实时性和资源代价之间的适用边界。