136 lines
16 KiB
Markdown
136 lines
16 KiB
Markdown
# 工程应用场景与异构系统性能指标对标
|
||
|
||
## 1 调研目的与结论
|
||
|
||
本文件把子课题B“Linux、RTOS、Hypervisor与异构加速器协同”的研究主线映射到可验证的工程场景,并整理截至2026年9月公开可查的延迟、抖动和控制周期数据。
|
||
|
||
先说明数据边界:目前项目材料尚未冻结目标SoC、载板、Linux/RTOS版本、Hypervisor、AI加速器运行时和具体机器人型号。因此,下文数据是公开论文、厂商工程测试和产品资料中的**对标值**,不是本课题目标板的实测值,也不能直接互相比较。尤其宇树官网公开了部分算力、传感器和开发接口信息,但未公开其机器人内部控制链的端到端延迟分布、P99/P99.9抖动或截止期违约率。
|
||
|
||
本次调研的工程判断是:
|
||
|
||
1. 具身机器人适合作为课题牵引场景,宇树G1-D/G1-Comp、H1/H1-2以及四足巡检机器人具备“实时运动控制+视觉/语言模型+边侧算力”的真实需求;
|
||
2. 公开VLA数据能说明高级策略推理可能需要百毫秒至秒级,不能把它放入毫秒级伺服闭环;
|
||
3. 控制域的目标应单独定义周期、抖动和违约率,并由RTOS或专用控制器维持安全闭环;Linux/AI域通过有界通道提供更新较慢的感知和动作建议;
|
||
4. 对课题最有价值的实验不是只报AI FPS,而是在CPU、DDR、DMA、NPU/GPU和温度压力下测量“传感输入至控制输出”的长尾时延、抖动和故障切换时间。
|
||
|
||
## 2 已公开的量化性能参照
|
||
|
||
### 2.1 边侧SoC实时内核与现场总线
|
||
|
||
Seeed公布了在Orin Nano Super上对标准Linux和PREEMPT_RT进行的同机对照测试。设备运行JetPack 7.2,六核CPU;测试同时包含满CPU负载、内核临界区干扰、GPIO周期输出和1 kHz EtherCAT主站。该资料由硬件厂商发布,实验步骤和部分代码公开,属于可复核的工程数据,但不是独立同行评审论文。
|
||
|
||
| 测量对象与条件 | 标准内核 | PREEMPT_RT | 解释 |
|
||
|---|---:|---:|---|
|
||
| 用户态满CPU负载下,周期线程唤醒延迟 P99 / 最大值 | 1,879 / 8,200 μs | 11 / 32 μs | 说明高优先级线程虽能压过普通用户任务,内核调度仍会产生毫秒级长尾 |
|
||
| EtherCAT主站,1 kHz,内核自旋锁每3秒持有1秒,5,000周期中超1 ms周期数 | 约2,000 | 0 | 这是有意构造的严重内核临界区干扰,展示了非抢占内核区可能造成总线失联 |
|
||
| 同一EtherCAT测试,主站唤醒延迟 P50 / P99 / 最大值 | 7 / 约994,000 / 约1,018,000 μs | 2 / 3 / 12 μs | PREEMPT_RT数据来自相同测试条件;不可视为所有Orin设备的通用保证 |
|
||
| 2 kHz GPIO输出,300 μs锁竞争下 P99 / 最大值 | 306 / 325–547 μs | 251 / 257 μs,标准差0.56 μs | 周期输出比单纯cyclictest更接近电气边沿抖动测量 |
|
||
|
||
同一资料还显示,标准内核与PREEMPT_RT在纯用户态负载下都能维持电机运行,但延迟分布差别仍明显;当内核不可抢占临界区加入后,标准内核会触发安全停机,PREEMPT_RT在该测试中没有丢周期。[Seeed Orin Nano Super PREEMPT_RT与EtherCAT对照测试](https://wiki.seeedstudio.com/deploy_preempt_rt_kernel_with_prebuilt_deb_package_on_recomputer_jetson/)
|
||
|
||
NVIDIA的Jetson Thor实时内核测试也给出一个资源隔离参照:在性能模式、DDR/GPU高频、显示/USB/网络和编译负载并行的配置下,隔离核上的`rtla timerlat`线程最大延迟为26 μs;承担系统负载的核最大值最高96 μs。该测试针对Thor,不应外推为Orin或宇树开发计算单元的性能保证。[NVIDIA Jetson实时内核测量说明](https://docs.nvidia.com/jetson/archives/r39.2/DeveloperGuide/SD/Kernel/RealTimeKernel.html)
|
||
|
||
### 2.2 ROS 2与机器人控制周期
|
||
|
||
清华大学双臂机器人相关研究在PC控制平台上测试ROS 2、PREEMPT_RT和EtherCAT。其结果可用来设计指标口径,但硬件不是Jetson异构SoC:
|
||
|
||
- 满CPU压力下,PREEMPT_RT周期线程测试持续25.7小时,最大唤醒延迟82 μs、平均2 μs;周期抖动在25–5,000 Hz测试范围内小于60 μs;
|
||
- 1 kHz EtherCAT主站、16个从站的周期实测最小982.5 μs、平均999.8 μs、最大1,022.4 μs;
|
||
- 1 KB ROS 2消息在不同发布频率下测得的最大传输延迟低于150 μs;消息大小、DDS/QoS和节点数变化会影响结果。
|
||
|
||
该研究明确指出其测试优化的是系统实时性能,并未证明机器人运动控制品质;因此上述值适合作为“如何报告周期与延迟”的参照,不宜直接作为课题目标板的验收结论。[Ye等,ROS2 Real-time Performance Optimization and Evaluation](https://doi.org/10.1186/s10033-023-00976-5)
|
||
|
||
### 2.3 Jetson上具身VLA推理与反应时间
|
||
|
||
2026年的Jetson-PI研究在Jetson Orin上测试π0.5视觉语言动作模型。其表格给出以下分阶段优化结果:
|
||
|
||
| Orin推理流程 | 端到端模型推理时间 | 动作反应时间 | 报告的控制频率 |
|
||
|---|---:|---:|---:|
|
||
| 朴素同步推理 | 1,420.8 ms | 1,420.8 ms | 0.70 Hz |
|
||
| 加入VLM调用调度 | 1,420.8 ms | 674.9 ms | 1.48 Hz |
|
||
| 加入CUDA Graph复用 | 476.1 ms | 227.0 ms | 4.41 Hz |
|
||
| 加入中间缓冲与迭代展开 | 412.9 ms | 165.1 ms | 6.06 Hz |
|
||
|
||
这里的“控制频率”是VLA高级策略生成/反应能力,不是关节伺服频率,也没有报告目标SoC混合负载下的P99抖动。研究另在PrimeBot X2-W平台上用三路224×224相机执行叠衣任务,报告机器人动作频率15 Hz;该实机结果使用XR-1模型,不应与上表π0.5的6.06 Hz混为一谈。该结果适合支持“VLA异步运行、低层控制独立闭环”的设计,而非证明VLA可以直接承担实时伺服。[Jetson-PI论文,arXiv版本于2026-09-05更新](https://arxiv.org/abs/2607.12659)
|
||
|
||
### 2.4 Orin Nano移动机器人感知—规划链路
|
||
|
||
2026年发表的一项ROS 2小型自动驾驶/移动机器人研究采用NVIDIA Jetson Orin Nano 8 GB作为高层计算单元、STM32 Nucleo-F401RE作为低层控制器,两者通过UART交换命令和反馈。其定位与感知规划链具有可对照的端到端时间分布:
|
||
|
||
| 感知—规划任务 | 均值 | P95 | 实测最大值 |
|
||
|---|---:|---:|---:|
|
||
| 车道检测链 | 43.221 ms | 49.538 ms | 62.061 ms |
|
||
| 目标检测链 | 49.998 ms | 61.986 ms | 72.616 ms |
|
||
| 障碍检测链 | 11.554 ms | 19.524 ms | 25.909 ms |
|
||
|
||
论文报告车道参考更新平均频率22.4 Hz。采集时计算、内存和I/O资源专门分配给该架构,没有叠加无关AI/DMA压力;论文将从测量数据汇总的最大值称为WCET,但从严格时序分析角度看,有限运行中的最大实测值不等同于已证明的理论WCET。[Bonci等,ROS 2-Based Architecture for Autonomous Driving Systems](https://doi.org/10.3390/s26020463)
|
||
|
||
### 2.5 宇树平台的公开参数与指标缺口
|
||
|
||
宇树官网资料显示,H1/H1-2标配计算单元包含平台功能计算机和用户开发计算机,选配可使用Intel Core i7或Orin NX;H1-2页面列出最多三块Orin NX。G1-D公开了8核高性能CPU、头部双目相机和腕部相机,并可选Orin NX 16 GB(100 TOPS);G1-Comp页面列出Orin NX、ROS生态兼容、仿真和运动控制API。官方SDK2的G1低层控制示例把`control_dt`设为2 ms,即示例任务按500 Hz生成命令。
|
||
|
||
这些信息证明具身机器人产品具有异构计算、感知和实时运动控制接口,但500 Hz只是SDK示例中的用户命令周期,不代表机器人内部伺服周期、实际网络收发周期或抖动上限。公开产品页和示例没有给出完整的传感器到执行器路径P99/P99.9、并发推理下的控制超期率或Hypervisor隔离数据。因此,宇树可作为应用平台和工作负载来源,具体性能必须在锁定机型、开发计算单元、SDK/固件和通信拓扑后实测。[宇树H1/H1-2规格](https://www.unitree.com/cn/h1/);[宇树G1-D平台](https://www.unitree.com/G1-D/);[宇树G1-Comp](https://www.unitree.com/cn/robocup/);[Unitree SDK2 G1低层控制示例](https://github.com/unitreerobotics/unitree_sdk2_python/blob/master/example/g1/low_level/g1_low_level_example.py)
|
||
|
||
## 3 适合子课题B的应用场景
|
||
|
||
| 场景 | 可选平台与任务 | 异构计算分工 | 需要回答的实时问题 | 适合作为课题的原因 |
|
||
|---|---|---|---|---|
|
||
| 人形机器人移动操作 | 宇树G1-D/G1-Comp或H1-2;视觉找物、自然语言任务、抓取、递送、整理 | Linux/Orin运行视觉、VLA、任务规划;RTOS/安全控制域维护高频状态采集、关节/底盘控制接口、限位与看门狗;Hypervisor划分核、内存、设备和通信区 | 模型推理过慢或NPU排队时,控制域能否保持步态/姿态稳定;过期动作块是否被丢弃;抓取碰撞事件能否抢占慢速任务规划 | 直接体现“慢速智能决策+快速安全闭环”,与具身智能、异构SoC和AI故障兜底高度吻合;官方有Orin NX选配和多相机/开发接口 |
|
||
| 四足机器人巡检与应急 | 宇树As2/Go2/B2等;电力巡检、园区巡逻、消防侦察、越障与回传 | Linux/SoC运行视觉、点云、SLAM、异常识别和任务规划;RTOS/运动控制域负责步态、IMU、关节状态和急停;网络/云端只传非安全关键任务 | 摄像头、雷达和NPU同时工作时,DDR/DMA竞争是否拉长姿态估计;无线链路断开、定位失效、AI异常时多快进入安全策略;热稳态后时延如何变化 | 宇树公开了[四足行业巡检方案及As2高算力扩展](https://www.unitree.com/As2/);跌倒、振动、户外温度和断网可构造真实压力及故障注入 |
|
||
| 视觉引导移动操作/仓储机器人 | Jetson Orin NX/Nano + ROS 2 + STM32/RTOS底盘或机械臂;目标搬运、避障、二维码/货架识别 | RTOS控制电机、编码器、安全输入和制动;Linux运行相机/激光雷达驱动、检测、定位和规划;IPC传递带时间戳的速度/轨迹目标 | 从相机曝光到电机命令的端到端P95/P99;队列积压和旧帧处理;Linux重启时RTOS能否维持受控停车 | 有Jetson Orin Nano + STM32的公开实机架构和端到端基线,原型成本较低,适合先打通测试工具链 |
|
||
| EtherCAT协作臂/高精度运动控制 | Orin Nano/NX或其他边侧SoC + EtherCAT伺服;视觉定位、抓取、插装、轨迹跟踪 | RTOS或PREEMPT_RT域运行1 kHz现场总线周期任务;Linux/NPU做视觉和轨迹更新;低层以有界周期缓冲接收新目标 | CPU、DMA、相机和模型并发时1 ms周期最大偏差;主站唤醒延迟;超期和总线失联次数;故障恢复到安全位置的时间 | 有Orin Nano Super + 1 kHz EtherCAT公开对照测试,能直接形成标准内核、PREEMPT_RT和隔离方案基线 |
|
||
|
||
## 4 推荐的课题验证路线
|
||
|
||
### 4.1 先做可复现的实时底座
|
||
|
||
建议先在一块可获得的Orin NX/Nano级开发板上固定操作系统、内核、频率和驱动版本,建立Linux基线、PREEMPT_RT基线和Linux+RTOS/Hypervisor共存方案。第一轮不急着跑完整VLA,可用固定模型推理或视频/DDR/DMA合成负载复现“AI负载压迫控制域”的时序问题。
|
||
|
||
### 4.2 再挂接真实机器人工作负载
|
||
|
||
低成本路径是Orin + RTOS微控制器的移动底盘/小型机械臂;展示路径可选宇树G1-D/G1-Comp或四足开发型号。接入前应确认指定版本是否开放所需SDK、低层命令、传感器时间戳、急停和控制权切换能力。机器人平台上是否能够部署本课题的Hypervisor/RTOS,需要根据厂商授权的开发单元和实际软件接口核实,不能从“支持Orin NX”推断内部控制器可被替换。
|
||
|
||
### 4.3 建议统一报告的指标
|
||
|
||
| 层次 | 指标 | 建议记录方法 |
|
||
|---|---|---|
|
||
| RTOS控制域 | 目标周期、唤醒延迟、执行时间、周期抖动P50/P95/P99/P99.9/最大值、截止期违约次数和连续违约长度 | 使用单调时钟或硬件时间戳;报告运行时间、样本数和负载条件 |
|
||
| AI/加速器域 | 输入等待、预处理、NPU/GPU排队、推理、后处理各段时延;推理吞吐与有效结果率 | 分离排队时间与设备执行时间;同时报告冷启动和热稳态 |
|
||
| 端到端链 | 传感器采集时间到RTOS接收结果、再到执行器命令提交的时延;AI结果年龄和过期率 | 以消息序列号和时间戳贯穿各域;不只测ROS topic往返 |
|
||
| 资源争用 | CPU占用、DDR带宽、LLC未命中、DMA吞吐、加速器队列深度、核心迁移/中断分布 | 逐项压力与联合压力对照,报告控制时延增量及隔离效果 |
|
||
| 故障与恢复 | 检测时间、降级切换时间、安全状态保持率、通道清理时间、重新接入时间 | 注入进程退出、NPU超时、旧/乱序数据、通信中断、热降频和Linux重启 |
|
||
| 热与能耗 | SoC/加速器温度、频率、板级功耗、热稳态前后尾时延差 | 长时运行后再测P99.9和最大值,避免只报启动后短测数据 |
|
||
|
||
### 4.4 初始验收值的设定原则
|
||
|
||
在目标控制器和机械对象尚未冻结前,不宜把单篇论文的数字写成最终验收指标。可先把下列值作为第一轮工程门槛,再由控制周期、执行器接口和安全分析修订:
|
||
|
||
- 若控制接口周期为2 ms,可将P99.9周期抖动≤50 μs、观测最大绝对偏差≤100 μs、规定负载下截止期违约为0作为试运行目标;
|
||
- 若EtherCAT周期为1 ms,应单独记录周期误差和主站唤醒延迟,并按驱动器/机构允许的周期偏差给出通过线;
|
||
- 感知或VLA消息需按任务设置有效期。超过有效期即丢弃,RTOS不得等待其完成;
|
||
- 任何实测“最大值”必须附带测试时长、样本数、温度、频率、负载和版本信息。有限时间内零违约是实验结果,不是已证明的硬实时上界。
|
||
|
||
## 5 与综述的衔接和课题落点
|
||
|
||
综述中的静态分区、共享资源干扰、跨域消息契约和安全降级,在上述应用中分别落到可操作的研究问题:
|
||
|
||
1. **体系结构贡献:** 明确AI域、控制域和Hypervisor的职责与设备所有权;
|
||
2. **实时性贡献:** 在相同传感与控制链下比较普通Linux、PREEMPT_RT、AMP和静态分区方案;
|
||
3. **资源治理贡献:** 使用真实NPU/GPU推理、图像流、DMA和存储负载测量控制尾时延;
|
||
4. **协同机制贡献:** 将序列号、采集时间、模型版本、置信度和有效期纳入IPC协议;
|
||
5. **安全证据贡献:** 通过过期结果拒绝、AI超时降级、Linux重启恢复和设备故障注入验证安全边界。
|
||
|
||
因此,推荐把“**具身机器人上的视觉/语言任务与实时运动控制共存**”作为总体应用牵引,把“**Orin类SoC + RTOS安全控制域 + Linux AI域 + 有界IPC + 多资源压力**”作为系统研究对象;先以移动底盘或EtherCAT小型执行器快速建立可复现实验,再在宇树人形或四足平台上验证场景价值和系统适用范围。
|
||
|
||
## 参考资料
|
||
|
||
1. Seeed Studio. *Deploy a PREEMPT_RT Real-Time Kernel with a Prebuilt DEB Package on Seeed reComputer Jetson Devices*. [官方工程测试与复现实验](https://wiki.seeedstudio.com/deploy_preempt_rt_kernel_with_prebuilt_deb_package_on_recomputer_jetson/),访问日期:2026-09-28。
|
||
2. NVIDIA. *Installing Real-Time Kernel — Jetson Linux Developer Guide, R39.2*. [官方文档](https://docs.nvidia.com/jetson/archives/r39.2/DeveloperGuide/SD/Kernel/RealTimeKernel.html),访问日期:2026-09-28。
|
||
3. YE Y, NIE Z, LIU X, et al. ROS2 Real-time Performance Optimization and Evaluation[J]. Chinese Journal of Mechanical Engineering, 2023, 36:144. [DOI: 10.1186/s10033-023-00976-5](https://doi.org/10.1186/s10033-023-00976-5)。
|
||
4. BONCI A, BRUNELLA F, COLLETTA M, et al. ROS 2-Based Architecture for Autonomous Driving Systems: Design and Implementation[J]. Sensors, 2026, 26(2):463. [DOI: 10.3390/s26020463](https://doi.org/10.3390/s26020463)。
|
||
5. YANG Z, WANG Q, WANG Y, et al. Jetson-PI: Towards Onboard Real-Time Robot Control via Foresight-Aligned Asynchronous Inference[EB/OL]. arXiv:2607.12659, 2026. [https://arxiv.org/abs/2607.12659](https://arxiv.org/abs/2607.12659)。
|
||
6. Unitree Robotics. H1/H1-2产品规格. [宇树官方页面](https://www.unitree.com/cn/h1/),访问日期:2026-09-28。
|
||
7. Unitree Robotics. G1-D End-to-End Platform for Humanoid Robot. [宇树官方页面](https://www.unitree.com/G1-D/),访问日期:2026-09-28。
|
||
8. Unitree Robotics. G1-Comp产品及RoboCup SDK. [宇树官方页面](https://www.unitree.com/cn/robocup/),访问日期:2026-09-28。
|
||
9. Unitree Robotics. Unitree SDK2 Python,G1低层控制示例. [官方代码仓库](https://github.com/unitreerobotics/unitree_sdk2_python/blob/master/example/g1/low_level/g1_low_level_example.py),访问日期:2026-09-28。
|