Files
rtos_llm_opt/03-主流异构边侧设备与AI模型性能指标综述.md
T

279 lines
26 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 主流异构边侧设备与AI模型性能指标综述
## 摘要
边侧智能控制设备正从单一CPU或GPU计算平台,演进为同时集成应用核、实时核、GPU、NPU/DLA、DSP、ISP、FPGA可编程逻辑和多类I/O加速单元的异构系统。对这类平台进行选型时,仅比较TOPS会遮蔽模型精度、权重体积、算子落点、内存带宽、运行时回退、队列等待、功耗模式和尾时延等关键差异。本文结合前期《面向边侧异构SoC的混合实时控制基础系统研究综述》和《工程应用场景与性能指标对标》,对NVIDIA Jetson Orin、Rockchip RK3588、TI TDA4VM、NXP i.MX 8M Plus、Qualcomm QRB5165/RB5、Hailo-8和AMD Kria K26等代表性设备的计算组成、标称算力、存储资源、功耗与推理软件栈进行对比;同时以MobileNetV3、YOLOv8、Octo、OpenVLA及边缘VLA工作负载为例,分析参数量、权重精度、训练/任务精度、量化损失、推理时间和端到端控制频率之间的关系。本文进一步给出面向子课题B的统一报告模板和分层实验矩阵,使“峰值算力—模型质量—平均性能—尾时延—控制安全”能在同一证据链中进行审查。
**关键词:** 异构SoC;边缘AI;模型权重;混合精度;量化;推理时延;尾延迟;具身智能;混合实时系统
---
## 1 研究对象及与前两篇综述的关系
前期国内外研究综述主要回答“Linux、RTOS、Hypervisor和AI加速器如何共存”,并将研究重点放在资源隔离、共享资源干扰、跨域通信和安全降级上。工程应用场景文档主要回答“这些问题在人形/四足机器人、移动操作、巡检和EtherCAT控制中如何落地”。
本文作为第三篇独立综述,聚焦于二者之间尚缺的“设备—模型—运行时—实时指标”对应关系:
1. 设备端具有哪些异构计算单元,其标称算力和存储资源是多少;
2. 模型的参数量、权重位宽、活化值和中间缓冲如何占用内存;
3. “训练精度”、“数值精度”和“任务准确率”应如何区分;
4. 推理时间究竟是纯硬件执行、运行时API返回,还是传感器到执行器的端到端时间;
5. 平均FPS很高的平台,在AI、DMA、网络和存储并发时是否仍能维持控制周期的P99.9和观测最大值。
因此,本文中的数据不用于简单给出设备排名,而用于建立实验选型和结果解释的基准。
## 2 性能指标的统一语义
### 2.1 峰值算力不等于模型性能
TOPS通常表示每秒可执行的万亿次基本操作,但其数值受计数方式、数据精度和稀疏性假设影响。例如Jetson Orin官方表格中的整体AI性能明确标为稀疏INT8 TOPS,而同页又另列GPU Tensor Core的稠密INT8性能[1]。因此,不能直接把某厂商的稀疏INT8 TOPS与另一厂商的稠密INT8、FP16 TFLOPS或可配置DPU单元数进行比例换算。
对任一实际模型,性能还取决于:
- 算子是否全部被加速器支持,是否回退到CPU/GPU;
- 张量排布转换、量化/反量化和外部算子的开销;
- 权重、活化值和特征图是否受内存带宽限制;
- 动态形状、batch大小、多流和多模型并发方式;
- 功耗档位、频率锁定、温度以及热降频状态;
- 运行时、编译器、驱动、固件和模型编译产物版本。
### 2.2 模型权重与内存占用
若模型参数量为\(N_p\),每个权重位宽为\(b\),则仅权重的理论容量为:
\[
S_{weight}=N_p\times b/8
\]
例如7B参数模型的理论权重容量约为:FP32 28 GB、FP16/BF16 14 GB、INT8 7 GB、INT4 3.5 GB。这些数字不包括视觉编码临时张量、KV cache、活化值、量化尺度/零点、运行时工作区、图优化副本及I/O缓冲。因此,“权重能放入内存”不等于“模型能稳定运行”。
本课题建议分开报告五个内存量:原始模型文件、编译后引擎/私有格式、常驻权重、峰值活化与工作区、进程峰值常驻内存(RSS)或设备内存峰值。
### 2.3 “精度”需要区分三种含义
| 精度类型 | 常见取值 | 它回答的问题 | 必须同时记录的信息 |
|---|---|---|---|
| 训练数值精度 | FP32、FP16、BF16、混合精度 | 梯度、权重更新和前/反向计算用什么数值格式 | 优化器、loss scaling、训练硬件、时长、数据集版本 |
| 部署/推理精度 | FP32、FP16/BF16、INT8、INT4、W4A16等 | 权重和活化值如何存储与计算 | PTQ或QAT、校准集、逐张量/逐通道、对称/非对称 |
| 任务质量 | Top-1/Top-5、mAP、mIoU、WER、任务成功率 | 模型完成实际任务的质量 | 数据集、划分、输入尺寸、评估脚本、随机种子、置信区间 |
用户所说的“训练精度”在工程文档中经常同时指数值精度和准确率。本文统一将二者分写为“训练/部署位宽”和“任务质量”,避免把“INT8”误读为“80%准确率”。
### 2.4 推理时间的五层口径
| 层级 | 延迟定义 | 包含内容 | 主要用途 |
|---|---|---|---|
| L0 | 算子/核函数时间 | 单个算子或融合核执行 | 算子库与瓶颈分析 |
| L1 | 设备执行时间 | 加速器从接受到完成图执行 | 比较编译产物和计算核 |
| L2 | 运行时推理时间 | API调用、提交、排队、同步和图执行 | 单模型部署基准 |
| L3 | 应用流水线时间 | 预处理+推理+后处理+主机/设备搬运 | 视觉或多模态应用评价 |
| L4 | 端到端控制时间 | 采集、队列、预处理、推理、IPC、校验、控制与执行提交 | 本课题的最终验收口径 |
FPS或samples/s表示吞吐率,\(1/FPS\)只能在batch=1、没有流水重叠且测量口径一致时近似单请求时间。对实时控制,应同时报告P50、P95、P99、P99.9、观测最大值、截止期违约率和连续违约长度,不应只报平均值。
## 3 代表性异构边侧设备指标
### 3.1 设备横向对比
表1使用2026年9月前公开的厂商一手资料。“未给出”表示引用的官方页面没有给出可直接比较的数值,而不表示设备没有功耗或存储限制。
| 平台/芯片 | 异构计算组成 | 官方标称AI性能 | 内存/带宽 | 官方功耗口径 | 典型软件路径 | 对本课题的主要价值 |
|---|---|---:|---|---|---|---|
| Jetson Orin Nano 8GB | 6核Cortex-A78AE + 512核Ampere GPU/16 Tensor Cores | 最高67稀疏INT8 TOPS | 8 GB LPDDR5,约102 GB/s | 7–25 W | Linux/JetPack + CUDA/TensorRT/ONNX Runtime/Isaac ROS | 低成本具身智能与视觉基线;没有独立DLA[1] |
| Jetson Orin NX 16GB | 8核Cortex-A78AE + 1024核Ampere GPU/32 Tensor Cores + 2个NVDLA | 最高157稀疏INT8 TOPS | 16 GB LPDDR5,102.4 GB/s | 10–40 W | Linux/JetPack + CUDA/TensorRT/NVDLA | 适合VLA、多视觉流和异构调度;也是当前机器人开发中常见的档位[1] |
| Jetson AGX Orin 64GB | 12核Cortex-A78AE + 2048核Ampere GPU/64 Tensor Cores + 2个NVDLA + PVA | 最高275稀疏INT8 TOPS | 64 GB LPDDR5,204.8 GB/s | 15–60 W | Linux/JetPack + CUDA/TensorRT/NVDLA | 多模型、多传感器和大模型本地推理基线[1][2] |
| Rockchip RK3588 | 4×Cortex-A76 + 4×Cortex-A55 + Mali-G610 MP4 + 三核NPU + 低功耗MCU | 6 INT8 TOPS;数据手册还列出INT4/INT16/FP16/BF16/TF32支持 | 64-bit LPDDR4/4X/5;额定容量与带宽取决于板级实现 | 未给出统一模块档位 | Linux/Android + RKNN Toolkit2/RKNN Runtime | 低成本NPU和多核CPU/GPU/NPU共存对照;官方模型库提供多模型FPS[3][4] |
| TI TDA4VM | 2×Cortex-A72 + 6×Cortex-R5F + C7x DSP/MMA + 2×C66x DSP + GPU + ISP/VPAC/DMPAC | MMA最高8 INT8 TOPS | 随具体型号和板级设计确定 | 官方产品页未给出统一整机值 | Linux/QNX/FreeRTOS等 + TIDL | 应用核、多实时核、DSP与AI加速器高度集成,非常适合研究“Linux+RTOS+硬件隔离”[5] |
| NXP i.MX 8M Plus | 2/4×Cortex-A53 + Cortex-M7 + NPU + HiFi 4 DSP + GPU + 双ISP | 最高2.3 TOPS | LPDDR4/DDR4,支持内联ECC;容量取决于型号和板级实现 | 未给出统一整机值 | Linux + FreeRTOS + eIQ/TFLite/ONNX生态 | 算力不高但实时核、TSN/CAN FD和工业接口完整,适合中小模型+实时控制[6][7] |
| Qualcomm QRB5165/RB5 | 4高性能+4低功耗Kryo 585 + Adreno 650 + Hexagon 698/HTA/HVX + EVA/ISP | AI Engine最高15 TOPS | 开发套件配置与商用SoM不同,需按BOM冻结 | 官方页未给出统一整机值 | Linux/Ubuntu/ROS 2 + QAIRT/QNN/HTP | 强ISP、DSP、NPU和连接性,适合机器人、无人机和多相机异构流水线[8] |
| Hailo-8(加速器) | 数据流AI处理器,需外部主机 | 26 TOPS | 芯片设计不需外部存储器;系统总内存仍由主机和流水线决定 | 官方典型值2.5 W | Host Linux + Hailo Dataflow Compiler + HailoRT/HEF | 适合研究外挂NPU、PCIe搬运、设备队列与主机控制任务之间的干扰[9] |
| AMD Kria K26 | 4×Cortex-A53 + 2×Cortex-R5F + Mali-400 + 25.6万逻辑单元/1248 DSP的可编程逻辑 | 取决于DPU或自定义数据通路配置,不宜以固定TOPS与NPU比较 | 4 GB 64-bit DDR4,2400 Mb/s;26.6 Mb片上存储 | 取决于PL设计与载板 | Linux/FreeRTOS + Vitis AI/自定义PL加速 | 可把关键预处理、时间触发或自定义推理流水线硬件化,适合确定性对照[10][11] |
上表表明,主流设备并不是同一类产品。Jetson强调GPU生态、统一内存与大模型兼容性;RK3588强调成本与多媒体NPU;TDA4VM、i.MX 8M Plus和Kria更容易形成应用域与实时域的硬件分工;QRB5165具有移动SoC的能效、感知和连接优势;Hailo-8则是主机外挂专用加速器。子课题B的“混合实时”研究应关注这些架构差异如何影响隔离和尾时延,而不是只寻找TOPS最大的设备。
### 3.2 主要推理架构和编译链
| 类型 | 典型数据路径 | 优势 | 与实时性相关的风险 |
|---|---|---|---|
| GPU/Tensor Core | PyTorch/ONNX → TensorRT engine → CUDA stream → GPU | 算子覆盖广,支持FP32/FP16/BF16/FP8/INT8/INT4/FP4等混合精度,易部署Transformer[12] | 核函数不可抢占区间、多流排队、显存/统一内存竞争和热降频 |
| 固定功能NPU/DLA | ONNX/TFLite → 厂商编译器 → 私有图/二进制 → NPU Runtime | INT8能效高,适合固定视觉网络 | 算子不支持时可切图或回退CPU;固件队列和抢占能力不透明 |
| DSP/HTP/MMA | 模型编译 → DSP/向量核+矩阵加速器 | 视觉、信号处理和AI可在相同子系统内融合 | 多核共享内存、任务图与数据搬运配置复杂 |
| 数据流NPU | 模型 → 结构映射/编译 → HEF等产物 → 流式执行 | 视觉模型吞吐和能效高 | 主机预/后处理、PCIe或M.2传输和多流调度仍会影响端到端时间 |
| FPGA/可编程逻辑 | 模型或自定义算子 → HLS/RTL/DPU → PL流水线 | 可定制I/O、并行度和固定数据路径,便于硬件时间触发 | 编译时间长,可用算子和量化方案受配置限制,更改模型需重新生成硬件产物 |
这些运行时并不直接对应操作系统的实时优先级。即使提交线程在Linux中设置了高优先级,设备内部已排队任务、固件命令批次和内存控制器仍可能不可抢占。因此需要以时间戳区分“主机提交—设备开始—设备完成—结果可用”四个时刻。
## 4 代表性模型的权重、质量与计算规模
### 4.1 从轻量视觉到具身大模型
表2中的权重容量按参数量与位宽计算,是方便选型的理论值,不代表文件大小或运行时峰值内存。
| 模型 | 任务/架构 | 参数与计算 | 理论权重容量 | 公开任务质量/训练信息 | 对边侧部署的含义 |
|---|---|---|---|---|---|
| MobileNetV3-Large 1.0 | ImageNet分类,移动CNN | 5.4M参数,219M MAdds | FP32 21.6 MB;FP16 10.8 MB;INT8 5.4 MB | ImageNet Top-1 75.2%[13] | 适合作为算子覆盖和量化基线,但不能代表检测、分割或VLA |
| YOLOv8n | COCO目标检测,单阶段CNN | 3.2M参数,约8.74 GOP(Hailo口径) | FP32 12.8 MB;FP16 6.4 MB;INT8 3.2 MB | Hailo模型库报告float mAP 37.0、设备mAP 36.4[14] | 适合低延迟感知和量化损失对照 |
| YOLOv8s | COCO目标检测 | 11.2M参数,约28.6 GOP | FP32 44.8 MB;FP16 22.4 MB;INT8 11.2 MB | float mAP 44.6、Hailo设备mAP 43.9[14] | 与YOLOv8n组成同系列精度—延迟折中实验 |
| Octo-Small/Base | 通用机器人策略,Transformer+动作头 | 27M/93M参数 | FP16约54/186 MB;INT8约27/93 MB | 使用约80万条机器人轨迹;官方仓库报告RTX 4090上约17/13 it/s[15] | 模型可放入边侧内存,但4090结果不能代替边侧实测;任务质量应以机器人成功率报告 |
| OpenVLA-7B | 视觉—语言—动作,双视觉编码器+投影层+Llama 2 7B | 约7B参数 | FP16约14 GB;INT8约7 GB;INT4约3.5 GB | 97万条真实机器人演示;64块A100训练15天;论文报告其在29项任务上较RT-2-X绝对成功率高16.5个百分点[16][17] | 量化后权重可能放入8–16 GB设备,但活化值、视觉编码和上下文仍可造成显著内存及延迟压力 |
| LiteVLA-Edge实验管线 | 边缘多模态控制,ROS 2 + llama.cpp | 论文采用FP32监督微调后4-bit GGUF量化 | 依具体基座模型而定 | Jetson Orin类平台上报告平均端到端时延150.5 ms,约6.6 Hz[18] | 说明“可运行”与“可高频闭环”差距巨大;需用异步动作块、过期拒绝和RTOS底层控制弥补 |
上述数据还显示,“准确率”不能在不同任务之间直接比较。75.2% ImageNet Top-1、44.6 COCO mAP和机器人任务成功率属于不同评价对象。对具身智能,最终应报告分任务成功率、碰撞/越界次数、完成时间和对延迟扰动的敏感性,不能只使用离线感知指标。
### 4.2 公开设备推理数据示例
下表故意保留了各官方模型库的测试口径,不将它们包装成严格跨平台排名。倒数时间仅为\(1000/FPS\)的理想化换算,不是P99或端到端延迟。
| 设备/来源 | 模型与输入 | 精度 | 公开吞吐 | 理想化倒数时间 | 测试条件与解读 |
|---|---|---|---:|---:|---|
| RK3588官方RKNN Model Zoo | MobileNetV2,1×3×224×224 | INT8 | 450.7 FPS | 2.22 ms | 官方表格标注RK3588 NPU单核,适合作图执行吞吐基线[4] |
| RK3588官方RKNN Model Zoo | ResNet50-v2,1×3×224×224 | INT8 | 110.1 FPS | 9.08 ms | 同上[4] |
| RK3588官方RKNN Model Zoo | YOLOv8n/s/m,1×3×640×640 | INT8 | 73.5/38.0/16.2 FPS | 13.61/26.32/61.73 ms | 同系列随模型规模增大出现清晰延迟梯度[4] |
| Hailo-8官方Model Zoo | YOLOv8n/s/m/l,640×640 | 编译后硬件部署 | 1036/491/66.9/36.2 FPS | 0.97/2.04/14.95/27.62 ms | 官方表格的主机为i5-9400、PCIe Gen3×4、室温、batch=1;表内还分别报告float和硬件mAP[14] |
| Hailo-8官方CLI示例 | ResNet-50 | 编译后HEF | 1328.83 FPS | 不按倒数解读 | 同一输出报告硬件延迟2.936 ms和流式平均功耗3.194 W,说明流水吞吐与单请求延迟并非简单互为倒数[19] |
| Jetson Orin类设备/LiteVLA-Edge | 量化多模态控制管线 | 4-bit GGUF | 约6.6 Hz | 平均端到端150.5 ms | 包含ROS 2感知—推理—动作管线,与纯NPU图执行不是同一口径[18] |
对真正的跨设备比较,应优先使用MLPerf Inference Edge这类固定模型、数据集、质量门槛、负载生成器和场景规则的基准。MLCommons将Closed组用于尽可能同模型横向比较,Open组则允许更换模型或重训练[20]。即使如此,MLPerf的Offline/Server/SingleStream等场景仍不能替代本课题的RTOS控制并发和故障注入实验。
## 5 面向混合实时控制的指标体系
### 5.1 不应缺失的设备信息
每一组实验至少冻结:
- SoC/模组/开发板型号、内存容量和载板版本;
- OS、内核、RTOS、Hypervisor、BSP和固件版本;
- AI编译器、运行时、驱动和模型编译产物的哈希;
- 功耗模式、CPU/GPU/NPU/内存频率、锁频方式和散热条件;
- CPU亲和性、中断亲和性、内存区域、IOMMU、设备所有权和加速器并发度;
- 采集时长、样本数、预热时间、环境温度与稳态温度。
### 5.2 不应缺失的模型信息
- 模型名称、代码/权重提交号、输入尺寸、batch、序列长度和动态形状范围;
- 参数量、MACs/FLOPs/OPS口径和支持算子比例;
- 原始权重位宽、部署权重/活化位宽和混合精度列表;
- PTQ/QAT方式、校准数据集与样本数,是否采用稀疏性或剪枝;
- FP32/原始模型质量、编译后仿真质量和目标板实测质量;
- 编译失败、CPU回退、子图切分、张量转换和外部算子情况。
### 5.3 四类性能结果
| 类别 | 核心指标 | 解释要点 |
|---|---|---|
| 模型质量 | 原始质量、量化后质量、绝对/相对下降、分类别/分场景成功率 | 达不到冻结质量门槛时,性能再高也不进入实时比较 |
| 推理时序 | 冷启动、预热后P50/P95/P99/P99.9/最大值,吞吐、队列深度和超时率 | 分别记录L1–L4口径,避免用纯硬件FPS代替端到端时间 |
| 资源与能效 | CPU/GPU/NPU利用率、DDR带宽、LLC未命中、DMA、峰值内存、平均/峰值功耗、J/inference | 功耗必须注明是芯片、模组、加速卡还是整机口径 |
| 控制影响 | 控制周期偏差、截止期违约、AI结果年龄、过期丢弃率、降级与恢复时间 | 这是子课题B区别于通用AI硬件评测的最终指标 |
## 6 对子课题B的设备和模型选型建议
### 6.1 建议形成四类对照平台
1. **高AI生态主平台:Jetson Orin NX 16GB或AGX Orin。** 用于具身视觉、VLA、多模型并发和GPU/DLA异构分配,也便于与已有机器人应用资料衔接。
2. **集成实时域平台:TDA4VM或i.MX 8M Plus。** 用于对比应用核与R5F/M7实时核的硬件分工、共享内存通信和故障隔离。
3. **低成本NPU平台:RK3588。** 用于评价私有NPU编译、算子回退、单/多NPU核调度与Linux实时化的性价比。
4. **外挂或可编程加速平台:Hailo-8或Kria K26。** 用于研究PCIe/DMA搬运、主机队列、自定义数据通路和固定流水线的确定性。
若当前资源只允许购置一套平台,建议优先Orin NX 16GB,并外接一块运行RTOS的MCU或实时控制器建立可测的Linux AI域—RTOS控制域链路。若研究重心更偏向单芯片内的真正AMP和安全隔离,TDA4VM的A72+R5F+C7x/MMA结构更具代表性。
### 6.2 建议的模型负载梯度
| 梯度 | 建议模型 | 目的 |
|---|---|---|
| M0 算子微基准 | Conv2D、Depthwise Conv、GEMM、Attention、Resize、NMS | 建立算子时间、能耗和CPU回退数据库 |
| M1 轻量分类 | MobileNetV3-Large或MobileNetV2 | 验证编译链、INT8量化和最小延迟 |
| M2 实时检测 | YOLOv8n/s/m | 建立模型规模—质量—延迟—能耗曲线 |
| M3 语义/姿态任务 | DeepLabV3+、YOLOv8-Pose或项目自有模型 | 接近机器人对环境和人的感知负载 |
| M4 紧凑机器人策略 | Octo-Small/Base或等规模动作模型 | 评估视觉、语言/状态和动作生成管线 |
| M5 量化VLA | OpenVLA类7B或更小VLA的INT4版本 | 验证大权重、长时延、异步动作块和结果新鲜度策略 |
## 7 建议直接纳入课题的实验设计
### 7.1 E0:版本与配置冻结
生成设备BOM、软件版本、功耗/频率、核与中断分配、模型哈希、校准集哈希和编译参数清单。未完成E0的数据不进入横向对比。
### 7.2 E1:模型质量与内存账本
对每个模型依次测量FP32/FP16原始质量、PTQ INT8/INT4质量、必要时的QAT质量;统计模型文件、设备编译产物、常驻权重、峰值工作区和稳态/峰值RSS。质量下降超过任务门槛的精度方案不参加性能验收。
### 7.3 E2:单模型隔离推理
固定batch=1和输入,分别测试冷启动、预热后和热稳态。对L1、L2、L3时间分段打点,报告分位数、吞吐、功耗和能耗。对具有多NPU核、GPU+DLA或CPU+DSP+NPU的设备,对比单加速器、多加速器和多模型并发。
### 7.4 E3:控制域与AI域并发
设置0.5/1/2/10 ms等不同控制周期的仿真或实机任务,对比:
1. 仅控制任务;
2. 控制+单模型推理;
3. 控制+多视频流/多模型;
4. 控制+大模型/VLA长时推理;
5. 同负载下的普通Linux、PREEMPT_RT、AMP或静态分区方案。
主指标为控制周期P99.9/最大偏差、截止期违约、AI结果年龄和过期拒绝率。
### 7.5 E4:共享资源压力
逐项和联合注入CPU、LLC、DDR、DMA、摄像头/ISP、网络、NVMe、GPU/NPU和热负载,建立:
\[
资源干扰强度\rightarrow推理队列和尾时延\rightarrow控制周期偏差\rightarrow截止期/任务质量
\]
的因果记录。此实验应长时运行到热稳态,否则无法观测DVFS和热降频对长尾的影响。
### 7.6 E5:超时、故障和恢复
注入AI进程崩溃、设备超时、驱动队列停滞、消息丢失/乱序/重复、过期结果、Linux重启和温度降频。测量故障检测时间、RTOS降级切换时间、安全状态保持率、通道清理和受控重新接入时间。
## 8 综合讨论
### 8.1 关于“边端训练”
大多数异构边侧设备的主要任务是推理,并非从零训练大模型。OpenVLA的公开信息显示其预训练使用了64块A100、15天[17],这与边侧SoC的功耗、内存和散热边界不在同一级别。边端更可行的路径是离线集中训练,边端进行小样本校准、LoRA/适配层微调、增量学习或模型选择。这些在线学习活动不应与高关键控制无界共享资源。
### 8.2 关于具身智能的多频率系统
具身智能中的VLA可能只能以6–20 Hz生成动作或动作块,而关节、平衡、力控和安全监测可能需要500 Hz–2 kHz甚至更高的周期。这不意味着VLA必须和伺服环同频,而意味着系统必须有明确的多频率协议:VLA只发布带时间戳、有效期、版本和置信度的有界目标/动作块;RTOS以高频率完成插值、限幅、状态估计、执行器控制和故障降级。
### 8.3 最有价值的研究指标
对本课题而言,最有价值的不是“将YOLO加速到多少FPS”,而是以下三类关系:
1. 在相同模型质量门槛下,不同设备/精度/运行时的L3和L4尾时延如何;
2. 在相同AI负载下,普通Linux、PREEMPT_RT、AMP和静态分区对控制周期P99.9和最大值的改善程度;
3. 当AI超时、过载或崩溃时,RTOS能否在已知时间内拒绝旧结果、进入降级并维持安全状态。
## 9 结论
当前主流异构边侧设备已形成GPU主导、集成NPU/DSP、应用核+实时核、外挂数据流加速器和FPGA可编程逻辑等多条技术路线。其公开算力横跨约2.3 TOPS到275稀疏INT8 TOPS,但TOPS口径、数值精度、稀疏性、算子覆盖、内存系统和运行时都不同,因而不能根据峰值数字直接预测模型FPS或端到端控制时闶。
在模型层面,MobileNet/YOLO类模型的权重仅为数MB至数十MB,而7B VLA即使INT4权重也约3.5 GB,其中间状态和端到端流水线还会显著增加内存与时间成本。量化的意义不只是减小文件,还要同时验证任务质量、算子映射、实际内存峰值和长尾时延。
因此,子课题B应将设备峰值参数作为入口,将模型质量作为准入门槛,将L1–L4时间分解和资源计量作为过程证据,最终以控制周期、AI结果新鲜度、过期拒绝、故障降级和恢复时间作为系统级结论。这样才能把“模型跑得动”提升为“智能与实时控制可在已知边界内共存”。
## 参考资料
1. NVIDIA. *Jetson AGX Orin for Next-Gen Robotics: Technical Specifications*. [官方产品与规格页](https://www.nvidia.com/en-us/autonomous-machines/embedded-systems/jetson-orin/),访问日期:2026-09-29。
2. NVIDIA. *Jetson AGX Orin Series Hardware Architecture*. [官方技术简报](https://www.nvidia.com/content/dam/en-zz/Solutions/gtcf21/jetson-orin/nvidia-jetson-agx-orin-technical-brief.pdf)。
3. Rockchip. *RK3588 Brief Datasheet*. [官方数据手册](https://www.rock-chips.com/uploads/pdf/2022.8.26/191/RK3588%20Brief%20Datasheet.pdf)。
4. Rockchip AI Team. *RKNN Model Zoo*. [官方代码仓库及性能表](https://github.com/airockchip/rknn_model_zoo/blob/main/README_CN.md),访问日期:2026-09-29。
5. Texas Instruments. *TDA4VM SoC with Dual Arm Cortex-A72, 8 TOPS of AI, C7x DSP, and GPU*. [官方产品页](https://www.ti.com/product/TDA4VM)。
6. NXP. *i.MX 8M Plus: Cortex-A53/M7, Machine Learning, Vision, Multimedia and Industrial IoT*. [官方产品页](https://www.nxp.com/products/i.MX8MPLUS)。
7. NXP. *i.MX 8M Plus Applications Processor Family*. [官方产品手册](https://www.nxp.com/docs/en/brochure/IMX8SERAPPBR.pdf)。
8. Qualcomm. *Dragonwing QRB5165*. [官方产品页](https://www.qualcomm.com/internet-of-things/products/q5-series/qrb5165)。
9. Hailo. *Hailo-8 AI Processor Product Brief*. [官方产品简报](https://hailo.ai/wp-content/uploads/2023/10/hailo-8-product-brief-rev3.26.pdf)。
10. AMD. *Kria K26 SOM Data Sheet (DS987)*. [官方数据手册](https://docs.amd.com/r/en-US/ds987-k26-som)。
11. AMD. *Kria K26 SOM: The Ideal Platform for Vision AI at the Edge*. [官方白皮书](https://docs.amd.com/v/u/en-US/wp529-som-benchmarks)。
12. NVIDIA. *TensorRT Documentation*. [官方文档](https://docs.nvidia.com/deeplearning/tensorrt/latest/)。
13. HOWARD A, SANDLER M, CHU G, et al. Searching for MobileNetV3[EB/OL]. arXiv:1905.02244, 2019. [论文](https://arxiv.org/abs/1905.02244)。
14. Hailo AI. *Hailo Model Zoo: Hailo-8 Object Detection Models*. [官方模型指标与基准表](https://github.com/hailo-ai/hailo_model_zoo/blob/master/docs/public_models/HAILO8/HAILO8_object_detection.rst)。
15. OCTO MODEL TEAM, GHOSH D, WALKE H, et al. Octo: An Open-Source Generalist Robot Policy[C]//Robotics: Science and Systems. 2024. [官方仓库与模型数据](https://github.com/octo-models/octo)。
16. KIM M J, PERTSCH K, KARAMCHETI S, et al. OpenVLA: An Open-Source Vision-Language-Action Model[EB/OL]. arXiv:2406.09246, 2024. [论文](https://arxiv.org/abs/2406.09246)。
17. OpenVLA Team. *OpenVLA Project Page*. [官方项目页](https://openvla.github.io/)。
18. WILLIAMS J, GUPTA K D, GEORGE R, et al. LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics[EB/OL]. arXiv:2603.03380, 2026. [论文](https://arxiv.org/abs/2603.03380)。
19. Hailo AI. *Hailo Model Zoo Benchmarks*. [官方基准复现说明](https://github.com/hailo-ai/hailo_model_zoo/blob/master/docs/BENCHMARKS.rst)。
20. MLCommons. *MLPerf Inference: Edge*. [官方基准、场景与结果](https://mlcommons.org/benchmarks/inference-edge/),访问日期:2026-09-29。