Files
rtos_llm_opt/03-主流异构边侧设备与AI模型性能指标综述.md
T

26 KiB
Raw Blame History

主流异构边侧设备与AI模型性能指标综述

摘要

边侧智能控制设备正从单一CPU或GPU计算平台,演进为同时集成应用核、实时核、GPU、NPU/DLA、DSP、ISP、FPGA可编程逻辑和多类I/O加速单元的异构系统。对这类平台进行选型时,仅比较TOPS会遮蔽模型精度、权重体积、算子落点、内存带宽、运行时回退、队列等待、功耗模式和尾时延等关键差异。本文结合前期《面向边侧异构SoC的混合实时控制基础系统研究综述》和《工程应用场景与性能指标对标》,对NVIDIA Jetson Orin、Rockchip RK3588、TI TDA4VM、NXP i.MX 8M Plus、Qualcomm QRB5165/RB5、Hailo-8和AMD Kria K26等代表性设备的计算组成、标称算力、存储资源、功耗与推理软件栈进行对比;同时以MobileNetV3、YOLOv8、Octo、OpenVLA及边缘VLA工作负载为例,分析参数量、权重精度、训练/任务精度、量化损失、推理时间和端到端控制频率之间的关系。本文进一步给出面向子课题B的统一报告模板和分层实验矩阵,使“峰值算力—模型质量—平均性能—尾时延—控制安全”能在同一证据链中进行审查。

关键词: 异构SoC;边缘AI;模型权重;混合精度;量化;推理时延;尾延迟;具身智能;混合实时系统


1 研究对象及与前两篇综述的关系

前期国内外研究综述主要回答“Linux、RTOS、Hypervisor和AI加速器如何共存”,并将研究重点放在资源隔离、共享资源干扰、跨域通信和安全降级上。工程应用场景文档主要回答“这些问题在人形/四足机器人、移动操作、巡检和EtherCAT控制中如何落地”。

本文作为第三篇独立综述,聚焦于二者之间尚缺的“设备—模型—运行时—实时指标”对应关系:

  1. 设备端具有哪些异构计算单元,其标称算力和存储资源是多少;
  2. 模型的参数量、权重位宽、活化值和中间缓冲如何占用内存;
  3. “训练精度”、“数值精度”和“任务准确率”应如何区分;
  4. 推理时间究竟是纯硬件执行、运行时API返回,还是传感器到执行器的端到端时间;
  5. 平均FPS很高的平台,在AI、DMA、网络和存储并发时是否仍能维持控制周期的P99.9和观测最大值。

因此,本文中的数据不用于简单给出设备排名,而用于建立实验选型和结果解释的基准。

2 性能指标的统一语义

2.1 峰值算力不等于模型性能

TOPS通常表示每秒可执行的万亿次基本操作,但其数值受计数方式、数据精度和稀疏性假设影响。例如Jetson Orin官方表格中的整体AI性能明确标为稀疏INT8 TOPS,而同页又另列GPU Tensor Core的稠密INT8性能[1]。因此,不能直接把某厂商的稀疏INT8 TOPS与另一厂商的稠密INT8、FP16 TFLOPS或可配置DPU单元数进行比例换算。

对任一实际模型,性能还取决于:

  • 算子是否全部被加速器支持,是否回退到CPU/GPU;
  • 张量排布转换、量化/反量化和外部算子的开销;
  • 权重、活化值和特征图是否受内存带宽限制;
  • 动态形状、batch大小、多流和多模型并发方式;
  • 功耗档位、频率锁定、温度以及热降频状态;
  • 运行时、编译器、驱动、固件和模型编译产物版本。

2.2 模型权重与内存占用

若模型参数量为(N_p),每个权重位宽为(b),则仅权重的理论容量为:

[ S_{weight}=N_p\times b/8 ]

例如7B参数模型的理论权重容量约为:FP32 28 GB、FP16/BF16 14 GB、INT8 7 GB、INT4 3.5 GB。这些数字不包括视觉编码临时张量、KV cache、活化值、量化尺度/零点、运行时工作区、图优化副本及I/O缓冲。因此,“权重能放入内存”不等于“模型能稳定运行”。

本课题建议分开报告五个内存量:原始模型文件、编译后引擎/私有格式、常驻权重、峰值活化与工作区、进程峰值常驻内存(RSS)或设备内存峰值。

2.3 “精度”需要区分三种含义

精度类型 常见取值 它回答的问题 必须同时记录的信息
训练数值精度 FP32、FP16、BF16、混合精度 梯度、权重更新和前/反向计算用什么数值格式 优化器、loss scaling、训练硬件、时长、数据集版本
部署/推理精度 FP32、FP16/BF16、INT8、INT4、W4A16等 权重和活化值如何存储与计算 PTQ或QAT、校准集、逐张量/逐通道、对称/非对称
任务质量 Top-1/Top-5、mAP、mIoU、WER、任务成功率 模型完成实际任务的质量 数据集、划分、输入尺寸、评估脚本、随机种子、置信区间

用户所说的“训练精度”在工程文档中经常同时指数值精度和准确率。本文统一将二者分写为“训练/部署位宽”和“任务质量”,避免把“INT8”误读为“80%准确率”。

2.4 推理时间的五层口径

层级 延迟定义 包含内容 主要用途
L0 算子/核函数时间 单个算子或融合核执行 算子库与瓶颈分析
L1 设备执行时间 加速器从接受到完成图执行 比较编译产物和计算核
L2 运行时推理时间 API调用、提交、排队、同步和图执行 单模型部署基准
L3 应用流水线时间 预处理+推理+后处理+主机/设备搬运 视觉或多模态应用评价
L4 端到端控制时间 采集、队列、预处理、推理、IPC、校验、控制与执行提交 本课题的最终验收口径

FPS或samples/s表示吞吐率,(1/FPS)只能在batch=1、没有流水重叠且测量口径一致时近似单请求时间。对实时控制,应同时报告P50、P95、P99、P99.9、观测最大值、截止期违约率和连续违约长度,不应只报平均值。

3 代表性异构边侧设备指标

3.1 设备横向对比

表1使用2026年9月前公开的厂商一手资料。“未给出”表示引用的官方页面没有给出可直接比较的数值,而不表示设备没有功耗或存储限制。

平台/芯片 异构计算组成 官方标称AI性能 内存/带宽 官方功耗口径 典型软件路径 对本课题的主要价值
Jetson Orin Nano 8GB 6核Cortex-A78AE + 512核Ampere GPU/16 Tensor Cores 最高67稀疏INT8 TOPS 8 GB LPDDR5,约102 GB/s 7–25 W Linux/JetPack + CUDA/TensorRT/ONNX Runtime/Isaac ROS 低成本具身智能与视觉基线;没有独立DLA[1]
Jetson Orin NX 16GB 8核Cortex-A78AE + 1024核Ampere GPU/32 Tensor Cores + 2个NVDLA 最高157稀疏INT8 TOPS 16 GB LPDDR5,102.4 GB/s 10–40 W Linux/JetPack + CUDA/TensorRT/NVDLA 适合VLA、多视觉流和异构调度;也是当前机器人开发中常见的档位[1]
Jetson AGX Orin 64GB 12核Cortex-A78AE + 2048核Ampere GPU/64 Tensor Cores + 2个NVDLA + PVA 最高275稀疏INT8 TOPS 64 GB LPDDR5,204.8 GB/s 15–60 W Linux/JetPack + CUDA/TensorRT/NVDLA 多模型、多传感器和大模型本地推理基线[1][2]
Rockchip RK3588 4×Cortex-A76 + 4×Cortex-A55 + Mali-G610 MP4 + 三核NPU + 低功耗MCU 6 INT8 TOPS;数据手册还列出INT4/INT16/FP16/BF16/TF32支持 64-bit LPDDR4/4X/5;额定容量与带宽取决于板级实现 未给出统一模块档位 Linux/Android + RKNN Toolkit2/RKNN Runtime 低成本NPU和多核CPU/GPU/NPU共存对照;官方模型库提供多模型FPS[3][4]
TI TDA4VM 2×Cortex-A72 + 6×Cortex-R5F + C7x DSP/MMA + 2×C66x DSP + GPU + ISP/VPAC/DMPAC MMA最高8 INT8 TOPS 随具体型号和板级设计确定 官方产品页未给出统一整机值 Linux/QNX/FreeRTOS等 + TIDL 应用核、多实时核、DSP与AI加速器高度集成,非常适合研究“Linux+RTOS+硬件隔离”[5]
NXP i.MX 8M Plus 2/4×Cortex-A53 + Cortex-M7 + NPU + HiFi 4 DSP + GPU + 双ISP 最高2.3 TOPS LPDDR4/DDR4,支持内联ECC;容量取决于型号和板级实现 未给出统一整机值 Linux + FreeRTOS + eIQ/TFLite/ONNX生态 算力不高但实时核、TSN/CAN FD和工业接口完整,适合中小模型+实时控制[6][7]
Qualcomm QRB5165/RB5 4高性能+4低功耗Kryo 585 + Adreno 650 + Hexagon 698/HTA/HVX + EVA/ISP AI Engine最高15 TOPS 开发套件配置与商用SoM不同,需按BOM冻结 官方页未给出统一整机值 Linux/Ubuntu/ROS 2 + QAIRT/QNN/HTP 强ISP、DSP、NPU和连接性,适合机器人、无人机和多相机异构流水线[8]
Hailo-8(加速器) 数据流AI处理器,需外部主机 26 TOPS 芯片设计不需外部存储器;系统总内存仍由主机和流水线决定 官方典型值2.5 W Host Linux + Hailo Dataflow Compiler + HailoRT/HEF 适合研究外挂NPU、PCIe搬运、设备队列与主机控制任务之间的干扰[9]
AMD Kria K26 4×Cortex-A53 + 2×Cortex-R5F + Mali-400 + 25.6万逻辑单元/1248 DSP的可编程逻辑 取决于DPU或自定义数据通路配置,不宜以固定TOPS与NPU比较 4 GB 64-bit DDR4,2400 Mb/s;26.6 Mb片上存储 取决于PL设计与载板 Linux/FreeRTOS + Vitis AI/自定义PL加速 可把关键预处理、时间触发或自定义推理流水线硬件化,适合确定性对照[10][11]

上表表明,主流设备并不是同一类产品。Jetson强调GPU生态、统一内存与大模型兼容性;RK3588强调成本与多媒体NPU;TDA4VM、i.MX 8M Plus和Kria更容易形成应用域与实时域的硬件分工;QRB5165具有移动SoC的能效、感知和连接优势;Hailo-8则是主机外挂专用加速器。子课题B的“混合实时”研究应关注这些架构差异如何影响隔离和尾时延,而不是只寻找TOPS最大的设备。

3.2 主要推理架构和编译链

类型 典型数据路径 优势 与实时性相关的风险
GPU/Tensor Core PyTorch/ONNX → TensorRT engine → CUDA stream → GPU 算子覆盖广,支持FP32/FP16/BF16/FP8/INT8/INT4/FP4等混合精度,易部署Transformer[12] 核函数不可抢占区间、多流排队、显存/统一内存竞争和热降频
固定功能NPU/DLA ONNX/TFLite → 厂商编译器 → 私有图/二进制 → NPU Runtime INT8能效高,适合固定视觉网络 算子不支持时可切图或回退CPU;固件队列和抢占能力不透明
DSP/HTP/MMA 模型编译 → DSP/向量核+矩阵加速器 视觉、信号处理和AI可在相同子系统内融合 多核共享内存、任务图与数据搬运配置复杂
数据流NPU 模型 → 结构映射/编译 → HEF等产物 → 流式执行 视觉模型吞吐和能效高 主机预/后处理、PCIe或M.2传输和多流调度仍会影响端到端时间
FPGA/可编程逻辑 模型或自定义算子 → HLS/RTL/DPU → PL流水线 可定制I/O、并行度和固定数据路径,便于硬件时间触发 编译时间长,可用算子和量化方案受配置限制,更改模型需重新生成硬件产物

这些运行时并不直接对应操作系统的实时优先级。即使提交线程在Linux中设置了高优先级,设备内部已排队任务、固件命令批次和内存控制器仍可能不可抢占。因此需要以时间戳区分“主机提交—设备开始—设备完成—结果可用”四个时刻。

4 代表性模型的权重、质量与计算规模

4.1 从轻量视觉到具身大模型

表2中的权重容量按参数量与位宽计算,是方便选型的理论值,不代表文件大小或运行时峰值内存。

模型 任务/架构 参数与计算 理论权重容量 公开任务质量/训练信息 对边侧部署的含义
MobileNetV3-Large 1.0 ImageNet分类,移动CNN 5.4M参数,219M MAdds FP32 21.6 MB;FP16 10.8 MB;INT8 5.4 MB ImageNet Top-1 75.2%[13] 适合作为算子覆盖和量化基线,但不能代表检测、分割或VLA
YOLOv8n COCO目标检测,单阶段CNN 3.2M参数,约8.74 GOP(Hailo口径) FP32 12.8 MB;FP16 6.4 MB;INT8 3.2 MB Hailo模型库报告float mAP 37.0、设备mAP 36.4[14] 适合低延迟感知和量化损失对照
YOLOv8s COCO目标检测 11.2M参数,约28.6 GOP FP32 44.8 MB;FP16 22.4 MB;INT8 11.2 MB float mAP 44.6、Hailo设备mAP 43.9[14] 与YOLOv8n组成同系列精度—延迟折中实验
Octo-Small/Base 通用机器人策略,Transformer+动作头 27M/93M参数 FP16约54/186 MB;INT8约27/93 MB 使用约80万条机器人轨迹;官方仓库报告RTX 4090上约17/13 it/s[15] 模型可放入边侧内存,但4090结果不能代替边侧实测;任务质量应以机器人成功率报告
OpenVLA-7B 视觉—语言—动作,双视觉编码器+投影层+Llama 2 7B 约7B参数 FP16约14 GB;INT8约7 GB;INT4约3.5 GB 97万条真实机器人演示;64块A100训练15天;论文报告其在29项任务上较RT-2-X绝对成功率高16.5个百分点[16][17] 量化后权重可能放入8–16 GB设备,但活化值、视觉编码和上下文仍可造成显著内存及延迟压力
LiteVLA-Edge实验管线 边缘多模态控制,ROS 2 + llama.cpp 论文采用FP32监督微调后4-bit GGUF量化 依具体基座模型而定 Jetson Orin类平台上报告平均端到端时延150.5 ms,约6.6 Hz[18] 说明“可运行”与“可高频闭环”差距巨大;需用异步动作块、过期拒绝和RTOS底层控制弥补

上述数据还显示,“准确率”不能在不同任务之间直接比较。75.2% ImageNet Top-1、44.6 COCO mAP和机器人任务成功率属于不同评价对象。对具身智能,最终应报告分任务成功率、碰撞/越界次数、完成时间和对延迟扰动的敏感性,不能只使用离线感知指标。

4.2 公开设备推理数据示例

下表故意保留了各官方模型库的测试口径,不将它们包装成严格跨平台排名。倒数时间仅为(1000/FPS)的理想化换算,不是P99或端到端延迟。

设备/来源 模型与输入 精度 公开吞吐 理想化倒数时间 测试条件与解读
RK3588官方RKNN Model Zoo MobileNetV2,1×3×224×224 INT8 450.7 FPS 2.22 ms 官方表格标注RK3588 NPU单核,适合作图执行吞吐基线[4]
RK3588官方RKNN Model Zoo ResNet50-v2,1×3×224×224 INT8 110.1 FPS 9.08 ms 同上[4]
RK3588官方RKNN Model Zoo YOLOv8n/s/m,1×3×640×640 INT8 73.5/38.0/16.2 FPS 13.61/26.32/61.73 ms 同系列随模型规模增大出现清晰延迟梯度[4]
Hailo-8官方Model Zoo YOLOv8n/s/m/l,640×640 编译后硬件部署 1036/491/66.9/36.2 FPS 0.97/2.04/14.95/27.62 ms 官方表格的主机为i5-9400、PCIe Gen3×4、室温、batch=1;表内还分别报告float和硬件mAP[14]
Hailo-8官方CLI示例 ResNet-50 编译后HEF 1328.83 FPS 不按倒数解读 同一输出报告硬件延迟2.936 ms和流式平均功耗3.194 W,说明流水吞吐与单请求延迟并非简单互为倒数[19]
Jetson Orin类设备/LiteVLA-Edge 量化多模态控制管线 4-bit GGUF 约6.6 Hz 平均端到端150.5 ms 包含ROS 2感知—推理—动作管线,与纯NPU图执行不是同一口径[18]

对真正的跨设备比较,应优先使用MLPerf Inference Edge这类固定模型、数据集、质量门槛、负载生成器和场景规则的基准。MLCommons将Closed组用于尽可能同模型横向比较,Open组则允许更换模型或重训练[20]。即使如此,MLPerf的Offline/Server/SingleStream等场景仍不能替代本课题的RTOS控制并发和故障注入实验。

5 面向混合实时控制的指标体系

5.1 不应缺失的设备信息

每一组实验至少冻结:

  • SoC/模组/开发板型号、内存容量和载板版本;
  • OS、内核、RTOS、Hypervisor、BSP和固件版本;
  • AI编译器、运行时、驱动和模型编译产物的哈希;
  • 功耗模式、CPU/GPU/NPU/内存频率、锁频方式和散热条件;
  • CPU亲和性、中断亲和性、内存区域、IOMMU、设备所有权和加速器并发度;
  • 采集时长、样本数、预热时间、环境温度与稳态温度。

5.2 不应缺失的模型信息

  • 模型名称、代码/权重提交号、输入尺寸、batch、序列长度和动态形状范围;
  • 参数量、MACs/FLOPs/OPS口径和支持算子比例;
  • 原始权重位宽、部署权重/活化位宽和混合精度列表;
  • PTQ/QAT方式、校准数据集与样本数,是否采用稀疏性或剪枝;
  • FP32/原始模型质量、编译后仿真质量和目标板实测质量;
  • 编译失败、CPU回退、子图切分、张量转换和外部算子情况。

5.3 四类性能结果

类别 核心指标 解释要点
模型质量 原始质量、量化后质量、绝对/相对下降、分类别/分场景成功率 达不到冻结质量门槛时,性能再高也不进入实时比较
推理时序 冷启动、预热后P50/P95/P99/P99.9/最大值,吞吐、队列深度和超时率 分别记录L1–L4口径,避免用纯硬件FPS代替端到端时间
资源与能效 CPU/GPU/NPU利用率、DDR带宽、LLC未命中、DMA、峰值内存、平均/峰值功耗、J/inference 功耗必须注明是芯片、模组、加速卡还是整机口径
控制影响 控制周期偏差、截止期违约、AI结果年龄、过期丢弃率、降级与恢复时间 这是子课题B区别于通用AI硬件评测的最终指标

6 对子课题B的设备和模型选型建议

6.1 建议形成四类对照平台

  1. 高AI生态主平台:Jetson Orin NX 16GB或AGX Orin。 用于具身视觉、VLA、多模型并发和GPU/DLA异构分配,也便于与已有机器人应用资料衔接。
  2. 集成实时域平台:TDA4VM或i.MX 8M Plus。 用于对比应用核与R5F/M7实时核的硬件分工、共享内存通信和故障隔离。
  3. 低成本NPU平台:RK3588。 用于评价私有NPU编译、算子回退、单/多NPU核调度与Linux实时化的性价比。
  4. 外挂或可编程加速平台:Hailo-8或Kria K26。 用于研究PCIe/DMA搬运、主机队列、自定义数据通路和固定流水线的确定性。

若当前资源只允许购置一套平台,建议优先Orin NX 16GB,并外接一块运行RTOS的MCU或实时控制器建立可测的Linux AI域—RTOS控制域链路。若研究重心更偏向单芯片内的真正AMP和安全隔离,TDA4VM的A72+R5F+C7x/MMA结构更具代表性。

6.2 建议的模型负载梯度

梯度 建议模型 目的
M0 算子微基准 Conv2D、Depthwise Conv、GEMM、Attention、Resize、NMS 建立算子时间、能耗和CPU回退数据库
M1 轻量分类 MobileNetV3-Large或MobileNetV2 验证编译链、INT8量化和最小延迟
M2 实时检测 YOLOv8n/s/m 建立模型规模—质量—延迟—能耗曲线
M3 语义/姿态任务 DeepLabV3+、YOLOv8-Pose或项目自有模型 接近机器人对环境和人的感知负载
M4 紧凑机器人策略 Octo-Small/Base或等规模动作模型 评估视觉、语言/状态和动作生成管线
M5 量化VLA OpenVLA类7B或更小VLA的INT4版本 验证大权重、长时延、异步动作块和结果新鲜度策略

7 建议直接纳入课题的实验设计

7.1 E0:版本与配置冻结

生成设备BOM、软件版本、功耗/频率、核与中断分配、模型哈希、校准集哈希和编译参数清单。未完成E0的数据不进入横向对比。

7.2 E1:模型质量与内存账本

对每个模型依次测量FP32/FP16原始质量、PTQ INT8/INT4质量、必要时的QAT质量;统计模型文件、设备编译产物、常驻权重、峰值工作区和稳态/峰值RSS。质量下降超过任务门槛的精度方案不参加性能验收。

7.3 E2:单模型隔离推理

固定batch=1和输入,分别测试冷启动、预热后和热稳态。对L1、L2、L3时间分段打点,报告分位数、吞吐、功耗和能耗。对具有多NPU核、GPU+DLA或CPU+DSP+NPU的设备,对比单加速器、多加速器和多模型并发。

7.4 E3:控制域与AI域并发

设置0.5/1/2/10 ms等不同控制周期的仿真或实机任务,对比:

  1. 仅控制任务;
  2. 控制+单模型推理;
  3. 控制+多视频流/多模型;
  4. 控制+大模型/VLA长时推理;
  5. 同负载下的普通Linux、PREEMPT_RT、AMP或静态分区方案。

主指标为控制周期P99.9/最大偏差、截止期违约、AI结果年龄和过期拒绝率。

7.5 E4:共享资源压力

逐项和联合注入CPU、LLC、DDR、DMA、摄像头/ISP、网络、NVMe、GPU/NPU和热负载,建立:

[ 资源干扰强度\rightarrow推理队列和尾时延\rightarrow控制周期偏差\rightarrow截止期/任务质量 ]

的因果记录。此实验应长时运行到热稳态,否则无法观测DVFS和热降频对长尾的影响。

7.6 E5:超时、故障和恢复

注入AI进程崩溃、设备超时、驱动队列停滞、消息丢失/乱序/重复、过期结果、Linux重启和温度降频。测量故障检测时间、RTOS降级切换时间、安全状态保持率、通道清理和受控重新接入时间。

8 综合讨论

8.1 关于“边端训练”

大多数异构边侧设备的主要任务是推理,并非从零训练大模型。OpenVLA的公开信息显示其预训练使用了64块A100、15天[17],这与边侧SoC的功耗、内存和散热边界不在同一级别。边端更可行的路径是离线集中训练,边端进行小样本校准、LoRA/适配层微调、增量学习或模型选择。这些在线学习活动不应与高关键控制无界共享资源。

8.2 关于具身智能的多频率系统

具身智能中的VLA可能只能以6–20 Hz生成动作或动作块,而关节、平衡、力控和安全监测可能需要500 Hz–2 kHz甚至更高的周期。这不意味着VLA必须和伺服环同频,而意味着系统必须有明确的多频率协议:VLA只发布带时间戳、有效期、版本和置信度的有界目标/动作块;RTOS以高频率完成插值、限幅、状态估计、执行器控制和故障降级。

8.3 最有价值的研究指标

对本课题而言,最有价值的不是“将YOLO加速到多少FPS”,而是以下三类关系:

  1. 在相同模型质量门槛下,不同设备/精度/运行时的L3和L4尾时延如何;
  2. 在相同AI负载下,普通Linux、PREEMPT_RT、AMP和静态分区对控制周期P99.9和最大值的改善程度;
  3. 当AI超时、过载或崩溃时,RTOS能否在已知时间内拒绝旧结果、进入降级并维持安全状态。

9 结论

当前主流异构边侧设备已形成GPU主导、集成NPU/DSP、应用核+实时核、外挂数据流加速器和FPGA可编程逻辑等多条技术路线。其公开算力横跨约2.3 TOPS到275稀疏INT8 TOPS,但TOPS口径、数值精度、稀疏性、算子覆盖、内存系统和运行时都不同,因而不能根据峰值数字直接预测模型FPS或端到端控制时闶。

在模型层面,MobileNet/YOLO类模型的权重仅为数MB至数十MB,而7B VLA即使INT4权重也约3.5 GB,其中间状态和端到端流水线还会显著增加内存与时间成本。量化的意义不只是减小文件,还要同时验证任务质量、算子映射、实际内存峰值和长尾时延。

因此,子课题B应将设备峰值参数作为入口,将模型质量作为准入门槛,将L1–L4时间分解和资源计量作为过程证据,最终以控制周期、AI结果新鲜度、过期拒绝、故障降级和恢复时间作为系统级结论。这样才能把“模型跑得动”提升为“智能与实时控制可在已知边界内共存”。

参考资料

  1. NVIDIA. Jetson AGX Orin for Next-Gen Robotics: Technical Specifications. 官方产品与规格页,访问日期:2026-09-29。
  2. NVIDIA. Jetson AGX Orin Series Hardware Architecture. 官方技术简报。
  3. Rockchip. RK3588 Brief Datasheet. 官方数据手册。
  4. Rockchip AI Team. RKNN Model Zoo. 官方代码仓库及性能表,访问日期:2026-09-29。
  5. Texas Instruments. TDA4VM SoC with Dual Arm Cortex-A72, 8 TOPS of AI, C7x DSP, and GPU. 官方产品页。
  6. NXP. i.MX 8M Plus: Cortex-A53/M7, Machine Learning, Vision, Multimedia and Industrial IoT. 官方产品页。
  7. NXP. i.MX 8M Plus Applications Processor Family. 官方产品手册。
  8. Qualcomm. Dragonwing QRB5165. 官方产品页。
  9. Hailo. Hailo-8 AI Processor Product Brief. 官方产品简报。
  10. AMD. Kria K26 SOM Data Sheet (DS987). 官方数据手册。
  11. AMD. Kria K26 SOM: The Ideal Platform for Vision AI at the Edge. 官方白皮书。
  12. NVIDIA. TensorRT Documentation. 官方文档。
  13. HOWARD A, SANDLER M, CHU G, et al. Searching for MobileNetV3[EB/OL]. arXiv:1905.02244, 2019. 论文。
  14. Hailo AI. Hailo Model Zoo: Hailo-8 Object Detection Models. 官方模型指标与基准表。
  15. OCTO MODEL TEAM, GHOSH D, WALKE H, et al. Octo: An Open-Source Generalist Robot Policy[C]//Robotics: Science and Systems. 2024. 官方仓库与模型数据。
  16. KIM M J, PERTSCH K, KARAMCHETI S, et al. OpenVLA: An Open-Source Vision-Language-Action Model[EB/OL]. arXiv:2406.09246, 2024. 论文。
  17. OpenVLA Team. OpenVLA Project Page. 官方项目页。
  18. WILLIAMS J, GUPTA K D, GEORGE R, et al. LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics[EB/OL]. arXiv:2603.03380, 2026. 论文。
  19. Hailo AI. Hailo Model Zoo Benchmarks. 官方基准复现说明。
  20. MLCommons. MLPerf Inference: Edge. 官方基准、场景与结果,访问日期:2026-09-29。