26 KiB
主流异构边侧设备与AI模型性能指标综述
摘要
边侧智能控制设备正从单一CPU或GPU计算平台,演进为同时集成应用核、实时核、GPU、NPU/DLA、DSP、ISP、FPGA可编程逻辑和多类I/O加速单元的异构系统。对这类平台进行选型时,仅比较TOPS会遮蔽模型精度、权重体积、算子落点、内存带宽、运行时回退、队列等待、功耗模式和尾时延等关键差异。本文结合前期《面向边侧异构SoC的混合实时控制基础系统研究综述》和《工程应用场景与性能指标对标》,对NVIDIA Jetson Orin、Rockchip RK3588、TI TDA4VM、NXP i.MX 8M Plus、Qualcomm QRB5165/RB5、Hailo-8和AMD Kria K26等代表性设备的计算组成、标称算力、存储资源、功耗与推理软件栈进行对比;同时以MobileNetV3、YOLOv8、Octo、OpenVLA及边缘VLA工作负载为例,分析参数量、权重精度、训练/任务精度、量化损失、推理时间和端到端控制频率之间的关系。本文进一步给出面向子课题B的统一报告模板和分层实验矩阵,使“峰值算力—模型质量—平均性能—尾时延—控制安全”能在同一证据链中进行审查。
关键词: 异构SoC;边缘AI;模型权重;混合精度;量化;推理时延;尾延迟;具身智能;混合实时系统
1 研究对象及与前两篇综述的关系
前期国内外研究综述主要回答“Linux、RTOS、Hypervisor和AI加速器如何共存”,并将研究重点放在资源隔离、共享资源干扰、跨域通信和安全降级上。工程应用场景文档主要回答“这些问题在人形/四足机器人、移动操作、巡检和EtherCAT控制中如何落地”。
本文作为第三篇独立综述,聚焦于二者之间尚缺的“设备—模型—运行时—实时指标”对应关系:
- 设备端具有哪些异构计算单元,其标称算力和存储资源是多少;
- 模型的参数量、权重位宽、活化值和中间缓冲如何占用内存;
- “训练精度”、“数值精度”和“任务准确率”应如何区分;
- 推理时间究竟是纯硬件执行、运行时API返回,还是传感器到执行器的端到端时间;
- 平均FPS很高的平台,在AI、DMA、网络和存储并发时是否仍能维持控制周期的P99.9和观测最大值。
因此,本文中的数据不用于简单给出设备排名,而用于建立实验选型和结果解释的基准。
2 性能指标的统一语义
2.1 峰值算力不等于模型性能
TOPS通常表示每秒可执行的万亿次基本操作,但其数值受计数方式、数据精度和稀疏性假设影响。例如Jetson Orin官方表格中的整体AI性能明确标为稀疏INT8 TOPS,而同页又另列GPU Tensor Core的稠密INT8性能[1]。因此,不能直接把某厂商的稀疏INT8 TOPS与另一厂商的稠密INT8、FP16 TFLOPS或可配置DPU单元数进行比例换算。
对任一实际模型,性能还取决于:
- 算子是否全部被加速器支持,是否回退到CPU/GPU;
- 张量排布转换、量化/反量化和外部算子的开销;
- 权重、活化值和特征图是否受内存带宽限制;
- 动态形状、batch大小、多流和多模型并发方式;
- 功耗档位、频率锁定、温度以及热降频状态;
- 运行时、编译器、驱动、固件和模型编译产物版本。
2.2 模型权重与内存占用
若模型参数量为(N_p),每个权重位宽为(b),则仅权重的理论容量为:
[ S_{weight}=N_p\times b/8 ]
例如7B参数模型的理论权重容量约为:FP32 28 GB、FP16/BF16 14 GB、INT8 7 GB、INT4 3.5 GB。这些数字不包括视觉编码临时张量、KV cache、活化值、量化尺度/零点、运行时工作区、图优化副本及I/O缓冲。因此,“权重能放入内存”不等于“模型能稳定运行”。
本课题建议分开报告五个内存量:原始模型文件、编译后引擎/私有格式、常驻权重、峰值活化与工作区、进程峰值常驻内存(RSS)或设备内存峰值。
2.3 “精度”需要区分三种含义
| 精度类型 | 常见取值 | 它回答的问题 | 必须同时记录的信息 |
|---|---|---|---|
| 训练数值精度 | FP32、FP16、BF16、混合精度 | 梯度、权重更新和前/反向计算用什么数值格式 | 优化器、loss scaling、训练硬件、时长、数据集版本 |
| 部署/推理精度 | FP32、FP16/BF16、INT8、INT4、W4A16等 | 权重和活化值如何存储与计算 | PTQ或QAT、校准集、逐张量/逐通道、对称/非对称 |
| 任务质量 | Top-1/Top-5、mAP、mIoU、WER、任务成功率 | 模型完成实际任务的质量 | 数据集、划分、输入尺寸、评估脚本、随机种子、置信区间 |
用户所说的“训练精度”在工程文档中经常同时指数值精度和准确率。本文统一将二者分写为“训练/部署位宽”和“任务质量”,避免把“INT8”误读为“80%准确率”。
2.4 推理时间的五层口径
| 层级 | 延迟定义 | 包含内容 | 主要用途 |
|---|---|---|---|
| L0 | 算子/核函数时间 | 单个算子或融合核执行 | 算子库与瓶颈分析 |
| L1 | 设备执行时间 | 加速器从接受到完成图执行 | 比较编译产物和计算核 |
| L2 | 运行时推理时间 | API调用、提交、排队、同步和图执行 | 单模型部署基准 |
| L3 | 应用流水线时间 | 预处理+推理+后处理+主机/设备搬运 | 视觉或多模态应用评价 |
| L4 | 端到端控制时间 | 采集、队列、预处理、推理、IPC、校验、控制与执行提交 | 本课题的最终验收口径 |
FPS或samples/s表示吞吐率,(1/FPS)只能在batch=1、没有流水重叠且测量口径一致时近似单请求时间。对实时控制,应同时报告P50、P95、P99、P99.9、观测最大值、截止期违约率和连续违约长度,不应只报平均值。
3 代表性异构边侧设备指标
3.1 设备横向对比
表1使用2026年9月前公开的厂商一手资料。“未给出”表示引用的官方页面没有给出可直接比较的数值,而不表示设备没有功耗或存储限制。
| 平台/芯片 | 异构计算组成 | 官方标称AI性能 | 内存/带宽 | 官方功耗口径 | 典型软件路径 | 对本课题的主要价值 |
|---|---|---|---|---|---|---|
| Jetson Orin Nano 8GB | 6核Cortex-A78AE + 512核Ampere GPU/16 Tensor Cores | 最高67稀疏INT8 TOPS | 8 GB LPDDR5,约102 GB/s | 7–25 W | Linux/JetPack + CUDA/TensorRT/ONNX Runtime/Isaac ROS | 低成本具身智能与视觉基线;没有独立DLA[1] |
| Jetson Orin NX 16GB | 8核Cortex-A78AE + 1024核Ampere GPU/32 Tensor Cores + 2个NVDLA | 最高157稀疏INT8 TOPS | 16 GB LPDDR5,102.4 GB/s | 10–40 W | Linux/JetPack + CUDA/TensorRT/NVDLA | 适合VLA、多视觉流和异构调度;也是当前机器人开发中常见的档位[1] |
| Jetson AGX Orin 64GB | 12核Cortex-A78AE + 2048核Ampere GPU/64 Tensor Cores + 2个NVDLA + PVA | 最高275稀疏INT8 TOPS | 64 GB LPDDR5,204.8 GB/s | 15–60 W | Linux/JetPack + CUDA/TensorRT/NVDLA | 多模型、多传感器和大模型本地推理基线[1][2] |
| Rockchip RK3588 | 4×Cortex-A76 + 4×Cortex-A55 + Mali-G610 MP4 + 三核NPU + 低功耗MCU | 6 INT8 TOPS;数据手册还列出INT4/INT16/FP16/BF16/TF32支持 | 64-bit LPDDR4/4X/5;额定容量与带宽取决于板级实现 | 未给出统一模块档位 | Linux/Android + RKNN Toolkit2/RKNN Runtime | 低成本NPU和多核CPU/GPU/NPU共存对照;官方模型库提供多模型FPS[3][4] |
| TI TDA4VM | 2×Cortex-A72 + 6×Cortex-R5F + C7x DSP/MMA + 2×C66x DSP + GPU + ISP/VPAC/DMPAC | MMA最高8 INT8 TOPS | 随具体型号和板级设计确定 | 官方产品页未给出统一整机值 | Linux/QNX/FreeRTOS等 + TIDL | 应用核、多实时核、DSP与AI加速器高度集成,非常适合研究“Linux+RTOS+硬件隔离”[5] |
| NXP i.MX 8M Plus | 2/4×Cortex-A53 + Cortex-M7 + NPU + HiFi 4 DSP + GPU + 双ISP | 最高2.3 TOPS | LPDDR4/DDR4,支持内联ECC;容量取决于型号和板级实现 | 未给出统一整机值 | Linux + FreeRTOS + eIQ/TFLite/ONNX生态 | 算力不高但实时核、TSN/CAN FD和工业接口完整,适合中小模型+实时控制[6][7] |
| Qualcomm QRB5165/RB5 | 4高性能+4低功耗Kryo 585 + Adreno 650 + Hexagon 698/HTA/HVX + EVA/ISP | AI Engine最高15 TOPS | 开发套件配置与商用SoM不同,需按BOM冻结 | 官方页未给出统一整机值 | Linux/Ubuntu/ROS 2 + QAIRT/QNN/HTP | 强ISP、DSP、NPU和连接性,适合机器人、无人机和多相机异构流水线[8] |
| Hailo-8(加速器) | 数据流AI处理器,需外部主机 | 26 TOPS | 芯片设计不需外部存储器;系统总内存仍由主机和流水线决定 | 官方典型值2.5 W | Host Linux + Hailo Dataflow Compiler + HailoRT/HEF | 适合研究外挂NPU、PCIe搬运、设备队列与主机控制任务之间的干扰[9] |
| AMD Kria K26 | 4×Cortex-A53 + 2×Cortex-R5F + Mali-400 + 25.6万逻辑单元/1248 DSP的可编程逻辑 | 取决于DPU或自定义数据通路配置,不宜以固定TOPS与NPU比较 | 4 GB 64-bit DDR4,2400 Mb/s;26.6 Mb片上存储 | 取决于PL设计与载板 | Linux/FreeRTOS + Vitis AI/自定义PL加速 | 可把关键预处理、时间触发或自定义推理流水线硬件化,适合确定性对照[10][11] |
上表表明,主流设备并不是同一类产品。Jetson强调GPU生态、统一内存与大模型兼容性;RK3588强调成本与多媒体NPU;TDA4VM、i.MX 8M Plus和Kria更容易形成应用域与实时域的硬件分工;QRB5165具有移动SoC的能效、感知和连接优势;Hailo-8则是主机外挂专用加速器。子课题B的“混合实时”研究应关注这些架构差异如何影响隔离和尾时延,而不是只寻找TOPS最大的设备。
3.2 主要推理架构和编译链
| 类型 | 典型数据路径 | 优势 | 与实时性相关的风险 |
|---|---|---|---|
| GPU/Tensor Core | PyTorch/ONNX → TensorRT engine → CUDA stream → GPU | 算子覆盖广,支持FP32/FP16/BF16/FP8/INT8/INT4/FP4等混合精度,易部署Transformer[12] | 核函数不可抢占区间、多流排队、显存/统一内存竞争和热降频 |
| 固定功能NPU/DLA | ONNX/TFLite → 厂商编译器 → 私有图/二进制 → NPU Runtime | INT8能效高,适合固定视觉网络 | 算子不支持时可切图或回退CPU;固件队列和抢占能力不透明 |
| DSP/HTP/MMA | 模型编译 → DSP/向量核+矩阵加速器 | 视觉、信号处理和AI可在相同子系统内融合 | 多核共享内存、任务图与数据搬运配置复杂 |
| 数据流NPU | 模型 → 结构映射/编译 → HEF等产物 → 流式执行 | 视觉模型吞吐和能效高 | 主机预/后处理、PCIe或M.2传输和多流调度仍会影响端到端时间 |
| FPGA/可编程逻辑 | 模型或自定义算子 → HLS/RTL/DPU → PL流水线 | 可定制I/O、并行度和固定数据路径,便于硬件时间触发 | 编译时间长,可用算子和量化方案受配置限制,更改模型需重新生成硬件产物 |
这些运行时并不直接对应操作系统的实时优先级。即使提交线程在Linux中设置了高优先级,设备内部已排队任务、固件命令批次和内存控制器仍可能不可抢占。因此需要以时间戳区分“主机提交—设备开始—设备完成—结果可用”四个时刻。
4 代表性模型的权重、质量与计算规模
4.1 从轻量视觉到具身大模型
表2中的权重容量按参数量与位宽计算,是方便选型的理论值,不代表文件大小或运行时峰值内存。
| 模型 | 任务/架构 | 参数与计算 | 理论权重容量 | 公开任务质量/训练信息 | 对边侧部署的含义 |
|---|---|---|---|---|---|
| MobileNetV3-Large 1.0 | ImageNet分类,移动CNN | 5.4M参数,219M MAdds | FP32 21.6 MB;FP16 10.8 MB;INT8 5.4 MB | ImageNet Top-1 75.2%[13] | 适合作为算子覆盖和量化基线,但不能代表检测、分割或VLA |
| YOLOv8n | COCO目标检测,单阶段CNN | 3.2M参数,约8.74 GOP(Hailo口径) | FP32 12.8 MB;FP16 6.4 MB;INT8 3.2 MB | Hailo模型库报告float mAP 37.0、设备mAP 36.4[14] | 适合低延迟感知和量化损失对照 |
| YOLOv8s | COCO目标检测 | 11.2M参数,约28.6 GOP | FP32 44.8 MB;FP16 22.4 MB;INT8 11.2 MB | float mAP 44.6、Hailo设备mAP 43.9[14] | 与YOLOv8n组成同系列精度—延迟折中实验 |
| Octo-Small/Base | 通用机器人策略,Transformer+动作头 | 27M/93M参数 | FP16约54/186 MB;INT8约27/93 MB | 使用约80万条机器人轨迹;官方仓库报告RTX 4090上约17/13 it/s[15] | 模型可放入边侧内存,但4090结果不能代替边侧实测;任务质量应以机器人成功率报告 |
| OpenVLA-7B | 视觉—语言—动作,双视觉编码器+投影层+Llama 2 7B | 约7B参数 | FP16约14 GB;INT8约7 GB;INT4约3.5 GB | 97万条真实机器人演示;64块A100训练15天;论文报告其在29项任务上较RT-2-X绝对成功率高16.5个百分点[16][17] | 量化后权重可能放入8–16 GB设备,但活化值、视觉编码和上下文仍可造成显著内存及延迟压力 |
| LiteVLA-Edge实验管线 | 边缘多模态控制,ROS 2 + llama.cpp | 论文采用FP32监督微调后4-bit GGUF量化 | 依具体基座模型而定 | Jetson Orin类平台上报告平均端到端时延150.5 ms,约6.6 Hz[18] | 说明“可运行”与“可高频闭环”差距巨大;需用异步动作块、过期拒绝和RTOS底层控制弥补 |
上述数据还显示,“准确率”不能在不同任务之间直接比较。75.2% ImageNet Top-1、44.6 COCO mAP和机器人任务成功率属于不同评价对象。对具身智能,最终应报告分任务成功率、碰撞/越界次数、完成时间和对延迟扰动的敏感性,不能只使用离线感知指标。
4.2 公开设备推理数据示例
下表故意保留了各官方模型库的测试口径,不将它们包装成严格跨平台排名。倒数时间仅为(1000/FPS)的理想化换算,不是P99或端到端延迟。
| 设备/来源 | 模型与输入 | 精度 | 公开吞吐 | 理想化倒数时间 | 测试条件与解读 |
|---|---|---|---|---|---|
| RK3588官方RKNN Model Zoo | MobileNetV2,1×3×224×224 | INT8 | 450.7 FPS | 2.22 ms | 官方表格标注RK3588 NPU单核,适合作图执行吞吐基线[4] |
| RK3588官方RKNN Model Zoo | ResNet50-v2,1×3×224×224 | INT8 | 110.1 FPS | 9.08 ms | 同上[4] |
| RK3588官方RKNN Model Zoo | YOLOv8n/s/m,1×3×640×640 | INT8 | 73.5/38.0/16.2 FPS | 13.61/26.32/61.73 ms | 同系列随模型规模增大出现清晰延迟梯度[4] |
| Hailo-8官方Model Zoo | YOLOv8n/s/m/l,640×640 | 编译后硬件部署 | 1036/491/66.9/36.2 FPS | 0.97/2.04/14.95/27.62 ms | 官方表格的主机为i5-9400、PCIe Gen3×4、室温、batch=1;表内还分别报告float和硬件mAP[14] |
| Hailo-8官方CLI示例 | ResNet-50 | 编译后HEF | 1328.83 FPS | 不按倒数解读 | 同一输出报告硬件延迟2.936 ms和流式平均功耗3.194 W,说明流水吞吐与单请求延迟并非简单互为倒数[19] |
| Jetson Orin类设备/LiteVLA-Edge | 量化多模态控制管线 | 4-bit GGUF | 约6.6 Hz | 平均端到端150.5 ms | 包含ROS 2感知—推理—动作管线,与纯NPU图执行不是同一口径[18] |
对真正的跨设备比较,应优先使用MLPerf Inference Edge这类固定模型、数据集、质量门槛、负载生成器和场景规则的基准。MLCommons将Closed组用于尽可能同模型横向比较,Open组则允许更换模型或重训练[20]。即使如此,MLPerf的Offline/Server/SingleStream等场景仍不能替代本课题的RTOS控制并发和故障注入实验。
5 面向混合实时控制的指标体系
5.1 不应缺失的设备信息
每一组实验至少冻结:
- SoC/模组/开发板型号、内存容量和载板版本;
- OS、内核、RTOS、Hypervisor、BSP和固件版本;
- AI编译器、运行时、驱动和模型编译产物的哈希;
- 功耗模式、CPU/GPU/NPU/内存频率、锁频方式和散热条件;
- CPU亲和性、中断亲和性、内存区域、IOMMU、设备所有权和加速器并发度;
- 采集时长、样本数、预热时间、环境温度与稳态温度。
5.2 不应缺失的模型信息
- 模型名称、代码/权重提交号、输入尺寸、batch、序列长度和动态形状范围;
- 参数量、MACs/FLOPs/OPS口径和支持算子比例;
- 原始权重位宽、部署权重/活化位宽和混合精度列表;
- PTQ/QAT方式、校准数据集与样本数,是否采用稀疏性或剪枝;
- FP32/原始模型质量、编译后仿真质量和目标板实测质量;
- 编译失败、CPU回退、子图切分、张量转换和外部算子情况。
5.3 四类性能结果
| 类别 | 核心指标 | 解释要点 |
|---|---|---|
| 模型质量 | 原始质量、量化后质量、绝对/相对下降、分类别/分场景成功率 | 达不到冻结质量门槛时,性能再高也不进入实时比较 |
| 推理时序 | 冷启动、预热后P50/P95/P99/P99.9/最大值,吞吐、队列深度和超时率 | 分别记录L1–L4口径,避免用纯硬件FPS代替端到端时间 |
| 资源与能效 | CPU/GPU/NPU利用率、DDR带宽、LLC未命中、DMA、峰值内存、平均/峰值功耗、J/inference | 功耗必须注明是芯片、模组、加速卡还是整机口径 |
| 控制影响 | 控制周期偏差、截止期违约、AI结果年龄、过期丢弃率、降级与恢复时间 | 这是子课题B区别于通用AI硬件评测的最终指标 |
6 对子课题B的设备和模型选型建议
6.1 建议形成四类对照平台
- 高AI生态主平台:Jetson Orin NX 16GB或AGX Orin。 用于具身视觉、VLA、多模型并发和GPU/DLA异构分配,也便于与已有机器人应用资料衔接。
- 集成实时域平台:TDA4VM或i.MX 8M Plus。 用于对比应用核与R5F/M7实时核的硬件分工、共享内存通信和故障隔离。
- 低成本NPU平台:RK3588。 用于评价私有NPU编译、算子回退、单/多NPU核调度与Linux实时化的性价比。
- 外挂或可编程加速平台:Hailo-8或Kria K26。 用于研究PCIe/DMA搬运、主机队列、自定义数据通路和固定流水线的确定性。
若当前资源只允许购置一套平台,建议优先Orin NX 16GB,并外接一块运行RTOS的MCU或实时控制器建立可测的Linux AI域—RTOS控制域链路。若研究重心更偏向单芯片内的真正AMP和安全隔离,TDA4VM的A72+R5F+C7x/MMA结构更具代表性。
6.2 建议的模型负载梯度
| 梯度 | 建议模型 | 目的 |
|---|---|---|
| M0 算子微基准 | Conv2D、Depthwise Conv、GEMM、Attention、Resize、NMS | 建立算子时间、能耗和CPU回退数据库 |
| M1 轻量分类 | MobileNetV3-Large或MobileNetV2 | 验证编译链、INT8量化和最小延迟 |
| M2 实时检测 | YOLOv8n/s/m | 建立模型规模—质量—延迟—能耗曲线 |
| M3 语义/姿态任务 | DeepLabV3+、YOLOv8-Pose或项目自有模型 | 接近机器人对环境和人的感知负载 |
| M4 紧凑机器人策略 | Octo-Small/Base或等规模动作模型 | 评估视觉、语言/状态和动作生成管线 |
| M5 量化VLA | OpenVLA类7B或更小VLA的INT4版本 | 验证大权重、长时延、异步动作块和结果新鲜度策略 |
7 建议直接纳入课题的实验设计
7.1 E0:版本与配置冻结
生成设备BOM、软件版本、功耗/频率、核与中断分配、模型哈希、校准集哈希和编译参数清单。未完成E0的数据不进入横向对比。
7.2 E1:模型质量与内存账本
对每个模型依次测量FP32/FP16原始质量、PTQ INT8/INT4质量、必要时的QAT质量;统计模型文件、设备编译产物、常驻权重、峰值工作区和稳态/峰值RSS。质量下降超过任务门槛的精度方案不参加性能验收。
7.3 E2:单模型隔离推理
固定batch=1和输入,分别测试冷启动、预热后和热稳态。对L1、L2、L3时间分段打点,报告分位数、吞吐、功耗和能耗。对具有多NPU核、GPU+DLA或CPU+DSP+NPU的设备,对比单加速器、多加速器和多模型并发。
7.4 E3:控制域与AI域并发
设置0.5/1/2/10 ms等不同控制周期的仿真或实机任务,对比:
- 仅控制任务;
- 控制+单模型推理;
- 控制+多视频流/多模型;
- 控制+大模型/VLA长时推理;
- 同负载下的普通Linux、PREEMPT_RT、AMP或静态分区方案。
主指标为控制周期P99.9/最大偏差、截止期违约、AI结果年龄和过期拒绝率。
7.5 E4:共享资源压力
逐项和联合注入CPU、LLC、DDR、DMA、摄像头/ISP、网络、NVMe、GPU/NPU和热负载,建立:
[ 资源干扰强度\rightarrow推理队列和尾时延\rightarrow控制周期偏差\rightarrow截止期/任务质量 ]
的因果记录。此实验应长时运行到热稳态,否则无法观测DVFS和热降频对长尾的影响。
7.6 E5:超时、故障和恢复
注入AI进程崩溃、设备超时、驱动队列停滞、消息丢失/乱序/重复、过期结果、Linux重启和温度降频。测量故障检测时间、RTOS降级切换时间、安全状态保持率、通道清理和受控重新接入时间。
8 综合讨论
8.1 关于“边端训练”
大多数异构边侧设备的主要任务是推理,并非从零训练大模型。OpenVLA的公开信息显示其预训练使用了64块A100、15天[17],这与边侧SoC的功耗、内存和散热边界不在同一级别。边端更可行的路径是离线集中训练,边端进行小样本校准、LoRA/适配层微调、增量学习或模型选择。这些在线学习活动不应与高关键控制无界共享资源。
8.2 关于具身智能的多频率系统
具身智能中的VLA可能只能以6–20 Hz生成动作或动作块,而关节、平衡、力控和安全监测可能需要500 Hz–2 kHz甚至更高的周期。这不意味着VLA必须和伺服环同频,而意味着系统必须有明确的多频率协议:VLA只发布带时间戳、有效期、版本和置信度的有界目标/动作块;RTOS以高频率完成插值、限幅、状态估计、执行器控制和故障降级。
8.3 最有价值的研究指标
对本课题而言,最有价值的不是“将YOLO加速到多少FPS”,而是以下三类关系:
- 在相同模型质量门槛下,不同设备/精度/运行时的L3和L4尾时延如何;
- 在相同AI负载下,普通Linux、PREEMPT_RT、AMP和静态分区对控制周期P99.9和最大值的改善程度;
- 当AI超时、过载或崩溃时,RTOS能否在已知时间内拒绝旧结果、进入降级并维持安全状态。
9 结论
当前主流异构边侧设备已形成GPU主导、集成NPU/DSP、应用核+实时核、外挂数据流加速器和FPGA可编程逻辑等多条技术路线。其公开算力横跨约2.3 TOPS到275稀疏INT8 TOPS,但TOPS口径、数值精度、稀疏性、算子覆盖、内存系统和运行时都不同,因而不能根据峰值数字直接预测模型FPS或端到端控制时闶。
在模型层面,MobileNet/YOLO类模型的权重仅为数MB至数十MB,而7B VLA即使INT4权重也约3.5 GB,其中间状态和端到端流水线还会显著增加内存与时间成本。量化的意义不只是减小文件,还要同时验证任务质量、算子映射、实际内存峰值和长尾时延。
因此,子课题B应将设备峰值参数作为入口,将模型质量作为准入门槛,将L1–L4时间分解和资源计量作为过程证据,最终以控制周期、AI结果新鲜度、过期拒绝、故障降级和恢复时间作为系统级结论。这样才能把“模型跑得动”提升为“智能与实时控制可在已知边界内共存”。
参考资料
- NVIDIA. Jetson AGX Orin for Next-Gen Robotics: Technical Specifications. 官方产品与规格页,访问日期:2026-09-29。
- NVIDIA. Jetson AGX Orin Series Hardware Architecture. 官方技术简报。
- Rockchip. RK3588 Brief Datasheet. 官方数据手册。
- Rockchip AI Team. RKNN Model Zoo. 官方代码仓库及性能表,访问日期:2026-09-29。
- Texas Instruments. TDA4VM SoC with Dual Arm Cortex-A72, 8 TOPS of AI, C7x DSP, and GPU. 官方产品页。
- NXP. i.MX 8M Plus: Cortex-A53/M7, Machine Learning, Vision, Multimedia and Industrial IoT. 官方产品页。
- NXP. i.MX 8M Plus Applications Processor Family. 官方产品手册。
- Qualcomm. Dragonwing QRB5165. 官方产品页。
- Hailo. Hailo-8 AI Processor Product Brief. 官方产品简报。
- AMD. Kria K26 SOM Data Sheet (DS987). 官方数据手册。
- AMD. Kria K26 SOM: The Ideal Platform for Vision AI at the Edge. 官方白皮书。
- NVIDIA. TensorRT Documentation. 官方文档。
- HOWARD A, SANDLER M, CHU G, et al. Searching for MobileNetV3[EB/OL]. arXiv:1905.02244, 2019. 论文。
- Hailo AI. Hailo Model Zoo: Hailo-8 Object Detection Models. 官方模型指标与基准表。
- OCTO MODEL TEAM, GHOSH D, WALKE H, et al. Octo: An Open-Source Generalist Robot Policy[C]//Robotics: Science and Systems. 2024. 官方仓库与模型数据。
- KIM M J, PERTSCH K, KARAMCHETI S, et al. OpenVLA: An Open-Source Vision-Language-Action Model[EB/OL]. arXiv:2406.09246, 2024. 论文。
- OpenVLA Team. OpenVLA Project Page. 官方项目页。
- WILLIAMS J, GUPTA K D, GEORGE R, et al. LiteVLA-Edge: Quantized On-Device Multimodal Control for Embedded Robotics[EB/OL]. arXiv:2603.03380, 2026. 论文。
- Hailo AI. Hailo Model Zoo Benchmarks. 官方基准复现说明。
- MLCommons. MLPerf Inference: Edge. 官方基准、场景与结果,访问日期:2026-09-29。