Files
rtos_llm_opt/20-实验与规划/02-基础设备与算力基础.md
T

56 KiB
Raw Blame History

基础设备与算力基础配置(T5~T1 五类部署形态 / 11 个代表档位)

版本: v2.1 起草日期: 2026-09-21 设计目标: 为“大型跨平台实时操作系统支撑任务关键系统中人工智能目标负载的实时保障机制研究”建立完整的验证矩阵,并细化为 T5~T1 五类部署形态 / 11 个代表实验档位 说明: 文中的 T5~T1 是设备档位/运行形态代码,用于组织实验与证据,承担验证矩阵角色


0. 场景、算力基础与设备档位总览

0.1 研究框架与设备谱系的对应关系

研究框架中,项目统一采用“T5~T1 五类部署形态 + 5 种算力基础 + 5 层技术栈”的表述。 本文件属于实验设计部分,因此进一步把不同部署环境下的设备条件展开成可执行的设备档位体系。 这里完整呈现硬件与指标颗粒度,并明确:

这些设备档位的作用是验证 RTOS 机制在不同资源条件下是否成立。

研究维度 定义 在本文件中的落地方式
5 类部署形态 控制端、设备端 SoC、边缘节点、桌面/工作站单机、服务器/集群 通过 T5~T1 设备档位覆盖
5 种算力基础 控制型、设备端 SoC 型、边缘节点型、工作站单机型、服务器/集群型 通过代表设备与容量区间体现
11 个代表档位 可采购、可测试、可对照的实验运行形态 作为 RTOS 机制验证矩阵与采购清单

T5~T1 是用于实验组织的部署形态代码。 这套划分以部署位置与系统角色为一级分类,以容量作为档位细分参考;T3 边缘节点 与 T2 桌面/工作站单机 分别对应独立节点与单机高密本地推理平台。 后续实验中,这些档位分别承担的是:

  • 人工智能目标负载在不同资源条件下的时效与有效性验证;
  • 关键保障负载在不同资源条件下的边界验证;
  • RTOS 在双目标约束下的机制有效性验证。

0.2 分级维度与分档规则

分级维度: 以「统一内存 / 显存容量」为第一分类维度。容量直接决定可承载的模型规模,并与功耗、散热、互联架构强相关,因此适合作为连续设备谱系的主轴。

分档规则: 相邻两档的边界值归入上界一侧

部署形态 代码 代表档位 容量范围 说明
T5 控制端场景 T5 T5-L / T5-M / T5-H 1~8 G 运行在控制器或轻量控制盒本体
T4 设备端 SoC 场景 T4 T4-L / T4-M 8~32 G 运行在设备本体 SoC 上
T3 边缘节点场景 T3 T3-L 32~64 G / 48 G 独显 运行在设备附近的边缘节点
T2 桌面/工作站单机场景 T2 T2-L / T2-M / T2-H 64~512 G 研发或本地服务用单机多卡
T1 服务器/集群场景 T1 T1-L / T1-H 512 G~2 T 多节点分布式推理

说明: 这里的首要分类依据是部署形态;容量只作为各部署形态内部的分档参考。

0.3 全谱系总表(11 个档位)

算力单位统一约定: NVIDIA GPU 用 FP16 Tensor Core TFLOPS(dense),NPU 用 INT8 TOPS;两者不可直接换算。

档位 容量 算力(峰值) 功耗 算力/供电架构 代表设备 状态
T5-L 1~2 G 0.8~1 TOPS (INT8) 3~5 W ARM A55 + 小 NPU;DC 5V/12V 被动散热 RK3568 1~2GB 核心板
T5-M 2~4 G 6 TOPS (INT8) 5~10 W ARM A72+A53 + NPU;DC 12V 被动散热 RK3576 4GB
T5-H 4~8 G 6~32 TOPS (INT8) 7~21 W ARM A76+A55 + M0 + NPU;DC 12V 被动 RK3588 8GB / Jetson Orin Nano 8GB 现有(16G 板降配)
T4-L 8~16 G 32~100 TOPS (INT8) 10~30 W ARM SoC 统一内存 + NPU/GPU;DC 12~24V 被动/小风扇 RK3588 16GB 工业盒 / Orin NX 16GB 现有
T4-M 16~32 G 275 TOPS (INT8) 15~60 W ARM A78AE + Ampere GPU + 2×DLA;DC 19V 主动风冷 Jetson AGX Orin 32GB
T3-L 32~64 G / 48 G 独显 275 TOPS / 91 TFLOPS (FP16) 60~600 W ARM 统一内存 或 x86+单卡 CUDA;风冷/液冷 Jetson AGX Orin 64GB / 边缘工控机 + RTX 6000 Ada 48GB
T2-L 64~128 G 500 TFLOPS (FP16) 600~1.65 kW x86 + 4×V100 SXM NVLink;双电源 + 360 液冷 4×V100 32GB SXM 塔式 现有
T2-M 128~256 G 1000 TFLOPS (FP16) 3.0~3.3 kW x86 + 8×V100 SXM NVLink;双电源 + 液冷 8×V100 32GB SXM 整机 需扩展
T2-H 256~512 G ~4000 TFLOPS (FP16) 4.5~6.5 kW x86 + 4×H100 SXM5 NVLink;高压供电 + 强制液冷 4×H100 80GB SXM5 工作站
T1-L 512 G~1 T ~2000 TFLOPS (FP16) ~6.6 kW 4 节点 × x86+4×V100,100GbE RoCE/IB;机房风冷/液冷 4×(T2-L 节点)+ IB 交换机 需扩展
T1-H 1~2 T ~16 PFLOPS (FP16) 20~25 kW 4 节点 × x86+4×H100,NDR 400G IB;机房级液冷 4×(T2-H 节点)+ NDR 交换机

0.4 设计原则

  1. 部署形态先行、设备落地: 先用“控制端 / 设备端 SoC / 边缘节点 / 桌面工作站 / 服务器集群”定义研究问题,再用 T5~T1 设备档位组织具体实验。
  2. 容量连续、功耗阶跃: 从 1 GB / 3 W 到 2 TB / 25 kW,容量每上一档约 ×2,功耗随架构变化阶跃(被动散热 → 主动风冷 → 液冷 → 机房级液冷),形成天然的性能/能效对比曲线。
  3. CUDA 栈贯通高算力侧: T1/T2/T3 的候选平台可共享 NVIDIA CUDA 生态(V100 / Ampere / Hopper),模型与推理框架(vLLM / TensorRT-LLM)可跨档位迁移,主要变化是规模与拓扑。
  4. 非 CUDA 控制端与设备端路线: T5 全档位与 T4-L 走 RKNN/RKLLM NPU 栈,代表最强资源约束与最接近设备本体的运行位置。
  5. 现有硬件复用: 4×V100 SXM(T2-L) 与 RK3588 工业盒(T4-L 16GB / T5-H 8GB 两用) 为零采购成本基线,整条谱系以此为锚点向两侧扩展。
  6. BSP 最小化: 全谱系仅需两类 BSP——x86(T1/T2/T3-B 路线)与 ARM64(T5/T4/T3-A 路线),档位差异靠设备树与驱动裁剪吸收,不新增架构分支。

T1. 服务器/集群场景的多节点形态 — 512 G ~ 2 T

T1.1 定位

大规模分布式 LLM 推理与多模型并发服务。验证 SylixOS 在多节点分布式调度下的实时性——跨节点 RDMA 延迟、NCCL 集合通信抖动、分布式推理框架(vLLM+Ray / TensorRT-LLM+MPI)与实时控制任务的混合负载隔离。

T1.2 档位对比

维度 T1-L 多节点-低 T1-H 多节点-高
容量 512 GB(4 × 128 GB) 1.28 TB(4 × 320 GB)
节点数 4 节点 4 节点
单节点加速器 4 × V100 32GB SXM 4 × H100 80GB SXM5
集群算力 ~2000 TFLOPS (FP16) ~16 PFLOPS (FP16)
节点内互联 NVLink 300 GB/s NVLink 900 GB/s
节点间互联 100GbE RoCE / IB NDR 400G IB
整机功耗 ~6.6 kW 20~25 kW
散热架构 每节点 360 液冷 + 机房风冷 机房级液冷(CDU / 后门换热器)
主要模型 72B FP16 / 多实例 14B 671B INT4 / 多实例 72B FP16

T1.2.1 T1-L 多节点-低 — 4 节点 × 4×V100 = 512 GB(本方案主线)

项目 规格 数量 备注
计算节点 同 T2-L 单机配置 4 台 每节点 4×V100 32GB SXM = 128GB
节点内 GPU NVIDIA V100 32GB SXM (NVLink 全互联) 4×4 = 16 卡 每节点 NVLink 全互联
节点内 CPU AMD EPYC 7402 (24C/48T, 2.0-3.2GHz) 4 每节点 1 颗
节点内内存 128GB DDR4-2133 ECC 4×128 = 512GB 每节点 128GB
节点间互联 Mellanox ConnectX-6 100GbE / IB 4 卡 每节点 1 卡,RoCE 或原生 IB
节点间交换机 100GbE/IB 交换机 (Mellanox SN2700 或同档) 1 32 端口
存储 共享 NFS / NVMe-oF (每节点 1TB NVMe 本地 + 共享存储) — 模型权重共享池
散热 每节点 360 一体液冷 ×2 — 同 T2-L
电源 每节点 长城 1650W + 1250W 双电源 4 套 单节点 ~1.65 kW,集群 ~6.6 kW
功率采集 PDU + Yokogawa WT310 (整机) + nvidia-smi dmon (单卡) — 每节点独立采集

显存与算力

指标 值
总显存 512 GB (4 × 128GB)
单卡 FP16 算力 125 TFLOPS
集群总算力 (FP16) ~2000 TFLOPS (NVLink 节点内 + IB 节点间)
NVLink 带宽 (节点内) 300 GB/s (GPU↔GPU)

可运行模型

模型 量化 显存占用 并发实例数 推理框架
Qwen2.5-72B-Instruct FP16 ~144 GB 3+ vLLM + Ray 分布式
Qwen2.5-72B INT4 (AWQ) ~36 GB 14+ vLLM + Ray
DeepSeek-V2-Chat FP16 ~210 GB 2 TensorRT-LLM + MPI
Qwen2.5-14B FP16 ~28 GB 18+ vLLM (可单节点)
LLaMA-3-70B FP16 ~140 GB 3+ vLLM + Ray

注: 若已有 1 台 T2-L 节点,仅需追加 3 台。V100 SXM 为二手市场/拆机渠道,价格波动大。也可租用云上 V100 实例替代自建集群。

T1.2.2 T1-H 多节点-高 — 4 节点 × 4×H100 = 1.28 TB(扩展档)

项目 规格 数量 备注
计算节点 同 T2-H 单机配置 4 台 每节点 4×H100 80GB SXM5
节点内 GPU NVIDIA H100 80GB SXM5 (NVLink 4 卡全互联) 16 卡 NVLink 900 GB/s
节点内 CPU AMD EPYC 9654 (96C/192T) 或 Intel Xeon 8468 4 每节点 1~2 颗
节点内内存 512GB DDR5-4800 ECC 4 × 512GB 每节点 512GB
节点间互联 NVIDIA ConnectX-7 NDR 400Gb/s IB 4~8 卡 每节点 1~2 卡
节点间交换机 NDR 400G IB 交换机 (Quantum-2 / SN5600) 1 32 端口
存储 并行文件系统 (GPFS/Lustre) + 每节点 4TB NVMe — 671B 级模型权重池
散热 机房级液冷 (CDU + 冷板) — 风冷不可行
电源 每节点 4~6 kW 冗余电源 4 套 集群 2025 kW

可运行模型

模型 量化 显存占用 并发实例数 推理框架
DeepSeek-V3 / R1-671B INT4 (AWQ) ~400 GB 3+ vLLM + Ray / SGLang
Qwen2.5-72B FP16 ~144 GB 8+ vLLM + TensorRT-LLM
LLaMA-3-405B INT4 ~230 GB 5+ TensorRT-LLM + MPI
Qwen2.5-32B FP16 ~64 GB 20+ vLLM

T1.3 SylixOS 要求(T1 通用)

要求项 描述 风险
x86 BSP 每节点运行 SylixOS x86 LTS 低(T2-L 已验证)
RDMA / RoCE 驱动 ConnectX-6 / ConnectX-7 在 SylixOS 上的 RDMA 驱动 中-高(需验证 Mellanox OFED 兼容性)
NCCL / MPI 分布式集合通信库在 SylixOS 移植 中(NCCL 依赖 CUDA + POSIX)
Ray / 分布式框架 vLLM + Ray 的 SylixOS 适配 中(Python + Ray 依赖链)
分布式调度器 SylixOS 跨节点实时任务调度原型 研究贡献点

T1.4 研究角度

  • 跨节点调度延迟: 分布式推理时,1ms 实时任务在跨节点 NCCL all-reduce 期间的尾延迟
  • RDMA bypass 内核: SylixOS 是否能利用 RDMA bypass kernel path 降低跨节点通信延迟
  • 分布式公平性: 多节点并发请求时,高优先级实时任务的跨节点响应稳定性
  • 能效: 分布式推理的每 token 能耗 vs 单节点(通信开销 vs 并行收益)
  • 档位对照: T1-L 与 T1-H 的每 token 能耗比——V100 集群(能效基线)vs H100 集群(能效上限)

T2. 高算力单机部署形态 — 64 G ~ 512 G

T2.1 定位

单节点多 GPU 大模型推理。验证 SylixOS 在单机多卡 NVLink 拓扑下的 GPU 命令调度延迟、显存管理实时性、多模型并发流水线调度。

T2.2 档位对比

维度 T2-L 单机-低 T2-M 单机-中 T2-H 单机-高
容量 128 GB(4 × 32 GB) 256 GB(8 × 32 GB) 320 GB(4 × 80 GB)
加速器 4 × V100 32GB SXM 8 × V100 32GB SXM 4 × H100 80GB SXM5
算力 500 TFLOPS (FP16) 1000 TFLOPS (FP16) ~4000 TFLOPS (FP16)
互联 NVLink 300 GB/s ×4 NVLink 300 GB/s ×8 NVLink 900 GB/s ×4
整机功耗 ~1.65 kW 3.03.3 kW 4.56.5 kW
散热架构 360 液冷 ×2 + 塔式风道 360 液冷 ×2 + 双路风冷 强制液冷 (冷板),风冷不可行
电源架构 1650W + 1250W 双电源 2× 2000W 冗余 / 220V 单相 2× 3000W 冗余 / 220V 双相
形态 塔式一体定制机箱 4U 机架式 / 塔式 4U~5U 机架式液冷
可运行模型 72B INT4 / 14B FP16 72B FP16 / 多实例 32B 671B INT4 / 72B FP16 多并发
状态 现有 需扩展(现有平台加卡) 需

T2.2.1 T2-L 单机-低 — 4×V100 SXM = 128 GB(现有设备,谱系锚点)

# 部件 型号 / 规格 数量 备注
1 主板 H12D-8D(双路 EPYC 服务器板) 1
2 CPU AMD EPYC 7402 (24C/48T, 2.0-3.2 GHz, TDP 180W) 1
3 硬盘 长城 M.2 NVMe 1TB 1 系统盘
4 内存 三星 DDR4-32G-2133 4 共 128 GB DDR4
5 散热系统 360 一体液冷散热套装 2 主机 + GPU
6 转接卡 ROHSTNS-2SXM2-2P54E 2
7 信号线 V100 32G × 2 4 NVLink 桥接
8 机箱 塔式一体定制机箱 1
9 主电源 长城全模组 1650W 1
10 副电源 长城 1250W 全模组 1 SXM 平台用
11 散热器 SP3 高性能散热器 1
12 SXM 平台 300G NVLink 4 卡直连底板 1
13 GPU NVIDIA V100 32GB SXM 4 NVLink 全互联,共 128GB HBM2

显存与算力

指标 值
总显存 128 GB (4 × 32GB HBM2)
单卡显存 32 GB HBM2
单卡 FP16 算力 125 TFLOPS
总算力 (FP16) ~500 TFLOPS
NVLink 带宽 300 GB/s (GPU↔GPU 全互联)
内存带宽 DDR4-2133 ~170 GB/s (CPU 侧)
整机功耗 ~1650 W (满载)

可运行模型

模型 量化 显存占用 并发实例数 推理框架
Qwen2.5-7B-Instruct FP16 ~14 GB 8+ vLLM / TensorRT-LLM
Qwen2.5-14B-Instruct INT4 (AWQ) ~8 GB 14+ vLLM
Qwen2.5-14B FP16 ~28 GB 4 vLLM
Qwen2.5-72B-Instruct INT4 (AWQ) ~36 GB 3 vLLM (张量并行 TP=4)
LLaMA-3-8B FP16 ~16 GB 7 vLLM
MiniCPM-V 2.6 INT4 ~6 GB 20+ llama.cpp
Whisper-Large-v3 FP16 ~3 GB 40+ faster-whisper

T2.2.2 T2-M 单机-中 — 8×V100 SXM = 256 GB

在 T2-L 平台基础上加卡扩容,是「同一代硬件纵向扩展」的对照档位,最贴近现有设备、改造成本最低。

项目 规格 变更点
GPU NVIDIA V100 32GB SXM × 8 4 → 8 卡
SXM 平台 300G NVLink 8 卡直连底板 更换底板
转接卡 ROHSTNS-2SXM2-2P54E 2 → 4
NVLink 全互联 8 卡,300 GB/s 拓扑扩展
主板 / CPU H12D-8D + EPYC 7402(双路可升级 EPYC 7742 64C) 建议升双路以喂满 8 卡
内存 128 GB → 256 GB DDR4-2133 8 卡需更大 pinned memory
电源 2 × 2000W 冗余(或 220V 单相 16A 回路) 1650W+1250W 不足
散热 360 液冷 ×2 + 机箱风道强化 —
整机功耗 3.03.3 kW +100%
总算力 ~1000 TFLOPS (FP16) +100%

可运行模型(新增/提升)

模型 量化 显存占用 并发实例数 说明
Qwen2.5-72B-Instruct FP16 ~144 GB 1~2 TP=8 张量并行,无需量化
Qwen2.5-32B-Instruct FP16 ~64 GB 3+ TP=4
DeepSeek-V2-Lite FP16 ~31 GB 8+ —
Qwen2.5-14B FP16 ~28 GB 9+ 单卡可容,多实例并发

备选方案: 4 × RTX 6000 Ada 48GB = 192 GB,364 TFLOPS (FP16),整机 ~2.4 kW,风冷即可。优势是无 NVLink 但单卡能效高、显存快;劣势是跨卡走 PCIe Gen5。

T2.2.3 T2-H 单机-高 — 4×H100 SXM5 = 320 GB

项目 规格
GPU NVIDIA H100 80GB SXM5 × 4(NVLink 全互联)
单卡算力 ~989 TFLOPS (FP16 Tensor Core, dense)
单卡显存 80 GB HBM3
NVLink 900 GB/s (GPU↔GPU)
CPU AMD EPYC 9654 (96C/192T) ×1~2
内存 512 GB DDR5-4800 ECC
底板 HGX H100 4-GPU 或 8-GPU 底板(留 4 卡空位)
存储 4 TB NVMe RAID0(模型权重加载)
散热 强制液冷(冷板式),风冷不可行
电源 2 × 3000W 冗余 / 220V
整机功耗 4.56.5 kW
总算力 ~4000 TFLOPS (FP16),稀疏 ~8000 TFLOPS

备选方案: 8 × RTX 6000 Ada 48GB = 384 GB,728 TFLOPS (FP16),~4.0 kW,风冷可行——容量更大、功耗更低,代价是无 NVLink 与算力密度。

可运行模型(新增/提升)

模型 量化 显存占用 并发实例数 说明
Qwen2.5-72B-Instruct FP16 ~144 GB 2 TP=4,H100 下 TTFT 极低
LLaMA-3-70B FP16 ~140 GB 2 —
DeepSeek-V2-Chat FP16 ~210 GB 1 单机可跑
Mixtral-8x7B FP16 ~93 GB 3 MoE 专家并行

T2.3 SylixOS 要求(T2 三档通用)

要求项 描述 风险
x86 BSP SylixOS 2.x LTS x86 低
CUDA 驱动 V100 SXM / H100 SXM 在 SylixOS 的 CUDA 驱动 中(需翼辉确认)
NVLink 支持 4 卡 / 8 卡 NVLink 拓扑在 SylixOS 可用 中
vLLM / llama.cpp Python + CUDA 推理框架适配 中(llama.cpp 优先,依赖少)
nvidia-smi / DCGM GPU 监控 + 功耗采集 低
8 卡 / 4 卡拓扑切换 同一 BSP 支持 T2-L/M/H 不同卡数 低(设备树 + 枚举)

T2.4 对照组 OS

  • 主对照: Ubuntu 22.04 LTS + linux-image-rt (PREEMPT_RT) + vLLM
  • 辅助对照: CentOS Stream 9 + RT 内核(可选)

T3. 边缘节点场景 — 32 G ~ 64 G / 48 G 独显

T3.1 定位

边缘节点位于设备本体之外、云端之前,承担近源推理、数据汇聚和多设备协同。
它是部署在设备附近的独立节点,承担近源推理、数据汇聚和多设备协同。

T3.2 代表档位对比

维度 T3-L 边缘节点代表档
容量 64 GB 统一内存 / 48 GB 独立显存
加速器 Jetson AGX Orin 64GB / RTX 6000 Ada 48GB
算力 275 TOPS (INT8) / 91 TFLOPS (FP16)
功耗 15~60 W / ~600 W
部署位置 设备附近机柜、边缘控制室、产线边缘节点
主要任务 多模态推理、近源协同、边缘缓存与调度

T3.3 候选平台

  • Jetson AGX Orin 64GB:统一内存、能效高,适合近设备部署;
  • 边缘工控机 + RTX 6000 Ada 48GB:生态完整,适合边缘机柜和算力下沉场景。

T3.4 研究重点

  • 设备端到边缘节点的协同调度;
  • 近源多任务并发下的实时隔离;
  • 边缘节点与桌面/工作站单机在功耗、散热和部署约束上的边界。

T4. 设备端 SoC 场景 — 8 G ~ 32 G

T4.1 定位

设备端 SoC 直接运行在终端设备本体上。验证 SylixOS 在统一内存架构(CPU+加速器共享 LPDDR)下的实时性,即推理任务与实时控制任务共享本机资源时的隔离能力。

T4.2 档位对比

维度 T4-L SoC-低 T4-M SoC-中
容量 16 GB 统一内存 32 GB 统一内存
加速器 RK3588 NPU 6+26 TOPS / Ampere Ampere GPU + 2×DLA
算力 32 TOPS / 100 TOPS (INT8) 275 TOPS (INT8)
功耗 10~30 W 15~60 W
供电架构 DC 12~24 V,无风扇/小风扇 DC 19 V,主动风冷
工作温度 -40~60 ℃ 工业级 -25~80 ℃
SylixOS 风险 极低(RK3588 BSP 复用 T5) 高(T234 BSP 需验证)
状态 (RK3588 16GB 工业盒) 待验证

T4.2.1 T4-L SoC-低 — RK3588 16GB 工业盒(现有设备)

这是现有 RK3588 设备的标准归属档位,也是唯一可零成本立即开展研究的设备端 SoC 档位。

项目 规格 备注
SoC Rockchip RK3588(同 T5-H) SylixOS BSP 与 T5 共用
内存 16 GB LPDDR4X(统一内存) -40~60 ℃ 工业宽温
NPU 6 TOPS 原生 + 26 TOPS 算力棒扩展 = 32 TOPS 算力棒走 M.2 2280
功耗 2130 W(含算力棒) 被动散热,可选小风扇
内存带宽 ~51.2 GB/s (128-bit LPDDR4X) 与 T5-H 同源,是带宽瓶颈点
模型 Qwen2.5-3B/7B INT4(RKLLM) 比 T5-H 内存翻倍,可跑更大模型

备选方案(同档位、CUDA 路线): NVIDIA Jetson Orin NX 16GB — 100 TOPS (INT8, sparse),1024 CUDA + 32 Tensor Core,16 GB LPDDR5 / 102.4 GB/s,10~25 W,CUDA 生态与 T1/T2/T3 打通。代价是 SylixOS T234 BSP 风险高。

T4.2.2 T4-M SoC-中 — NVIDIA Jetson AGX Orin 32GB

项目 规格
SoC NVIDIA T234(Grace 系列衍生)
CPU 12× ARM Cortex-A78AE @ 2.0 GHz(64-bit)
GPU NVIDIA Ampere 架构,2048 CUDA cores + 64 Tensor cores
DLA 2× DLA v2.0(深度学习加速器,可异步推理)
AI 算力 275 TOPS (INT8) / 137.5 TOPS (INT8+INT8 双精度)
内存 32 GB LPDDR5(统一内存,CPU/GPU 共享)
内存带宽 204.8 GB/s
功耗 15 W ~ 60 W(可配置功率模式:15W/30W/50W/60W)
工作温度 -25 ~ 80°C(工业级,但不如 RK3588 的 -40~60°C 宽)
存储 64GB eMMC + M.2 NVMe(可扩展)
网络 2× 10GbE(RJ45)+ 1× 千兆
视频接口 HDMI 2.1 + DP 1.4a
USB 4× USB 3.2 + 2× USB 2.0
PCIe PCIe Gen4 ×4(可扩展外设)
MIPI CSI 4 通道(可接工业相机)
尺寸 100mm × 87mm(核心模块)
出厂 OS Ubuntu 20.04 LTS (L4T)
价格 ~$2,000-4,000(~15,000-28,000 RMB)

选择 Jetson AGX Orin 的理由

  1. CUDA 生态统一: 与 T1/T2 同为 NVIDIA GPU,vLLM / TensorRT / llama.cpp 可直接移植,无需切换到 RKLLM 栈
  2. 统一内存架构: CPU 和 GPU 共享 32GB LPDDR5,无独立显存——LLM 推理和实时控制任务争抢同一内存带宽,是验证内存带宽管控(RQ2)的理想平台
  3. DLA 异步推理: 2 个 DLA 可在 GPU/CPU 不介入时执行推理,适合"LLM 推理让出 CPU/GPU 给实时任务"的调度策略验证
  4. 功率可配置: 15W/30W/50W/60W 多档功率模式,可在不同功耗预算下测试
  5. 丰富 I/O: 10GbE + MIPI CSI + PCIe Gen4,可接工业相机、高速网络、扩展卡

T3 边缘节点候选平台

64 GB 统一内存 Jetson AGX Orin 与 48 GB 独显边缘工控机统一归入 T3 边缘节点场景。

可运行模型(T4 两档合并)

模型 量化 显存占用 预期 tokens/s 适用档位 推理框架
Qwen2.5-1.5B-Instruct INT4 ~1.2 GB ~40-60 T4-L RKLLM
Qwen2.5-3B-Instruct INT4 ~2.5 GB ~50-80 T4-L / T4-M TensorRT-LLM / RKLLM
Qwen2.5-7B-Instruct INT4 (W4A16) ~5 GB ~30-50 T4-L / T4-M TensorRT-LLM / llama.cpp
Qwen2.5-14B-Instruct INT4 ~8 GB ~20-35 T4-M TensorRT-LLM
Qwen2.5-32B-Instruct INT4 ~18 GB ~12-20 T4-M TensorRT-LLM
MiniCPM-V 2.6 INT4 ~6 GB ~15-25 T4-L 以上 llama.cpp
Whisper-Large-v3 INT8/FP16 ~1.5 GB 流式 ASR T4-L 以上 faster-whisper
YOLOv8n INT8 ~0.1 GB 200+ FPS T4 全档 TensorRT / RKNN

T4.3 SylixOS 要求(T4)

要求项 描述 风险
ARM64 BSP (T234) SylixOS 需提供 NVIDIA T234 SoC 的 ARM64 BSP 高(需翼辉确认是否支持 Jetson Orin)
RK3588 BSP(T4-L) 与 T5-H 共用同一 BSP,零额外风险 极低
CUDA 驱动 Jetson 专用 CUDA(L4T 驱动栈)在 SylixOS 适配 高
DLA 驱动 DLA 异步推理在 SylixOS 的可用性 高
功率模式 API 15W/30W/50W/60W 切换在 SylixOS 的实现 中
内存监控 统一内存架构下的内存带宽监控(PMU 计数器) 中
独立显存管理(T3 B 路线) x86 + 独显的显存分配与实时性 中

当前路径:T4-L 采用现有 RK3588 起步;T4-M 在 Jetson BSP 与驱动条件确认后纳入采购与验证计划。

T4.4 对照组 OS

档位 主对照 辅助对照
T4-L Ubuntu 22.04 + PREEMPT_RT(RK3588) OpenHarmony 4.x + RT patch(可选)
T4-M Ubuntu 20.04 LTS (L4T) + PREEMPT_RT Ubuntu 22.04 + Docker(容器隔离方案)

T4.5 功率采集

设备 用途 适用档位
DC 功率计(USB 接口型) 整机 DC 输入端功耗 T4-L / T4-M
INA226 采集板 SoC 主电源轨(若可接入) 全档
jetson_stats / tegrastats 内部功耗代理(辅助,非主报) T4-M / T3-L
交流功率计(PZEM / 智能插座) 边缘工控机整机功耗 T3-L B 路线

T5. 控制端场景 — 1 G ~ 8 G

T5.1 定位

工业端点超低功耗 LLM 推理与硬实时控制。验证 SylixOS 在极致资源约束(321 W / 18 GB / 0.8~32 TOPS)下的 LLM + 1ms 实时控制并发能力。这一场景能够充分暴露实时调度、隔离与准入机制的有效性,也是 RTOS 与普通 Linux / PREEMPT_RT Linux 差异最容易被观察到的重要验证位置。

T5.2 档位对比

维度 T5-L 控制端-低 T5-M 控制端-中 T5-H 控制端-高
容量 1~2 GB LPDDR4X 2~4 GB LPDDR5 4~8 GB LPDDR4X / LPDDR5
SoC RK3568 (4×A55) RK3576 (4×A72+4×A53) RK3588 (4×A76+4×A55+M0) / Orin Nano
NPU 算力 0.8~1 TOPS (INT8) 6 TOPS (INT8) 632 TOPS / 4067 TOPS (INT8)
功耗 3~5 W 5~10 W 7~21 W
散热架构 无风扇被动 无风扇被动 无风扇被动(可选小风扇)
供电 DC 5V / 12V DC 12V DC 12V
工作温度 -40~85 ℃ 工业级 -40~85 ℃ 工业级 -4060 ℃ / 050 ℃
可运行模型 0.5B INT4 / Whisper-Tiny 1.5B INT4 / YOLO 系列 3B~7B INT4 / MiniCPM-V
状态 ✅ 现有(RK3588 16GB 降配)

T5.2.1 T5-L 控制端-低 — RK3568 核心板(1~2 GB)

项目 规格
SoC Rockchip RK3568 (22nm)
CPU 4× Cortex-A55 @ 2.0 GHz
NPU 0.8~1 TOPS (INT8)(RKNN 原生栈)
内存 1~2 GB LPDDR4X(统一内存,板贴)
内存带宽 ~25.6 GB/s
GPU Mali-G52(仅辅助显示)
存储 8~16 GB eMMC
网络 1× 千兆 + 可选 WiFi
工业接口 CAN ×2 / RS485 ×2 / GPIO(典型核心板引出)
功耗 3~5 W(无风扇被动散热)
工作温度 -40 ~ 85 ℃ 工业级
出厂 OS Buildroot / Ubuntu 20.04(可换 SylixOS)
参考价格 300800 RMB(核心板/开发板)

可运行模型: Qwen2.5-0.5B INT4(~0.5 GB)、Whisper-Tiny INT8(~0.2 GB)、YOLOv5n INT8。 定位价值: 谱系最低档,用于测量极小资源预算下的实时保障下界、容量边界,以及 RTOS 在极小内存条件下维持 1 ms 周期任务的能力。

T5.2.2 T5-M 控制端-中 — RK3576 核心板(2~4 GB)

项目 规格
SoC Rockchip RK3576 (8nm)
CPU 4× Cortex-A72 + 4× Cortex-A53(异构大小核)
NPU 6 TOPS (INT8) + 可扩展算力棒
内存 2~4 GB LPDDR5(统一内存)
内存带宽 ~40 GB/s
功耗 5~10 W(无风扇被动)
工作温度 -40 ~ 85 ℃ 工业级
参考价格 6001,500 RMB

可运行模型: Qwen2.5-1.5B INT4(~1.2 GB,~15-25 tok/s)、Qwen2.5-0.5B INT4 多实例、YOLOv8s INT8。 定位价值: 控制端主力档,算力是 T5-L 的 6 倍而功耗仅翻倍,是能效拐点档位。

T5.2.3 T5-H 控制端-高 — RK3588 8GB(现有设备降配)/ Jetson Orin Nano 8GB

路线 A(现有设备,零成本): RK3588 工业盒 8GB 配置

项目 规格 说明
SoC Rockchip RK3588 (8nm) 与现有 16GB 工业盒同板同 BSP
CPU 4×A76 @2.4 GHz + 4×A55 @1.8 GHz 异构大小核
MCU Cortex-M0 @200 MHz(协处理,可选) 跨核通信验证
GPU Mali-G610 MC4 仅辅助显示
NPU 6 TOPS(内置, INT8)/ 32 TOPS(板贴 26 TOPS 算力芯片扩展) 两档可切换
内存 4~8 GB LPDDR4X(统一内存) 现有 16GB 板通过内存分区限额降配运行
内存带宽 ~51.2 GB/s (128-bit) 与 T4-L 同
功耗 7~21 W(无风扇被动散热) 6 TOPS 档 ~12W / 32 TOPS 档 ~21W
工作温度 -40 ~ 60 ℃ 工业级 宽温优势
出厂 OS Ubuntu 22.04 换 SylixOS BSP

现有 16GB 工业盒的双档位用法: 同一台设备既可作为 T4-L(16 GB 全量) 也可作为 T5-H(分区限额 8 GB) 运行,通过 SylixOS 内存分区 / cgroup 限额切换,一台设备覆盖两个档位的对照实验,是本方案的成本关键。

路线 B(CUDA 生态): NVIDIA Jetson Orin Nano 8GB

项目 规格
SoC NVIDIA T234(Ampere 1024 CUDA + 32 Tensor Core)
AI 算力 40 TOPS (INT8, 稀疏)(Super 模式 67 TOPS)
内存 8 GB LPDDR5(统一内存,102.4 GB/s)
功耗 7~25 W(可配置 7W/15W/25W)
优势 T5 档内唯一 CUDA 路线,TensorRT-LLM 与 T1/T2/T3/T4 同栈
劣势 SylixOS T234 BSP 风险高,宽温不如 RK3588
参考价格 ~$249(开发套件)

可运行模型(T5-H)

模型 量化 显存占用 预期 tokens/s 推理框架
Qwen2.5-3B-Instruct INT4 ~2.5 GB ~40-60 RKLLM
Qwen2.5-7B-Instruct INT4 ~5 GB ~20-30 RKLLM
MiniCPM-V 2.6 INT4 ~6 GB ~15-25 RKLLM
Whisper-Large-v3 INT8 ~1.5 GB 流式 ASR RKLLM

T5.2.4 硬件配置明细(RK3588 工业级边缘计算盒子,现有设备)

系统 (System)

项目 规格
SoC Rockchip RK3588 (8nm)
CPU 4×Cortex-A76 @2.4 GHz + 4×Cortex-A55 @1.8 GHz(异构大小核)
MCU Cortex-M0 @200 MHz(协处理,可选)
GPU Mali-G610 MC4
NPU 6 TOPS(内置, INT8)/ 32 TOPS(板贴 26 TOPS 算力芯片扩展)
内存 16 GB LPDDR4X(板贴,不可升级)→ 可按 8 GB 分区用作 T5-H
显存 统一内存(NPU 与 CPU 共享)

存储 / 扩展

  • EMMC 64 GB(系统盘)
  • 1× TF 卡槽(存储扩展)
  • 1× M.2 2280 NVMe(可扩展 SSD / 算力棒)

出厂软件

  • 操作系统: Ubuntu 22.04(出厂预装)
  • 运行方案: SylixOS BSP for RK3588 + Ubuntu 22.04 对照组

算力与功耗(T5-H 档)

指标 值
可用显存 8 GB(16 GB 板分区限额)
NPU 算力 (6 TOPS 档) 6 TOPS (INT8)
NPU 算力 (32 TOPS 档) 32 TOPS (INT8, 含 26 TOPS 扩展)
GPU 算力 Mali-G610 MC4(仅辅助,非主推理路径)
内存带宽 LPDDR4X ~51.2 GB/s (128-bit)
TDP 7~21 W(无风扇被动散热)

T5.3 SylixOS 要求(T5)

要求项 描述 风险 适用档位
RK3588 BSP SylixOS BSP for RK3588(A76+A55 大小核 SMP) 中(需翼辉提供) T5-H
RK3576 BSP SylixOS BSP for RK3576 中-高(需翼辉确认) T5-M
RK3568 BSP SylixOS BSP for RK3568 中(RK3568 生态成熟,风险低于 T234) T5-L
rknn / RKLLM 驱动 NPU 驱动在 SylixOS 移植 高(平台B 模型适配核心风险) T5 全档
板贴 26 TOPS 算力芯片驱动 算力棒 SDK 高(厂商支持度) T5-H
M0 核 BSP + RPMsg 跨核通信 高(需翼辉 + 板卡引出 M0 调试口) T5-H
内存分区限额机制 16 GB 板按 8 GB 分区运行(T4-L/T5-H 切换) 中(需 SylixOS 内存域支持) T5-H
CAN ×2 驱动 工业现场总线 中 T5 全档
RS485 ×2 + RS232 ×1 串口 低 T5 全档
双千兆 + WiFi + 4G/5G 网络 中 T5-H
看门狗 / RTC 工业可靠性 低 T5 全档
Jetson Orin Nano BSP T234 低配版 BSP(路线 B) 高 T5-H 路线B

T5.4 对照组 OS

  • 主对照: Ubuntu 22.04(RK3588 出厂预装,完美匹配,直接对照)
  • 辅助对照: OpenHarmony 4.x + RT patch(可选)
  • T5-L / T5-M: Buildroot + PREEMPT_RT

5. 跨档位对比总表

5.1 全档位硬件规格对比

档位 容量 算力 功耗 加速器架构 散热架构 互联 SylixOS BSP 风险
T5-L 1~2 GB 0.8~1 TOPS 3~5 W ARM A55 + NPU 被动无风扇 GPIO/CAN/RS485 中
T5-M 2~4 GB 6 TOPS 5~10 W ARM A72+A53 + NPU 被动无风扇 千兆 + CAN 中-高
T5-H 4~8 GB 6~32 TOPS 7~21 W ARM A76+A55+M0+NPU 被动无风扇 双千兆 + CAN + M.2 中 / 高(路线B)
T4-L 8~16 GB 32~100 TOPS 10~30 W ARM 统一内存 + NPU/GPU 被动/小风扇 双千兆 + M.2 极低(现有)
T4-M 16~32 GB 275 TOPS 15~60 W A78AE + Ampere + DLA 主动风冷 10GbE + PCIe Gen4 高
T3-L 32~64 GB / 48 GB 独显 275 TOPS / 91 TFLOPS 60~600 W ARM 统一内存 / x86+独显 风冷 / 液冷 10GbE + PCIe 高 / 中
T2-L 64~128 GB 500 TFLOPS (FP16) ~1.65 kW x86 + 4×V100 NVLink 360 液冷 + 风道 NVLink 低(现有)
T2-M 128~256 GB 1000 TFLOPS (FP16) 3.03.3 kW x86 + 8×V100 NVLink 360 液冷 + 风道 NVLink 低
T2-H 256~512 GB ~4000 TFLOPS (FP16) 4.56.5 kW x86 + 4×H100 NVLink 强制液冷 NVLink + PCIe 中
T1-L 512 GB~1 T ~2000 TFLOPS (FP16) ~6.6 kW 4 节点 × 4×V100 机房风冷 + 液冷 NVLink + 100GbE 中-高
T1-H 1~2 T ~16 PFLOPS (FP16) 2025 kW 4 节点 × 4×H100 机房级液冷 NVLink + NDR 400G 中-高

5.2 模型规模梯度

档位 代表模型 量化 显存占用 角色
T5-L Qwen2.5-0.5B / Whisper-Tiny INT4/INT8 0.5 GB 控制端最低资源参考档,实时性基准
T5-M Qwen2.5-1.5B INT4 1.2 GB 控制端能效拐点
T5-H Qwen2.5-3B / 7B INT4 2.5 / 5 GB 端点可跑 7B
T4-L Qwen2.5-3B / 7B INT4 2.5 / 5 GB 设备端推理 + 工业控制
T4-M Qwen2.5-14B / 32B INT4 8 / 18 GB 设备端多模型并发
T3-L Qwen2.5-72B INT4 (AWQ) 36 GB 边缘节点可跑 72B
T2-L Qwen2.5-72B / 14B INT4 / FP16 36 / 28 GB 桌面多模型并发
T2-M Qwen2.5-72B FP16 144 GB 桌面单机无量化 72B
T2-H DeepSeek-V2 / 72B FP16 210 / 144 GB 桌面单机超大模型
T1-L Qwen2.5-72B / DeepSeek-V2 FP16 144 / 210 GB 多节点分布式推理
T1-H DeepSeek-V3/R1 671B INT4 ~400 GB 超大模型分布式服务

5.3 SylixOS 调度框架验证重点

档位 验证重点 核心实时指标 核心吞吐指标
T5-L 极小内存下保持关键保障负载边界 1ms RT 任务延迟(1GB 内存约束下) 0.5B tokens/s、内存占用上限
T5-M 能效拐点 1ms RT 任务 P99.9、CPU 频率调节影响 1.5B tokens/s、E_per_token
T5-H 极致资源约束下保持关键保障负载边界 1ms RT 任务最大延迟 + CAN/RS485 延迟 3B/7B tokens/s、E_per_token
T4-L 统一内存带宽隔离(NPU) NPU 推理 + 实时任务共享 51.2 GB/s 带宽时 RT 抖动 7B INT4 tokens/s
T4-M 统一内存带宽隔离(GPU) LLM+RT 共享内存带宽时 RT 任务 P99.9 14B tokens/s、DLA 异步收益
T3-L 大容量边缘并发 72B 推理与 RT 任务共存时的优先级反转 72B INT4 tokens/s、多模型 QPS
T2-L 单机多卡 NVLink 调度 GPU 命令端到端延迟、多模型并发公平性 14B/72B tokens/s、TTFT P99.9
T2-M 8 卡拓扑调度 8 卡 NVLink 全互联下的集合通信抖动 72B FP16 tokens/s
T2-H 高算力密度下的隔离 H100 满负载时 RT 任务 P99.9 72B FP16 TTFT、671B 分片吞吐
T1-L 跨节点分布式调度隔离 RDMA 延迟、NCCL all-reduce 期间 RT 任务抖动 72B 模型 tokens/s、多模型 QPS
T1-H 超大规模分布式调度 NDR IB 延迟、671B 推理期间 RT 抖动 671B tokens/s、能效比

5.4 基线 OS 对照

档位 SylixOS 实验组 主对照 (PREEMPT_RT Linux) 虚拟化对照 容器对照
T5-L SylixOS ARM64 (RK3568) Buildroot + RT — Docker
T5-M SylixOS ARM64 (RK3576) Buildroot + RT — Docker
T5-H SylixOS ARM64 (RK3588) Ubuntu 22.04 + RT KVM (RT VM) Docker
T4-L SylixOS ARM64 (RK3588) Ubuntu 22.04 + RT KVM (RT VM) Docker
T4-M SylixOS ARM64 (T234) L4T Ubuntu 20.04 + RT KVM (RT VM) Docker
T3-L SylixOS ARM64 / x86 Ubuntu 22.04 + RT KVM (RT VM) Docker
T2-L/M SylixOS x86 Ubuntu 22.04 + RT KVM (RT VM) Docker
T2-H SylixOS x86 Ubuntu 22.04 + RT KVM (RT VM) Docker
T1-L SylixOS x86 ×4 节点 Ubuntu 22.04 + RT ×4 KVM (RT VM) ×4 Docker ×4
T1-H SylixOS x86 ×4 节点 Ubuntu 22.04 + RT ×4 KVM (RT VM) ×4 Docker ×4

6. 采购与获取计划

优先级 档位 设备 估算费用 (RMB) 备注
P0 T4-L RK3588 16GB 工业盒(现有) 0 现有设备,立即可用
P0 T2-L 4×V100 SXM 塔式整机(现有) 0 现有设备,谱系锚点
P0 T5-H RK3588 工业盒 8GB 分区(现有) 0 与 T4-L 同机双档位
P1 T5-L RK3568 1~2GB 核心板 ~300-800 控制端最低资源参考档,必做
P1 T5-M RK3576 4GB 核心板 ~600-1,500 控制端能效拐点
P1 T4-M Jetson AGX Orin 32GB ~15,000-28,000 需尽早确认 SylixOS T234 BSP
P2 T4-M 备选 RK3588 32GB 工业盒 + 26 TOPS 算力棒 ~3,000-5,000 若 Jetson BSP 不支持
P2 T3-L Jetson AGX Orin 64GB ~30,000-50,000 边缘节点可跑 72B
P2 T5-H 备选 Jetson Orin Nano 8GB 开发套件 ~1,800-2,500 CUDA 路线对照
P3 T2-M 4× V100 32GB SXM + 8 卡底板 + 电源 ~70,000-100,000 现有平台加卡扩容
P3 T2-H 4× H100 80GB SXM5 工作站 ~800,000-1,200,000 可租云实例替代
P3 T1-L 3× 计算节点 + 12× V100 + IB ~270,000 可用云实例替代
P4 T1-H 4 节点 × 4×H100 + NDR IB ~3,000,000+ 强烈建议云租替代
— 仪器 DC 功率计 ×2 (T4+T5) ~6,000 T5 强制
— 仪器 INA226 采集板 ×2 ~500 T4+T5
— 仪器 交流功率计 / 智能插座 ~1,000 T3 / T2 档
— 仪器 示波器 (Tektronix MDO34) ~30,000 GPIO 环回延迟(可借用)
— 仪器 红外测温枪 ×2 ~1,000 被动散热档位
— 仪器 CANalyzer ~20,000 T4 CAN 总线延迟(可借用)
合计 P0~P2 必做项 ~55,000-95,000 不含 T1/T2 扩展

降本策略

  1. P0 零成本起步: T2-L + T4-L + T5-H 三个档位由现有硬件直接覆盖,可立即启动 SylixOS 适配与基线数据采集,无需等待采购。
  2. 一机两档: RK3588 16GB 工业盒通过内存分区同时充当 T4-L(16 GB)与 T5-H(8 GB),省去一台设备与一套 BSP 验证成本。
  3. 档位跳跃验证: 若某档位 SylixOS BSP 不可行,可直接跳过该档(如 T5-M 若 RK3576 BSP 不可用,用 T5-H 降配替代),谱系不断。
  4. T1/T2-H 云替代: H100 集群强烈建议租用云实例(阿里云 GN7 / AWS p5),按需付费,避免百万级 CAPEX 与机房改造。
  5. T4-M Jetson: 可先用 NVIDIA 开发者板(约 $2,000)验证 SylixOS BSP 可行性后再采购工业级版本。
  6. 仪器借用: 示波器和 CANalyzer 可从实验室借用,不必专门采购。

7. SylixOS BSP 适配 Checklist(跨档位汇总)

7.1 x86 BSP(T2 全档 + T1 全档)

  • SylixOS 2.x LTS x86 在 H12D-8D 主板可启动
  • AMD EPYC 7402 / 9654 多核 SMP 调度
  • 4× V100 SXM CUDA 驱动(T2-L,核心)
  • 8× V100 SXM CUDA 驱动 + 8 卡拓扑(T2-M)
  • 4× H100 SXM5 CUDA 驱动 + NVLink 900GB/s(T2-H)
  • NVLink 4 卡 / 8 卡全互联拓扑枚举
  • nvidia-smi / DCGM 监控
  • vLLM / llama.cpp 在 SylixOS x86 编译运行
  • Mellanox ConnectX-6 RDMA 驱动(T1-L 专属)
  • ConnectX-7 NDR 400G RDMA 驱动(T1-H 专属)
  • NCCL / MPI 分布式通信库(T1 专属)
  • IPMI / BMC 功耗采集
  • tickless + CPU 隔离 + 中断亲和性
  • 高功耗档位热管理(H100 液冷温度阈值联动降频)

7.2 ARM64 BSP — T234 / Ampere(T4-M / T3-L-A / T5-H 路线B)

  • SylixOS ARM64 在 NVIDIA T234 SoC 可启动(核心,需翼辉确认)
  • 12× Cortex-A78AE SMP 调度(AGX Orin)/ 6× A78AE(Orin NX / Nano)
  • Jetson Ampere GPU CUDA 驱动
  • DLA v2.0 驱动(异步推理,AGX Orin 专属)
  • 16/32/64 GB LPDDR5 统一内存管理
  • 功率模式切换 API (7W/15W/25W/30W/50W/60W)
  • 10GbE 网络驱动
  • MIPI CSI 工业相机接口
  • PCIe Gen4 扩展
  • 温度传感器 + 降频阈值

7.3 ARM64 BSP — RK3588(T5-H / T4-L)

  • SylixOS BSP for RK3588(A76+A55 大小核 SMP)
  • CPU 频率独立调节 (governor)
  • 内存分区限额机制(16 GB 板按 8 GB 运行,T4-L ↔ T5-H 切换)
  • tickless / idle hook
  • 看门狗驱动
  • rknn / RKLLM NPU 驱动(核心)
  • 板贴 26 TOPS 算力芯片驱动(32 TOPS 档位)
  • M0 核 BSP + RPMsg 跨核通信(若用 M0)
  • 双千兆 + WiFi 6 + 4G/5G 驱动
  • CAN ×2 驱动
  • RS485 ×2 + RS232 ×1 驱动
  • GPIO 子系统
  • HDMI 输出(调试)
  • Ubuntu 22.04 与 SylixOS 双系统引导

7.4 ARM64 BSP — RK3576(T5-M)

  • SylixOS BSP for RK3576(A72+A53 大小核 SMP)
  • 6 TOPS NPU 驱动(RKNN 栈)
  • 2~4 GB LPDDR5 内存管理
  • CAN / RS485 / 千兆网络驱动
  • 低功耗被动散热下的频率/温度联动

7.5 ARM64 BSP — RK3568(T5-L)

  • SylixOS BSP for RK3568(4×A55 SMP)
  • 0.8~1 TOPS NPU 驱动(RKNN 栈)
  • 1~2 GB 极小内存下的内核裁剪与内存域划分(核心难点)
  • CAN / RS485 / 千兆网络驱动
  • 1ms 实时任务在 1 GB 内存约束下的可行性验证