基础设备配置(四层级 × 三档算力分级)
版本: v2.0 起草日期: 2026-09-18
设计目标: 为翼辉 SylixOS 调度框架研究建立 集群→桌面→边→端 四级硬件体系,每级内再按 低/中/高 三档细分
现有硬件全覆盖: T2-L(4×V100 SXM)+ T3-L / T4-H(RK3588 工业盒)| 需新增: T1 集群扩展 + 其余档位
0. 分级体系总览
0.1 分级维度与分档规则
分级维度: 以「统一内存 / 显存容量」为第一分类维度——容量直接决定可承载的模型规模,且与功耗、散热、互联架构强相关,四个层级可连续衔接、无断层。
分档规则: 相邻两档的边界值归入上界一侧
| 层级 |
代码 |
低级 |
中级 |
高级 |
| 端级 |
T4 |
1~2 G |
2~4 G |
4~8 G |
| 边级 |
T3 |
8~16 G |
16~32 G |
32~64 G |
| 桌面级 |
T2 |
64~128 G |
128~256 G |
256~512 G |
| 集群级 |
T1 |
512 G~1 T |
—(不设中档) |
1 T~2 T |
边界值归属示例: 8 GB → 端-高;16 GB → 边-低;64 GB → 边-高;128 GB → 桌-低;512 GB → 桌-高;1 TB → 集-低。
0.2 全谱系总表(11 个档位)
算力单位统一约定: NVIDIA GPU 用 FP16 Tensor Core TFLOPS(dense),NPU 用 INT8 TOPS;两者不可直接换算。
| 档位 |
容量 |
算力(峰值) |
功耗 |
算力/供电架构 |
代表设备 |
状态 |
| T4-L |
1~2 G |
0.8~1 TOPS (INT8) |
3~5 W |
ARM A55 + 小 NPU;DC 5V/12V 被动散热 |
RK3568 1~2GB 核心板 |
|
| T4-M |
2~4 G |
6 TOPS (INT8) |
5~10 W |
ARM A72+A53 + NPU;DC 12V 被动散热 |
RK3576 4GB |
|
| T4-H |
4~8 G |
6~32 TOPS (INT8) |
7~21 W |
ARM A76+A55 + M0 + NPU;DC 12V 被动 |
RK3588 8GB / Jetson Orin Nano 8GB |
现有(16G 板降配) |
| T3-L |
8~16 G |
32~100 TOPS (INT8) |
10~30 W |
ARM SoC 统一内存 + NPU/GPU;DC 12~24V 被动/小风扇 |
RK3588 16GB 工业盒 / Orin NX 16GB |
现有 |
| T3-M |
16~32 G |
275 TOPS (INT8) |
15~60 W |
ARM A78AE + Ampere GPU + 2×DLA;DC 19V 主动风冷 |
Jetson AGX Orin 32GB |
|
| T3-H |
32~64 G |
275 TOPS / 91 TFLOPS (FP16) |
60~600 W |
ARM 统一内存 或 x86+单卡 CUDA;风冷/液冷 |
Jetson AGX Orin 64GB / 边缘工控机 + RTX 6000 Ada 48GB |
|
| T2-L |
64~128 G |
500 TFLOPS (FP16) |
600~1.65 kW |
x86 + 4×V100 SXM NVLink;双电源 + 360 液冷 |
4×V100 32GB SXM 塔式 |
现有 |
| T2-M |
128~256 G |
1000 TFLOPS (FP16) |
3.0~3.3 kW |
x86 + 8×V100 SXM NVLink;双电源 + 液冷 |
8×V100 32GB SXM 整机 |
需扩展 |
| T2-H |
256~512 G |
~4000 TFLOPS (FP16) |
4.5~6.5 kW |
x86 + 4×H100 SXM5 NVLink;高压供电 + 强制液冷 |
4×H100 80GB SXM5 工作站 |
|
| T1-L |
512 G~1 T |
~2000 TFLOPS (FP16) |
~6.6 kW |
4 节点 × x86+4×V100,100GbE RoCE/IB;机房风冷/液冷 |
4×(T2-L 节点)+ IB 交换机 |
需扩展 |
| T1-H |
1~2 T |
~16 PFLOPS (FP16) |
20~25 kW |
4 节点 × x86+4×H100,NDR 400G IB;机房级液冷 |
4×(T2-H 节点)+ NDR 交换机 |
|
0.3 设计原则
- 容量连续、功耗阶跃: 从 1 GB / 3 W 到 2 TB / 25 kW,容量每上一档约 ×2,功耗随架构变化阶跃(被动散热 → 主动风冷 → 液冷 → 机房级液冷),形成天然的性能/能效对比曲线。
- CUDA 栈贯通 T1/T2/T3: 集群/桌面/边级全部或大部分走 NVIDIA CUDA 生态(V100 / Ampere / Hopper),模型与推理框架(vLLM / TensorRT-LLM)可跨档位无缝迁移,变量只有规模。
- 非 CUDA 端路线: T4 全档位与 T3-L 走 RKNN/RKLLM NPU 栈,代表极致资源约束端点,是 RTOS 调度隔离价值最大化的场景。
- 现有硬件复用: 4×V100 SXM(T2-L) 与 RK3588 工业盒(T3-L 16GB / T4-H 8GB 两用) 为零采购成本基线,整条谱系以此为锚点向两侧扩展。
- BSP 最小化: 全谱系仅需两类 BSP——x86(T1/T2)与 ARM64(T3/T4),档位差异靠设备树与驱动裁剪吸收,不新增架构分支。
T1. 集群级 — 512 G ~ 2 T
T1.1 定位
大规模分布式 LLM 推理与多模型并发服务。验证 SylixOS 在多节点分布式调度下的实时性——跨节点 RDMA 延迟、NCCL 集合通信抖动、分布式推理框架(vLLM+Ray / TensorRT-LLM+MPI)与实时控制任务的混合负载隔离。
T1.2 档位对比
| 维度 |
T1-L 集群-低 |
T1-H 集群-高 |
| 容量 |
512 GB(4 × 128 GB) |
1.28 TB(4 × 320 GB) |
| 节点数 |
4 节点 |
4 节点 |
| 单节点加速器 |
4 × V100 32GB SXM |
4 × H100 80GB SXM5 |
| 集群算力 |
~2000 TFLOPS (FP16) |
~16 PFLOPS (FP16) |
| 节点内互联 |
NVLink 300 GB/s |
NVLink 900 GB/s |
| 节点间互联 |
100GbE RoCE / IB |
NDR 400G IB |
| 整机功耗 |
~6.6 kW |
20~25 kW |
| 散热架构 |
每节点 360 液冷 + 机房风冷 |
机房级液冷(CDU / 后门换热器) |
| 主要模型 |
72B FP16 / 多实例 14B |
671B INT4 / 多实例 72B FP16 |
T1.2.1 T1-L 集群-低 — 4 节点 × 4×V100 = 512 GB(本方案主线)
| 项目 |
规格 |
数量 |
备注 |
| 计算节点 |
同 T2-L 桌面级配置 |
4 台 |
每节点 4×V100 32GB SXM = 128GB |
| 节点内 GPU |
NVIDIA V100 32GB SXM (NVLink 全互联) |
4×4 = 16 卡 |
每节点 NVLink 全互联 |
| 节点内 CPU |
AMD EPYC 7402 (24C/48T, 2.0-3.2GHz) |
4 |
每节点 1 颗 |
| 节点内内存 |
128GB DDR4-2133 ECC |
4×128 = 512GB |
每节点 128GB |
| 节点间互联 |
Mellanox ConnectX-6 100GbE / IB |
4 卡 |
每节点 1 卡,RoCE 或原生 IB |
| 节点间交换机 |
100GbE/IB 交换机 (Mellanox SN2700 或同档) |
1 |
32 端口 |
| 存储 |
共享 NFS / NVMe-oF (每节点 1TB NVMe 本地 + 共享存储) |
— |
模型权重共享池 |
| 散热 |
每节点 360 一体液冷 ×2 |
— |
同 T2-L |
| 电源 |
每节点 长城 1650W + 1250W 双电源 |
4 套 |
单节点 ~1.65 kW,集群 ~6.6 kW |
| 功率采集 |
PDU + Yokogawa WT310 (整机) + nvidia-smi dmon (单卡) |
— |
每节点独立采集 |
显存与算力
| 指标 |
值 |
| 总显存 |
512 GB (4 × 128GB) |
| 单卡 FP16 算力 |
125 TFLOPS |
| 集群总算力 (FP16) |
~2000 TFLOPS (NVLink 节点内 + IB 节点间) |
| NVLink 带宽 (节点内) |
300 GB/s (GPU↔GPU) |
可运行模型
| 模型 |
量化 |
显存占用 |
并发实例数 |
推理框架 |
| Qwen2.5-72B-Instruct |
FP16 |
~144 GB |
3+ |
vLLM + Ray 分布式 |
| Qwen2.5-72B |
INT4 (AWQ) |
~36 GB |
14+ |
vLLM + Ray |
| DeepSeek-V2-Chat |
FP16 |
~210 GB |
2 |
TensorRT-LLM + MPI |
| Qwen2.5-14B |
FP16 |
~28 GB |
18+ |
vLLM (可单节点) |
| LLaMA-3-70B |
FP16 |
~140 GB |
3+ |
vLLM + Ray |
注: 若已有 1 台 T2-L 节点,仅需追加 3 台。V100 SXM 为二手市场/拆机渠道,价格波动大。也可租用云上 V100 实例替代自建集群。
T1.2.2 T1-H 集群-高 — 4 节点 × 4×H100 = 1.28 TB(扩展档)
| 项目 |
规格 |
数量 |
备注 |
| 计算节点 |
同 T2-H 桌面级配置 |
4 台 |
每节点 4×H100 80GB SXM5 |
| 节点内 GPU |
NVIDIA H100 80GB SXM5 (NVLink 4 卡全互联) |
16 卡 |
NVLink 900 GB/s |
| 节点内 CPU |
AMD EPYC 9654 (96C/192T) 或 Intel Xeon 8468 |
4 |
每节点 1~2 颗 |
| 节点内内存 |
512GB DDR5-4800 ECC |
4 × 512GB |
每节点 512GB |
| 节点间互联 |
NVIDIA ConnectX-7 NDR 400Gb/s IB |
4~8 卡 |
每节点 1~2 卡 |
| 节点间交换机 |
NDR 400G IB 交换机 (Quantum-2 / SN5600) |
1 |
32 端口 |
| 存储 |
并行文件系统 (GPFS/Lustre) + 每节点 4TB NVMe |
— |
671B 级模型权重池 |
| 散热 |
机房级液冷 (CDU + 冷板) |
— |
风冷不可行 |
| 电源 |
每节点 4~6 kW 冗余电源 |
4 套 |
集群 2025 kW |
可运行模型
| 模型 |
量化 |
显存占用 |
并发实例数 |
推理框架 |
| DeepSeek-V3 / R1-671B |
INT4 (AWQ) |
~400 GB |
3+ |
vLLM + Ray / SGLang |
| Qwen2.5-72B |
FP16 |
~144 GB |
8+ |
vLLM + TensorRT-LLM |
| LLaMA-3-405B |
INT4 |
~230 GB |
5+ |
TensorRT-LLM + MPI |
| Qwen2.5-32B |
FP16 |
~64 GB |
20+ |
vLLM |
T1.3 SylixOS 要求(T1 通用)
| 要求项 |
描述 |
风险 |
| x86 BSP |
每节点运行 SylixOS x86 LTS |
低(T2-L 已验证) |
| RDMA / RoCE 驱动 |
ConnectX-6 / ConnectX-7 在 SylixOS 上的 RDMA 驱动 |
中-高(需验证 Mellanox OFED 兼容性) |
| NCCL / MPI |
分布式集合通信库在 SylixOS 移植 |
中(NCCL 依赖 CUDA + POSIX) |
| Ray / 分布式框架 |
vLLM + Ray 的 SylixOS 适配 |
中(Python + Ray 依赖链) |
| 分布式调度器 |
SylixOS 跨节点实时任务调度原型 |
研究贡献点 |
T1.4 研究角度
- 跨节点调度延迟: 分布式推理时,1ms 实时任务在跨节点 NCCL all-reduce 期间的尾延迟
- RDMA bypass 内核: SylixOS 是否能利用 RDMA bypass kernel path 降低跨节点通信延迟
- 分布式公平性: 多节点并发请求时,高优先级实时任务的跨节点响应稳定性
- 能效: 分布式推理的每 token 能耗 vs 单节点(通信开销 vs 并行收益)
- 档位对照: T1-L 与 T1-H 的每 token 能耗比——V100 集群(能效基线)vs H100 集群(能效上限)
T2. 桌面级 — 64 G ~ 512 G
T2.1 定位
单节点多 GPU 大模型推理。验证 SylixOS 在单机多卡 NVLink 拓扑下的 GPU 命令调度延迟、显存管理实时性、多模型并发流水线调度。
T2.2 档位对比
| 维度 |
T2-L 桌面-低 |
T2-M 桌面-中 |
T2-H 桌面-高 |
| 容量 |
128 GB(4 × 32 GB) |
256 GB(8 × 32 GB) |
320 GB(4 × 80 GB) |
| 加速器 |
4 × V100 32GB SXM |
8 × V100 32GB SXM |
4 × H100 80GB SXM5 |
| 算力 |
500 TFLOPS (FP16) |
1000 TFLOPS (FP16) |
~4000 TFLOPS (FP16) |
| 互联 |
NVLink 300 GB/s ×4 |
NVLink 300 GB/s ×8 |
NVLink 900 GB/s ×4 |
| 整机功耗 |
~1.65 kW |
3.03.3 kW |
4.56.5 kW |
| 散热架构 |
360 液冷 ×2 + 塔式风道 |
360 液冷 ×2 + 双路风冷 |
强制液冷 (冷板),风冷不可行 |
| 电源架构 |
1650W + 1250W 双电源 |
2× 2000W 冗余 / 220V 单相 |
2× 3000W 冗余 / 220V 双相 |
| 形态 |
塔式一体定制机箱 |
4U 机架式 / 塔式 |
4U~5U 机架式液冷 |
| 可运行模型 |
72B INT4 / 14B FP16 |
72B FP16 / 多实例 32B |
671B INT4 / 72B FP16 多并发 |
| 状态 |
现有 |
需扩展(现有平台加卡) |
需 |
T2.2.1 T2-L 桌面-低 — 4×V100 SXM = 128 GB(现有设备,谱系锚点)
| # |
部件 |
型号 / 规格 |
数量 |
备注 |
| 1 |
主板 |
H12D-8D(双路 EPYC 服务器板) |
1 |
|
| 2 |
CPU |
AMD EPYC 7402 (24C/48T, 2.0-3.2 GHz, TDP 180W) |
1 |
|
| 3 |
硬盘 |
长城 M.2 NVMe 1TB |
1 |
系统盘 |
| 4 |
内存 |
三星 DDR4-32G-2133 |
4 |
共 128 GB DDR4 |
| 5 |
散热系统 |
360 一体液冷散热套装 |
2 |
主机 + GPU |
| 6 |
转接卡 |
ROHSTNS-2SXM2-2P54E |
2 |
|
| 7 |
信号线 |
V100 32G × 2 |
4 |
NVLink 桥接 |
| 8 |
机箱 |
塔式一体定制机箱 |
1 |
|
| 9 |
主电源 |
长城全模组 1650W |
1 |
|
| 10 |
副电源 |
长城 1250W 全模组 |
1 |
SXM 平台用 |
| 11 |
散热器 |
SP3 高性能散热器 |
1 |
|
| 12 |
SXM 平台 |
300G NVLink 4 卡直连底板 |
1 |
|
| 13 |
GPU |
NVIDIA V100 32GB SXM |
4 |
NVLink 全互联,共 128GB HBM2 |
显存与算力
| 指标 |
值 |
| 总显存 |
128 GB (4 × 32GB HBM2) |
| 单卡显存 |
32 GB HBM2 |
| 单卡 FP16 算力 |
125 TFLOPS |
| 总算力 (FP16) |
~500 TFLOPS |
| NVLink 带宽 |
300 GB/s (GPU↔GPU 全互联) |
| 内存带宽 |
DDR4-2133 ~170 GB/s (CPU 侧) |
| 整机功耗 |
~1650 W (满载) |
可运行模型
| 模型 |
量化 |
显存占用 |
并发实例数 |
推理框架 |
| Qwen2.5-7B-Instruct |
FP16 |
~14 GB |
8+ |
vLLM / TensorRT-LLM |
| Qwen2.5-14B-Instruct |
INT4 (AWQ) |
~8 GB |
14+ |
vLLM |
| Qwen2.5-14B |
FP16 |
~28 GB |
4 |
vLLM |
| Qwen2.5-72B-Instruct |
INT4 (AWQ) |
~36 GB |
3 |
vLLM (张量并行 TP=4) |
| LLaMA-3-8B |
FP16 |
~16 GB |
7 |
vLLM |
| MiniCPM-V 2.6 |
INT4 |
~6 GB |
20+ |
llama.cpp |
| Whisper-Large-v3 |
FP16 |
~3 GB |
40+ |
faster-whisper |
T2.2.2 T2-M 桌面-中 — 8×V100 SXM = 256 GB
在 T2-L 平台基础上加卡扩容,是「同一代硬件纵向扩展」的对照档位,最贴近现有设备、改造成本最低。
| 项目 |
规格 |
变更点 |
| GPU |
NVIDIA V100 32GB SXM × 8 |
4 → 8 卡 |
| SXM 平台 |
300G NVLink 8 卡直连底板 |
更换底板 |
| 转接卡 |
ROHSTNS-2SXM2-2P54E |
2 → 4 |
| NVLink |
全互联 8 卡,300 GB/s |
拓扑扩展 |
| 主板 / CPU |
H12D-8D + EPYC 7402(双路可升级 EPYC 7742 64C) |
建议升双路以喂满 8 卡 |
| 内存 |
128 GB → 256 GB DDR4-2133 |
8 卡需更大 pinned memory |
| 电源 |
2 × 2000W 冗余(或 220V 单相 16A 回路) |
1650W+1250W 不足 |
| 散热 |
360 液冷 ×2 + 机箱风道强化 |
— |
| 整机功耗 |
3.03.3 kW |
+100% |
| 总算力 |
~1000 TFLOPS (FP16) |
+100% |
可运行模型(新增/提升)
| 模型 |
量化 |
显存占用 |
并发实例数 |
说明 |
| Qwen2.5-72B-Instruct |
FP16 |
~144 GB |
1~2 |
TP=8 张量并行,无需量化 |
| Qwen2.5-32B-Instruct |
FP16 |
~64 GB |
3+ |
TP=4 |
| DeepSeek-V2-Lite |
FP16 |
~31 GB |
8+ |
— |
| Qwen2.5-14B |
FP16 |
~28 GB |
9+ |
单卡可容,多实例并发 |
备选方案: 4 × RTX 6000 Ada 48GB = 192 GB,364 TFLOPS (FP16),整机 ~2.4 kW,风冷即可。优势是无 NVLink 但单卡能效高、显存快;劣势是跨卡走 PCIe Gen5。
T2.2.3 T2-H 桌面-高 — 4×H100 SXM5 = 320 GB
| 项目 |
规格 |
| GPU |
NVIDIA H100 80GB SXM5 × 4(NVLink 全互联) |
| 单卡算力 |
~989 TFLOPS (FP16 Tensor Core, dense) |
| 单卡显存 |
80 GB HBM3 |
| NVLink |
900 GB/s (GPU↔GPU) |
| CPU |
AMD EPYC 9654 (96C/192T) ×1~2 |
| 内存 |
512 GB DDR5-4800 ECC |
| 底板 |
HGX H100 4-GPU 或 8-GPU 底板(留 4 卡空位) |
| 存储 |
4 TB NVMe RAID0(模型权重加载) |
| 散热 |
强制液冷(冷板式),风冷不可行 |
| 电源 |
2 × 3000W 冗余 / 220V |
| 整机功耗 |
4.56.5 kW |
| 总算力 |
~4000 TFLOPS (FP16),稀疏 ~8000 TFLOPS |
备选方案: 8 × RTX 6000 Ada 48GB = 384 GB,728 TFLOPS (FP16),~4.0 kW,风冷可行——容量更大、功耗更低,代价是无 NVLink 与算力密度。
可运行模型(新增/提升)
| 模型 |
量化 |
显存占用 |
并发实例数 |
说明 |
| Qwen2.5-72B-Instruct |
FP16 |
~144 GB |
2 |
TP=4,H100 下 TTFT 极低 |
| LLaMA-3-70B |
FP16 |
~140 GB |
2 |
— |
| DeepSeek-V2-Chat |
FP16 |
~210 GB |
1 |
单机可跑 |
| Mixtral-8x7B |
FP16 |
~93 GB |
3 |
MoE 专家并行 |
T2.3 SylixOS 要求(T2 三档通用)
| 要求项 |
描述 |
风险 |
| x86 BSP |
SylixOS 2.x LTS x86 |
低 |
| CUDA 驱动 |
V100 SXM / H100 SXM 在 SylixOS 的 CUDA 驱动 |
中(需翼辉确认) |
| NVLink 支持 |
4 卡 / 8 卡 NVLink 拓扑在 SylixOS 可用 |
中 |
| vLLM / llama.cpp |
Python + CUDA 推理框架适配 |
中(llama.cpp 优先,依赖少) |
| nvidia-smi / DCGM |
GPU 监控 + 功耗采集 |
低 |
| 8 卡 / 4 卡拓扑切换 |
同一 BSP 支持 T2-L/M/H 不同卡数 |
低(设备树 + 枚举) |
T2.4 对照组 OS
- 主对照: Ubuntu 22.04 LTS +
linux-image-rt (PREEMPT_RT) + vLLM
- 辅助对照: CentOS Stream 9 + RT 内核(可选)
T3. 边级 — 8 G ~ 64 G
T3.1 定位
边缘 AI 推理与工业控制并发。验证 SylixOS 在统一内存架构(CPU+加速器共享 LPDDR)下的实时性——推理任务与实时控制任务共享内存带宽时的隔离能力。
T3.2 档位对比
| 维度 |
T3-L 边-低 |
T3-M 边-中 |
T3-H 边-高 |
| 容量 |
16 GB 统一内存 |
32 GB 统一内存 |
64 GB 统一内存 / 48 GB 独立显存 |
| 加速器 |
RK3588 NPU 6+26 TOPS / Ampere |
Ampere GPU + 2×DLA |
AGX Orin 64GB / RTX 6000 Ada |
| 算力 |
32 TOPS / 100 TOPS (INT8) |
275 TOPS (INT8) |
275 TOPS / 91 TFLOPS (FP16) |
| 功耗 |
10~30 W |
15~60 W |
60~600 W |
| 供电架构 |
DC 12~24 V,无风扇/小风扇 |
DC 19 V,主动风冷 |
DC 19 V 或 ATX,风冷/液冷 |
| 工作温度 |
-40~60 ℃ 工业级 |
-25~80 ℃ |
-2580 ℃ / 050 ℃ |
| SylixOS 风险 |
极低(RK3588 BSP 复用 T4) |
高(T234 BSP 需验证) |
高 / 中 |
| 状态 |
(RK3588 16GB 工业盒) |
|
|
T3.2.1 T3-L 边-低 — RK3588 16GB 工业盒(现有设备)
这是现有 RK3588 设备的标准归属档位(16 GB 统一内存落在边级区间内),也是唯一可零成本立即开展研究的边级档位。
| 项目 |
规格 |
备注 |
| SoC |
Rockchip RK3588(同 T4-H) |
SylixOS BSP 与 T4 共用 |
| 内存 |
16 GB LPDDR4X(统一内存) |
-40~60 ℃ 工业宽温 |
| NPU |
6 TOPS 原生 + 26 TOPS 算力棒扩展 = 32 TOPS |
算力棒走 M.2 2280 |
| 功耗 |
2130 W(含算力棒) |
被动散热,可选小风扇 |
| 内存带宽 |
~51.2 GB/s (128-bit LPDDR4X) |
与 T4 相同,是带宽瓶颈点 |
| 模型 |
Qwen2.5-3B/7B INT4(RKLLM) |
比 T4-H 内存翻倍,可跑更大模型 |
备选方案(同档位、CUDA 路线): NVIDIA Jetson Orin NX 16GB — 100 TOPS (INT8, sparse),1024 CUDA + 32 Tensor Core,16 GB LPDDR5 / 102.4 GB/s,10~25 W,CUDA 生态与 T1/T2 打通。代价是 SylixOS T234 BSP 风险高。
T3.2.2 T3-M 边-中 — NVIDIA Jetson AGX Orin 32GB
| 项目 |
规格 |
| SoC |
NVIDIA T234(Grace 系列衍生) |
| CPU |
12× ARM Cortex-A78AE @ 2.0 GHz(64-bit) |
| GPU |
NVIDIA Ampere 架构,2048 CUDA cores + 64 Tensor cores |
| DLA |
2× DLA v2.0(深度学习加速器,可异步推理) |
| AI 算力 |
275 TOPS (INT8) / 137.5 TOPS (INT8+INT8 双精度) |
| 内存 |
32 GB LPDDR5(统一内存,CPU/GPU 共享) |
| 内存带宽 |
204.8 GB/s |
| 功耗 |
15 W ~ 60 W(可配置功率模式:15W/30W/50W/60W) |
| 工作温度 |
-25 ~ 80°C(工业级,但不如 RK3588 的 -40~60°C 宽) |
| 存储 |
64GB eMMC + M.2 NVMe(可扩展) |
| 网络 |
2× 10GbE(RJ45)+ 1× 千兆 |
| 视频接口 |
HDMI 2.1 + DP 1.4a |
| USB |
4× USB 3.2 + 2× USB 2.0 |
| PCIe |
PCIe Gen4 ×4(可扩展外设) |
| MIPI CSI |
4 通道(可接工业相机) |
| 尺寸 |
100mm × 87mm(核心模块) |
| 出厂 OS |
Ubuntu 20.04 LTS (L4T) |
| 价格 |
~$2,000-4,000(~15,000-28,000 RMB) |
选择 Jetson AGX Orin 的理由
- CUDA 生态统一: 与 T1/T2 同为 NVIDIA GPU,vLLM / TensorRT / llama.cpp 可直接移植,无需切换到 RKLLM 栈
- 统一内存架构: CPU 和 GPU 共享 32GB LPDDR5,无独立显存——LLM 推理和实时控制任务争抢同一内存带宽,是验证内存带宽管控(RQ2)的理想平台
- DLA 异步推理: 2 个 DLA 可在 GPU/CPU 不介入时执行推理,适合"LLM 推理让出 CPU/GPU 给实时任务"的调度策略验证
- 功率可配置: 15W/30W/50W/60W 多档功率模式,可在不同功耗预算下测试
- 丰富 I/O: 10GbE + MIPI CSI + PCIe Gen4,可接工业相机、高速网络、扩展卡
T3.2.3 T3-H 边-高 — 64 GB 档(两条路线)
| 路线 |
主推 A: Jetson AGX Orin 64GB |
主推 B: 边缘工控机 + RTX 6000 Ada 48GB |
| 架构 |
ARM A78AE + Ampere GPU(统一内存) |
x86 (Xeon/Core) + 独立 CUDA 显卡 |
| 容量 |
64 GB LPDDR5(统一内存) |
48 GB GDDR6 ECC(独立显存) |
| 算力 |
275 TOPS (INT8) |
91 TFLOPS (FP16) / 182 TFLOPS 稀疏 |
| 功耗 |
15~60 W |
整机 ~600 W |
| 散热 |
被动/主动风冷 |
主动风冷或液冷 |
| 生态 |
CUDA + DLA,与 T3-M 同 BSP |
完整 CUDA + NVLink 可选 |
| 优势 |
能效极高、宽温、无风扇可行 |
算力密度高、显存带宽大、生态完整 |
| 劣势 |
统一内存带宽仅 204.8 GB/s,带宽受限 |
功耗/体积/散热不适合现场部署 |
| 适用场景 |
边缘现场、宽温环境、低功耗 |
边缘机柜、算力下沉、多模型并发 |
可运行模型(T3 三档合并)
| 模型 |
量化 |
显存占用 |
预期 tokens/s |
适用档位 |
推理框架 |
| Qwen2.5-1.5B-Instruct |
INT4 |
~1.2 GB |
~40-60 |
T3-L |
RKLLM |
| Qwen2.5-3B-Instruct |
INT4 |
~2.5 GB |
~50-80 |
T3-L / T3-M |
TensorRT-LLM / RKLLM |
| Qwen2.5-7B-Instruct |
INT4 (W4A16) |
~5 GB |
~30-50 |
T3-L / T3-M |
TensorRT-LLM / llama.cpp |
| Qwen2.5-14B-Instruct |
INT4 |
~8 GB |
~20-35 |
T3-M |
TensorRT-LLM |
| Qwen2.5-32B-Instruct |
INT4 |
~18 GB |
~12-20 |
T3-M / T3-H |
TensorRT-LLM |
| Qwen2.5-72B-Instruct |
INT4 (AWQ) |
~36 GB |
~5-8 |
T3-H |
TensorRT-LLM / vLLM |
| MiniCPM-V 2.6 |
INT4 |
~6 GB |
~15-25 |
T3-L 以上 |
llama.cpp |
| Whisper-Large-v3 |
INT8/FP16 |
~1.5 GB |
流式 ASR |
T3-L 以上 |
faster-whisper |
| YOLOv8n |
INT8 |
~0.1 GB |
200+ FPS |
T3 全档 |
TensorRT / RKNN |
T3.3 SylixOS 要求(T3)
| 要求项 |
描述 |
风险 |
| ARM64 BSP (T234) |
SylixOS 需提供 NVIDIA T234 SoC 的 ARM64 BSP |
高(需翼辉确认是否支持 Jetson Orin) |
| RK3588 BSP(T3-L) |
与 T4-H 共用同一 BSP,零额外风险 |
极低 |
| CUDA 驱动 |
Jetson 专用 CUDA(L4T 驱动栈)在 SylixOS 适配 |
高 |
| DLA 驱动 |
DLA 异步推理在 SylixOS 的可用性 |
高 |
| 功率模式 API |
15W/30W/50W/60W 切换在 SylixOS 的实现 |
中 |
| 内存监控 |
统一内存架构下的内存带宽监控(PMU 计数器) |
中 |
| 独立显存管理(T3-H B 路线) |
x86 + 独显的显存分配与实时性 |
中 |
取舍: Jetson 路线优势在 CUDA 生态统一 + 275 TOPS + DLA;RK3588-16GB(T3-L)优势在 SylixOS BSP 风险极低 + -40~60℃ 工业级宽温。建议 T3-L 直接用现有 RK3588 起步,T3-M/H 待 Jetson BSP 确认后再采购。
T3.4 对照组 OS
| 档位 |
主对照 |
辅助对照 |
| T3-L |
Ubuntu 22.04 + PREEMPT_RT(RK3588) |
OpenHarmony 4.x + RT patch(可选) |
| T3-M |
Ubuntu 20.04 LTS (L4T) + PREEMPT_RT |
Ubuntu 22.04 + Docker(容器隔离方案) |
| T3-H |
Ubuntu 22.04 + PREEMPT_RT(x86/ARM) |
Docker + KVM |
T3.5 功率采集
| 设备 |
用途 |
适用档位 |
| DC 功率计(USB 接口型) |
整机 DC 输入端功耗 |
T3-L / T3-M |
| INA226 采集板 |
SoC 主电源轨(若可接入) |
全档 |
jetson_stats / tegrastats |
内部功耗代理(辅助,非主报) |
T3-M / T3-H |
| 交流功率计(PZEM / 智能插座) |
边缘工控机整机功耗 |
T3-H B 路线 |
T4. 端级 — 1 G ~ 8 G
T4.1 定位
工业端点超低功耗 LLM 推理与硬实时控制。验证 SylixOS 在极致资源约束(321 W / 18 GB / 0.8~32 TOPS)下的 LLM + 1ms 实时控制并发能力。这是 RTOS 杀手锏场景——资源越紧张,RTOS 调度隔离的价值越大。
T4.2 档位对比
| 维度 |
T4-L 端-低 |
T4-M 端-中 |
T4-H 端-高 |
| 容量 |
1~2 GB LPDDR4X |
2~4 GB LPDDR5 |
4~8 GB LPDDR4X / LPDDR5 |
| SoC |
RK3568 (4×A55) |
RK3576 (4×A72+4×A53) |
RK3588 (4×A76+4×A55+M0) / Orin Nano |
| NPU 算力 |
0.8~1 TOPS (INT8) |
6 TOPS (INT8) |
632 TOPS / 4067 TOPS (INT8) |
| 功耗 |
3~5 W |
5~10 W |
7~21 W |
| 散热架构 |
无风扇被动 |
无风扇被动 |
无风扇被动(可选小风扇) |
| 供电 |
DC 5V / 12V |
DC 12V |
DC 12V |
| 工作温度 |
-40~85 ℃ 工业级 |
-40~85 ℃ 工业级 |
-4060 ℃ / 050 ℃ |
| 可运行模型 |
0.5B INT4 / Whisper-Tiny |
1.5B INT4 / YOLO 系列 |
3B~7B INT4 / MiniCPM-V |
| 状态 |
|
|
✅ 现有(RK3588 16GB 降配) |
T4.2.1 T4-L 端-低 — RK3568 核心板(1~2 GB)
| 项目 |
规格 |
| SoC |
Rockchip RK3568 (22nm) |
| CPU |
4× Cortex-A55 @ 2.0 GHz |
| NPU |
0.8~1 TOPS (INT8)(RKNN 原生栈) |
| 内存 |
1~2 GB LPDDR4X(统一内存,板贴) |
| 内存带宽 |
~25.6 GB/s |
| GPU |
Mali-G52(仅辅助显示) |
| 存储 |
8~16 GB eMMC |
| 网络 |
1× 千兆 + 可选 WiFi |
| 工业接口 |
CAN ×2 / RS485 ×2 / GPIO(典型核心板引出) |
| 功耗 |
3~5 W(无风扇被动散热) |
| 工作温度 |
-40 ~ 85 ℃ 工业级 |
| 出厂 OS |
Buildroot / Ubuntu 20.04(可换 SylixOS) |
| 参考价格 |
300800 RMB(核心板/开发板) |
可运行模型: Qwen2.5-0.5B INT4(~0.5 GB)、Whisper-Tiny INT8(~0.2 GB)、YOLOv5n INT8。
定位价值: 谱系最低档,用于测出「LLM 推理到底能把实时性压到多差」的下界,以及 RTOS 在极小内存下能否守住 1ms。
T4.2.2 T4-M 端-中 — RK3576 核心板(2~4 GB)
| 项目 |
规格 |
| SoC |
Rockchip RK3576 (8nm) |
| CPU |
4× Cortex-A72 + 4× Cortex-A53(异构大小核) |
| NPU |
6 TOPS (INT8) + 可扩展算力棒 |
| 内存 |
2~4 GB LPDDR5(统一内存) |
| 内存带宽 |
~40 GB/s |
| 功耗 |
5~10 W(无风扇被动) |
| 工作温度 |
-40 ~ 85 ℃ 工业级 |
| 参考价格 |
6001,500 RMB |
可运行模型: Qwen2.5-1.5B INT4(~1.2 GB,~15-25 tok/s)、Qwen2.5-0.5B INT4 多实例、YOLOv8s INT8。
定位价值: 端级主力档,算力是 T4-L 的 6 倍而功耗仅翻倍,是能效拐点档位。
T4.2.3 T4-H 端-高 — RK3588 8GB(现有设备降配)/ Jetson Orin Nano 8GB
路线 A(现有设备,零成本): RK3588 工业盒 8GB 配置
| 项目 |
规格 |
说明 |
| SoC |
Rockchip RK3588 (8nm) |
与现有 16GB 工业盒同板同 BSP |
| CPU |
4×A76 @2.4 GHz + 4×A55 @1.8 GHz |
异构大小核 |
| MCU |
Cortex-M0 @200 MHz(协处理,可选) |
跨核通信验证 |
| GPU |
Mali-G610 MC4 |
仅辅助显示 |
| NPU |
6 TOPS(内置, INT8)/ 32 TOPS(板贴 26 TOPS 算力芯片扩展) |
两档可切换 |
| 内存 |
4~8 GB LPDDR4X(统一内存) |
现有 16GB 板通过内存分区限额降配运行 |
| 内存带宽 |
~51.2 GB/s (128-bit) |
与 T3-L 同 |
| 功耗 |
7~21 W(无风扇被动散热) |
6 TOPS 档 ~12W / 32 TOPS 档 ~21W |
| 工作温度 |
-40 ~ 60 ℃ 工业级 |
宽温优势 |
| 出厂 OS |
Ubuntu 22.04 |
换 SylixOS BSP |
现有 16GB 工业盒的双档位用法: 同一台设备既可作为 T3-L(16 GB 全量) 也可作为 T4-H(分区限额 8 GB) 运行,通过 SylixOS 内存分区 / cgroup 限额切换,一台设备覆盖两个档位的对照实验,是本方案的成本关键。
路线 B(CUDA 生态): NVIDIA Jetson Orin Nano 8GB
| 项目 |
规格 |
| SoC |
NVIDIA T234(Ampere 1024 CUDA + 32 Tensor Core) |
| AI 算力 |
40 TOPS (INT8, 稀疏)(Super 模式 67 TOPS) |
| 内存 |
8 GB LPDDR5(统一内存,102.4 GB/s) |
| 功耗 |
7~25 W(可配置 7W/15W/25W) |
| 优势 |
T4 档内唯一 CUDA 路线,TensorRT-LLM 与 T1/T2/T3-M 同栈 |
| 劣势 |
SylixOS T234 BSP 风险高,宽温不如 RK3588 |
| 参考价格 |
~$249(开发套件) |
可运行模型(T4-H)
| 模型 |
量化 |
显存占用 |
预期 tokens/s |
推理框架 |
| Qwen2.5-3B-Instruct |
INT4 |
~2.5 GB |
~40-60 |
RKLLM |
| Qwen2.5-7B-Instruct |
INT4 |
~5 GB |
~20-30 |
RKLLM |
| MiniCPM-V 2.6 |
INT4 |
~6 GB |
~15-25 |
RKLLM |
| Whisper-Large-v3 |
INT8 |
~1.5 GB |
流式 ASR |
RKLLM |
T4.2.4 硬件配置明细(RK3588 工业级边缘计算盒子,现有设备)
系统 (System)
| 项目 |
规格 |
| SoC |
Rockchip RK3588 (8nm) |
| CPU |
4×Cortex-A76 @2.4 GHz + 4×Cortex-A55 @1.8 GHz(异构大小核) |
| MCU |
Cortex-M0 @200 MHz(协处理,可选) |
| GPU |
Mali-G610 MC4 |
| NPU |
6 TOPS(内置, INT8)/ 32 TOPS(板贴 26 TOPS 算力芯片扩展) |
| 内存 |
16 GB LPDDR4X(板贴,不可升级)→ 可按 8 GB 分区用作 T4-H |
| 显存 |
统一内存(NPU 与 CPU 共享) |
存储 / 扩展
- EMMC 64 GB(系统盘)
- 1× TF 卡槽(存储扩展)
- 1× M.2 2280 NVMe(可扩展 SSD / 算力棒)
出厂软件
- 操作系统: Ubuntu 22.04(出厂预装)
- 验证方案: 替换为 SylixOS BSP for RK3588,保留 Ubuntu 22.04 作为对照组
算力与功耗(T4-H 档)
| 指标 |
值 |
| 可用显存 |
8 GB(16 GB 板分区限额) |
| NPU 算力 (6 TOPS 档) |
6 TOPS (INT8) |
| NPU 算力 (32 TOPS 档) |
32 TOPS (INT8, 含 26 TOPS 扩展) |
| GPU 算力 |
Mali-G610 MC4(仅辅助,非主推理路径) |
| 内存带宽 |
LPDDR4X ~51.2 GB/s (128-bit) |
| TDP |
7~21 W(无风扇被动散热) |
T4.3 SylixOS 要求(T4)
| 要求项 |
描述 |
风险 |
适用档位 |
| RK3588 BSP |
SylixOS BSP for RK3588(A76+A55 大小核 SMP) |
中(需翼辉提供) |
T4-H |
| RK3576 BSP |
SylixOS BSP for RK3576 |
中-高(需翼辉确认) |
T4-M |
| RK3568 BSP |
SylixOS BSP for RK3568 |
中(RK3568 生态成熟,风险低于 T234) |
T4-L |
| rknn / RKLLM 驱动 |
NPU 驱动在 SylixOS 移植 |
高(平台B 模型适配核心风险) |
T4 全档 |
| 板贴 26 TOPS 算力芯片驱动 |
算力棒 SDK |
高(厂商支持度) |
T4-H |
| M0 核 BSP + RPMsg |
跨核通信 |
高(需翼辉 + 板卡引出 M0 调试口) |
T4-H |
| 内存分区限额机制 |
16 GB 板按 8 GB 分区运行(T3-L/T4-H 切换) |
中(需 SylixOS 内存域支持) |
T4-H |
| CAN ×2 驱动 |
工业现场总线 |
中 |
T4 全档 |
| RS485 ×2 + RS232 ×1 |
串口 |
低 |
T4 全档 |
| 双千兆 + WiFi + 4G/5G |
网络 |
中 |
T4-H |
| 看门狗 / RTC |
工业可靠性 |
低 |
T4 全档 |
| Jetson Orin Nano BSP |
T234 低配版 BSP(路线 B) |
高 |
T4-H 路线B |
T4.4 对照组 OS
- 主对照: Ubuntu 22.04(RK3588 出厂预装,完美匹配,直接对照)
- 辅助对照: OpenHarmony 4.x + RT patch(可选)
- T4-L / T4-M: Buildroot + PREEMPT_RT
5. 跨档位对比总表
5.1 全档位硬件规格对比
| 档位 |
容量 |
算力 |
功耗 |
加速器架构 |
散热架构 |
互联 |
SylixOS BSP 风险 |
| T4-L |
1~2 GB |
0.8~1 TOPS |
3~5 W |
ARM A55 + NPU |
被动无风扇 |
GPIO/CAN/RS485 |
中 |
| T4-M |
2~4 GB |
6 TOPS |
5~10 W |
ARM A72+A53 + NPU |
被动无风扇 |
千兆 + CAN |
中-高 |
| T4-H |
4~8 GB |
6~32 TOPS |
7~21 W |
ARM A76+A55+M0+NPU |
被动无风扇 |
双千兆 + CAN + M.2 |
中 / 高(路线B) |
| T3-L |
8~16 GB |
32~100 TOPS |
10~30 W |
ARM 统一内存 + NPU/GPU |
被动/小风扇 |
双千兆 + M.2 |
极低(现有) |
| T3-M |
16~32 GB |
275 TOPS |
15~60 W |
A78AE + Ampere + DLA |
主动风冷 |
10GbE + PCIe Gen4 |
高 |
| T3-H |
32~64 GB |
275 TOPS / 91 TFLOPS |
60~600 W |
ARM 统一内存 / x86+独显 |
风冷 / 液冷 |
10GbE + PCIe |
高 / 中 |
| T2-L |
64~128 GB |
500 TFLOPS (FP16) |
~1.65 kW |
x86 + 4×V100 NVLink |
360 液冷 + 风道 |
NVLink |
低(现有) |
| T2-M |
128~256 GB |
1000 TFLOPS (FP16) |
3.03.3 kW |
x86 + 8×V100 NVLink |
360 液冷 + 风道 |
NVLink |
低 |
| T2-H |
256~512 GB |
~4000 TFLOPS (FP16) |
4.56.5 kW |
x86 + 4×H100 NVLink |
强制液冷 |
NVLink + PCIe |
中 |
| T1-L |
512 GB~1 T |
~2000 TFLOPS (FP16) |
~6.6 kW |
4 节点 × 4×V100 |
机房风冷 + 液冷 |
NVLink + 100GbE |
中-高 |
| T1-H |
1~2 T |
~16 PFLOPS (FP16) |
2025 kW |
4 节点 × 4×H100 |
机房级液冷 |
NVLink + NDR 400G |
中-高 |
5.2 模型规模梯度
| 档位 |
代表模型 |
量化 |
显存占用 |
角色 |
| T4-L |
Qwen2.5-0.5B / Whisper-Tiny |
INT4/INT8 |
0.5 GB |
谱系下界,实时性基准 |
| T4-M |
Qwen2.5-1.5B |
INT4 |
1.2 GB |
端级能效拐点 |
| T4-H |
Qwen2.5-3B / 7B |
INT4 |
2.5 / 5 GB |
端点可跑 7B |
| T3-L |
Qwen2.5-3B / 7B |
INT4 |
2.5 / 5 GB |
边缘推理 + 工业控制 |
| T3-M |
Qwen2.5-14B / 32B |
INT4 |
8 / 18 GB |
边缘多模型并发 |
| T3-H |
Qwen2.5-72B |
INT4 (AWQ) |
36 GB |
边缘可跑 72B |
| T2-L |
Qwen2.5-72B / 14B |
INT4 / FP16 |
36 / 28 GB |
桌面多模型并发 |
| T2-M |
Qwen2.5-72B |
FP16 |
144 GB |
桌面单机无量化 72B |
| T2-H |
DeepSeek-V2 / 72B |
FP16 |
210 / 144 GB |
桌面单机超大模型 |
| T1-L |
Qwen2.5-72B / DeepSeek-V2 |
FP16 |
144 / 210 GB |
多节点分布式推理 |
| T1-H |
DeepSeek-V3/R1 671B |
INT4 |
~400 GB |
超大模型分布式服务 |
5.3 SylixOS 调度框架验证重点
| 档位 |
验证重点 |
核心实时指标 |
核心吞吐指标 |
| T4-L |
极小内存下保号 |
1ms RT 任务延迟(1GB 内存约束下) |
0.5B tokens/s、内存占用上限 |
| T4-M |
能效拐点 |
1ms RT 任务 P99.9、CPU 频率调节影响 |
1.5B tokens/s、E_per_token |
| T4-H |
极致资源约束下保号 |
1ms RT 任务最大延迟 + CAN/RS485 延迟 |
3B/7B tokens/s、E_per_token |
| T3-L |
统一内存带宽隔离(NPU) |
NPU 推理 + 实时任务共享 51.2 GB/s 带宽时 RT 抖动 |
7B INT4 tokens/s |
| T3-M |
统一内存带宽隔离(GPU) |
LLM+RT 共享内存带宽时 RT 任务 P99.9 |
14B tokens/s、DLA 异步收益 |
| T3-H |
大容量边缘并发 |
72B 推理与 RT 任务共存时的优先级反转 |
72B INT4 tokens/s、多模型 QPS |
| T2-L |
单机多卡 NVLink 调度 |
GPU 命令端到端延迟、多模型并发公平性 |
14B/72B tokens/s、TTFT P99.9 |
| T2-M |
8 卡拓扑调度 |
8 卡 NVLink 全互联下的集合通信抖动 |
72B FP16 tokens/s |
| T2-H |
高算力密度下的隔离 |
H100 满负载时 RT 任务 P99.9 |
72B FP16 TTFT、671B 分片吞吐 |
| T1-L |
跨节点分布式调度隔离 |
RDMA 延迟、NCCL all-reduce 期间 RT 任务抖动 |
72B 模型 tokens/s、多模型 QPS |
| T1-H |
超大规模分布式调度 |
NDR IB 延迟、671B 推理期间 RT 抖动 |
671B tokens/s、能效比 |
5.4 基线 OS 对照
| 档位 |
SylixOS 实验组 |
主对照 (Linux RT) |
虚拟化对照 |
容器对照 |
| T4-L |
SylixOS ARM64 (RK3568) |
Buildroot + RT |
— |
Docker |
| T4-M |
SylixOS ARM64 (RK3576) |
Buildroot + RT |
— |
Docker |
| T4-H |
SylixOS ARM64 (RK3588) |
Ubuntu 22.04 + RT |
KVM (RT VM) |
Docker |
| T3-L |
SylixOS ARM64 (RK3588) |
Ubuntu 22.04 + RT |
KVM (RT VM) |
Docker |
| T3-M |
SylixOS ARM64 (T234) |
L4T Ubuntu 20.04 + RT |
KVM (RT VM) |
Docker |
| T3-H |
SylixOS ARM64 / x86 |
Ubuntu 22.04 + RT |
KVM (RT VM) |
Docker |
| T2-L/M |
SylixOS x86 |
Ubuntu 22.04 + RT |
KVM (RT VM) |
Docker |
| T2-H |
SylixOS x86 |
Ubuntu 22.04 + RT |
KVM (RT VM) |
Docker |
| T1-L |
SylixOS x86 ×4 节点 |
Ubuntu 22.04 + RT ×4 |
KVM (RT VM) ×4 |
Docker ×4 |
| T1-H |
SylixOS x86 ×4 节点 |
Ubuntu 22.04 + RT ×4 |
KVM (RT VM) ×4 |
Docker ×4 |
6. 采购与获取计划
| 优先级 |
档位 |
设备 |
估算费用 (RMB) |
备注 |
| P0 |
T3-L |
RK3588 16GB 工业盒(现有) |
0 |
现有设备,立即可用 |
| P0 |
T2-L |
4×V100 SXM 塔式整机(现有) |
0 |
现有设备,谱系锚点 |
| P0 |
T4-H |
RK3588 工业盒 8GB 分区(现有) |
0 |
与 T3-L 同机双档位 |
| P1 |
T4-L |
RK3568 1~2GB 核心板 |
~300-800 |
谱系下界,必做 |
| P1 |
T4-M |
RK3576 4GB 核心板 |
~600-1,500 |
端级能效拐点 |
| P1 |
T3-M |
Jetson AGX Orin 32GB |
~15,000-28,000 |
需尽早确认 SylixOS T234 BSP |
| P2 |
T3-M 备选 |
RK3588 32GB 工业盒 + 26 TOPS 算力棒 |
~3,000-5,000 |
若 Jetson BSP 不支持 |
| P2 |
T3-H |
Jetson AGX Orin 64GB |
~30,000-50,000 |
边缘可跑 72B |
| P2 |
T4-H 备选 |
Jetson Orin Nano 8GB 开发套件 |
~1,800-2,500 |
CUDA 路线对照 |
| P3 |
T2-M |
4× V100 32GB SXM + 8 卡底板 + 电源 |
~70,000-100,000 |
现有平台加卡扩容 |
| P3 |
T2-H |
4× H100 80GB SXM5 工作站 |
~800,000-1,200,000 |
可租云实例替代 |
| P3 |
T1-L |
3× 计算节点 + 12× V100 + IB |
~270,000 |
可用云实例替代 |
| P4 |
T1-H |
4 节点 × 4×H100 + NDR IB |
~3,000,000+ |
强烈建议云租替代 |
| — |
仪器 |
DC 功率计 ×2 (T3+T4) |
~6,000 |
T4 强制 |
| — |
仪器 |
INA226 采集板 ×2 |
~500 |
T3+T4 |
| — |
仪器 |
交流功率计 / 智能插座 |
~1,000 |
T3-H / T2 档 |
| — |
仪器 |
示波器 (Tektronix MDO34) |
~30,000 |
GPIO 环回延迟(可借用) |
| — |
仪器 |
红外测温枪 ×2 |
~1,000 |
被动散热档位 |
| — |
仪器 |
CANalyzer |
~20,000 |
T4 CAN 总线延迟(可借用) |
| 合计 |
|
P0~P2 必做项 |
~55,000-95,000 |
不含 T1/T2 扩展 |
降本策略
- P0 零成本起步: T2-L + T3-L + T4-H 三个档位由现有硬件直接覆盖,可立即启动 SylixOS 适配与基线数据采集,无需等待采购。
- 一机两档: RK3588 16GB 工业盒通过内存分区同时充当 T3-L(16 GB)与 T4-H(8 GB),省去一台设备与一套 BSP 验证成本。
- 档位跳跃验证: 若某档位 SylixOS BSP 不可行,可直接跳过该档(如 T4-M 若 RK3576 BSP 不可用,用 T4-H 降配替代),谱系不断。
- T1/T2-H 云替代: H100 集群强烈建议租用云实例(阿里云 GN7 / AWS p5),按需付费,避免百万级 CAPEX 与机房改造。
- T3-M Jetson: 可先用 NVIDIA 开发者板(约 $2,000)验证 SylixOS BSP 可行性后再采购工业级版本。
- 仪器借用: 示波器和 CANalyzer 可从实验室借用,不必专门采购。
7. SylixOS BSP 适配 Checklist(跨档位汇总)
7.1 x86 BSP(T2 全档 + T1 全档)
7.2 ARM64 BSP — T234 / Ampere(T3-M / T3-H-A / T4-H 路线B)
7.3 ARM64 BSP — RK3588(T4-H / T3-L)
7.4 ARM64 BSP — RK3576(T4-M)
7.5 ARM64 BSP — RK3568(T4-L)