# 基础设备配置(四层级 × 三档算力分级) > 版本: v2.0 起草日期: 2026-09-18 > 设计目标: 为翼辉 SylixOS 调度框架研究建立 **集群→桌面→边→端** 四级硬件体系,每级内再按 **低/中/高** 三档细分 > 现有硬件全覆盖: T2-L(4×V100 SXM)+ T3-L / T4-H(RK3588 工业盒)| 需新增: T1 集群扩展 + 其余档位 --- ## 0. 分级体系总览 ### 0.1 分级维度与分档规则 **分级维度**: 以「统一内存 / 显存容量」为第一分类维度——容量直接决定可承载的模型规模,且与功耗、散热、互联架构强相关,四个层级可连续衔接、无断层。 **分档规则**: 相邻两档的边界值归入**上界一侧** | 层级 | 代码 | 低级 | 中级 | 高级 | | -------- | --- | --------------- | ---------------- | ---------------- | | **端级** | T4 | **1~2 G** | **2~4 G** | **4~8 G** | | **边级** | T3 | **8~16 G** | **16~32 G** | **32~64 G** | | **桌面级** | T2 | **64~128 G** | **128~256 G** | **256~512 G** | | **集群级** | T1 | **512 G~1 T** | —(不设中档) | **1 T~2 T** | > 边界值归属示例: 8 GB → 端-高;16 GB → 边-低;64 GB → 边-高;128 GB → 桌-低;512 GB → 桌-高;1 TB → 集-低。 ### 0.2 全谱系总表(11 个档位) > 算力单位统一约定: **NVIDIA GPU 用 FP16 Tensor Core TFLOPS(dense)**,**NPU 用 INT8 TOPS**;两者不可直接换算。 | 档位 | 容量 | 算力(峰值) | 功耗 | 算力/供电架构 | 代表设备 | 状态 | | -------- | ------------ | -------------------------- | ------------- | ---------------------------------- | ----------------------------- | ------- | | **T4-L** | 1~2 G | 0.8~1 TOPS (INT8) | 3~5 W | ARM A55 + 小 NPU;DC 5V/12V 被动散热 | RK3568 1~2GB 核心板 | | | **T4-M** | 2~4 G | 6 TOPS (INT8) | 5~10 W | ARM A72+A53 + NPU;DC 12V 被动散热 | RK3576 4GB | | | **T4-H** | 4~8 G | 6~32 TOPS (INT8) | 7~21 W | ARM A76+A55 + M0 + NPU;DC 12V 被动 | **RK3588 8GB** / Jetson Orin Nano 8GB | 现有(16G 板降配) | | **T3-L** | 8~16 G | 32~100 TOPS (INT8) | 10~30 W | ARM SoC 统一内存 + NPU/GPU;DC 12~24V 被动/小风扇 | **RK3588 16GB 工业盒** / Orin NX 16GB | 现有 | | **T3-M** | 16~32 G | 275 TOPS (INT8) | 15~60 W | ARM A78AE + Ampere GPU + 2×DLA;DC 19V 主动风冷 | Jetson AGX Orin 32GB | | | **T3-H** | 32~64 G | 275 TOPS / 91 TFLOPS (FP16) | 60~600 W | ARM 统一内存 或 x86+单卡 CUDA;风冷/液冷 | Jetson AGX Orin 64GB / 边缘工控机 + RTX 6000 Ada 48GB | | | **T2-L** | 64~128 G | 500 TFLOPS (FP16) | 600~1.65 kW | x86 + 4×V100 SXM NVLink;双电源 + 360 液冷 | **4×V100 32GB SXM 塔式** | 现有 | | **T2-M** | 128~256 G | 1000 TFLOPS (FP16) | 3.0~3.3 kW | x86 + 8×V100 SXM NVLink;双电源 + 液冷 | 8×V100 32GB SXM 整机 | 需扩展 | | **T2-H** | 256~512 G | ~4000 TFLOPS (FP16) | 4.5~6.5 kW | x86 + 4×H100 SXM5 NVLink;高压供电 + 强制液冷 | 4×H100 80GB SXM5 工作站 | | | **T1-L** | 512 G~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × x86+4×V100,100GbE RoCE/IB;机房风冷/液冷 | 4×(T2-L 节点)+ IB 交换机 | 需扩展 | | **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | 20~25 kW | 4 节点 × x86+4×H100,NDR 400G IB;机房级液冷 | 4×(T2-H 节点)+ NDR 交换机 | | ### 0.3 设计原则 1. **容量连续、功耗阶跃**: 从 1 GB / 3 W 到 2 TB / 25 kW,容量每上一档约 ×2,功耗随架构变化阶跃(被动散热 → 主动风冷 → 液冷 → 机房级液冷),形成天然的性能/能效对比曲线。 2. **CUDA 栈贯通 T1/T2/T3**: 集群/桌面/边级全部或大部分走 NVIDIA CUDA 生态(V100 / Ampere / Hopper),模型与推理框架(vLLM / TensorRT-LLM)可跨档位无缝迁移,变量只有规模。 3. **非 CUDA 端路线**: T4 全档位与 T3-L 走 RKNN/RKLLM NPU 栈,代表极致资源约束端点,是 RTOS 调度隔离价值最大化的场景。 4. **现有硬件复用**: **4×V100 SXM(T2-L)** 与 **RK3588 工业盒(T3-L 16GB / T4-H 8GB 两用)** 为零采购成本基线,整条谱系以此为锚点向两侧扩展。 5. **BSP 最小化**: 全谱系仅需两类 BSP——x86(T1/T2)与 ARM64(T3/T4),档位差异靠设备树与驱动裁剪吸收,不新增架构分支。 --- ## T1. 集群级 — 512 G ~ 2 T ### T1.1 定位 大规模分布式 LLM 推理与多模型并发服务。验证 SylixOS 在**多节点分布式调度**下的实时性——跨节点 RDMA 延迟、NCCL 集合通信抖动、分布式推理框架(vLLM+Ray / TensorRT-LLM+MPI)与实时控制任务的混合负载隔离。 ### T1.2 档位对比 | 维度 | T1-L 集群-低 | T1-H 集群-高 | | ----------- | --------------------- | --------------------------- | | **容量** | 512 GB(4 × 128 GB) | 1.28 TB(4 × 320 GB) | | **节点数** | 4 节点 | 4 节点 | | **单节点加速器** | 4 × V100 32GB SXM | 4 × H100 80GB SXM5 | | **集群算力** | ~2000 TFLOPS (FP16) | ~16 PFLOPS (FP16) | | **节点内互联** | NVLink 300 GB/s | NVLink 900 GB/s | | **节点间互联** | 100GbE RoCE / IB | NDR 400G IB | | **整机功耗** | ~6.6 kW | 20~25 kW | | **散热架构** | 每节点 360 液冷 + 机房风冷 | 机房级液冷(CDU / 后门换热器) | | **主要模型** | 72B FP16 / 多实例 14B | 671B INT4 / 多实例 72B FP16 | #### T1.2.1 T1-L 集群-低 — 4 节点 × 4×V100 = 512 GB(本方案主线) | 项目 | 规格 | 数量 | 备注 | | --------- | ------------------------------------------------ | ------------- | --------------------------- | | **计算节点** | 同 T2-L 桌面级配置 | **4 台** | 每节点 4×V100 32GB SXM = 128GB | | 节点内 GPU | NVIDIA V100 32GB SXM (NVLink 全互联) | 4×4 = 16 卡 | 每节点 NVLink 全互联 | | 节点内 CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2GHz) | 4 | 每节点 1 颗 | | 节点内内存 | 128GB DDR4-2133 ECC | 4×128 = 512GB | 每节点 128GB | | **节点间互联** | Mellanox ConnectX-6 100GbE / IB | 4 卡 | 每节点 1 卡,RoCE 或原生 IB | | 节点间交换机 | 100GbE/IB 交换机 (Mellanox SN2700 或同档) | 1 | 32 端口 | | 存储 | 共享 NFS / NVMe-oF (每节点 1TB NVMe 本地 + 共享存储) | — | 模型权重共享池 | | 散热 | 每节点 360 一体液冷 ×2 | — | 同 T2-L | | 电源 | 每节点 长城 1650W + 1250W 双电源 | 4 套 | 单节点 ~1.65 kW,集群 ~6.6 kW | | 功率采集 | PDU + Yokogawa WT310 (整机) + nvidia-smi dmon (单卡) | — | 每节点独立采集 | **显存与算力** | 指标 | 值 | | --------------- | ---------------------------------- | | **总显存** | **512 GB** (4 × 128GB) | | 单卡 FP16 算力 | 125 TFLOPS | | 集群总算力 (FP16) | ~2000 TFLOPS (NVLink 节点内 + IB 节点间) | | NVLink 带宽 (节点内) | 300 GB/s (GPU↔GPU) | **可运行模型** | 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 | | ------------------------ | ---------- | ------- | ----- | ------------------ | | **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 3+ | vLLM + Ray 分布式 | | Qwen2.5-72B | INT4 (AWQ) | ~36 GB | 14+ | vLLM + Ray | | **DeepSeek-V2-Chat** | FP16 | ~210 GB | 2 | TensorRT-LLM + MPI | | Qwen2.5-14B | FP16 | ~28 GB | 18+ | vLLM (可单节点) | | LLaMA-3-70B | FP16 | ~140 GB | 3+ | vLLM + Ray | > 注: 若已有 1 台 T2-L 节点,仅需追加 3 台。V100 SXM 为二手市场/拆机渠道,价格波动大。也可租用云上 V100 实例替代自建集群。 #### T1.2.2 T1-H 集群-高 — 4 节点 × 4×H100 = 1.28 TB(扩展档) | 项目 | 规格 | 数量 | 备注 | | ------- | ----------------------------------------- | --------- | --------------------- | | 计算节点 | 同 T2-H 桌面级配置 | 4 台 | 每节点 4×H100 80GB SXM5 | | 节点内 GPU | NVIDIA H100 80GB SXM5 (NVLink 4 卡全互联) | 16 卡 | NVLink 900 GB/s | | 节点内 CPU | AMD EPYC 9654 (96C/192T) 或 Intel Xeon 8468 | 4 | 每节点 1~2 颗 | | 节点内内存 | 512GB DDR5-4800 ECC | 4 × 512GB | 每节点 512GB | | 节点间互联 | NVIDIA ConnectX-7 NDR 400Gb/s IB | 4~8 卡 | 每节点 1~2 卡 | | 节点间交换机 | NDR 400G IB 交换机 (Quantum-2 / SN5600) | 1 | 32 端口 | | 存储 | 并行文件系统 (GPFS/Lustre) + 每节点 4TB NVMe | — | 671B 级模型权重池 | | 散热 | 机房级液冷 (CDU + 冷板) | — | 风冷不可行 | | 电源 | 每节点 4~6 kW 冗余电源 | 4 套 | 集群 ~20~25 kW | **可运行模型** | 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 | | ------------------------ | ---------- | -------- | ----- | -------------------- | | **DeepSeek-V3 / R1-671B** | INT4 (AWQ) | ~400 GB | 3+ | vLLM + Ray / SGLang | | **Qwen2.5-72B** | FP16 | ~144 GB | 8+ | vLLM + TensorRT-LLM | | LLaMA-3-405B | INT4 | ~230 GB | 5+ | TensorRT-LLM + MPI | | Qwen2.5-32B | FP16 | ~64 GB | 20+ | vLLM | ### T1.3 SylixOS 要求(T1 通用) | 要求项 | 描述 | 风险 | | ------------------ | ------------------------------- | ------------------------------ | | x86 BSP | 每节点运行 SylixOS x86 LTS | 低(T2-L 已验证) | | **RDMA / RoCE 驱动** | ConnectX-6 / ConnectX-7 在 SylixOS 上的 RDMA 驱动 | **中-高**(需验证 Mellanox OFED 兼容性) | | NCCL / MPI | 分布式集合通信库在 SylixOS 移植 | 中(NCCL 依赖 CUDA + POSIX) | | Ray / 分布式框架 | vLLM + Ray 的 SylixOS 适配 | 中(Python + Ray 依赖链) | | 分布式调度器 | SylixOS 跨节点实时任务调度原型 | **研究贡献点** | ### T1.4 研究角度 - **跨节点调度延迟**: 分布式推理时,1ms 实时任务在跨节点 NCCL all-reduce 期间的尾延迟 - **RDMA bypass 内核**: SylixOS 是否能利用 RDMA bypass kernel path 降低跨节点通信延迟 - **分布式公平性**: 多节点并发请求时,高优先级实时任务的跨节点响应稳定性 - **能效**: 分布式推理的每 token 能耗 vs 单节点(通信开销 vs 并行收益) - **档位对照**: T1-L 与 T1-H 的**每 token 能耗比**——V100 集群(能效基线)vs H100 集群(能效上限) --- ## T2. 桌面级 — 64 G ~ 512 G ### T2.1 定位 单节点多 GPU 大模型推理。验证 SylixOS 在**单机多卡 NVLink 拓扑**下的 GPU 命令调度延迟、显存管理实时性、多模型并发流水线调度。 ### T2.2 档位对比 | 维度 | T2-L 桌面-低 | T2-M 桌面-中 | T2-H 桌面-高 | | ----------- | ---------------------- | --------------------------- | --------------------------- | | **容量** | 128 GB(4 × 32 GB) | 256 GB(8 × 32 GB) | 320 GB(4 × 80 GB) | | **加速器** | 4 × V100 32GB SXM | 8 × V100 32GB SXM | 4 × H100 80GB SXM5 | | **算力** | 500 TFLOPS (FP16) | 1000 TFLOPS (FP16) | ~4000 TFLOPS (FP16) | | **互联** | NVLink 300 GB/s ×4 | NVLink 300 GB/s ×8 | NVLink 900 GB/s ×4 | | **整机功耗** | ~1.65 kW | ~3.0~3.3 kW | ~4.5~6.5 kW | | **散热架构** | 360 液冷 ×2 + 塔式风道 | 360 液冷 ×2 + 双路风冷 | 强制液冷 (冷板),风冷不可行 | | **电源架构** | 1650W + 1250W 双电源 | 2× 2000W 冗余 / 220V 单相 | 2× 3000W 冗余 / 220V 双相 | | **形态** | 塔式一体定制机箱 | 4U 机架式 / 塔式 | 4U~5U 机架式液冷 | | **可运行模型** | 72B INT4 / 14B FP16 | 72B FP16 / 多实例 32B | 671B INT4 / 72B FP16 多并发 | | **状态** | 现有 | 需扩展(现有平台加卡) | 需 | #### T2.2.1 T2-L 桌面-低 — 4×V100 SXM = 128 GB(现有设备,谱系锚点) | # | 部件 | 型号 / 规格 | 数量 | 备注 | | -- | ------- | ---------------------------------------------- | ----- | --------------------------- | | 1 | 主板 | H12D-8D(双路 EPYC 服务器板) | 1 | | | 2 | CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2 GHz, TDP 180W) | 1 | | | 3 | 硬盘 | 长城 M.2 NVMe 1TB | 1 | 系统盘 | | 4 | 内存 | 三星 DDR4-32G-2133 | 4 | 共 128 GB DDR4 | | 5 | 散热系统 | 360 一体液冷散热套装 | 2 | 主机 + GPU | | 6 | 转接卡 | ROHSTNS-2SXM2-2P54E | 2 | | | 7 | 信号线 | V100 32G × 2 | 4 | NVLink 桥接 | | 8 | 机箱 | 塔式一体定制机箱 | 1 | | | 9 | 主电源 | 长城全模组 1650W | 1 | | | 10 | 副电源 | 长城 1250W 全模组 | 1 | SXM 平台用 | | 11 | 散热器 | SP3 高性能散热器 | 1 | | | 12 | SXM 平台 | 300G NVLink 4 卡直连底板 | 1 | | | 13 | **GPU** | **NVIDIA V100 32GB SXM** | **4** | **NVLink 全互联,共 128GB HBM2** | **显存与算力** | 指标 | 值 | | ---------- | --------------------------- | | **总显存** | **128 GB** (4 × 32GB HBM2) | | 单卡显存 | 32 GB HBM2 | | 单卡 FP16 算力 | 125 TFLOPS | | 总算力 (FP16) | ~500 TFLOPS | | NVLink 带宽 | 300 GB/s (GPU↔GPU 全互联) | | 内存带宽 | DDR4-2133 ~170 GB/s (CPU 侧) | | **整机功耗** | **~1650 W** (满载) | **可运行模型** | 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 | | ------------------------ | ---------- | ------ | ----- | ------------------- | | **Qwen2.5-7B-Instruct** | FP16 | ~14 GB | 8+ | vLLM / TensorRT-LLM | | **Qwen2.5-14B-Instruct** | INT4 (AWQ) | ~8 GB | 14+ | vLLM | | Qwen2.5-14B | FP16 | ~28 GB | 4 | vLLM | | **Qwen2.5-72B-Instruct** | INT4 (AWQ) | ~36 GB | 3 | vLLM (张量并行 TP=4) | | LLaMA-3-8B | FP16 | ~16 GB | 7 | vLLM | | MiniCPM-V 2.6 | INT4 | ~6 GB | 20+ | llama.cpp | | Whisper-Large-v3 | FP16 | ~3 GB | 40+ | faster-whisper | #### T2.2.2 T2-M 桌面-中 — 8×V100 SXM = 256 GB 在 T2-L 平台基础上**加卡扩容**,是「同一代硬件纵向扩展」的对照档位,最贴近现有设备、改造成本最低。 | 项目 | 规格 | 变更点 | | --------- | ----------------------------------------------- | ------------------ | | **GPU** | NVIDIA V100 32GB SXM **× 8** | 4 → 8 卡 | | **SXM 平台** | 300G NVLink **8 卡直连底板** | 更换底板 | | **转接卡** | ROHSTNS-2SXM2-2P54E | 2 → 4 | | **NVLink** | 全互联 8 卡,300 GB/s | 拓扑扩展 | | 主板 / CPU | H12D-8D + EPYC 7402(双路可升级 EPYC 7742 64C) | 建议升双路以喂满 8 卡 | | 内存 | 128 GB → **256 GB** DDR4-2133 | 8 卡需更大 pinned memory | | 电源 | 2 × 2000W 冗余(或 220V 单相 16A 回路) | 1650W+1250W 不足 | | 散热 | 360 液冷 ×2 + 机箱风道强化 | — | | **整机功耗** | **~3.0~3.3 kW** | +100% | | **总算力** | **~1000 TFLOPS (FP16)** | +100% | **可运行模型(新增/提升)** | 模型 | 量化 | 显存占用 | 并发实例数 | 说明 | | ------------------------ | ---------- | ------ | ----- | ------------------ | | **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 1~2 | TP=8 张量并行,无需量化 | | **Qwen2.5-32B-Instruct** | FP16 | ~64 GB | 3+ | TP=4 | | DeepSeek-V2-Lite | FP16 | ~31 GB | 8+ | — | | Qwen2.5-14B | FP16 | ~28 GB | 9+ | 单卡可容,多实例并发 | > **备选方案**: 4 × RTX 6000 Ada 48GB = 192 GB,364 TFLOPS (FP16),整机 ~2.4 kW,风冷即可。优势是无 NVLink 但单卡能效高、显存快;劣势是跨卡走 PCIe Gen5。 #### T2.2.3 T2-H 桌面-高 — 4×H100 SXM5 = 320 GB | 项目 | 规格 | | ------- | ---------------------------------------- | | **GPU** | NVIDIA H100 80GB SXM5 **× 4**(NVLink 全互联) | | 单卡算力 | ~989 TFLOPS (FP16 Tensor Core, dense) | | 单卡显存 | 80 GB HBM3 | | NVLink | 900 GB/s (GPU↔GPU) | | CPU | AMD EPYC 9654 (96C/192T) ×1~2 | | 内存 | 512 GB DDR5-4800 ECC | | 底板 | HGX H100 4-GPU 或 8-GPU 底板(留 4 卡空位) | | 存储 | 4 TB NVMe RAID0(模型权重加载) | | 散热 | **强制液冷(冷板式)**,风冷不可行 | | 电源 | 2 × 3000W 冗余 / 220V | | **整机功耗** | **~4.5~6.5 kW** | | **总算力** | **~4000 TFLOPS (FP16)**,稀疏 ~8000 TFLOPS | **备选方案**: 8 × RTX 6000 Ada 48GB = 384 GB,728 TFLOPS (FP16),~4.0 kW,风冷可行——容量更大、功耗更低,代价是无 NVLink 与算力密度。 **可运行模型(新增/提升)** | 模型 | 量化 | 显存占用 | 并发实例数 | 说明 | | ------------------------ | ---------- | ------- | ----- | ----------------- | | **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 2 | TP=4,H100 下 TTFT 极低 | | LLaMA-3-70B | FP16 | ~140 GB | 2 | — | | **DeepSeek-V2-Chat** | FP16 | ~210 GB | 1 | 单机可跑 | | Mixtral-8x7B | FP16 | ~93 GB | 3 | MoE 专家并行 | ### T2.3 SylixOS 要求(T2 三档通用) | 要求项 | 描述 | 风险 | | ----------------- | ----------------------------- | ------------------- | | x86 BSP | SylixOS 2.x LTS x86 | 低 | | **CUDA 驱动** | V100 SXM / H100 SXM 在 SylixOS 的 CUDA 驱动 | **中**(需翼辉确认) | | NVLink 支持 | 4 卡 / 8 卡 NVLink 拓扑在 SylixOS 可用 | 中 | | vLLM / llama.cpp | Python + CUDA 推理框架适配 | 中(llama.cpp 优先,依赖少) | | nvidia-smi / DCGM | GPU 监控 + 功耗采集 | 低 | | 8 卡 / 4 卡拓扑切换 | 同一 BSP 支持 T2-L/M/H 不同卡数 | 低(设备树 + 枚举) | ### T2.4 对照组 OS - **主对照**: Ubuntu 22.04 LTS + `linux-image-rt` (PREEMPT_RT) + vLLM - **辅助对照**: CentOS Stream 9 + RT 内核(可选) --- ## T3. 边级 — 8 G ~ 64 G ### T3.1 定位 边缘 AI 推理与工业控制并发。验证 SylixOS 在**统一内存架构**(CPU+加速器共享 LPDDR)下的实时性——推理任务与实时控制任务共享内存带宽时的隔离能力。 ### T3.2 档位对比 | 维度 | T3-L 边-低 | T3-M 边-中 | T3-H 边-高 | | --------- | ---------------------------- | -------------------------- | ----------------------------- | | **容量** | 16 GB 统一内存 | 32 GB 统一内存 | 64 GB 统一内存 / 48 GB 独立显存 | | **加速器** | RK3588 NPU 6+26 TOPS / Ampere | Ampere GPU + 2×DLA | AGX Orin 64GB / RTX 6000 Ada | | **算力** | 32 TOPS / 100 TOPS (INT8) | 275 TOPS (INT8) | 275 TOPS / 91 TFLOPS (FP16) | | **功耗** | 10~30 W | 15~60 W | 60~600 W | | **供电架构** | DC 12~24 V,无风扇/小风扇 | DC 19 V,主动风冷 | DC 19 V 或 ATX,风冷/液冷 | | **工作温度** | -40~60 ℃ 工业级 | -25~80 ℃ | -25~80 ℃ / 0~50 ℃ | | **SylixOS 风险** | **极低**(RK3588 BSP 复用 T4) | **高**(T234 BSP 需验证) | 高 / 中 | | **状态** | (RK3588 16GB 工业盒) | | | #### T3.2.1 T3-L 边-低 — RK3588 16GB 工业盒(现有设备) **这是现有 RK3588 设备的标准归属档位**(16 GB 统一内存落在边级区间内),也是唯一可零成本立即开展研究的边级档位。 | 项目 | 规格 | 备注 | | --------- | --------------------------------------- | --------------------- | | SoC | Rockchip RK3588(同 T4-H) | SylixOS BSP 与 T4 共用 | | 内存 | **16 GB LPDDR4X**(统一内存) | -40~60 ℃ 工业宽温 | | NPU | 6 TOPS 原生 + **26 TOPS 算力棒扩展 = 32 TOPS** | 算力棒走 M.2 2280 | | 功耗 | ~21~30 W(含算力棒) | 被动散热,可选小风扇 | | 内存带宽 | ~51.2 GB/s (128-bit LPDDR4X) | 与 T4 相同,是带宽瓶颈点 | | 模型 | Qwen2.5-3B/7B INT4(RKLLM) | 比 T4-H 内存翻倍,可跑更大模型 | **备选方案(同档位、CUDA 路线)**: NVIDIA Jetson Orin NX 16GB — 100 TOPS (INT8, sparse),1024 CUDA + 32 Tensor Core,16 GB LPDDR5 / 102.4 GB/s,10~25 W,**CUDA 生态与 T1/T2 打通**。代价是 SylixOS T234 BSP 风险高。 #### T3.2.2 T3-M 边-中 — NVIDIA Jetson AGX Orin 32GB | 项目 | 规格 | | --------- | -------------------------------------------------- | | **SoC** | NVIDIA T234(Grace 系列衍生) | | **CPU** | 12× ARM Cortex-A78AE @ 2.0 GHz(64-bit) | | **GPU** | NVIDIA Ampere 架构,2048 CUDA cores + 64 Tensor cores | | **DLA** | 2× DLA v2.0(深度学习加速器,可异步推理) | | **AI 算力** | **275 TOPS** (INT8) / 137.5 TOPS (INT8+INT8 双精度) | | **内存** | **32 GB LPDDR5**(统一内存,CPU/GPU 共享) | | 内存带宽 | 204.8 GB/s | | **功耗** | **15 W ~ 60 W**(可配置功率模式:15W/30W/50W/60W) | | 工作温度 | -25 ~ 80°C(工业级,但不如 RK3588 的 -40~60°C 宽) | | 存储 | 64GB eMMC + M.2 NVMe(可扩展) | | 网络 | 2× 10GbE(RJ45)+ 1× 千兆 | | 视频接口 | HDMI 2.1 + DP 1.4a | | USB | 4× USB 3.2 + 2× USB 2.0 | | PCIe | PCIe Gen4 ×4(可扩展外设) | | MIPI CSI | 4 通道(可接工业相机) | | 尺寸 | 100mm × 87mm(核心模块) | | **出厂 OS** | Ubuntu 20.04 LTS (L4T) | | 价格 | ~$2,000-4,000(~15,000-28,000 RMB) | **选择 Jetson AGX Orin 的理由** 1. **CUDA 生态统一**: 与 T1/T2 同为 NVIDIA GPU,vLLM / TensorRT / llama.cpp 可直接移植,无需切换到 RKLLM 栈 2. **统一内存架构**: CPU 和 GPU 共享 32GB LPDDR5,无独立显存——LLM 推理和实时控制任务**争抢同一内存带宽**,是验证内存带宽管控(RQ2)的理想平台 3. **DLA 异步推理**: 2 个 DLA 可在 GPU/CPU 不介入时执行推理,适合"LLM 推理让出 CPU/GPU 给实时任务"的调度策略验证 4. **功率可配置**: 15W/30W/50W/60W 多档功率模式,可在不同功耗预算下测试 5. **丰富 I/O**: 10GbE + MIPI CSI + PCIe Gen4,可接工业相机、高速网络、扩展卡 #### T3.2.3 T3-H 边-高 — 64 GB 档(两条路线) | 路线 | 主推 A: Jetson AGX Orin 64GB | 主推 B: 边缘工控机 + RTX 6000 Ada 48GB | | ---------- | -------------------------------- | -------------------------------- | | **架构** | ARM A78AE + Ampere GPU(统一内存) | x86 (Xeon/Core) + 独立 CUDA 显卡 | | **容量** | 64 GB LPDDR5(统一内存) | 48 GB GDDR6 ECC(独立显存) | | **算力** | 275 TOPS (INT8) | 91 TFLOPS (FP16) / 182 TFLOPS 稀疏 | | **功耗** | 15~60 W | 整机 ~600 W | | **散热** | 被动/主动风冷 | 主动风冷或液冷 | | **生态** | CUDA + DLA,与 T3-M 同 BSP | 完整 CUDA + NVLink 可选 | | **优势** | 能效极高、宽温、无风扇可行 | 算力密度高、显存带宽大、生态完整 | | **劣势** | 统一内存带宽仅 204.8 GB/s,带宽受限 | 功耗/体积/散热不适合现场部署 | | **适用场景** | 边缘现场、宽温环境、低功耗 | 边缘机柜、算力下沉、多模型并发 | **可运行模型(T3 三档合并)** | 模型 | 量化 | 显存占用 | 预期 tokens/s | 适用档位 | 推理框架 | | ------------------------ | ------------ | ------- | ----------- | ------------- | ------------------------ | | **Qwen2.5-1.5B-Instruct** | INT4 | ~1.2 GB | ~40-60 | T3-L | RKLLM | | **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~50-80 | T3-L / T3-M | TensorRT-LLM / RKLLM | | **Qwen2.5-7B-Instruct** | INT4 (W4A16) | ~5 GB | ~30-50 | T3-L / T3-M | TensorRT-LLM / llama.cpp | | **Qwen2.5-14B-Instruct** | INT4 | ~8 GB | ~20-35 | T3-M | TensorRT-LLM | | **Qwen2.5-32B-Instruct** | INT4 | ~18 GB | ~12-20 | T3-M / T3-H | TensorRT-LLM | | **Qwen2.5-72B-Instruct** | INT4 (AWQ) | ~36 GB | ~5-8 | T3-H | TensorRT-LLM / vLLM | | MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | T3-L 以上 | llama.cpp | | Whisper-Large-v3 | INT8/FP16 | ~1.5 GB | 流式 ASR | T3-L 以上 | faster-whisper | | YOLOv8n | INT8 | ~0.1 GB | 200+ FPS | T3 全档 | TensorRT / RKNN | ### T3.3 SylixOS 要求(T3) | 要求项 | 描述 | 风险 | | -------------------- | --------------------------------------- | ---------------------------- | | **ARM64 BSP (T234)** | SylixOS 需提供 NVIDIA T234 SoC 的 ARM64 BSP | **高**(需翼辉确认是否支持 Jetson Orin) | | **RK3588 BSP(T3-L)** | 与 T4-H 共用同一 BSP,零额外风险 | **极低** | | CUDA 驱动 | Jetson 专用 CUDA(L4T 驱动栈)在 SylixOS 适配 | 高 | | DLA 驱动 | DLA 异步推理在 SylixOS 的可用性 | 高 | | 功率模式 API | 15W/30W/50W/60W 切换在 SylixOS 的实现 | 中 | | 内存监控 | 统一内存架构下的内存带宽监控(PMU 计数器) | 中 | | 独立显存管理(T3-H B 路线) | x86 + 独显的显存分配与实时性 | 中 | > **取舍**: Jetson 路线优势在 CUDA 生态统一 + 275 TOPS + DLA;RK3588-16GB(T3-L)优势在 SylixOS BSP 风险极低 + -40~60℃ 工业级宽温。**建议 T3-L 直接用现有 RK3588 起步,T3-M/H 待 Jetson BSP 确认后再采购。** ### T3.4 对照组 OS | 档位 | 主对照 | 辅助对照 | | ---- | -------------------------------- | ----------------------------- | | T3-L | Ubuntu 22.04 + PREEMPT_RT(RK3588) | OpenHarmony 4.x + RT patch(可选) | | T3-M | Ubuntu 20.04 LTS (L4T) + PREEMPT_RT | Ubuntu 22.04 + Docker(容器隔离方案) | | T3-H | Ubuntu 22.04 + PREEMPT_RT(x86/ARM) | Docker + KVM | ### T3.5 功率采集 | 设备 | 用途 | 适用档位 | | ----------------------------- | --------------------- | ----------- | | DC 功率计(USB 接口型) | 整机 DC 输入端功耗 | T3-L / T3-M | | INA226 采集板 | SoC 主电源轨(若可接入) | 全档 | | `jetson_stats` / tegrastats | 内部功耗代理(辅助,非主报) | T3-M / T3-H | | 交流功率计(PZEM / 智能插座) | 边缘工控机整机功耗 | T3-H B 路线 | --- ## T4. 端级 — 1 G ~ 8 G ### T4.1 定位 工业端点超低功耗 LLM 推理与硬实时控制。验证 SylixOS 在**极致资源约束**(3~21 W / 1~8 GB / 0.8~32 TOPS)下的 LLM + 1ms 实时控制并发能力。这是 RTOS 杀手锏场景——资源越紧张,RTOS 调度隔离的价值越大。 ### T4.2 档位对比 | 维度 | T4-L 端-低 | T4-M 端-中 | T4-H 端-高 | | ----------- | ---------------------- | -------------------- | ------------------------------ | | **容量** | 1~2 GB LPDDR4X | 2~4 GB LPDDR5 | 4~8 GB LPDDR4X / LPDDR5 | | **SoC** | RK3568 (4×A55) | RK3576 (4×A72+4×A53) | RK3588 (4×A76+4×A55+M0) / Orin Nano | | **NPU 算力** | 0.8~1 TOPS (INT8) | 6 TOPS (INT8) | 6~32 TOPS / 40~67 TOPS (INT8) | | **功耗** | 3~5 W | 5~10 W | 7~21 W | | **散热架构** | 无风扇被动 | 无风扇被动 | 无风扇被动(可选小风扇) | | **供电** | DC 5V / 12V | DC 12V | DC 12V | | **工作温度** | -40~85 ℃ 工业级 | -40~85 ℃ 工业级 | -40~60 ℃ / 0~50 ℃ | | **可运行模型** | 0.5B INT4 / Whisper-Tiny | 1.5B INT4 / YOLO 系列 | 3B~7B INT4 / MiniCPM-V | | **状态** | | | ✅ 现有(RK3588 16GB 降配) | #### T4.2.1 T4-L 端-低 — RK3568 核心板(1~2 GB) | 项目 | 规格 | | --------- | -------------------------------------- | | SoC | Rockchip RK3568 (22nm) | | CPU | 4× Cortex-A55 @ 2.0 GHz | | **NPU** | **0.8~1 TOPS (INT8)**(RKNN 原生栈) | | **内存** | **1~2 GB LPDDR4X**(统一内存,板贴) | | 内存带宽 | ~25.6 GB/s | | GPU | Mali-G52(仅辅助显示) | | 存储 | 8~16 GB eMMC | | 网络 | 1× 千兆 + 可选 WiFi | | 工业接口 | CAN ×2 / RS485 ×2 / GPIO(典型核心板引出) | | **功耗** | **3~5 W**(无风扇被动散热) | | 工作温度 | -40 ~ 85 ℃ 工业级 | | 出厂 OS | Buildroot / Ubuntu 20.04(可换 SylixOS) | | 参考价格 | ~300~800 RMB(核心板/开发板) | **可运行模型**: Qwen2.5-0.5B INT4(~0.5 GB)、Whisper-Tiny INT8(~0.2 GB)、YOLOv5n INT8。 **定位价值**: 谱系最低档,用于测出「LLM 推理到底能把实时性压到多差」的**下界**,以及 RTOS 在极小内存下能否守住 1ms。 #### T4.2.2 T4-M 端-中 — RK3576 核心板(2~4 GB) | 项目 | 规格 | | --------- | ---------------------------------------- | | SoC | Rockchip RK3576 (8nm) | | CPU | 4× Cortex-A72 + 4× Cortex-A53(异构大小核) | | **NPU** | **6 TOPS (INT8)** + 可扩展算力棒 | | **内存** | **2~4 GB LPDDR5**(统一内存) | | 内存带宽 | ~40 GB/s | | **功耗** | **5~10 W**(无风扇被动) | | 工作温度 | -40 ~ 85 ℃ 工业级 | | 参考价格 | ~600~1,500 RMB | **可运行模型**: Qwen2.5-1.5B INT4(~1.2 GB,~15-25 tok/s)、Qwen2.5-0.5B INT4 多实例、YOLOv8s INT8。 **定位价值**: 端级主力档,算力是 T4-L 的 6 倍而功耗仅翻倍,是**能效拐点**档位。 #### T4.2.3 T4-H 端-高 — RK3588 8GB(现有设备降配)/ Jetson Orin Nano 8GB **路线 A(现有设备,零成本): RK3588 工业盒 8GB 配置** | 项目 | 规格 | 说明 | | --------- | --------------------------------------------------- | ------------------------ | | SoC | Rockchip RK3588 (8nm) | 与现有 16GB 工业盒**同板同 BSP** | | CPU | 4×A76 @2.4 GHz + 4×A55 @1.8 GHz | 异构大小核 | | MCU | Cortex-M0 @200 MHz(协处理,可选) | 跨核通信验证 | | GPU | Mali-G610 MC4 | 仅辅助显示 | | **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) | 两档可切换 | | **内存** | **4~8 GB LPDDR4X**(统一内存) | 现有 16GB 板通过**内存分区限额**降配运行 | | 内存带宽 | ~51.2 GB/s (128-bit) | 与 T3-L 同 | | **功耗** | **7~21 W**(无风扇被动散热) | 6 TOPS 档 ~12W / 32 TOPS 档 ~21W | | 工作温度 | -40 ~ 60 ℃ 工业级 | 宽温优势 | | 出厂 OS | Ubuntu 22.04 | 换 SylixOS BSP | > **现有 16GB 工业盒的双档位用法**: 同一台设备既可作为 **T3-L(16 GB 全量)** 也可作为 **T4-H(分区限额 8 GB)** 运行,通过 SylixOS 内存分区 / cgroup 限额切换,一台设备覆盖两个档位的对照实验,是本方案的成本关键。 **路线 B(CUDA 生态): NVIDIA Jetson Orin Nano 8GB** | 项目 | 规格 | | --------- | --------------------------------------------------- | | SoC | NVIDIA T234(Ampere 1024 CUDA + 32 Tensor Core) | | **AI 算力** | **40 TOPS (INT8, 稀疏)**(Super 模式 67 TOPS) | | **内存** | **8 GB LPDDR5**(统一内存,102.4 GB/s) | | **功耗** | **7~25 W**(可配置 7W/15W/25W) | | 优势 | **T4 档内唯一 CUDA 路线**,TensorRT-LLM 与 T1/T2/T3-M 同栈 | | 劣势 | SylixOS T234 BSP 风险高,宽温不如 RK3588 | | 参考价格 | ~$249(开发套件) | **可运行模型(T4-H)** | 模型 | 量化 | 显存占用 | 预期 tokens/s | 推理框架 | | ------------------------- | ---- | ------- | ----------- | ----- | | **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~40-60 | RKLLM | | **Qwen2.5-7B-Instruct** | INT4 | ~5 GB | ~20-30 | RKLLM | | MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | RKLLM | | Whisper-Large-v3 | INT8 | ~1.5 GB | 流式 ASR | RKLLM | #### T4.2.4 硬件配置明细(RK3588 工业级边缘计算盒子,现有设备) **系统 (System)** | 项目 | 规格 | | ------- | ---------------------------------------------------- | | SoC | Rockchip RK3588 (8nm) | | CPU | 4×Cortex-A76 @2.4 GHz + 4×Cortex-A55 @1.8 GHz(异构大小核) | | MCU | Cortex-M0 @200 MHz(协处理,可选) | | GPU | Mali-G610 MC4 | | **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) | | **内存** | **16 GB LPDDR4X**(板贴,不可升级)→ 可按 8 GB 分区用作 T4-H | | **显存** | 统一内存(NPU 与 CPU 共享) | **存储 / 扩展** - EMMC 64 GB(系统盘) - 1× TF 卡槽(存储扩展) - 1× M.2 2280 NVMe(可扩展 SSD / 算力棒) **出厂软件** - 操作系统: **Ubuntu 22.04**(出厂预装) - 验证方案: 替换为 SylixOS BSP for RK3588,保留 Ubuntu 22.04 作为对照组 **算力与功耗(T4-H 档)** | 指标 | 值 | | ------------------ | ------------------------------- | | **可用显存** | **8 GB**(16 GB 板分区限额) | | NPU 算力 (6 TOPS 档) | 6 TOPS (INT8) | | NPU 算力 (32 TOPS 档) | 32 TOPS (INT8, 含 26 TOPS 扩展) | | GPU 算力 | Mali-G610 MC4(仅辅助,非主推理路径) | | 内存带宽 | LPDDR4X ~51.2 GB/s (128-bit) | | **TDP** | **7~21 W**(无风扇被动散热) | ### T4.3 SylixOS 要求(T4) | 要求项 | 描述 | 风险 | 适用档位 | | ---------------------- | --------------------------------------- | -------------------- | --------- | | **RK3588 BSP** | SylixOS BSP for RK3588(A76+A55 大小核 SMP) | 中(需翼辉提供) | T4-H | | **RK3576 BSP** | SylixOS BSP for RK3576 | 中-高(需翼辉确认) | T4-M | | **RK3568 BSP** | SylixOS BSP for RK3568 | 中(RK3568 生态成熟,风险低于 T234) | T4-L | | **rknn / RKLLM 驱动** | NPU 驱动在 SylixOS 移植 | **高**(平台B 模型适配核心风险) | T4 全档 | | 板贴 26 TOPS 算力芯片驱动 | 算力棒 SDK | 高(厂商支持度) | T4-H | | M0 核 BSP + RPMsg | 跨核通信 | 高(需翼辉 + 板卡引出 M0 调试口) | T4-H | | **内存分区限额机制** | 16 GB 板按 8 GB 分区运行(T3-L/T4-H 切换) | 中(需 SylixOS 内存域支持) | T4-H | | CAN ×2 驱动 | 工业现场总线 | 中 | T4 全档 | | RS485 ×2 + RS232 ×1 | 串口 | 低 | T4 全档 | | 双千兆 + WiFi + 4G/5G | 网络 | 中 | T4-H | | 看门狗 / RTC | 工业可靠性 | 低 | T4 全档 | | Jetson Orin Nano BSP | T234 低配版 BSP(路线 B) | 高 | T4-H 路线B | ### T4.4 对照组 OS - **主对照**: Ubuntu 22.04(RK3588 出厂预装,完美匹配,直接对照) - **辅助对照**: OpenHarmony 4.x + RT patch(可选) - T4-L / T4-M: Buildroot + PREEMPT_RT --- ## 5. 跨档位对比总表 ### 5.1 全档位硬件规格对比 | 档位 | 容量 | 算力 | 功耗 | 加速器架构 | 散热架构 | 互联 | SylixOS BSP 风险 | | -------- | ---------- | ------------------- | ----------- | ------------------ | ----------- | ---------------- | ------------- | | **T4-L** | 1~2 GB | 0.8~1 TOPS | 3~5 W | ARM A55 + NPU | 被动无风扇 | GPIO/CAN/RS485 | 中 | | **T4-M** | 2~4 GB | 6 TOPS | 5~10 W | ARM A72+A53 + NPU | 被动无风扇 | 千兆 + CAN | 中-高 | | **T4-H** | 4~8 GB | 6~32 TOPS | 7~21 W | ARM A76+A55+M0+NPU | 被动无风扇 | 双千兆 + CAN + M.2 | 中 / 高(路线B) | | **T3-L** | 8~16 GB | 32~100 TOPS | 10~30 W | ARM 统一内存 + NPU/GPU | 被动/小风扇 | 双千兆 + M.2 | **极低**(现有) | | **T3-M** | 16~32 GB | 275 TOPS | 15~60 W | A78AE + Ampere + DLA | 主动风冷 | 10GbE + PCIe Gen4 | **高** | | **T3-H** | 32~64 GB | 275 TOPS / 91 TFLOPS | 60~600 W | ARM 统一内存 / x86+独显 | 风冷 / 液冷 | 10GbE + PCIe | 高 / 中 | | **T2-L** | 64~128 GB | 500 TFLOPS (FP16) | ~1.65 kW | x86 + 4×V100 NVLink | 360 液冷 + 风道 | NVLink | 低(现有) | | **T2-M** | 128~256 GB | 1000 TFLOPS (FP16) | ~3.0~3.3 kW | x86 + 8×V100 NVLink | 360 液冷 + 风道 | NVLink | 低 | | **T2-H** | 256~512 GB | ~4000 TFLOPS (FP16) | ~4.5~6.5 kW | x86 + 4×H100 NVLink | 强制液冷 | NVLink + PCIe | 中 | | **T1-L** | 512 GB~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × 4×V100 | 机房风冷 + 液冷 | NVLink + 100GbE | 中-高 | | **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | ~20~25 kW | 4 节点 × 4×H100 | 机房级液冷 | NVLink + NDR 400G | 中-高 | ### 5.2 模型规模梯度 | 档位 | 代表模型 | 量化 | 显存占用 | 角色 | | -------- | --------------------------- | ---------- | ------- | -------------- | | T4-L | Qwen2.5-0.5B / Whisper-Tiny | INT4/INT8 | 0.5 GB | 谱系下界,实时性基准 | | T4-M | Qwen2.5-1.5B | INT4 | 1.2 GB | 端级能效拐点 | | T4-H | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 端点可跑 7B | | T3-L | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 边缘推理 + 工业控制 | | T3-M | Qwen2.5-14B / 32B | INT4 | 8 / 18 GB | 边缘多模型并发 | | T3-H | Qwen2.5-72B | INT4 (AWQ) | 36 GB | 边缘可跑 72B | | T2-L | Qwen2.5-72B / 14B | INT4 / FP16 | 36 / 28 GB | 桌面多模型并发 | | T2-M | Qwen2.5-72B | FP16 | 144 GB | 桌面单机无量化 72B | | T2-H | DeepSeek-V2 / 72B | FP16 | 210 / 144 GB | 桌面单机超大模型 | | T1-L | Qwen2.5-72B / DeepSeek-V2 | FP16 | 144 / 210 GB | 多节点分布式推理 | | T1-H | DeepSeek-V3/R1 671B | INT4 | ~400 GB | 超大模型分布式服务 | ### 5.3 SylixOS 调度框架验证重点 | 档位 | 验证重点 | 核心实时指标 | 核心吞吐指标 | | ----- | ----------- | ---------------------------------- | -------------------------- | | T4-L | 极小内存下保号 | 1ms RT 任务延迟(1GB 内存约束下) | 0.5B tokens/s、内存占用上限 | | T4-M | 能效拐点 | 1ms RT 任务 P99.9、CPU 频率调节影响 | 1.5B tokens/s、E_per_token | | T4-H | 极致资源约束下保号 | **1ms RT 任务最大延迟 + CAN/RS485 延迟** | 3B/7B tokens/s、E_per_token | | T3-L | 统一内存带宽隔离(NPU) | NPU 推理 + 实时任务共享 51.2 GB/s 带宽时 RT 抖动 | 7B INT4 tokens/s | | T3-M | 统一内存带宽隔离(GPU) | LLM+RT 共享内存带宽时 RT 任务 P99.9 | 14B tokens/s、DLA 异步收益 | | T3-H | 大容量边缘并发 | 72B 推理与 RT 任务共存时的优先级反转 | 72B INT4 tokens/s、多模型 QPS | | T2-L | 单机多卡 NVLink 调度 | GPU 命令端到端延迟、多模型并发公平性 | 14B/72B tokens/s、TTFT P99.9 | | T2-M | 8 卡拓扑调度 | 8 卡 NVLink 全互联下的集合通信抖动 | 72B FP16 tokens/s | | T2-H | 高算力密度下的隔离 | H100 满负载时 RT 任务 P99.9 | 72B FP16 TTFT、671B 分片吞吐 | | T1-L | 跨节点分布式调度隔离 | RDMA 延迟、NCCL all-reduce 期间 RT 任务抖动 | 72B 模型 tokens/s、多模型 QPS | | T1-H | 超大规模分布式调度 | NDR IB 延迟、671B 推理期间 RT 抖动 | 671B tokens/s、能效比 | ### 5.4 基线 OS 对照 | 档位 | SylixOS 实验组 | 主对照 (Linux RT) | 虚拟化对照 | 容器对照 | | ------- | ---------------------- | --------------------- | -------------- | --------- | | T4-L | SylixOS ARM64 (RK3568) | Buildroot + RT | — | Docker | | T4-M | SylixOS ARM64 (RK3576) | Buildroot + RT | — | Docker | | T4-H | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker | | T3-L | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker | | T3-M | SylixOS ARM64 (T234) | L4T Ubuntu 20.04 + RT | KVM (RT VM) | Docker | | T3-H | SylixOS ARM64 / x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker | | T2-L/M | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker | | T2-H | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker | | T1-L | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 | | T1-H | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 | --- ## 6. 采购与获取计划 | 优先级 | 档位 | 设备 | 估算费用 (RMB) | 备注 | | ------ | ------- | ----------------------------- | -------------------- | ---------------------- | | **P0** | T3-L | **RK3588 16GB 工业盒**(现有) | **0** | 现有设备,立即可用 | | **P0** | T2-L | **4×V100 SXM 塔式整机**(现有) | **0** | 现有设备,谱系锚点 | | **P0** | T4-H | **RK3588 工业盒 8GB 分区**(现有) | **0** | 与 T3-L 同机双档位 | | **P1** | T4-L | RK3568 1~2GB 核心板 | ~300-800 | 谱系下界,必做 | | **P1** | T4-M | RK3576 4GB 核心板 | ~600-1,500 | 端级能效拐点 | | **P1** | T3-M | Jetson AGX Orin 32GB | ~15,000-28,000 | 需尽早确认 SylixOS T234 BSP | | **P2** | T3-M 备选 | RK3588 32GB 工业盒 + 26 TOPS 算力棒 | ~3,000-5,000 | 若 Jetson BSP 不支持 | | **P2** | T3-H | Jetson AGX Orin 64GB | ~30,000-50,000 | 边缘可跑 72B | | **P2** | T4-H 备选 | Jetson Orin Nano 8GB 开发套件 | ~1,800-2,500 | CUDA 路线对照 | | **P3** | T2-M | 4× V100 32GB SXM + 8 卡底板 + 电源 | ~70,000-100,000 | 现有平台加卡扩容 | | **P3** | T2-H | 4× H100 80GB SXM5 工作站 | ~800,000-1,200,000 | 可租云实例替代 | | **P3** | T1-L | 3× 计算节点 + 12× V100 + IB | ~270,000 | 可用云实例替代 | | **P4** | T1-H | 4 节点 × 4×H100 + NDR IB | ~3,000,000+ | 强烈建议云租替代 | | — | 仪器 | DC 功率计 ×2 (T3+T4) | ~6,000 | T4 强制 | | — | 仪器 | INA226 采集板 ×2 | ~500 | T3+T4 | | — | 仪器 | 交流功率计 / 智能插座 | ~1,000 | T3-H / T2 档 | | — | 仪器 | 示波器 (Tektronix MDO34) | ~30,000 | GPIO 环回延迟(可借用) | | — | 仪器 | 红外测温枪 ×2 | ~1,000 | 被动散热档位 | | — | 仪器 | CANalyzer | ~20,000 | T4 CAN 总线延迟(可借用) | | **合计** | | **P0~P2 必做项** | **~55,000-95,000** | 不含 T1/T2 扩展 | ### 降本策略 1. **P0 零成本起步**: T2-L + T3-L + T4-H 三个档位由现有硬件直接覆盖,可立即启动 SylixOS 适配与基线数据采集,无需等待采购。 2. **一机两档**: RK3588 16GB 工业盒通过内存分区同时充当 T3-L(16 GB)与 T4-H(8 GB),省去一台设备与一套 BSP 验证成本。 3. **档位跳跃验证**: 若某档位 SylixOS BSP 不可行,可直接跳过该档(如 T4-M 若 RK3576 BSP 不可用,用 T4-H 降配替代),谱系不断。 4. **T1/T2-H 云替代**: H100 集群强烈建议租用云实例(阿里云 GN7 / AWS p5),按需付费,避免百万级 CAPEX 与机房改造。 5. **T3-M Jetson**: 可先用 NVIDIA 开发者板(约 $2,000)验证 SylixOS BSP 可行性后再采购工业级版本。 6. **仪器借用**: 示波器和 CANalyzer 可从实验室借用,不必专门采购。 --- ## 7. SylixOS BSP 适配 Checklist(跨档位汇总) ### 7.1 x86 BSP(T2 全档 + T1 全档) - [ ] SylixOS 2.x LTS x86 在 H12D-8D 主板可启动 - [ ] AMD EPYC 7402 / 9654 多核 SMP 调度 - [ ] **4× V100 SXM CUDA 驱动**(T2-L,核心) - [ ] **8× V100 SXM CUDA 驱动 + 8 卡拓扑**(T2-M) - [ ] **4× H100 SXM5 CUDA 驱动 + NVLink 900GB/s**(T2-H) - [ ] NVLink 4 卡 / 8 卡全互联拓扑枚举 - [ ] nvidia-smi / DCGM 监控 - [ ] vLLM / llama.cpp 在 SylixOS x86 编译运行 - [ ] **Mellanox ConnectX-6 RDMA 驱动**(T1-L 专属) - [ ] **ConnectX-7 NDR 400G RDMA 驱动**(T1-H 专属) - [ ] NCCL / MPI 分布式通信库(T1 专属) - [ ] IPMI / BMC 功耗采集 - [ ] tickless + CPU 隔离 + 中断亲和性 - [ ] 高功耗档位热管理(H100 液冷温度阈值联动降频) ### 7.2 ARM64 BSP — T234 / Ampere(T3-M / T3-H-A / T4-H 路线B) - [ ] **SylixOS ARM64 在 NVIDIA T234 SoC 可启动**(核心,需翼辉确认) - [ ] 12× Cortex-A78AE SMP 调度(AGX Orin)/ 6× A78AE(Orin NX / Nano) - [ ] Jetson Ampere GPU CUDA 驱动 - [ ] **DLA v2.0 驱动**(异步推理,AGX Orin 专属) - [ ] 16/32/64 GB LPDDR5 统一内存管理 - [ ] 功率模式切换 API (7W/15W/25W/30W/50W/60W) - [ ] 10GbE 网络驱动 - [ ] MIPI CSI 工业相机接口 - [ ] PCIe Gen4 扩展 - [ ] 温度传感器 + 降频阈值 ### 7.3 ARM64 BSP — RK3588(T4-H / T3-L) - [ ] SylixOS BSP for RK3588(A76+A55 大小核 SMP) - [ ] CPU 频率独立调节 (governor) - [ ] **内存分区限额机制**(16 GB 板按 8 GB 运行,T3-L ↔ T4-H 切换) - [ ] tickless / idle hook - [ ] 看门狗驱动 - [ ] **rknn / RKLLM NPU 驱动**(核心) - [ ] **板贴 26 TOPS 算力芯片驱动**(32 TOPS 档位) - [ ] **M0 核 BSP + RPMsg 跨核通信**(若用 M0) - [ ] 双千兆 + WiFi 6 + 4G/5G 驱动 - [ ] CAN ×2 驱动 - [ ] RS485 ×2 + RS232 ×1 驱动 - [ ] GPIO 子系统 - [ ] HDMI 输出(调试) - [ ] **Ubuntu 22.04 与 SylixOS 双系统引导** ### 7.4 ARM64 BSP — RK3576(T4-M) - [ ] SylixOS BSP for RK3576(A72+A53 大小核 SMP) - [ ] 6 TOPS NPU 驱动(RKNN 栈) - [ ] 2~4 GB LPDDR5 内存管理 - [ ] CAN / RS485 / 千兆网络驱动 - [ ] 低功耗被动散热下的频率/温度联动 ### 7.5 ARM64 BSP — RK3568(T4-L) - [ ] SylixOS BSP for RK3568(4×A55 SMP) - [ ] 0.8~1 TOPS NPU 驱动(RKNN 栈) - [ ] **1~2 GB 极小内存下的内核裁剪与内存域划分**(核心难点) - [ ] CAN / RS485 / 千兆网络驱动 - [ ] 1ms 实时任务在 1 GB 内存约束下的可行性验证