Files
rtos_llm_opt/20-实验与规划/02-基础设备与算力基础.md
T

784 lines
56 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 基础设备与算力基础配置(T5~T1 五类部署形态 / 11 个代表档位)
> 版本: v2.1 起草日期: 2026-09-21
> 设计目标: 为“**大型跨平台实时操作系统支撑任务关键系统中人工智能目标负载的实时保障机制研究**”建立完整的验证矩阵,并细化为 **T5~T1 五类部署形态 / 11 个代表实验档位**
> 说明: 文中的 `T5~T1` 是**设备档位/运行形态代码**,用于组织实验与证据,承担验证矩阵角色
---
## 0. 场景、算力基础与设备档位总览
### 0.1 研究框架与设备谱系的对应关系
研究框架中,项目统一采用“**T5~T1 五类部署形态 + 5 种算力基础 + 5 层技术栈**”的表述。
本文件属于实验设计部分,因此进一步把不同部署环境下的设备条件展开成可执行的设备档位体系。
这里完整呈现硬件与指标颗粒度,并明确:
> **这些设备档位的作用是验证 RTOS 机制在不同资源条件下是否成立。**
| 研究维度 | 定义 | 在本文件中的落地方式 |
|---|---|---|
| 5 类部署形态 | 控制端、设备端 SoC、边缘节点、桌面/工作站单机、服务器/集群 | 通过 `T5~T1` 设备档位覆盖 |
| 5 种算力基础 | 控制型、设备端 SoC 型、边缘节点型、工作站单机型、服务器/集群型 | 通过代表设备与容量区间体现 |
| 11 个代表档位 | 可采购、可测试、可对照的实验运行形态 | 作为 RTOS 机制验证矩阵与采购清单 |
`T5~T1` 是用于实验组织的**部署形态代码**。
这套划分以**部署位置与系统角色**为一级分类,以容量作为档位细分参考;`T3 边缘节点` 与 `T2 桌面/工作站单机` 分别对应独立节点与单机高密本地推理平台。
后续实验中,这些档位分别承担的是:
- 人工智能目标负载在不同资源条件下的时效与有效性验证;
- 关键保障负载在不同资源条件下的边界验证;
- RTOS 在双目标约束下的机制有效性验证。
### 0.2 分级维度与分档规则
**分级维度**: 以「统一内存 / 显存容量」为第一分类维度。容量直接决定可承载的模型规模,并与功耗、散热、互联架构强相关,因此适合作为连续设备谱系的主轴。
**分档规则**: 相邻两档的边界值归入**上界一侧**
| 部署形态 | 代码 | 代表档位 | 容量范围 | 说明 |
| -------- | --- | --------------- | ---------------- | ---------------- |
| **T5 控制端场景** | T5 | **T5-L / T5-M / T5-H** | **1~8 G** | 运行在控制器或轻量控制盒本体 |
| **T4 设备端 SoC 场景** | T4 | **T4-L / T4-M** | **8~32 G** | 运行在设备本体 SoC 上 |
| **T3 边缘节点场景** | T3 | **T3-L** | **32~64 G / 48 G 独显** | 运行在设备附近的边缘节点 |
| **T2 桌面/工作站单机场景** | T2 | **T2-L / T2-M / T2-H** | **64~512 G** | 研发或本地服务用单机多卡 |
| **T1 服务器/集群场景** | T1 | **T1-L / T1-H** | **512 G~2 T** | 多节点分布式推理 |
> 说明: 这里的首要分类依据是部署形态;容量只作为各部署形态内部的分档参考。
### 0.3 全谱系总表(11 个档位)
> 算力单位统一约定: **NVIDIA GPU 用 FP16 Tensor Core TFLOPS(dense)**,**NPU 用 INT8 TOPS**;两者不可直接换算。
| 档位 | 容量 | 算力(峰值) | 功耗 | 算力/供电架构 | 代表设备 | 状态 |
| -------- | ------------ | -------------------------- | ------------- | ---------------------------------- | ----------------------------- | ------- |
| **T5-L** | 1~2 G | 0.8~1 TOPS (INT8) | 3~5 W | ARM A55 + 小 NPU;DC 5V/12V 被动散热 | RK3568 1~2GB 核心板 | |
| **T5-M** | 2~4 G | 6 TOPS (INT8) | 5~10 W | ARM A72+A53 + NPU;DC 12V 被动散热 | RK3576 4GB | |
| **T5-H** | 4~8 G | 6~32 TOPS (INT8) | 7~21 W | ARM A76+A55 + M0 + NPU;DC 12V 被动 | **RK3588 8GB** / Jetson Orin Nano 8GB | 现有(16G 板降配) |
| **T4-L** | 8~16 G | 32~100 TOPS (INT8) | 10~30 W | ARM SoC 统一内存 + NPU/GPU;DC 12~24V 被动/小风扇 | **RK3588 16GB 工业盒** / Orin NX 16GB | 现有 |
| **T4-M** | 16~32 G | 275 TOPS (INT8) | 15~60 W | ARM A78AE + Ampere GPU + 2×DLA;DC 19V 主动风冷 | Jetson AGX Orin 32GB | |
| **T3-L** | 32~64 G / 48 G 独显 | 275 TOPS / 91 TFLOPS (FP16) | 60~600 W | ARM 统一内存 或 x86+单卡 CUDA;风冷/液冷 | Jetson AGX Orin 64GB / 边缘工控机 + RTX 6000 Ada 48GB | |
| **T2-L** | 64~128 G | 500 TFLOPS (FP16) | 600~1.65 kW | x86 + 4×V100 SXM NVLink;双电源 + 360 液冷 | **4×V100 32GB SXM 塔式** | 现有 |
| **T2-M** | 128~256 G | 1000 TFLOPS (FP16) | 3.0~3.3 kW | x86 + 8×V100 SXM NVLink;双电源 + 液冷 | 8×V100 32GB SXM 整机 | 需扩展 |
| **T2-H** | 256~512 G | ~4000 TFLOPS (FP16) | 4.5~6.5 kW | x86 + 4×H100 SXM5 NVLink;高压供电 + 强制液冷 | 4×H100 80GB SXM5 工作站 | |
| **T1-L** | 512 G~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × x86+4×V100,100GbE RoCE/IB;机房风冷/液冷 | 4×(T2-L 节点)+ IB 交换机 | 需扩展 |
| **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | 20~25 kW | 4 节点 × x86+4×H100,NDR 400G IB;机房级液冷 | 4×(T2-H 节点)+ NDR 交换机 | |
### 0.4 设计原则
1. **部署形态先行、设备落地**: 先用“控制端 / 设备端 SoC / 边缘节点 / 桌面工作站 / 服务器集群”定义研究问题,再用 `T5~T1` 设备档位组织具体实验。
2. **容量连续、功耗阶跃**: 从 1 GB / 3 W 到 2 TB / 25 kW,容量每上一档约 ×2,功耗随架构变化阶跃(被动散热 → 主动风冷 → 液冷 → 机房级液冷),形成天然的性能/能效对比曲线。
3. **CUDA 栈贯通高算力侧**: T1/T2/T3 的候选平台可共享 NVIDIA CUDA 生态(V100 / Ampere / Hopper),模型与推理框架(vLLM / TensorRT-LLM)可跨档位迁移,主要变化是规模与拓扑。
4. **非 CUDA 控制端与设备端路线**: T5 全档位与 T4-L 走 RKNN/RKLLM NPU 栈,代表最强资源约束与最接近设备本体的运行位置。
5. **现有硬件复用**: **4×V100 SXM(T2-L)** 与 **RK3588 工业盒(T4-L 16GB / T5-H 8GB 两用)** 为零采购成本基线,整条谱系以此为锚点向两侧扩展。
6. **BSP 最小化**: 全谱系仅需两类 BSP——x86(T1/T2/T3-B 路线)与 ARM64(T5/T4/T3-A 路线),档位差异靠设备树与驱动裁剪吸收,不新增架构分支。
---
## T1. 服务器/集群场景的多节点形态 — 512 G ~ 2 T
### T1.1 定位
大规模分布式 LLM 推理与多模型并发服务。验证 SylixOS 在**多节点分布式调度**下的实时性——跨节点 RDMA 延迟、NCCL 集合通信抖动、分布式推理框架(vLLM+Ray / TensorRT-LLM+MPI)与实时控制任务的混合负载隔离。
### T1.2 档位对比
| 维度 | T1-L 多节点-低 | T1-H 多节点-高 |
| ----------- | --------------------- | --------------------------- |
| **容量** | 512 GB(4 × 128 GB) | 1.28 TB(4 × 320 GB) |
| **节点数** | 4 节点 | 4 节点 |
| **单节点加速器** | 4 × V100 32GB SXM | 4 × H100 80GB SXM5 |
| **集群算力** | ~2000 TFLOPS (FP16) | ~16 PFLOPS (FP16) |
| **节点内互联** | NVLink 300 GB/s | NVLink 900 GB/s |
| **节点间互联** | 100GbE RoCE / IB | NDR 400G IB |
| **整机功耗** | ~6.6 kW | 20~25 kW |
| **散热架构** | 每节点 360 液冷 + 机房风冷 | 机房级液冷(CDU / 后门换热器) |
| **主要模型** | 72B FP16 / 多实例 14B | 671B INT4 / 多实例 72B FP16 |
#### T1.2.1 T1-L 多节点-低 — 4 节点 × 4×V100 = 512 GB(本方案主线)
| 项目 | 规格 | 数量 | 备注 |
| --------- | ------------------------------------------------ | ------------- | --------------------------- |
| **计算节点** | 同 T2-L 单机配置 | **4 台** | 每节点 4×V100 32GB SXM = 128GB |
| 节点内 GPU | NVIDIA V100 32GB SXM (NVLink 全互联) | 4×4 = 16 卡 | 每节点 NVLink 全互联 |
| 节点内 CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2GHz) | 4 | 每节点 1 颗 |
| 节点内内存 | 128GB DDR4-2133 ECC | 4×128 = 512GB | 每节点 128GB |
| **节点间互联** | Mellanox ConnectX-6 100GbE / IB | 4 卡 | 每节点 1 卡,RoCE 或原生 IB |
| 节点间交换机 | 100GbE/IB 交换机 (Mellanox SN2700 或同档) | 1 | 32 端口 |
| 存储 | 共享 NFS / NVMe-oF (每节点 1TB NVMe 本地 + 共享存储) | — | 模型权重共享池 |
| 散热 | 每节点 360 一体液冷 ×2 | — | 同 T2-L |
| 电源 | 每节点 长城 1650W + 1250W 双电源 | 4 套 | 单节点 ~1.65 kW,集群 ~6.6 kW |
| 功率采集 | PDU + Yokogawa WT310 (整机) + nvidia-smi dmon (单卡) | — | 每节点独立采集 |
**显存与算力**
| 指标 | 值 |
| --------------- | ---------------------------------- |
| **总显存** | **512 GB** (4 × 128GB) |
| 单卡 FP16 算力 | 125 TFLOPS |
| 集群总算力 (FP16) | ~2000 TFLOPS (NVLink 节点内 + IB 节点间) |
| NVLink 带宽 (节点内) | 300 GB/s (GPU↔GPU) |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | ------- | ----- | ------------------ |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 3+ | vLLM + Ray 分布式 |
| Qwen2.5-72B | INT4 (AWQ) | ~36 GB | 14+ | vLLM + Ray |
| **DeepSeek-V2-Chat** | FP16 | ~210 GB | 2 | TensorRT-LLM + MPI |
| Qwen2.5-14B | FP16 | ~28 GB | 18+ | vLLM (可单节点) |
| LLaMA-3-70B | FP16 | ~140 GB | 3+ | vLLM + Ray |
> 注: 若已有 1 台 T2-L 节点,仅需追加 3 台。V100 SXM 为二手市场/拆机渠道,价格波动大。也可租用云上 V100 实例替代自建集群。
#### T1.2.2 T1-H 多节点-高 — 4 节点 × 4×H100 = 1.28 TB(扩展档)
| 项目 | 规格 | 数量 | 备注 |
| ------- | ----------------------------------------- | --------- | --------------------- |
| 计算节点 | 同 T2-H 单机配置 | 4 台 | 每节点 4×H100 80GB SXM5 |
| 节点内 GPU | NVIDIA H100 80GB SXM5 (NVLink 4 卡全互联) | 16 卡 | NVLink 900 GB/s |
| 节点内 CPU | AMD EPYC 9654 (96C/192T) 或 Intel Xeon 8468 | 4 | 每节点 1~2 颗 |
| 节点内内存 | 512GB DDR5-4800 ECC | 4 × 512GB | 每节点 512GB |
| 节点间互联 | NVIDIA ConnectX-7 NDR 400Gb/s IB | 4~8 卡 | 每节点 1~2 卡 |
| 节点间交换机 | NDR 400G IB 交换机 (Quantum-2 / SN5600) | 1 | 32 端口 |
| 存储 | 并行文件系统 (GPFS/Lustre) + 每节点 4TB NVMe | — | 671B 级模型权重池 |
| 散热 | 机房级液冷 (CDU + 冷板) | — | 风冷不可行 |
| 电源 | 每节点 4~6 kW 冗余电源 | 4 套 | 集群 ~20~25 kW |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | -------- | ----- | -------------------- |
| **DeepSeek-V3 / R1-671B** | INT4 (AWQ) | ~400 GB | 3+ | vLLM + Ray / SGLang |
| **Qwen2.5-72B** | FP16 | ~144 GB | 8+ | vLLM + TensorRT-LLM |
| LLaMA-3-405B | INT4 | ~230 GB | 5+ | TensorRT-LLM + MPI |
| Qwen2.5-32B | FP16 | ~64 GB | 20+ | vLLM |
### T1.3 SylixOS 要求(T1 通用)
| 要求项 | 描述 | 风险 |
| ------------------ | ------------------------------- | ------------------------------ |
| x86 BSP | 每节点运行 SylixOS x86 LTS | 低(T2-L 已验证) |
| **RDMA / RoCE 驱动** | ConnectX-6 / ConnectX-7 在 SylixOS 上的 RDMA 驱动 | **中-高**(需验证 Mellanox OFED 兼容性) |
| NCCL / MPI | 分布式集合通信库在 SylixOS 移植 | 中(NCCL 依赖 CUDA + POSIX) |
| Ray / 分布式框架 | vLLM + Ray 的 SylixOS 适配 | 中(Python + Ray 依赖链) |
| 分布式调度器 | SylixOS 跨节点实时任务调度原型 | **研究贡献点** |
### T1.4 研究角度
- **跨节点调度延迟**: 分布式推理时,1ms 实时任务在跨节点 NCCL all-reduce 期间的尾延迟
- **RDMA bypass 内核**: SylixOS 是否能利用 RDMA bypass kernel path 降低跨节点通信延迟
- **分布式公平性**: 多节点并发请求时,高优先级实时任务的跨节点响应稳定性
- **能效**: 分布式推理的每 token 能耗 vs 单节点(通信开销 vs 并行收益)
- **档位对照**: T1-L 与 T1-H 的**每 token 能耗比**——V100 集群(能效基线)vs H100 集群(能效上限)
---
## T2. 高算力单机部署形态 — 64 G ~ 512 G
### T2.1 定位
单节点多 GPU 大模型推理。验证 SylixOS 在**单机多卡 NVLink 拓扑**下的 GPU 命令调度延迟、显存管理实时性、多模型并发流水线调度。
### T2.2 档位对比
| 维度 | T2-L 单机-低 | T2-M 单机-中 | T2-H 单机-高 |
| ----------- | ---------------------- | --------------------------- | --------------------------- |
| **容量** | 128 GB(4 × 32 GB) | 256 GB(8 × 32 GB) | 320 GB(4 × 80 GB) |
| **加速器** | 4 × V100 32GB SXM | 8 × V100 32GB SXM | 4 × H100 80GB SXM5 |
| **算力** | 500 TFLOPS (FP16) | 1000 TFLOPS (FP16) | ~4000 TFLOPS (FP16) |
| **互联** | NVLink 300 GB/s ×4 | NVLink 300 GB/s ×8 | NVLink 900 GB/s ×4 |
| **整机功耗** | ~1.65 kW | ~3.0~3.3 kW | ~4.5~6.5 kW |
| **散热架构** | 360 液冷 ×2 + 塔式风道 | 360 液冷 ×2 + 双路风冷 | 强制液冷 (冷板),风冷不可行 |
| **电源架构** | 1650W + 1250W 双电源 | 2× 2000W 冗余 / 220V 单相 | 2× 3000W 冗余 / 220V 双相 |
| **形态** | 塔式一体定制机箱 | 4U 机架式 / 塔式 | 4U~5U 机架式液冷 |
| **可运行模型** | 72B INT4 / 14B FP16 | 72B FP16 / 多实例 32B | 671B INT4 / 72B FP16 多并发 |
| **状态** | 现有 | 需扩展(现有平台加卡) | 需 |
#### T2.2.1 T2-L 单机-低 — 4×V100 SXM = 128 GB(现有设备,谱系锚点)
| # | 部件 | 型号 / 规格 | 数量 | 备注 |
| -- | ------- | ---------------------------------------------- | ----- | --------------------------- |
| 1 | 主板 | H12D-8D(双路 EPYC 服务器板) | 1 | |
| 2 | CPU | AMD EPYC 7402 (24C/48T, 2.0-3.2 GHz, TDP 180W) | 1 | |
| 3 | 硬盘 | 长城 M.2 NVMe 1TB | 1 | 系统盘 |
| 4 | 内存 | 三星 DDR4-32G-2133 | 4 | 共 128 GB DDR4 |
| 5 | 散热系统 | 360 一体液冷散热套装 | 2 | 主机 + GPU |
| 6 | 转接卡 | ROHSTNS-2SXM2-2P54E | 2 | |
| 7 | 信号线 | V100 32G × 2 | 4 | NVLink 桥接 |
| 8 | 机箱 | 塔式一体定制机箱 | 1 | |
| 9 | 主电源 | 长城全模组 1650W | 1 | |
| 10 | 副电源 | 长城 1250W 全模组 | 1 | SXM 平台用 |
| 11 | 散热器 | SP3 高性能散热器 | 1 | |
| 12 | SXM 平台 | 300G NVLink 4 卡直连底板 | 1 | |
| 13 | **GPU** | **NVIDIA V100 32GB SXM** | **4** | **NVLink 全互联,共 128GB HBM2** |
**显存与算力**
| 指标 | 值 |
| ---------- | --------------------------- |
| **总显存** | **128 GB** (4 × 32GB HBM2) |
| 单卡显存 | 32 GB HBM2 |
| 单卡 FP16 算力 | 125 TFLOPS |
| 总算力 (FP16) | ~500 TFLOPS |
| NVLink 带宽 | 300 GB/s (GPU↔GPU 全互联) |
| 内存带宽 | DDR4-2133 ~170 GB/s (CPU 侧) |
| **整机功耗** | **~1650 W** (满载) |
**可运行模型**
| 模型 | 量化 | 显存占用 | 并发实例数 | 推理框架 |
| ------------------------ | ---------- | ------ | ----- | ------------------- |
| **Qwen2.5-7B-Instruct** | FP16 | ~14 GB | 8+ | vLLM / TensorRT-LLM |
| **Qwen2.5-14B-Instruct** | INT4 (AWQ) | ~8 GB | 14+ | vLLM |
| Qwen2.5-14B | FP16 | ~28 GB | 4 | vLLM |
| **Qwen2.5-72B-Instruct** | INT4 (AWQ) | ~36 GB | 3 | vLLM (张量并行 TP=4) |
| LLaMA-3-8B | FP16 | ~16 GB | 7 | vLLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | 20+ | llama.cpp |
| Whisper-Large-v3 | FP16 | ~3 GB | 40+ | faster-whisper |
#### T2.2.2 T2-M 单机-中 — 8×V100 SXM = 256 GB
在 T2-L 平台基础上**加卡扩容**,是「同一代硬件纵向扩展」的对照档位,最贴近现有设备、改造成本最低。
| 项目 | 规格 | 变更点 |
| --------- | ----------------------------------------------- | ------------------ |
| **GPU** | NVIDIA V100 32GB SXM **× 8** | 4 → 8 卡 |
| **SXM 平台** | 300G NVLink **8 卡直连底板** | 更换底板 |
| **转接卡** | ROHSTNS-2SXM2-2P54E | 2 → 4 |
| **NVLink** | 全互联 8 卡,300 GB/s | 拓扑扩展 |
| 主板 / CPU | H12D-8D + EPYC 7402(双路可升级 EPYC 7742 64C) | 建议升双路以喂满 8 卡 |
| 内存 | 128 GB → **256 GB** DDR4-2133 | 8 卡需更大 pinned memory |
| 电源 | 2 × 2000W 冗余(或 220V 单相 16A 回路) | 1650W+1250W 不足 |
| 散热 | 360 液冷 ×2 + 机箱风道强化 | — |
| **整机功耗** | **~3.0~3.3 kW** | +100% |
| **总算力** | **~1000 TFLOPS (FP16)** | +100% |
**可运行模型(新增/提升)**
| 模型 | 量化 | 显存占用 | 并发实例数 | 说明 |
| ------------------------ | ---------- | ------ | ----- | ------------------ |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 1~2 | TP=8 张量并行,无需量化 |
| **Qwen2.5-32B-Instruct** | FP16 | ~64 GB | 3+ | TP=4 |
| DeepSeek-V2-Lite | FP16 | ~31 GB | 8+ | — |
| Qwen2.5-14B | FP16 | ~28 GB | 9+ | 单卡可容,多实例并发 |
> **备选方案**: 4 × RTX 6000 Ada 48GB = 192 GB,364 TFLOPS (FP16),整机 ~2.4 kW,风冷即可。优势是无 NVLink 但单卡能效高、显存快;劣势是跨卡走 PCIe Gen5。
#### T2.2.3 T2-H 单机-高 — 4×H100 SXM5 = 320 GB
| 项目 | 规格 |
| ------- | ---------------------------------------- |
| **GPU** | NVIDIA H100 80GB SXM5 **× 4**(NVLink 全互联) |
| 单卡算力 | ~989 TFLOPS (FP16 Tensor Core, dense) |
| 单卡显存 | 80 GB HBM3 |
| NVLink | 900 GB/s (GPU↔GPU) |
| CPU | AMD EPYC 9654 (96C/192T) ×1~2 |
| 内存 | 512 GB DDR5-4800 ECC |
| 底板 | HGX H100 4-GPU 或 8-GPU 底板(留 4 卡空位) |
| 存储 | 4 TB NVMe RAID0(模型权重加载) |
| 散热 | **强制液冷(冷板式)**,风冷不可行 |
| 电源 | 2 × 3000W 冗余 / 220V |
| **整机功耗** | **~4.5~6.5 kW** |
| **总算力** | **~4000 TFLOPS (FP16)**,稀疏 ~8000 TFLOPS |
**备选方案**: 8 × RTX 6000 Ada 48GB = 384 GB,728 TFLOPS (FP16),~4.0 kW,风冷可行——容量更大、功耗更低,代价是无 NVLink 与算力密度。
**可运行模型(新增/提升)**
| 模型 | 量化 | 显存占用 | 并发实例数 | 说明 |
| ------------------------ | ---------- | ------- | ----- | ----------------- |
| **Qwen2.5-72B-Instruct** | FP16 | ~144 GB | 2 | TP=4,H100 下 TTFT 极低 |
| LLaMA-3-70B | FP16 | ~140 GB | 2 | — |
| **DeepSeek-V2-Chat** | FP16 | ~210 GB | 1 | 单机可跑 |
| Mixtral-8x7B | FP16 | ~93 GB | 3 | MoE 专家并行 |
### T2.3 SylixOS 要求(T2 三档通用)
| 要求项 | 描述 | 风险 |
| ----------------- | ----------------------------- | ------------------- |
| x86 BSP | SylixOS 2.x LTS x86 | 低 |
| **CUDA 驱动** | V100 SXM / H100 SXM 在 SylixOS 的 CUDA 驱动 | **中**(需翼辉确认) |
| NVLink 支持 | 4 卡 / 8 卡 NVLink 拓扑在 SylixOS 可用 | 中 |
| vLLM / llama.cpp | Python + CUDA 推理框架适配 | 中(llama.cpp 优先,依赖少) |
| nvidia-smi / DCGM | GPU 监控 + 功耗采集 | 低 |
| 8 卡 / 4 卡拓扑切换 | 同一 BSP 支持 T2-L/M/H 不同卡数 | 低(设备树 + 枚举) |
### T2.4 对照组 OS
- **主对照**: Ubuntu 22.04 LTS + `linux-image-rt` (PREEMPT_RT) + vLLM
- **辅助对照**: CentOS Stream 9 + RT 内核(可选)
---
## T3. 边缘节点场景 — 32 G ~ 64 G / 48 G 独显
### T3.1 定位
边缘节点位于设备本体之外、云端之前,承担近源推理、数据汇聚和多设备协同。
它是部署在设备附近的独立节点,承担近源推理、数据汇聚和多设备协同。
### T3.2 代表档位对比
| 维度 | T3-L 边缘节点代表档 |
| --------- | ---------------- |
| **容量** | 64 GB 统一内存 / 48 GB 独立显存 |
| **加速器** | Jetson AGX Orin 64GB / RTX 6000 Ada 48GB |
| **算力** | 275 TOPS (INT8) / 91 TFLOPS (FP16) |
| **功耗** | 15~60 W / ~600 W |
| **部署位置** | 设备附近机柜、边缘控制室、产线边缘节点 |
| **主要任务** | 多模态推理、近源协同、边缘缓存与调度 |
### T3.3 候选平台
- Jetson AGX Orin 64GB:统一内存、能效高,适合近设备部署;
- 边缘工控机 + RTX 6000 Ada 48GB:生态完整,适合边缘机柜和算力下沉场景。
### T3.4 研究重点
- 设备端到边缘节点的协同调度;
- 近源多任务并发下的实时隔离;
- 边缘节点与桌面/工作站单机在功耗、散热和部署约束上的边界。
---
## T4. 设备端 SoC 场景 — 8 G ~ 32 G
### T4.1 定位
设备端 SoC 直接运行在终端设备本体上。验证 SylixOS 在**统一内存架构**(CPU+加速器共享 LPDDR)下的实时性,即推理任务与实时控制任务共享本机资源时的隔离能力。
### T4.2 档位对比
| 维度 | T4-L SoC-低 | T4-M SoC-中 |
| --------- | ---------------------------- | -------------------------- |
| **容量** | 16 GB 统一内存 | 32 GB 统一内存 |
| **加速器** | RK3588 NPU 6+26 TOPS / Ampere | Ampere GPU + 2×DLA |
| **算力** | 32 TOPS / 100 TOPS (INT8) | 275 TOPS (INT8) |
| **功耗** | 10~30 W | 15~60 W |
| **供电架构** | DC 12~24 V,无风扇/小风扇 | DC 19 V,主动风冷 |
| **工作温度** | -40~60 ℃ 工业级 | -25~80 ℃ |
| **SylixOS 风险** | **极低**(RK3588 BSP 复用 T5) | **高**(T234 BSP 需验证) |
| **状态** | (RK3588 16GB 工业盒) | 待验证 |
#### T4.2.1 T4-L SoC-低 — RK3588 16GB 工业盒(现有设备)
**这是现有 RK3588 设备的标准归属档位**,也是唯一可零成本立即开展研究的设备端 SoC 档位。
| 项目 | 规格 | 备注 |
| --------- | --------------------------------------- | --------------------- |
| SoC | Rockchip RK3588(同 T5-H) | SylixOS BSP 与 T5 共用 |
| 内存 | **16 GB LPDDR4X**(统一内存) | -40~60 ℃ 工业宽温 |
| NPU | 6 TOPS 原生 + **26 TOPS 算力棒扩展 = 32 TOPS** | 算力棒走 M.2 2280 |
| 功耗 | ~21~30 W(含算力棒) | 被动散热,可选小风扇 |
| 内存带宽 | ~51.2 GB/s (128-bit LPDDR4X) | 与 T5-H 同源,是带宽瓶颈点 |
| 模型 | Qwen2.5-3B/7B INT4(RKLLM) | 比 T5-H 内存翻倍,可跑更大模型 |
**备选方案(同档位、CUDA 路线)**: NVIDIA Jetson Orin NX 16GB — 100 TOPS (INT8, sparse),1024 CUDA + 32 Tensor Core,16 GB LPDDR5 / 102.4 GB/s,10~25 W,**CUDA 生态与 T1/T2/T3 打通**。代价是 SylixOS T234 BSP 风险高。
#### T4.2.2 T4-M SoC-中 — NVIDIA Jetson AGX Orin 32GB
| 项目 | 规格 |
| --------- | -------------------------------------------------- |
| **SoC** | NVIDIA T234(Grace 系列衍生) |
| **CPU** | 12× ARM Cortex-A78AE @ 2.0 GHz(64-bit) |
| **GPU** | NVIDIA Ampere 架构,2048 CUDA cores + 64 Tensor cores |
| **DLA** | 2× DLA v2.0(深度学习加速器,可异步推理) |
| **AI 算力** | **275 TOPS** (INT8) / 137.5 TOPS (INT8+INT8 双精度) |
| **内存** | **32 GB LPDDR5**(统一内存,CPU/GPU 共享) |
| 内存带宽 | 204.8 GB/s |
| **功耗** | **15 W ~ 60 W**(可配置功率模式:15W/30W/50W/60W) |
| 工作温度 | -25 ~ 80°C(工业级,但不如 RK3588 的 -40~60°C 宽) |
| 存储 | 64GB eMMC + M.2 NVMe(可扩展) |
| 网络 | 2× 10GbE(RJ45)+ 1× 千兆 |
| 视频接口 | HDMI 2.1 + DP 1.4a |
| USB | 4× USB 3.2 + 2× USB 2.0 |
| PCIe | PCIe Gen4 ×4(可扩展外设) |
| MIPI CSI | 4 通道(可接工业相机) |
| 尺寸 | 100mm × 87mm(核心模块) |
| **出厂 OS** | Ubuntu 20.04 LTS (L4T) |
| 价格 | ~$2,000-4,000(~15,000-28,000 RMB) |
**选择 Jetson AGX Orin 的理由**
1. **CUDA 生态统一**: 与 T1/T2 同为 NVIDIA GPU,vLLM / TensorRT / llama.cpp 可直接移植,无需切换到 RKLLM 栈
2. **统一内存架构**: CPU 和 GPU 共享 32GB LPDDR5,无独立显存——LLM 推理和实时控制任务**争抢同一内存带宽**,是验证内存带宽管控(RQ2)的理想平台
3. **DLA 异步推理**: 2 个 DLA 可在 GPU/CPU 不介入时执行推理,适合"LLM 推理让出 CPU/GPU 给实时任务"的调度策略验证
4. **功率可配置**: 15W/30W/50W/60W 多档功率模式,可在不同功耗预算下测试
5. **丰富 I/O**: 10GbE + MIPI CSI + PCIe Gen4,可接工业相机、高速网络、扩展卡
#### T3 边缘节点候选平台
64 GB 统一内存 Jetson AGX Orin 与 48 GB 独显边缘工控机统一归入 `T3 边缘节点场景`。
**可运行模型(T4 两档合并)**
| 模型 | 量化 | 显存占用 | 预期 tokens/s | 适用档位 | 推理框架 |
| ------------------------ | ------------ | ------- | ----------- | ------------- | ------------------------ |
| **Qwen2.5-1.5B-Instruct** | INT4 | ~1.2 GB | ~40-60 | T4-L | RKLLM |
| **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~50-80 | T4-L / T4-M | TensorRT-LLM / RKLLM |
| **Qwen2.5-7B-Instruct** | INT4 (W4A16) | ~5 GB | ~30-50 | T4-L / T4-M | TensorRT-LLM / llama.cpp |
| **Qwen2.5-14B-Instruct** | INT4 | ~8 GB | ~20-35 | T4-M | TensorRT-LLM |
| **Qwen2.5-32B-Instruct** | INT4 | ~18 GB | ~12-20 | T4-M | TensorRT-LLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | T4-L 以上 | llama.cpp |
| Whisper-Large-v3 | INT8/FP16 | ~1.5 GB | 流式 ASR | T4-L 以上 | faster-whisper |
| YOLOv8n | INT8 | ~0.1 GB | 200+ FPS | T4 全档 | TensorRT / RKNN |
### T4.3 SylixOS 要求(T4)
| 要求项 | 描述 | 风险 |
| -------------------- | --------------------------------------- | ---------------------------- |
| **ARM64 BSP (T234)** | SylixOS 需提供 NVIDIA T234 SoC 的 ARM64 BSP | **高**(需翼辉确认是否支持 Jetson Orin) |
| **RK3588 BSP(T4-L)** | 与 T5-H 共用同一 BSP,零额外风险 | **极低** |
| CUDA 驱动 | Jetson 专用 CUDA(L4T 驱动栈)在 SylixOS 适配 | 高 |
| DLA 驱动 | DLA 异步推理在 SylixOS 的可用性 | 高 |
| 功率模式 API | 15W/30W/50W/60W 切换在 SylixOS 的实现 | 中 |
| 内存监控 | 统一内存架构下的内存带宽监控(PMU 计数器) | 中 |
| 独立显存管理(T3 B 路线) | x86 + 独显的显存分配与实时性 | 中 |
> **当前路径**:T4-L 采用现有 RK3588 起步;T4-M 在 Jetson BSP 与驱动条件确认后纳入采购与验证计划。
### T4.4 对照组 OS
| 档位 | 主对照 | 辅助对照 |
| ---- | -------------------------------- | ----------------------------- |
| T4-L | Ubuntu 22.04 + PREEMPT_RT(RK3588) | OpenHarmony 4.x + RT patch(可选) |
| T4-M | Ubuntu 20.04 LTS (L4T) + PREEMPT_RT | Ubuntu 22.04 + Docker(容器隔离方案) |
### T4.5 功率采集
| 设备 | 用途 | 适用档位 |
| ----------------------------- | --------------------- | ----------- |
| DC 功率计(USB 接口型) | 整机 DC 输入端功耗 | T4-L / T4-M |
| INA226 采集板 | SoC 主电源轨(若可接入) | 全档 |
| `jetson_stats` / tegrastats | 内部功耗代理(辅助,非主报) | T4-M / T3-L |
| 交流功率计(PZEM / 智能插座) | 边缘工控机整机功耗 | T3-L B 路线 |
---
## T5. 控制端场景 — 1 G ~ 8 G
### T5.1 定位
工业端点超低功耗 LLM 推理与硬实时控制。验证 SylixOS 在**极致资源约束**(3~21 W / 1~8 GB / 0.8~32 TOPS)下的 LLM + 1ms 实时控制并发能力。这一场景能够充分暴露实时调度、隔离与准入机制的有效性,也是 RTOS 与普通 Linux / PREEMPT_RT Linux 差异最容易被观察到的重要验证位置。
### T5.2 档位对比
| 维度 | T5-L 控制端-低 | T5-M 控制端-中 | T5-H 控制端-高 |
| ----------- | ---------------------- | -------------------- | ------------------------------ |
| **容量** | 1~2 GB LPDDR4X | 2~4 GB LPDDR5 | 4~8 GB LPDDR4X / LPDDR5 |
| **SoC** | RK3568 (4×A55) | RK3576 (4×A72+4×A53) | RK3588 (4×A76+4×A55+M0) / Orin Nano |
| **NPU 算力** | 0.8~1 TOPS (INT8) | 6 TOPS (INT8) | 6~32 TOPS / 40~67 TOPS (INT8) |
| **功耗** | 3~5 W | 5~10 W | 7~21 W |
| **散热架构** | 无风扇被动 | 无风扇被动 | 无风扇被动(可选小风扇) |
| **供电** | DC 5V / 12V | DC 12V | DC 12V |
| **工作温度** | -40~85 ℃ 工业级 | -40~85 ℃ 工业级 | -40~60 ℃ / 0~50 ℃ |
| **可运行模型** | 0.5B INT4 / Whisper-Tiny | 1.5B INT4 / YOLO 系列 | 3B~7B INT4 / MiniCPM-V |
| **状态** | | | ✅ 现有(RK3588 16GB 降配) |
#### T5.2.1 T5-L 控制端-低 — RK3568 核心板(1~2 GB)
| 项目 | 规格 |
| --------- | -------------------------------------- |
| SoC | Rockchip RK3568 (22nm) |
| CPU | 4× Cortex-A55 @ 2.0 GHz |
| **NPU** | **0.8~1 TOPS (INT8)**(RKNN 原生栈) |
| **内存** | **1~2 GB LPDDR4X**(统一内存,板贴) |
| 内存带宽 | ~25.6 GB/s |
| GPU | Mali-G52(仅辅助显示) |
| 存储 | 8~16 GB eMMC |
| 网络 | 1× 千兆 + 可选 WiFi |
| 工业接口 | CAN ×2 / RS485 ×2 / GPIO(典型核心板引出) |
| **功耗** | **3~5 W**(无风扇被动散热) |
| 工作温度 | -40 ~ 85 ℃ 工业级 |
| 出厂 OS | Buildroot / Ubuntu 20.04(可换 SylixOS) |
| 参考价格 | ~300~800 RMB(核心板/开发板) |
**可运行模型**: Qwen2.5-0.5B INT4(~0.5 GB)、Whisper-Tiny INT8(~0.2 GB)、YOLOv5n INT8。
**定位价值**: 谱系最低档,用于测量极小资源预算下的实时保障下界、容量边界,以及 RTOS 在极小内存条件下维持 1 ms 周期任务的能力。
#### T5.2.2 T5-M 控制端-中 — RK3576 核心板(2~4 GB)
| 项目 | 规格 |
| --------- | ---------------------------------------- |
| SoC | Rockchip RK3576 (8nm) |
| CPU | 4× Cortex-A72 + 4× Cortex-A53(异构大小核) |
| **NPU** | **6 TOPS (INT8)** + 可扩展算力棒 |
| **内存** | **2~4 GB LPDDR5**(统一内存) |
| 内存带宽 | ~40 GB/s |
| **功耗** | **5~10 W**(无风扇被动) |
| 工作温度 | -40 ~ 85 ℃ 工业级 |
| 参考价格 | ~600~1,500 RMB |
**可运行模型**: Qwen2.5-1.5B INT4(~1.2 GB,~15-25 tok/s)、Qwen2.5-0.5B INT4 多实例、YOLOv8s INT8。
**定位价值**: 控制端主力档,算力是 T5-L 的 6 倍而功耗仅翻倍,是**能效拐点**档位。
#### T5.2.3 T5-H 控制端-高 — RK3588 8GB(现有设备降配)/ Jetson Orin Nano 8GB
**路线 A(现有设备,零成本): RK3588 工业盒 8GB 配置**
| 项目 | 规格 | 说明 |
| --------- | --------------------------------------------------- | ------------------------ |
| SoC | Rockchip RK3588 (8nm) | 与现有 16GB 工业盒**同板同 BSP** |
| CPU | 4×A76 @2.4 GHz + 4×A55 @1.8 GHz | 异构大小核 |
| MCU | Cortex-M0 @200 MHz(协处理,可选) | 跨核通信验证 |
| GPU | Mali-G610 MC4 | 仅辅助显示 |
| **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) | 两档可切换 |
| **内存** | **4~8 GB LPDDR4X**(统一内存) | 现有 16GB 板通过**内存分区限额**降配运行 |
| 内存带宽 | ~51.2 GB/s (128-bit) | 与 T4-L 同 |
| **功耗** | **7~21 W**(无风扇被动散热) | 6 TOPS 档 ~12W / 32 TOPS 档 ~21W |
| 工作温度 | -40 ~ 60 ℃ 工业级 | 宽温优势 |
| 出厂 OS | Ubuntu 22.04 | 换 SylixOS BSP |
> **现有 16GB 工业盒的双档位用法**: 同一台设备既可作为 **T4-L(16 GB 全量)** 也可作为 **T5-H(分区限额 8 GB)** 运行,通过 SylixOS 内存分区 / cgroup 限额切换,一台设备覆盖两个档位的对照实验,是本方案的成本关键。
**路线 B(CUDA 生态): NVIDIA Jetson Orin Nano 8GB**
| 项目 | 规格 |
| --------- | --------------------------------------------------- |
| SoC | NVIDIA T234(Ampere 1024 CUDA + 32 Tensor Core) |
| **AI 算力** | **40 TOPS (INT8, 稀疏)**(Super 模式 67 TOPS) |
| **内存** | **8 GB LPDDR5**(统一内存,102.4 GB/s) |
| **功耗** | **7~25 W**(可配置 7W/15W/25W) |
| 优势 | **T5 档内唯一 CUDA 路线**,TensorRT-LLM 与 T1/T2/T3/T4 同栈 |
| 劣势 | SylixOS T234 BSP 风险高,宽温不如 RK3588 |
| 参考价格 | ~$249(开发套件) |
**可运行模型(T5-H)**
| 模型 | 量化 | 显存占用 | 预期 tokens/s | 推理框架 |
| ------------------------- | ---- | ------- | ----------- | ----- |
| **Qwen2.5-3B-Instruct** | INT4 | ~2.5 GB | ~40-60 | RKLLM |
| **Qwen2.5-7B-Instruct** | INT4 | ~5 GB | ~20-30 | RKLLM |
| MiniCPM-V 2.6 | INT4 | ~6 GB | ~15-25 | RKLLM |
| Whisper-Large-v3 | INT8 | ~1.5 GB | 流式 ASR | RKLLM |
#### T5.2.4 硬件配置明细(RK3588 工业级边缘计算盒子,现有设备)
**系统 (System)**
| 项目 | 规格 |
| ------- | ---------------------------------------------------- |
| SoC | Rockchip RK3588 (8nm) |
| CPU | 4×Cortex-A76 @2.4 GHz + 4×Cortex-A55 @1.8 GHz(异构大小核) |
| MCU | Cortex-M0 @200 MHz(协处理,可选) |
| GPU | Mali-G610 MC4 |
| **NPU** | **6 TOPS**(内置, INT8)/ **32 TOPS**(板贴 26 TOPS 算力芯片扩展) |
| **内存** | **16 GB LPDDR4X**(板贴,不可升级)→ 可按 8 GB 分区用作 T5-H |
| **显存** | 统一内存(NPU 与 CPU 共享) |
**存储 / 扩展**
- EMMC 64 GB(系统盘)
- 1× TF 卡槽(存储扩展)
- 1× M.2 2280 NVMe(可扩展 SSD / 算力棒)
**出厂软件**
- 操作系统: **Ubuntu 22.04**(出厂预装)
- 运行方案: SylixOS BSP for RK3588 + Ubuntu 22.04 对照组
**算力与功耗(T5-H 档)**
| 指标 | 值 |
| ------------------ | ------------------------------- |
| **可用显存** | **8 GB**(16 GB 板分区限额) |
| NPU 算力 (6 TOPS 档) | 6 TOPS (INT8) |
| NPU 算力 (32 TOPS 档) | 32 TOPS (INT8, 含 26 TOPS 扩展) |
| GPU 算力 | Mali-G610 MC4(仅辅助,非主推理路径) |
| 内存带宽 | LPDDR4X ~51.2 GB/s (128-bit) |
| **TDP** | **7~21 W**(无风扇被动散热) |
### T5.3 SylixOS 要求(T5)
| 要求项 | 描述 | 风险 | 适用档位 |
| ---------------------- | --------------------------------------- | -------------------- | --------- |
| **RK3588 BSP** | SylixOS BSP for RK3588(A76+A55 大小核 SMP) | 中(需翼辉提供) | T5-H |
| **RK3576 BSP** | SylixOS BSP for RK3576 | 中-高(需翼辉确认) | T5-M |
| **RK3568 BSP** | SylixOS BSP for RK3568 | 中(RK3568 生态成熟,风险低于 T234) | T5-L |
| **rknn / RKLLM 驱动** | NPU 驱动在 SylixOS 移植 | **高**(平台B 模型适配核心风险) | T5 全档 |
| 板贴 26 TOPS 算力芯片驱动 | 算力棒 SDK | 高(厂商支持度) | T5-H |
| M0 核 BSP + RPMsg | 跨核通信 | 高(需翼辉 + 板卡引出 M0 调试口) | T5-H |
| **内存分区限额机制** | 16 GB 板按 8 GB 分区运行(T4-L/T5-H 切换) | 中(需 SylixOS 内存域支持) | T5-H |
| CAN ×2 驱动 | 工业现场总线 | 中 | T5 全档 |
| RS485 ×2 + RS232 ×1 | 串口 | 低 | T5 全档 |
| 双千兆 + WiFi + 4G/5G | 网络 | 中 | T5-H |
| 看门狗 / RTC | 工业可靠性 | 低 | T5 全档 |
| Jetson Orin Nano BSP | T234 低配版 BSP(路线 B) | 高 | T5-H 路线B |
### T5.4 对照组 OS
- **主对照**: Ubuntu 22.04(RK3588 出厂预装,完美匹配,直接对照)
- **辅助对照**: OpenHarmony 4.x + RT patch(可选)
- T5-L / T5-M: Buildroot + PREEMPT_RT
---
## 5. 跨档位对比总表
### 5.1 全档位硬件规格对比
| 档位 | 容量 | 算力 | 功耗 | 加速器架构 | 散热架构 | 互联 | SylixOS BSP 风险 |
| -------- | ---------- | ------------------- | ----------- | ------------------ | ----------- | ---------------- | ------------- |
| **T5-L** | 1~2 GB | 0.8~1 TOPS | 3~5 W | ARM A55 + NPU | 被动无风扇 | GPIO/CAN/RS485 | 中 |
| **T5-M** | 2~4 GB | 6 TOPS | 5~10 W | ARM A72+A53 + NPU | 被动无风扇 | 千兆 + CAN | 中-高 |
| **T5-H** | 4~8 GB | 6~32 TOPS | 7~21 W | ARM A76+A55+M0+NPU | 被动无风扇 | 双千兆 + CAN + M.2 | 中 / 高(路线B) |
| **T4-L** | 8~16 GB | 32~100 TOPS | 10~30 W | ARM 统一内存 + NPU/GPU | 被动/小风扇 | 双千兆 + M.2 | **极低**(现有) |
| **T4-M** | 16~32 GB | 275 TOPS | 15~60 W | A78AE + Ampere + DLA | 主动风冷 | 10GbE + PCIe Gen4 | **高** |
| **T3-L** | 32~64 GB / 48 GB 独显 | 275 TOPS / 91 TFLOPS | 60~600 W | ARM 统一内存 / x86+独显 | 风冷 / 液冷 | 10GbE + PCIe | 高 / 中 |
| **T2-L** | 64~128 GB | 500 TFLOPS (FP16) | ~1.65 kW | x86 + 4×V100 NVLink | 360 液冷 + 风道 | NVLink | 低(现有) |
| **T2-M** | 128~256 GB | 1000 TFLOPS (FP16) | ~3.0~3.3 kW | x86 + 8×V100 NVLink | 360 液冷 + 风道 | NVLink | 低 |
| **T2-H** | 256~512 GB | ~4000 TFLOPS (FP16) | ~4.5~6.5 kW | x86 + 4×H100 NVLink | 强制液冷 | NVLink + PCIe | 中 |
| **T1-L** | 512 GB~1 T | ~2000 TFLOPS (FP16) | ~6.6 kW | 4 节点 × 4×V100 | 机房风冷 + 液冷 | NVLink + 100GbE | 中-高 |
| **T1-H** | 1~2 T | ~16 PFLOPS (FP16) | ~20~25 kW | 4 节点 × 4×H100 | 机房级液冷 | NVLink + NDR 400G | 中-高 |
### 5.2 模型规模梯度
| 档位 | 代表模型 | 量化 | 显存占用 | 角色 |
| -------- | --------------------------- | ---------- | ------- | -------------- |
| T5-L | Qwen2.5-0.5B / Whisper-Tiny | INT4/INT8 | 0.5 GB | 控制端最低资源参考档,实时性基准 |
| T5-M | Qwen2.5-1.5B | INT4 | 1.2 GB | 控制端能效拐点 |
| T5-H | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 端点可跑 7B |
| T4-L | Qwen2.5-3B / 7B | INT4 | 2.5 / 5 GB | 设备端推理 + 工业控制 |
| T4-M | Qwen2.5-14B / 32B | INT4 | 8 / 18 GB | 设备端多模型并发 |
| T3-L | Qwen2.5-72B | INT4 (AWQ) | 36 GB | 边缘节点可跑 72B |
| T2-L | Qwen2.5-72B / 14B | INT4 / FP16 | 36 / 28 GB | 桌面多模型并发 |
| T2-M | Qwen2.5-72B | FP16 | 144 GB | 桌面单机无量化 72B |
| T2-H | DeepSeek-V2 / 72B | FP16 | 210 / 144 GB | 桌面单机超大模型 |
| T1-L | Qwen2.5-72B / DeepSeek-V2 | FP16 | 144 / 210 GB | 多节点分布式推理 |
| T1-H | DeepSeek-V3/R1 671B | INT4 | ~400 GB | 超大模型分布式服务 |
### 5.3 SylixOS 调度框架验证重点
| 档位 | 验证重点 | 核心实时指标 | 核心吞吐指标 |
| ----- | ----------- | ---------------------------------- | -------------------------- |
| T5-L | 极小内存下保持关键保障负载边界 | 1ms RT 任务延迟(1GB 内存约束下) | 0.5B tokens/s、内存占用上限 |
| T5-M | 能效拐点 | 1ms RT 任务 P99.9、CPU 频率调节影响 | 1.5B tokens/s、E_per_token |
| T5-H | 极致资源约束下保持关键保障负载边界 | **1ms RT 任务最大延迟 + CAN/RS485 延迟** | 3B/7B tokens/s、E_per_token |
| T4-L | 统一内存带宽隔离(NPU) | NPU 推理 + 实时任务共享 51.2 GB/s 带宽时 RT 抖动 | 7B INT4 tokens/s |
| T4-M | 统一内存带宽隔离(GPU) | LLM+RT 共享内存带宽时 RT 任务 P99.9 | 14B tokens/s、DLA 异步收益 |
| T3-L | 大容量边缘并发 | 72B 推理与 RT 任务共存时的优先级反转 | 72B INT4 tokens/s、多模型 QPS |
| T2-L | 单机多卡 NVLink 调度 | GPU 命令端到端延迟、多模型并发公平性 | 14B/72B tokens/s、TTFT P99.9 |
| T2-M | 8 卡拓扑调度 | 8 卡 NVLink 全互联下的集合通信抖动 | 72B FP16 tokens/s |
| T2-H | 高算力密度下的隔离 | H100 满负载时 RT 任务 P99.9 | 72B FP16 TTFT、671B 分片吞吐 |
| T1-L | 跨节点分布式调度隔离 | RDMA 延迟、NCCL all-reduce 期间 RT 任务抖动 | 72B 模型 tokens/s、多模型 QPS |
| T1-H | 超大规模分布式调度 | NDR IB 延迟、671B 推理期间 RT 抖动 | 671B tokens/s、能效比 |
### 5.4 基线 OS 对照
| 档位 | SylixOS 实验组 | 主对照 (PREEMPT_RT Linux) | 虚拟化对照 | 容器对照 |
| ------- | ---------------------- | --------------------- | -------------- | --------- |
| T5-L | SylixOS ARM64 (RK3568) | Buildroot + RT | — | Docker |
| T5-M | SylixOS ARM64 (RK3576) | Buildroot + RT | — | Docker |
| T5-H | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T4-L | SylixOS ARM64 (RK3588) | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T4-M | SylixOS ARM64 (T234) | L4T Ubuntu 20.04 + RT | KVM (RT VM) | Docker |
| T3-L | SylixOS ARM64 / x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T2-L/M | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T2-H | SylixOS x86 | Ubuntu 22.04 + RT | KVM (RT VM) | Docker |
| T1-L | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 |
| T1-H | SylixOS x86 ×4 节点 | Ubuntu 22.04 + RT ×4 | KVM (RT VM) ×4 | Docker ×4 |
---
## 6. 采购与获取计划
| 优先级 | 档位 | 设备 | 估算费用 (RMB) | 备注 |
| ------ | ------- | ----------------------------- | -------------------- | ---------------------- |
| **P0** | T4-L | **RK3588 16GB 工业盒**(现有) | **0** | 现有设备,立即可用 |
| **P0** | T2-L | **4×V100 SXM 塔式整机**(现有) | **0** | 现有设备,谱系锚点 |
| **P0** | T5-H | **RK3588 工业盒 8GB 分区**(现有) | **0** | 与 T4-L 同机双档位 |
| **P1** | T5-L | RK3568 1~2GB 核心板 | ~300-800 | 控制端最低资源参考档,必做 |
| **P1** | T5-M | RK3576 4GB 核心板 | ~600-1,500 | 控制端能效拐点 |
| **P1** | T4-M | Jetson AGX Orin 32GB | ~15,000-28,000 | 需尽早确认 SylixOS T234 BSP |
| **P2** | T4-M 备选 | RK3588 32GB 工业盒 + 26 TOPS 算力棒 | ~3,000-5,000 | 若 Jetson BSP 不支持 |
| **P2** | T3-L | Jetson AGX Orin 64GB | ~30,000-50,000 | 边缘节点可跑 72B |
| **P2** | T5-H 备选 | Jetson Orin Nano 8GB 开发套件 | ~1,800-2,500 | CUDA 路线对照 |
| **P3** | T2-M | 4× V100 32GB SXM + 8 卡底板 + 电源 | ~70,000-100,000 | 现有平台加卡扩容 |
| **P3** | T2-H | 4× H100 80GB SXM5 工作站 | ~800,000-1,200,000 | 可租云实例替代 |
| **P3** | T1-L | 3× 计算节点 + 12× V100 + IB | ~270,000 | 可用云实例替代 |
| **P4** | T1-H | 4 节点 × 4×H100 + NDR IB | ~3,000,000+ | 强烈建议云租替代 |
| — | 仪器 | DC 功率计 ×2 (T4+T5) | ~6,000 | T5 强制 |
| — | 仪器 | INA226 采集板 ×2 | ~500 | T4+T5 |
| — | 仪器 | 交流功率计 / 智能插座 | ~1,000 | T3 / T2 档 |
| — | 仪器 | 示波器 (Tektronix MDO34) | ~30,000 | GPIO 环回延迟(可借用) |
| — | 仪器 | 红外测温枪 ×2 | ~1,000 | 被动散热档位 |
| — | 仪器 | CANalyzer | ~20,000 | T4 CAN 总线延迟(可借用) |
| **合计** | | **P0~P2 必做项** | **~55,000-95,000** | 不含 T1/T2 扩展 |
### 降本策略
1. **P0 零成本起步**: T2-L + T4-L + T5-H 三个档位由现有硬件直接覆盖,可立即启动 SylixOS 适配与基线数据采集,无需等待采购。
2. **一机两档**: RK3588 16GB 工业盒通过内存分区同时充当 T4-L(16 GB)与 T5-H(8 GB),省去一台设备与一套 BSP 验证成本。
3. **档位跳跃验证**: 若某档位 SylixOS BSP 不可行,可直接跳过该档(如 T5-M 若 RK3576 BSP 不可用,用 T5-H 降配替代),谱系不断。
4. **T1/T2-H 云替代**: H100 集群强烈建议租用云实例(阿里云 GN7 / AWS p5),按需付费,避免百万级 CAPEX 与机房改造。
5. **T4-M Jetson**: 可先用 NVIDIA 开发者板(约 $2,000)验证 SylixOS BSP 可行性后再采购工业级版本。
6. **仪器借用**: 示波器和 CANalyzer 可从实验室借用,不必专门采购。
---
## 7. SylixOS BSP 适配 Checklist(跨档位汇总)
### 7.1 x86 BSP(T2 全档 + T1 全档)
- [ ] SylixOS 2.x LTS x86 在 H12D-8D 主板可启动
- [ ] AMD EPYC 7402 / 9654 多核 SMP 调度
- [ ] **4× V100 SXM CUDA 驱动**(T2-L,核心)
- [ ] **8× V100 SXM CUDA 驱动 + 8 卡拓扑**(T2-M)
- [ ] **4× H100 SXM5 CUDA 驱动 + NVLink 900GB/s**(T2-H)
- [ ] NVLink 4 卡 / 8 卡全互联拓扑枚举
- [ ] nvidia-smi / DCGM 监控
- [ ] vLLM / llama.cpp 在 SylixOS x86 编译运行
- [ ] **Mellanox ConnectX-6 RDMA 驱动**(T1-L 专属)
- [ ] **ConnectX-7 NDR 400G RDMA 驱动**(T1-H 专属)
- [ ] NCCL / MPI 分布式通信库(T1 专属)
- [ ] IPMI / BMC 功耗采集
- [ ] tickless + CPU 隔离 + 中断亲和性
- [ ] 高功耗档位热管理(H100 液冷温度阈值联动降频)
### 7.2 ARM64 BSP — T234 / Ampere(T4-M / T3-L-A / T5-H 路线B)
- [ ] **SylixOS ARM64 在 NVIDIA T234 SoC 可启动**(核心,需翼辉确认)
- [ ] 12× Cortex-A78AE SMP 调度(AGX Orin)/ 6× A78AE(Orin NX / Nano)
- [ ] Jetson Ampere GPU CUDA 驱动
- [ ] **DLA v2.0 驱动**(异步推理,AGX Orin 专属)
- [ ] 16/32/64 GB LPDDR5 统一内存管理
- [ ] 功率模式切换 API (7W/15W/25W/30W/50W/60W)
- [ ] 10GbE 网络驱动
- [ ] MIPI CSI 工业相机接口
- [ ] PCIe Gen4 扩展
- [ ] 温度传感器 + 降频阈值
### 7.3 ARM64 BSP — RK3588(T5-H / T4-L)
- [ ] SylixOS BSP for RK3588(A76+A55 大小核 SMP)
- [ ] CPU 频率独立调节 (governor)
- [ ] **内存分区限额机制**(16 GB 板按 8 GB 运行,T4-L ↔ T5-H 切换)
- [ ] tickless / idle hook
- [ ] 看门狗驱动
- [ ] **rknn / RKLLM NPU 驱动**(核心)
- [ ] **板贴 26 TOPS 算力芯片驱动**(32 TOPS 档位)
- [ ] **M0 核 BSP + RPMsg 跨核通信**(若用 M0)
- [ ] 双千兆 + WiFi 6 + 4G/5G 驱动
- [ ] CAN ×2 驱动
- [ ] RS485 ×2 + RS232 ×1 驱动
- [ ] GPIO 子系统
- [ ] HDMI 输出(调试)
- [ ] **Ubuntu 22.04 与 SylixOS 双系统引导**
### 7.4 ARM64 BSP — RK3576(T5-M)
- [ ] SylixOS BSP for RK3576(A72+A53 大小核 SMP)
- [ ] 6 TOPS NPU 驱动(RKNN 栈)
- [ ] 2~4 GB LPDDR5 内存管理
- [ ] CAN / RS485 / 千兆网络驱动
- [ ] 低功耗被动散热下的频率/温度联动
### 7.5 ARM64 BSP — RK3568(T5-L)
- [ ] SylixOS BSP for RK3568(4×A55 SMP)
- [ ] 0.8~1 TOPS NPU 驱动(RKNN 栈)
- [ ] **1~2 GB 极小内存下的内核裁剪与内存域划分**(核心难点)
- [ ] CAN / RS485 / 千兆网络驱动
- [ ] 1ms 实时任务在 1 GB 内存约束下的可行性验证