forked from eaiadmin/rtos_llm_opt
docs: add alternative real-time research frameworks
This commit is contained in:
@@ -0,0 +1,55 @@
|
||||
# 内存、功耗、热与降级
|
||||
|
||||
## 1. 内存治理
|
||||
|
||||
模型准入按完整峰值计算:
|
||||
|
||||
```text
|
||||
M_total = M_weight + M_activation + M_workspace
|
||||
+ M_io + M_runtime + M_control_reserved
|
||||
```
|
||||
|
||||
必须为控制任务、关键通信和故障日志保留不可侵占空间。权重大小不能代替峰值内存测量。
|
||||
|
||||
推荐机制:
|
||||
|
||||
- 模型和工作区静态加载;
|
||||
- 固定大小内存池;
|
||||
- 禁止关键窗口模型切换;
|
||||
- DMA 缓冲区白名单和容量上限;
|
||||
- OOM 前主动降低 AI 并发或切换模型。
|
||||
|
||||
## 2. 功耗与热耦合
|
||||
|
||||
AI 满载可能触发整芯片功耗限制或热降频,进而增加控制任务执行时间。实验必须同步记录:
|
||||
|
||||
- 整机功率;
|
||||
- 芯片温度;
|
||||
- CPU/NPU 实际频率;
|
||||
- AI 执行阶段;
|
||||
- 控制响应时间和违约;
|
||||
- 降频事件。
|
||||
|
||||
## 3. 降级策略
|
||||
|
||||
| 触发条件 | 优先动作 |
|
||||
|---|---|
|
||||
| 控制裕量下降 | 降低 AI 请求率或跳帧 |
|
||||
| AI 队列增长 | 拒绝低优先级请求 |
|
||||
| 内存水位过高 | 减少并发或切换小模型 |
|
||||
| 温度接近阈值 | 降低 AI 占空比或精度 |
|
||||
| 连续 AI 超时 | 暂停 AI,保留传统控制 |
|
||||
| 驱动或设备故障 | 复位 AI 子系统并进入安全模式 |
|
||||
|
||||
## 4. 能效口径
|
||||
|
||||
不能仅比较最低功率,应在相同控制实时约束和 AI 质量约束下比较:
|
||||
|
||||
- 单次有效推理能耗;
|
||||
- 有效结果/焦耳;
|
||||
- 控制无违约条件下的持续 AI 吞吐;
|
||||
- 热稳态而非冷机短时能效。
|
||||
|
||||
## 5. 结论边界
|
||||
|
||||
动态量化、模型切换和 DVFS 只有在切换开销已测量且不破坏控制 deadline 时,才能称为实时感知的低功耗策略。
|
||||
Reference in New Issue
Block a user