1.6 KiB
1.6 KiB
内存、功耗、热与降级
1. 内存治理
模型准入按完整峰值计算:
M_total = M_weight + M_activation + M_workspace
+ M_io + M_runtime + M_control_reserved
必须为控制任务、关键通信和故障日志保留不可侵占空间。权重大小不能代替峰值内存测量。
推荐机制:
- 模型和工作区静态加载;
- 固定大小内存池;
- 禁止关键窗口模型切换;
- DMA 缓冲区白名单和容量上限;
- OOM 前主动降低 AI 并发或切换模型。
2. 功耗与热耦合
AI 满载可能触发整芯片功耗限制或热降频,进而增加控制任务执行时间。实验必须同步记录:
- 整机功率;
- 芯片温度;
- CPU/NPU 实际频率;
- AI 执行阶段;
- 控制响应时间和违约;
- 降频事件。
3. 降级策略
| 触发条件 | 优先动作 |
|---|---|
| 控制裕量下降 | 降低 AI 请求率或跳帧 |
| AI 队列增长 | 拒绝低优先级请求 |
| 内存水位过高 | 减少并发或切换小模型 |
| 温度接近阈值 | 降低 AI 占空比或精度 |
| 连续 AI 超时 | 暂停 AI,保留传统控制 |
| 驱动或设备故障 | 复位 AI 子系统并进入安全模式 |
4. 能效口径
不能仅比较最低功率,应在相同控制实时约束和 AI 质量约束下比较:
- 单次有效推理能耗;
- 有效结果/焦耳;
- 控制无违约条件下的持续 AI 吞吐;
- 热稳态而非冷机短时能效。
5. 结论边界
动态量化、模型切换和 DVFS 只有在切换开销已测量且不破坏控制 deadline 时,才能称为实时感知的低功耗策略。