Files
rtos_llm_opt/项目框架3-MCU与资源受限SoC的AI实时性与低功耗研究/10-研究框架/02-内存、功耗、热与降级.md
T

1.6 KiB

内存、功耗、热与降级

1. 内存治理

模型准入按完整峰值计算:

M_total = M_weight + M_activation + M_workspace
        + M_io + M_runtime + M_control_reserved

必须为控制任务、关键通信和故障日志保留不可侵占空间。权重大小不能代替峰值内存测量。

推荐机制:

  • 模型和工作区静态加载;
  • 固定大小内存池;
  • 禁止关键窗口模型切换;
  • DMA 缓冲区白名单和容量上限;
  • OOM 前主动降低 AI 并发或切换模型。

2. 功耗与热耦合

AI 满载可能触发整芯片功耗限制或热降频,进而增加控制任务执行时间。实验必须同步记录:

  • 整机功率;
  • 芯片温度;
  • CPU/NPU 实际频率;
  • AI 执行阶段;
  • 控制响应时间和违约;
  • 降频事件。

3. 降级策略

触发条件 优先动作
控制裕量下降 降低 AI 请求率或跳帧
AI 队列增长 拒绝低优先级请求
内存水位过高 减少并发或切换小模型
温度接近阈值 降低 AI 占空比或精度
连续 AI 超时 暂停 AI,保留传统控制
驱动或设备故障 复位 AI 子系统并进入安全模式

4. 能效口径

不能仅比较最低功率,应在相同控制实时约束和 AI 质量约束下比较:

  • 单次有效推理能耗;
  • 有效结果/焦耳;
  • 控制无违约条件下的持续 AI 吞吐;
  • 热稳态而非冷机短时能效。

5. 结论边界

动态量化、模型切换和 DVFS 只有在切换开销已测量且不破坏控制 deadline 时,才能称为实时感知的低功耗策略。