3.0 KiB
3.0 KiB
能耗与热管理参考
1. 与本项目的关系
本方向关注满足人工智能和关键实时约束时的能效,而不是脱离任务完成质量的最低功率。功率、温度、频率、有效吞吐和违约必须使用对齐的时间窗口联合分析。
2. 核心资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| MLCommons, “MLPerf Inference Power Measurement.” 官方文档 | A | 外部功率分析仪、PTDaemon、测量窗口和配置 | 设计整机功耗采集链路 |
| MLCommons, “MLPerf Inference Benchmark Suite.” 官方文档 | A | Edge/Datacenter 场景、性能与准确率约束 | 对齐负载发生和结果报告方法 |
| SPEC, “SPECpower_ssj2008.” 官方资料 | A | AC 输入功率—性能联合测量、负载档位 | 借鉴整机边界和多负载点报告 |
| W. Huang et al., “HotSpot: A Compact Thermal Modeling Methodology for Early-Stage VLSI Design,” IEEE TVLSI, 2006. DOI | A | 热 RC 模型、瞬态与稳态温度 | 支撑热动态建模背景,不替代板级传感器实测 |
| NVIDIA, “DCGM Field Identifiers.” 官方文档 | A | GPU 功率、能量、温度、频率和降频原因 | V100/H100 路线的设备侧归因数据 |
3. 统一计算口径
E_total = integral(P(t), t0, t1)
E/token = E_total / N_output
effective_E/token = E_total / N_qualified_output
tokens/J = N_output / E_total
throttling_ratio = throttled_time / valid_measurement_time
主结果使用整机输入端测量。设备遥测只作归因;TDP、标称功耗和电源额定值不能替代实测。N_output=0 时能效不可计算。
4. 建议实验
- 空闲、prefill、decode 和混合负载分阶段功率曲线;
- 25/50/75/100% 负载下的温度—频率—性能耦合;
- 不同固定频率/DVFS/功耗上限下的
E/token与 deadline miss; - 冷态、热稳态和 24 h 后的 TTFT/TPOT、吞吐与关键任务尾延迟;
- 降频前后同一到达流的有效吞吐变化;
- O0~O4 在相同双目标门槛下的能效比较。
每次运行记录环境温度、散热方式、风扇策略、功率计型号、量程、精度和采样率。
5. 可形成的论文论点
- RTOS 的准入、空闲管理和频率策略可能降低无效执行和失败请求的能耗。
- 更低精度或更高并发可能降低
J/token,但热饱和后可能扩大尾延迟和违约率。 - 应寻找满足双目标约束的 Pareto 前沿,而不是独立最小化功率或最大化吞吐。
6. 不应直接推出的结论
- 芯片遥测功率不能代表整机功率。
- 短时冷态跑分不能代表热稳态或 24 h 性能。
- 更低平均功率不等于更低任务能耗;运行时间延长可能提高总能量。
- 未取得温箱数据时不能宣称覆盖全温域。