# 能耗与热管理参考 ## 1. 与本项目的关系 本方向关注满足人工智能和关键实时约束时的能效,而不是脱离任务完成质量的最低功率。功率、温度、频率、有效吞吐和违约必须使用对齐的时间窗口联合分析。 ## 2. 核心资料 | 资料 | 等级 | 可支撑内容 | 本项目使用方式 | |---|---|---|---| | MLCommons, “MLPerf Inference Power Measurement.” [官方文档](https://docs.mlcommons.org/inference/power/) | A | 外部功率分析仪、PTDaemon、测量窗口和配置 | 设计整机功耗采集链路 | | MLCommons, “MLPerf Inference Benchmark Suite.” [官方文档](https://docs.mlcommons.org/inference/index_gh/) | A | Edge/Datacenter 场景、性能与准确率约束 | 对齐负载发生和结果报告方法 | | SPEC, “SPECpower_ssj2008.” [官方资料](https://www.spec.org/osg/power_ssj2008/) | A | AC 输入功率—性能联合测量、负载档位 | 借鉴整机边界和多负载点报告 | | W. Huang et al., “HotSpot: A Compact Thermal Modeling Methodology for Early-Stage VLSI Design,” IEEE TVLSI, 2006. [DOI](https://doi.org/10.1109/TVLSI.2006.876103) | A | 热 RC 模型、瞬态与稳态温度 | 支撑热动态建模背景,不替代板级传感器实测 | | NVIDIA, “DCGM Field Identifiers.” [官方文档](https://docs.nvidia.com/datacenter/dcgm/latest/dcgm-api/dcgm-api-field-ids.html) | A | GPU 功率、能量、温度、频率和降频原因 | V100/H100 路线的设备侧归因数据 | ## 3. 统一计算口径 ```text E_total = integral(P(t), t0, t1) E/token = E_total / N_output effective_E/token = E_total / N_qualified_output tokens/J = N_output / E_total throttling_ratio = throttled_time / valid_measurement_time ``` 主结果使用整机输入端测量。设备遥测只作归因;TDP、标称功耗和电源额定值不能替代实测。`N_output=0` 时能效不可计算。 ## 4. 建议实验 1. 空闲、prefill、decode 和混合负载分阶段功率曲线; 2. 25/50/75/100% 负载下的温度—频率—性能耦合; 3. 不同固定频率/DVFS/功耗上限下的 `E/token` 与 deadline miss; 4. 冷态、热稳态和 24 h 后的 TTFT/TPOT、吞吐与关键任务尾延迟; 5. 降频前后同一到达流的有效吞吐变化; 6. O0~O4 在相同双目标门槛下的能效比较。 每次运行记录环境温度、散热方式、风扇策略、功率计型号、量程、精度和采样率。 ## 5. 可形成的论文论点 - RTOS 的准入、空闲管理和频率策略可能降低无效执行和失败请求的能耗。 - 更低精度或更高并发可能降低 `J/token`,但热饱和后可能扩大尾延迟和违约率。 - 应寻找满足双目标约束的 Pareto 前沿,而不是独立最小化功率或最大化吞吐。 ## 6. 不应直接推出的结论 - 芯片遥测功率不能代表整机功率。 - 短时冷态跑分不能代表热稳态或 24 h 性能。 - 更低平均功率不等于更低任务能耗;运行时间延长可能提高总能量。 - 未取得温箱数据时不能宣称覆盖全温域。