Files
rtos_llm_opt/项目框架1-基于RTOS的五类场景AI实时性研究/10-研究框架/参考文件/04-量化与精度感知调度参考.md
T
Mo1s 60e0d2e46b Merge remote-tracking branch 'origin/main' into moyixin-patch-1
# Conflicts:
#	10-研究框架/README.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/03-实验设计.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/metric.md
2026-09-22 15:50:56 +08:00

45 lines
3.6 KiB
Markdown

# 量化与精度感知调度参考
## 1. 与本项目的关系
本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。
## 2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. [OpenReview](https://openreview.net/forum?id=tcbBPnfwxS) | A | 基于近似二阶信息的低比特权重量化 | 作为 3/4-bit PTQ 方法基线 |
| G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. [PMLR](https://proceedings.mlr.press/v202/xiao23c.html) | A | W8A8、激活离群值平滑、硬件效率 | 作为 INT8 权重—激活量化基线 |
| J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2024/hash/42a452cbafa9dd64e9ba4aa95cc1ef21-Abstract-Conference.html) | A | 面向端侧的激活感知权重量化 | 对应 T5/T4/T3 设备端路线 |
| T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2022/hash/c3ba4962c05c49636d4c6206a97e9c8a-Abstract-Conference.html) | A | 激活离群值与混合精度分解 | 支撑异常通道和精度保持讨论 |
| T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1feb87871436031bdc0f2beaa62a049b-Abstract.html) | A | NF4、双重量化和分页优化器 | 主要用于背景;本项目若不训练,不作为主实验 |
| Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2025/hash/fbe2b2f74a2ece8070d8fb073717bda6-Abstract-Conference.html) | A | 权重、激活和 KV 联合低比特系统设计 | 支撑量化与内存/内核协同研究 |
## 3. 精度感知调度应补足的研究空白
现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答:
- 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值;
- 动态切换期间关键保障负载是否出现尾延迟峰值;
- 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小;
- 质量门槛、实时门槛和功耗门槛能否同时满足;
- 对不同风险等级请求,能否采用不同的可接受精度下限。
## 4. 建议实验矩阵
| 维度 | 建议取值 |
|---|---|
| 精度 | FP16/BF16、INT8、INT4;仅测试后端真实支持项 |
| 模型变量 | 同一模型修订、同一 tokenizer、同一输入与解码参数 |
| 质量 | 固定题集、perplexity/准确率/F1/任务判分、输出可用率 |
| 性能 | TTFT、TPOT、端到端时延、有效吞吐 |
| 系统 | 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟 |
| 调度 | 静态精度、基于 deadline 的精度、基于热/功耗预算的精度 |
## 5. 不应直接推出的结论
- 权重压缩比不能替代整机内存、速度或能效实测。
- perplexity 接近不等于所有任务质量和安全性等价。
- 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。
- 动态精度调度若未测切换开销,不能宣称适合实时路径。