Files
rtos_llm_opt/项目框架1-基于RTOS的五类场景AI实时性研究/10-研究框架/参考文件/04-量化与精度感知调度参考.md
T
Mo1s 60e0d2e46b Merge remote-tracking branch 'origin/main' into moyixin-patch-1
# Conflicts:
#	10-研究框架/README.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/03-实验设计.md
#	项目框架1-基于RTOS的五类场景AI实时性研究/20-实验与规划/metric.md
2026-09-22 15:50:56 +08:00

3.6 KiB

量化与精度感知调度参考

1. 与本项目的关系

本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。

2. 核心必引资料

资料 等级 可支撑内容 本项目使用方式
E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. OpenReview A 基于近似二阶信息的低比特权重量化 作为 3/4-bit PTQ 方法基线
G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. PMLR A W8A8、激活离群值平滑、硬件效率 作为 INT8 权重—激活量化基线
J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. MLSys A 面向端侧的激活感知权重量化 对应 T5/T4/T3 设备端路线
T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. NeurIPS A 激活离群值与混合精度分解 支撑异常通道和精度保持讨论
T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. NeurIPS A NF4、双重量化和分页优化器 主要用于背景;本项目若不训练,不作为主实验
Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. MLSys A 权重、激活和 KV 联合低比特系统设计 支撑量化与内存/内核协同研究

3. 精度感知调度应补足的研究空白

现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答:

  • 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值;
  • 动态切换期间关键保障负载是否出现尾延迟峰值;
  • 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小;
  • 质量门槛、实时门槛和功耗门槛能否同时满足;
  • 对不同风险等级请求,能否采用不同的可接受精度下限。

4. 建议实验矩阵

维度 建议取值
精度 FP16/BF16、INT8、INT4;仅测试后端真实支持项
模型变量 同一模型修订、同一 tokenizer、同一输入与解码参数
质量 固定题集、perplexity/准确率/F1/任务判分、输出可用率
性能 TTFT、TPOT、端到端时延、有效吞吐
系统 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟
调度 静态精度、基于 deadline 的精度、基于热/功耗预算的精度

5. 不应直接推出的结论

  • 权重压缩比不能替代整机内存、速度或能效实测。
  • perplexity 接近不等于所有任务质量和安全性等价。
  • 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。
  • 动态精度调度若未测切换开销,不能宣称适合实时路径。