# 量化与精度感知调度参考 ## 1. 与本项目的关系 本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。 ## 2. 核心必引资料 | 资料 | 等级 | 可支撑内容 | 本项目使用方式 | |---|---|---|---| | E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. [OpenReview](https://openreview.net/forum?id=tcbBPnfwxS) | A | 基于近似二阶信息的低比特权重量化 | 作为 3/4-bit PTQ 方法基线 | | G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. [PMLR](https://proceedings.mlr.press/v202/xiao23c.html) | A | W8A8、激活离群值平滑、硬件效率 | 作为 INT8 权重—激活量化基线 | | J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2024/hash/42a452cbafa9dd64e9ba4aa95cc1ef21-Abstract-Conference.html) | A | 面向端侧的激活感知权重量化 | 对应 T5/T4/T3 设备端路线 | | T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2022/hash/c3ba4962c05c49636d4c6206a97e9c8a-Abstract-Conference.html) | A | 激活离群值与混合精度分解 | 支撑异常通道和精度保持讨论 | | T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. [NeurIPS](https://proceedings.neurips.cc/paper_files/paper/2023/hash/1feb87871436031bdc0f2beaa62a049b-Abstract.html) | A | NF4、双重量化和分页优化器 | 主要用于背景;本项目若不训练,不作为主实验 | | Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. [MLSys](https://proceedings.mlsys.org/paper_files/paper/2025/hash/fbe2b2f74a2ece8070d8fb073717bda6-Abstract-Conference.html) | A | 权重、激活和 KV 联合低比特系统设计 | 支撑量化与内存/内核协同研究 | ## 3. 精度感知调度应补足的研究空白 现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答: - 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值; - 动态切换期间关键保障负载是否出现尾延迟峰值; - 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小; - 质量门槛、实时门槛和功耗门槛能否同时满足; - 对不同风险等级请求,能否采用不同的可接受精度下限。 ## 4. 建议实验矩阵 | 维度 | 建议取值 | |---|---| | 精度 | FP16/BF16、INT8、INT4;仅测试后端真实支持项 | | 模型变量 | 同一模型修订、同一 tokenizer、同一输入与解码参数 | | 质量 | 固定题集、perplexity/准确率/F1/任务判分、输出可用率 | | 性能 | TTFT、TPOT、端到端时延、有效吞吐 | | 系统 | 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟 | | 调度 | 静态精度、基于 deadline 的精度、基于热/功耗预算的精度 | ## 5. 不应直接推出的结论 - 权重压缩比不能替代整机内存、速度或能效实测。 - perplexity 接近不等于所有任务质量和安全性等价。 - 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。 - 动态精度调度若未测切换开销,不能宣称适合实时路径。