Files
rtos_llm_opt/项目框架1-基于RTOS的五类场景AI实时性研究/10-研究框架/参考文件/04-量化与精度感知调度参考.md
T
moyixinandMo1s 15e1c2727c docs: 完善三套实时性研究框架与验证方案 (#3)
## 改动内容

- 完善并提交“项目框架1:基于 RTOS 的五类场景 AI 实时性研究”。
- 新增“项目框架2:面向机器人大小脑异构系统的实时保障研究”。
- 新增“项目框架3:MCU 与资源受限 SoC 的 AI 实时性与低功耗研究”。
- 新增 RTOS–Linux–Hypervisor 边缘并行架构说明。
- 新增调整后的研究问题与验证建议,明确 RTOS、系统实时性与大模型低时延的边界。

## 验证

- 已同步上游 `main`,源分支基于最新上游历史继续提交。
- `git diff --cached --check` 通过。
- 已检查提交范围,未加入凭据、令牌或临时文件。
- 远端分支提交已核对为 `b7863721fe906c0fa6a5e841599dd276a579d679`。

## 建议重点审查

- 三套框架是否应作为相互独立、可并列选择的研究路线。
- 是否充分区分工业实时性、AI 推理低时延与端到端系统实时性。
- 机器人大小脑分域、Hypervisor 隔离及 MCU 资源预算的实验指标是否可落地。

---------

Co-authored-by: Mo1s <1194302708@qq.com>
Reviewed-on: #3
Co-authored-by: moyixin <15971501952@163.com>
2026-09-29 04:07:48 +00:00

3.6 KiB

量化与精度感知调度参考

1. 与本项目的关系

本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。

2. 核心必引资料

资料 等级 可支撑内容 本项目使用方式
E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. OpenReview A 基于近似二阶信息的低比特权重量化 作为 3/4-bit PTQ 方法基线
G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. PMLR A W8A8、激活离群值平滑、硬件效率 作为 INT8 权重—激活量化基线
J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. MLSys A 面向端侧的激活感知权重量化 对应 T5/T4/T3 设备端路线
T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. NeurIPS A 激活离群值与混合精度分解 支撑异常通道和精度保持讨论
T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. NeurIPS A NF4、双重量化和分页优化器 主要用于背景;本项目若不训练,不作为主实验
Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. MLSys A 权重、激活和 KV 联合低比特系统设计 支撑量化与内存/内核协同研究

3. 精度感知调度应补足的研究空白

现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答:

  • 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值;
  • 动态切换期间关键保障负载是否出现尾延迟峰值;
  • 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小;
  • 质量门槛、实时门槛和功耗门槛能否同时满足;
  • 对不同风险等级请求,能否采用不同的可接受精度下限。

4. 建议实验矩阵

维度 建议取值
精度 FP16/BF16、INT8、INT4;仅测试后端真实支持项
模型变量 同一模型修订、同一 tokenizer、同一输入与解码参数
质量 固定题集、perplexity/准确率/F1/任务判分、输出可用率
性能 TTFT、TPOT、端到端时延、有效吞吐
系统 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟
调度 静态精度、基于 deadline 的精度、基于热/功耗预算的精度

5. 不应直接推出的结论

  • 权重压缩比不能替代整机内存、速度或能效实测。
  • perplexity 接近不等于所有任务质量和安全性等价。
  • 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。
  • 动态精度调度若未测切换开销,不能宣称适合实时路径。