## 改动内容 - 完善并提交“项目框架1:基于 RTOS 的五类场景 AI 实时性研究”。 - 新增“项目框架2:面向机器人大小脑异构系统的实时保障研究”。 - 新增“项目框架3:MCU 与资源受限 SoC 的 AI 实时性与低功耗研究”。 - 新增 RTOS–Linux–Hypervisor 边缘并行架构说明。 - 新增调整后的研究问题与验证建议,明确 RTOS、系统实时性与大模型低时延的边界。 ## 验证 - 已同步上游 `main`,源分支基于最新上游历史继续提交。 - `git diff --cached --check` 通过。 - 已检查提交范围,未加入凭据、令牌或临时文件。 - 远端分支提交已核对为 `b7863721fe906c0fa6a5e841599dd276a579d679`。 ## 建议重点审查 - 三套框架是否应作为相互独立、可并列选择的研究路线。 - 是否充分区分工业实时性、AI 推理低时延与端到端系统实时性。 - 机器人大小脑分域、Hypervisor 隔离及 MCU 资源预算的实验指标是否可落地。 --------- Co-authored-by: Mo1s <1194302708@qq.com> Reviewed-on: #3 Co-authored-by: moyixin <15971501952@163.com>
3.6 KiB
3.6 KiB
量化与精度感知调度参考
1. 与本项目的关系
本方向不只比较 INT4/INT8/FP16 的速度,而是研究在不同任务紧迫度、资源预算和热状态下,能否选择满足质量门槛的最低成本精度,并保证切换过程不会破坏关键任务实时性。
2. 核心必引资料
| 资料 | 等级 | 可支撑内容 | 本项目使用方式 |
|---|---|---|---|
| E. Frantar et al., “GPTQ: Accurate Post-Training Quantization for Generative Pre-trained Transformers,” ICLR 2023. OpenReview | A | 基于近似二阶信息的低比特权重量化 | 作为 3/4-bit PTQ 方法基线 |
| G. Xiao et al., “SmoothQuant: Accurate and Efficient Post-Training Quantization for Large Language Models,” ICML 2023. PMLR | A | W8A8、激活离群值平滑、硬件效率 | 作为 INT8 权重—激活量化基线 |
| J. Lin et al., “AWQ: Activation-aware Weight Quantization for On-Device LLM Compression and Acceleration,” MLSys 2024. MLSys | A | 面向端侧的激活感知权重量化 | 对应 T5/T4/T3 设备端路线 |
| T. Dettmers et al., “LLM.int8(): 8-bit Matrix Multiplication for Transformers at Scale,” NeurIPS 2022. NeurIPS | A | 激活离群值与混合精度分解 | 支撑异常通道和精度保持讨论 |
| T. Dettmers et al., “QLoRA: Efficient Finetuning of Quantized LLMs,” NeurIPS 2023. NeurIPS | A | NF4、双重量化和分页优化器 | 主要用于背景;本项目若不训练,不作为主实验 |
| Z. Lin et al., “QServe: W4A8KV4 Quantization and System Co-design for Efficient LLM Serving,” MLSys 2025. MLSys | A | 权重、激活和 KV 联合低比特系统设计 | 支撑量化与内存/内核协同研究 |
3. 精度感知调度应补足的研究空白
现有量化论文通常回答“某种格式能否保持平均精度并加速推理”,但本项目还需要回答:
- 精度切换是否引起模型加载、重新编译、缓存失效或内存峰值;
- 动态切换期间关键保障负载是否出现尾延迟峰值;
- 低比特内核在目标 NPU/GPU 上是否真正加速,而非只有模型更小;
- 质量门槛、实时门槛和功耗门槛能否同时满足;
- 对不同风险等级请求,能否采用不同的可接受精度下限。
4. 建议实验矩阵
| 维度 | 建议取值 |
|---|---|
| 精度 | FP16/BF16、INT8、INT4;仅测试后端真实支持项 |
| 模型变量 | 同一模型修订、同一 tokenizer、同一输入与解码参数 |
| 质量 | 固定题集、perplexity/准确率/F1/任务判分、输出可用率 |
| 性能 | TTFT、TPOT、端到端时延、有效吞吐 |
| 系统 | 峰值内存、切换时间、能耗、温度、关键任务违约与尾延迟 |
| 调度 | 静态精度、基于 deadline 的精度、基于热/功耗预算的精度 |
5. 不应直接推出的结论
- 权重压缩比不能替代整机内存、速度或能效实测。
- perplexity 接近不等于所有任务质量和安全性等价。
- 不同量化后端的算子、校准和数值格式不同,通常只能视为整套软件栈比较。
- 动态精度调度若未测切换开销,不能宣称适合实时路径。