forked from eaiadmin/rtos_llm_opt
包含6个文件: - 总览:7条关键发现摘要 - 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架 - 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI - 学术文献:14篇论文/文章完整摘要和链接 - 关键研究空白:7个研究空白及与项目框架的对齐 - 文献索引:40+条文献完整列表
310 lines
10 KiB
Markdown
310 lines
10 KiB
Markdown
# 03-学术文献
|
||
|
||
## 一、RTOS + AI/Edge推理
|
||
|
||
### 论文1: RTOS内核在Edge AI上的实证对比
|
||
|
||
**标题**:Real-time Operating Systems (RTOS) For Edge AI
|
||
|
||
**作者**:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul
|
||
|
||
**机构**:中国西部师范大学 电子与信息工程系
|
||
|
||
**发表**:International Journal of Trends in Emerging Research and Development, 2025年6月
|
||
|
||
**链接**:[https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf)
|
||
|
||
**DOI**:10.5281/zenodo.16729307
|
||
|
||
**实验配置**:STM32H7平台,运行量化CNN
|
||
|
||
**核心结果**:
|
||
|
||
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|
||
|------|---------|--------|----------|---------|
|
||
| 内核大小 | 2KB | 30KB | 15KB | - |
|
||
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - |
|
||
| 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 |
|
||
|
||
**关键结论**:
|
||
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
|
||
- RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
|
||
- 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS
|
||
|
||
---
|
||
|
||
### 论文2: 嵌入式智能体模块化架构
|
||
|
||
**标题**:Toward a Modular Architecture for Embedded Agent Systems at the Edge
|
||
|
||
**作者**:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)
|
||
|
||
**发表**:arXiv:2606.02862, 2026年6月
|
||
|
||
**链接**:[https://arxiv.org/html/2606.02862](https://arxiv.org/html/2606.02862)
|
||
|
||
**核心贡献**:
|
||
- 提出嵌入式智能体模块化参考架构
|
||
- 两种Agent形态:
|
||
- **自治端侧Agent**:规则+高度压缩神经网络,低延迟隐私关键任务
|
||
- **云端增强Agent**:SLM进行高层推理和规划
|
||
- 跨域治理层(Governance Layer)保障可观测性、策略执行和安全
|
||
|
||
**关键需求**:
|
||
- 毫秒级响应延迟和确定性行为
|
||
- 本地感知-动作闭环无网络延迟
|
||
- 能量效率:嵌入式Agent需长期运行
|
||
|
||
**应用场景**:
|
||
- 智慧农业(系留式Agent)
|
||
- 预测性维护(混合模式)
|
||
- 隐私优先智能家居(自治式)
|
||
|
||
---
|
||
|
||
### 论文3: AI辅助工程化方法
|
||
|
||
**标题**:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现
|
||
|
||
**作者**:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)
|
||
|
||
**发表**:电信科技, 2026年5月
|
||
|
||
**链接**:[https://pdf.hanspub.org/etis_1380065.pdf](https://pdf.hanspub.org/etis_1380065.pdf)
|
||
|
||
**核心方法**:
|
||
- 面向Zephyr RTOS的"三文件"提示策略:
|
||
- 硬件覆盖文件 (.overlay/.dts)
|
||
- 项目配置文件 (prj.conf)
|
||
- 主程序文件 (main.c)
|
||
|
||
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
|
||
|
||
**应用场景**:预测性维护、工业AIoT
|
||
|
||
---
|
||
|
||
## 二、Edge LLM推理
|
||
|
||
### 论文4: 端侧LLM推理框架对比
|
||
|
||
**标题**:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM
|
||
|
||
**作者**:Edge AI Stack
|
||
|
||
**发表**:2026年7月
|
||
|
||
**链接**:[https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
|
||
|
||
**对比维度**:7大运行时框架的硬件适配、吞吐量、量化支持
|
||
|
||
**关键发现**:
|
||
- 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
|
||
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
|
||
- KV cache管理是生产部署成败关键
|
||
|
||
---
|
||
|
||
### 论文5: 移动端NPU推理持续负载评测
|
||
|
||
**标题**:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
|
||
|
||
**作者**:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)
|
||
|
||
**发表**:arXiv:2603.23640, 2026年6月
|
||
|
||
**链接**:[https://arxiv.org/html/2603.23640v2](https://arxiv.org/html/2603.23640v2)
|
||
|
||
**实验配置**:Qwen 2.5 1.5B (4-bit量化)
|
||
|
||
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|
||
|------|---------|------|---------|
|
||
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
|
||
| iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% |
|
||
| S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% |
|
||
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
|
||
|
||
**核心结论**:
|
||
- 移动端热管理是比峰值算力更主要的约束
|
||
- iPhone 16 Pro在3次迭代后进入"热态"平台期
|
||
- 专用NPU在能量效率上匹配GPU(19倍低功耗)
|
||
|
||
---
|
||
|
||
### 论文6: 边缘LLM推理综述
|
||
|
||
**标题**:Efficient Inference for Edge Large Language Models: A Survey
|
||
|
||
**作者**:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang
|
||
|
||
**发表**:Science China Information Sciences / Tsinghua Science and Technology, 2025年
|
||
|
||
**链接**:[https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf)
|
||
|
||
**两大运行时优化策略**:
|
||
- **推测解码(Speculative Decoding)**:小模型提议候选token,大模型并行验证
|
||
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘,低频部分放服务器/云端
|
||
|
||
---
|
||
|
||
### 论文7: 边缘中心生成式AI综述
|
||
|
||
**标题**:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments
|
||
|
||
**作者**:Rui Huang (独立研究员)
|
||
|
||
**发表**:Journal of Computer and Communications, 14(4), 238-253, 2026年4月
|
||
|
||
**链接**:[https://content.scirp.org/pdf/jcc_1733489.pdf](https://content.scirp.org/pdf/jcc_1733489.pdf)
|
||
|
||
**核心框架**:
|
||
- 定义"推理调度"为计算图到处理器的映射函数
|
||
- 目标:在功率约束下最小化总延迟
|
||
- 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡
|
||
|
||
**设备分类**:
|
||
- 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
|
||
- 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
|
||
- 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP
|
||
|
||
---
|
||
|
||
## 三、LLM调度系统
|
||
|
||
### 论文8: 异构SoC上的Agent调度
|
||
|
||
**标题**:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
|
||
|
||
**作者**:Xinming Wei, Jiahao Zhang, Haoran Li等
|
||
|
||
**机构**:北京大学 多媒体信息处理国家重点实验室 / 香港大学
|
||
|
||
**发表**:arXiv:2506.24045, 2026年1月
|
||
|
||
**链接**:[https://arxiv.org/html/2506.24045v2](https://arxiv.org/html/2506.24045v2)
|
||
|
||
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式
|
||
|
||
**技术方案**:
|
||
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性
|
||
- **流感知NPU-iGPU协同**:解耦prefill和decode
|
||
- **细粒度抢占**:slack-aware piggybacking
|
||
|
||
**性能提升**:
|
||
- 主动式吞吐提升1.2-4.9倍
|
||
- 响应式延迟降低≥91%
|
||
|
||
---
|
||
|
||
### 论文9: LLM推理调度综述
|
||
|
||
**标题**:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs
|
||
|
||
**作者**:华为技术团队 (Yong Zhang, Zhenan Fan等)
|
||
|
||
**发表**:TechRxiv, 2025年11月
|
||
|
||
**链接**:[https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true)
|
||
|
||
**覆盖方向**:
|
||
- 控制平面和数据平面的调度策略
|
||
- 冷启动延迟、HOL阻塞、资源利用率
|
||
- 强化学习调度、自适应批处理、推测执行
|
||
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
|
||
|
||
---
|
||
|
||
## 四、端侧AI框架(华为鸿蒙)
|
||
|
||
### 论文10: 鸿蒙端侧AI推理
|
||
|
||
**标题**:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解
|
||
|
||
**作者**:CSDN博主 zq18
|
||
|
||
**发表**:博客园, 2026年
|
||
|
||
**链接**:[https://www.cnblogs.com/zq18/p/19263508](https://www.cnblogs.com/zq18/p/19263508)
|
||
|
||
**三大压缩技术对比**:
|
||
|
||
| 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 |
|
||
|------|---------|---------|---------|---------|
|
||
| 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 |
|
||
| 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 |
|
||
| 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 |
|
||
|
||
**HarmonyOS推荐**:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝
|
||
|
||
---
|
||
|
||
### 论文11: 鸿蒙AI框架集成
|
||
|
||
**标题**:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化
|
||
|
||
**作者**:bug菌
|
||
|
||
**发表**:华为云社区, 2025年11月
|
||
|
||
**链接**:[https://bbs.huaweicloud.cn/blogs/467036](https://bbs.huaweicloud.cn/blogs/467036)
|
||
|
||
**核心内容**:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧
|
||
|
||
---
|
||
|
||
### 论文12: 端侧AI框架让智能真正贴身随行
|
||
|
||
**标题**:端侧 AI 框架让智能真正贴身随行
|
||
|
||
**作者**:佩臻(华为开发者联盟)
|
||
|
||
**发表**:华为开发者联盟, 2026年1月
|
||
|
||
**链接**:[https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)
|
||
|
||
**关键数据**:
|
||
- 鸿蒙端侧AI已支持超200种预置模型
|
||
- 覆盖图像、语音、文本、传感器四大类
|
||
- 开放Model Zoo供开发者一键集成
|
||
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
|
||
|
||
---
|
||
|
||
## 五、物理AI与机器人
|
||
|
||
### 论文13: 物理AI机器人革命
|
||
|
||
**标题**:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026
|
||
|
||
**作者**:Arjun Mehta
|
||
|
||
**发表**:JustLast.in, 2026年7月
|
||
|
||
**链接**:[https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/)
|
||
|
||
**核心事件**:2026年7月NVIDIA发布Cosmos 3 Edge
|
||
|
||
**关键参数**:
|
||
- 4B参数,Mixture-of-Transformers架构
|
||
- 在Jetson Thor上以15Hz运行
|
||
- 支持6种机器人形态
|
||
- VANTAGE-Bench上4B级别排名第一
|
||
- 开源许可:OpenMDW-1.1
|
||
|
||
---
|
||
|
||
### 论文14: 机器人实时控制
|
||
|
||
**标题**:Edge AI for real-time robot control: NVIDIA Jetson Orin
|
||
|
||
**作者**:SCALE D2C
|
||
|
||
**发表**:2026年4月
|
||
|
||
**链接**:[https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html)
|
||
|
||
**核心数据**:
|
||
- AGX Orin:275 TOPS,15-60W
|
||
- 边缘推理<1ms vs 云端往返50-200ms
|
||
- 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim
|