Files
rtos_llm_opt/02-项目框架/03-同行研究情况调研/03-学术文献.md
T
eaiadmin ccf72e32bd add industry research survey on RTOS+LLM+Agent competitors
包含6个文件:
- 总览:7条关键发现摘要
- 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架
- 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI
- 学术文献:14篇论文/文章完整摘要和链接
- 关键研究空白:7个研究空白及与项目框架的对齐
- 文献索引:40+条文献完整列表
2026-09-23 03:12:03 +08:00

310 lines
10 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 03-学术文献
## 一、RTOS + AI/Edge推理
### 论文1: RTOS内核在Edge AI上的实证对比
**标题**:Real-time Operating Systems (RTOS) For Edge AI
**作者**:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul
**机构**:中国西部师范大学 电子与信息工程系
**发表**:International Journal of Trends in Emerging Research and Development, 2025年6月
**链接**:[https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf)
**DOI**:10.5281/zenodo.16729307
**实验配置**:STM32H7平台,运行量化CNN
**核心结果**:
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|------|---------|--------|----------|---------|
| 内核大小 | 2KB | 30KB | 15KB | - |
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - |
| 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 |
**关键结论**:
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
- RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
- 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS
---
### 论文2: 嵌入式智能体模块化架构
**标题**:Toward a Modular Architecture for Embedded Agent Systems at the Edge
**作者**:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)
**发表**:arXiv:2606.02862, 2026年6月
**链接**:[https://arxiv.org/html/2606.02862](https://arxiv.org/html/2606.02862)
**核心贡献**:
- 提出嵌入式智能体模块化参考架构
- 两种Agent形态:
- **自治端侧Agent**:规则+高度压缩神经网络,低延迟隐私关键任务
- **云端增强Agent**:SLM进行高层推理和规划
- 跨域治理层(Governance Layer)保障可观测性、策略执行和安全
**关键需求**:
- 毫秒级响应延迟和确定性行为
- 本地感知-动作闭环无网络延迟
- 能量效率:嵌入式Agent需长期运行
**应用场景**:
- 智慧农业(系留式Agent)
- 预测性维护(混合模式)
- 隐私优先智能家居(自治式)
---
### 论文3: AI辅助工程化方法
**标题**:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现
**作者**:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)
**发表**:电信科技, 2026年5月
**链接**:[https://pdf.hanspub.org/etis_1380065.pdf](https://pdf.hanspub.org/etis_1380065.pdf)
**核心方法**:
- 面向Zephyr RTOS的"三文件"提示策略:
- 硬件覆盖文件 (.overlay/.dts)
- 项目配置文件 (prj.conf)
- 主程序文件 (main.c)
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
**应用场景**:预测性维护、工业AIoT
---
## 二、Edge LLM推理
### 论文4: 端侧LLM推理框架对比
**标题**:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM
**作者**:Edge AI Stack
**发表**:2026年7月
**链接**:[https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
**对比维度**:7大运行时框架的硬件适配、吞吐量、量化支持
**关键发现**:
- 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
- KV cache管理是生产部署成败关键
---
### 论文5: 移动端NPU推理持续负载评测
**标题**:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
**作者**:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)
**发表**:arXiv:2603.23640, 2026年6月
**链接**:[https://arxiv.org/html/2603.23640v2](https://arxiv.org/html/2603.23640v2)
**实验配置**:Qwen 2.5 1.5B (4-bit量化)
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|------|---------|------|---------|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
| iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% |
| S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% |
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
**核心结论**:
- 移动端热管理是比峰值算力更主要的约束
- iPhone 16 Pro在3次迭代后进入"热态"平台期
- 专用NPU在能量效率上匹配GPU(19倍低功耗)
---
### 论文6: 边缘LLM推理综述
**标题**:Efficient Inference for Edge Large Language Models: A Survey
**作者**:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang
**发表**:Science China Information Sciences / Tsinghua Science and Technology, 2025年
**链接**:[https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf)
**两大运行时优化策略**:
- **推测解码(Speculative Decoding)**:小模型提议候选token,大模型并行验证
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘,低频部分放服务器/云端
---
### 论文7: 边缘中心生成式AI综述
**标题**:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments
**作者**:Rui Huang (独立研究员)
**发表**:Journal of Computer and Communications, 14(4), 238-253, 2026年4月
**链接**:[https://content.scirp.org/pdf/jcc_1733489.pdf](https://content.scirp.org/pdf/jcc_1733489.pdf)
**核心框架**:
- 定义"推理调度"为计算图到处理器的映射函数
- 目标:在功率约束下最小化总延迟
- 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡
**设备分类**:
- 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
- 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
- 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP
---
## 三、LLM调度系统
### 论文8: 异构SoC上的Agent调度
**标题**:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
**作者**:Xinming Wei, Jiahao Zhang, Haoran Li等
**机构**:北京大学 多媒体信息处理国家重点实验室 / 香港大学
**发表**:arXiv:2506.24045, 2026年1月
**链接**:[https://arxiv.org/html/2506.24045v2](https://arxiv.org/html/2506.24045v2)
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式
**技术方案**:
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性
- **流感知NPU-iGPU协同**:解耦prefill和decode
- **细粒度抢占**:slack-aware piggybacking
**性能提升**:
- 主动式吞吐提升1.2-4.9倍
- 响应式延迟降低≥91%
---
### 论文9: LLM推理调度综述
**标题**:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs
**作者**:华为技术团队 (Yong Zhang, Zhenan Fan等)
**发表**:TechRxiv, 2025年11月
**链接**:[https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true)
**覆盖方向**:
- 控制平面和数据平面的调度策略
- 冷启动延迟、HOL阻塞、资源利用率
- 强化学习调度、自适应批处理、推测执行
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
---
## 四、端侧AI框架(华为鸿蒙)
### 论文10: 鸿蒙端侧AI推理
**标题**:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解
**作者**:CSDN博主 zq18
**发表**:博客园, 2026年
**链接**:[https://www.cnblogs.com/zq18/p/19263508](https://www.cnblogs.com/zq18/p/19263508)
**三大压缩技术对比**:
| 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 |
|------|---------|---------|---------|---------|
| 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 |
| 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 |
| 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 |
**HarmonyOS推荐**:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝
---
### 论文11: 鸿蒙AI框架集成
**标题**:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化
**作者**:bug菌
**发表**:华为云社区, 2025年11月
**链接**:[https://bbs.huaweicloud.cn/blogs/467036](https://bbs.huaweicloud.cn/blogs/467036)
**核心内容**:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧
---
### 论文12: 端侧AI框架让智能真正贴身随行
**标题**:端侧 AI 框架让智能真正贴身随行
**作者**:佩臻(华为开发者联盟)
**发表**:华为开发者联盟, 2026年1月
**链接**:[https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)
**关键数据**:
- 鸿蒙端侧AI已支持超200种预置模型
- 覆盖图像、语音、文本、传感器四大类
- 开放Model Zoo供开发者一键集成
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
---
## 五、物理AI与机器人
### 论文13: 物理AI机器人革命
**标题**:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026
**作者**:Arjun Mehta
**发表**:JustLast.in, 2026年7月
**链接**:[https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/)
**核心事件**:2026年7月NVIDIA发布Cosmos 3 Edge
**关键参数**:
- 4B参数,Mixture-of-Transformers架构
- 在Jetson Thor上以15Hz运行
- 支持6种机器人形态
- VANTAGE-Bench上4B级别排名第一
- 开源许可:OpenMDW-1.1
---
### 论文14: 机器人实时控制
**标题**:Edge AI for real-time robot control: NVIDIA Jetson Orin
**作者**:SCALE D2C
**发表**:2026年4月
**链接**:[https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html)
**核心数据**:
- AGX Orin:275 TOPS,15-60W
- 边缘推理<1ms vs 云端往返50-200ms
- 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim