包含6个文件: - 总览:7条关键发现摘要 - 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架 - 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI - 学术文献:14篇论文/文章完整摘要和链接 - 关键研究空白:7个研究空白及与项目框架的对齐 - 文献索引:40+条文献完整列表
10 KiB
03-学术文献
一、RTOS + AI/Edge推理
论文1: RTOS内核在Edge AI上的实证对比
标题:Real-time Operating Systems (RTOS) For Edge AI
作者:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul
机构:中国西部师范大学 电子与信息工程系
发表:International Journal of Trends in Emerging Research and Development, 2025年6月
链接:https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf
DOI:10.5281/zenodo.16729307
实验配置:STM32H7平台,运行量化CNN
核心结果:
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|---|---|---|---|---|
| 内核大小 | 2KB | 30KB | 15KB | - |
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - |
| 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 |
关键结论:
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
- RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
- 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS
论文2: 嵌入式智能体模块化架构
标题:Toward a Modular Architecture for Embedded Agent Systems at the Edge
作者:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)
发表:arXiv:2606.02862, 2026年6月
链接:https://arxiv.org/html/2606.02862
核心贡献:
- 提出嵌入式智能体模块化参考架构
- 两种Agent形态:
- 自治端侧Agent:规则+高度压缩神经网络,低延迟隐私关键任务
- 云端增强Agent:SLM进行高层推理和规划
- 跨域治理层(Governance Layer)保障可观测性、策略执行和安全
关键需求:
- 毫秒级响应延迟和确定性行为
- 本地感知-动作闭环无网络延迟
- 能量效率:嵌入式Agent需长期运行
应用场景:
- 智慧农业(系留式Agent)
- 预测性维护(混合模式)
- 隐私优先智能家居(自治式)
论文3: AI辅助工程化方法
标题:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现
作者:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)
发表:电信科技, 2026年5月
链接:https://pdf.hanspub.org/etis_1380065.pdf
核心方法:
- 面向Zephyr RTOS的"三文件"提示策略:
- 硬件覆盖文件 (.overlay/.dts)
- 项目配置文件 (prj.conf)
- 主程序文件 (main.c)
参考实现:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
应用场景:预测性维护、工业AIoT
二、Edge LLM推理
论文4: 端侧LLM推理框架对比
标题:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM
作者:Edge AI Stack
发表:2026年7月
链接:https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/
对比维度:7大运行时框架的硬件适配、吞吐量、量化支持
关键发现:
- 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
- KV cache管理是生产部署成败关键
论文5: 移动端NPU推理持续负载评测
标题:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
作者:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)
发表:arXiv:2603.23640, 2026年6月
链接:https://arxiv.org/html/2603.23640v2
实验配置:Qwen 2.5 1.5B (4-bit量化)
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|---|---|---|---|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
| iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% |
| S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% |
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
核心结论:
- 移动端热管理是比峰值算力更主要的约束
- iPhone 16 Pro在3次迭代后进入"热态"平台期
- 专用NPU在能量效率上匹配GPU(19倍低功耗)
论文6: 边缘LLM推理综述
标题:Efficient Inference for Edge Large Language Models: A Survey
作者:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang
发表:Science China Information Sciences / Tsinghua Science and Technology, 2025年
链接:https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf
两大运行时优化策略:
- 推测解码(Speculative Decoding):小模型提议候选token,大模型并行验证
- 模型卸载(Model Offloading):战略分区LLM,高频组件放边缘,低频部分放服务器/云端
论文7: 边缘中心生成式AI综述
标题:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments
作者:Rui Huang (独立研究员)
发表:Journal of Computer and Communications, 14(4), 238-253, 2026年4月
链接:https://content.scirp.org/pdf/jcc_1733489.pdf
核心框架:
- 定义"推理调度"为计算图到处理器的映射函数
- 目标:在功率约束下最小化总延迟
- 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡
设备分类:
- 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
- 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
- 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP
三、LLM调度系统
论文8: 异构SoC上的Agent调度
标题:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
作者:Xinming Wei, Jiahao Zhang, Haoran Li等
机构:北京大学 多媒体信息处理国家重点实验室 / 香港大学
发表:arXiv:2506.24045, 2026年1月
链接:https://arxiv.org/html/2506.24045v2
核心问题:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式
技术方案:
- HEG(异构执行图):捕获NPU/iGPU亲和性
- 流感知NPU-iGPU协同:解耦prefill和decode
- 细粒度抢占:slack-aware piggybacking
性能提升:
- 主动式吞吐提升1.2-4.9倍
- 响应式延迟降低≥91%
论文9: LLM推理调度综述
标题:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs
作者:华为技术团队 (Yong Zhang, Zhenan Fan等)
发表:TechRxiv, 2025年11月
链接:https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true
覆盖方向:
- 控制平面和数据平面的调度策略
- 冷启动延迟、HOL阻塞、资源利用率
- 强化学习调度、自适应批处理、推测执行
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
四、端侧AI框架(华为鸿蒙)
论文10: 鸿蒙端侧AI推理
标题:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解
作者:CSDN博主 zq18
发表:博客园, 2026年
链接:https://www.cnblogs.com/zq18/p/19263508
三大压缩技术对比:
| 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 |
|---|---|---|---|---|
| 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 |
| 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 |
| 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 |
HarmonyOS推荐:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝
论文11: 鸿蒙AI框架集成
标题:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化
作者:bug菌
发表:华为云社区, 2025年11月
链接:https://bbs.huaweicloud.cn/blogs/467036
核心内容:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧
论文12: 端侧AI框架让智能真正贴身随行
标题:端侧 AI 框架让智能真正贴身随行
作者:佩臻(华为开发者联盟)
发表:华为开发者联盟, 2026年1月
链接:https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385
关键数据:
- 鸿蒙端侧AI已支持超200种预置模型
- 覆盖图像、语音、文本、传感器四大类
- 开放Model Zoo供开发者一键集成
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
五、物理AI与机器人
论文13: 物理AI机器人革命
标题:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026
作者:Arjun Mehta
发表:JustLast.in, 2026年7月
核心事件:2026年7月NVIDIA发布Cosmos 3 Edge
关键参数:
- 4B参数,Mixture-of-Transformers架构
- 在Jetson Thor上以15Hz运行
- 支持6种机器人形态
- VANTAGE-Bench上4B级别排名第一
- 开源许可:OpenMDW-1.1
论文14: 机器人实时控制
标题:Edge AI for real-time robot control: NVIDIA Jetson Orin
作者:SCALE D2C
发表:2026年4月
核心数据:
- AGX Orin:275 TOPS,15-60W
- 边缘推理<1ms vs 云端往返50-200ms
- 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim