# 03-学术文献 ## 一、RTOS + AI/Edge推理 ### 论文1: RTOS内核在Edge AI上的实证对比 **标题**:Real-time Operating Systems (RTOS) For Edge AI **作者**:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul **机构**:中国西部师范大学 电子与信息工程系 **发表**:International Journal of Trends in Emerging Research and Development, 2025年6月 **链接**:[https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) **DOI**:10.5281/zenodo.16729307 **实验配置**:STM32H7平台,运行量化CNN **核心结果**: | 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks | |------|---------|--------|----------|---------| | 内核大小 | 2KB | 30KB | 15KB | - | | 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - | | 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 | **关键结论**: - AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延 - RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作 - 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS --- ### 论文2: 嵌入式智能体模块化架构 **标题**:Toward a Modular Architecture for Embedded Agent Systems at the Edge **作者**:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting) **发表**:arXiv:2606.02862, 2026年6月 **链接**:[https://arxiv.org/html/2606.02862](https://arxiv.org/html/2606.02862) **核心贡献**: - 提出嵌入式智能体模块化参考架构 - 两种Agent形态: - **自治端侧Agent**:规则+高度压缩神经网络,低延迟隐私关键任务 - **云端增强Agent**:SLM进行高层推理和规划 - 跨域治理层(Governance Layer)保障可观测性、策略执行和安全 **关键需求**: - 毫秒级响应延迟和确定性行为 - 本地感知-动作闭环无网络延迟 - 能量效率:嵌入式Agent需长期运行 **应用场景**: - 智慧农业(系留式Agent) - 预测性维护(混合模式) - 隐私优先智能家居(自治式) --- ### 论文3: AI辅助工程化方法 **标题**:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现 **作者**:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司) **发表**:电信科技, 2026年5月 **链接**:[https://pdf.hanspub.org/etis_1380065.pdf](https://pdf.hanspub.org/etis_1380065.pdf) **核心方法**: - 面向Zephyr RTOS的"三文件"提示策略: - 硬件覆盖文件 (.overlay/.dts) - 项目配置文件 (prj.conf) - 主程序文件 (main.c) **参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard) **应用场景**:预测性维护、工业AIoT --- ## 二、Edge LLM推理 ### 论文4: 端侧LLM推理框架对比 **标题**:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM **作者**:Edge AI Stack **发表**:2026年7月 **链接**:[https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) **对比维度**:7大运行时框架的硬件适配、吞吐量、量化支持 **关键发现**: - 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍 - 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell - KV cache管理是生产部署成败关键 --- ### 论文5: 移动端NPU推理持续负载评测 **标题**:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load **作者**:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines) **发表**:arXiv:2603.23640, 2026年6月 **链接**:[https://arxiv.org/html/2603.23640v2](https://arxiv.org/html/2603.23640v2) **实验配置**:Qwen 2.5 1.5B (4-bit量化) | 平台 | 持续吞吐 | 功耗 | 关键约束 | |------|---------|------|---------| | RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 | | iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% | | S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% | | Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 | **核心结论**: - 移动端热管理是比峰值算力更主要的约束 - iPhone 16 Pro在3次迭代后进入"热态"平台期 - 专用NPU在能量效率上匹配GPU(19倍低功耗) --- ### 论文6: 边缘LLM推理综述 **标题**:Efficient Inference for Edge Large Language Models: A Survey **作者**:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang **发表**:Science China Information Sciences / Tsinghua Science and Technology, 2025年 **链接**:[https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) **两大运行时优化策略**: - **推测解码(Speculative Decoding)**:小模型提议候选token,大模型并行验证 - **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘,低频部分放服务器/云端 --- ### 论文7: 边缘中心生成式AI综述 **标题**:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments **作者**:Rui Huang (独立研究员) **发表**:Journal of Computer and Communications, 14(4), 238-253, 2026年4月 **链接**:[https://content.scirp.org/pdf/jcc_1733489.pdf](https://content.scirp.org/pdf/jcc_1733489.pdf) **核心框架**: - 定义"推理调度"为计算图到处理器的映射函数 - 目标:在功率约束下最小化总延迟 - 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡 **设备分类**: - 智能手机/平板:6-12GB LPDDR5, 4-8W TDP - 可穿戴设备:<2W TDP, 皮肤温度上限~42°C - 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP --- ## 三、LLM调度系统 ### 论文8: 异构SoC上的Agent调度 **标题**:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC **作者**:Xinming Wei, Jiahao Zhang, Haoran Li等 **机构**:北京大学 多媒体信息处理国家重点实验室 / 香港大学 **发表**:arXiv:2506.24045, 2026年1月 **链接**:[https://arxiv.org/html/2506.24045v2](https://arxiv.org/html/2506.24045v2) **核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式 **技术方案**: - **HEG(异构执行图)**:捕获NPU/iGPU亲和性 - **流感知NPU-iGPU协同**:解耦prefill和decode - **细粒度抢占**:slack-aware piggybacking **性能提升**: - 主动式吞吐提升1.2-4.9倍 - 响应式延迟降低≥91% --- ### 论文9: LLM推理调度综述 **标题**:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs **作者**:华为技术团队 (Yong Zhang, Zhenan Fan等) **发表**:TechRxiv, 2025年11月 **链接**:[https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) **覆盖方向**: - 控制平面和数据平面的调度策略 - 冷启动延迟、HOL阻塞、资源利用率 - 强化学习调度、自适应批处理、推测执行 - 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用 --- ## 四、端侧AI框架(华为鸿蒙) ### 论文10: 鸿蒙端侧AI推理 **标题**:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解 **作者**:CSDN博主 zq18 **发表**:博客园, 2026年 **链接**:[https://www.cnblogs.com/zq18/p/19263508](https://www.cnblogs.com/zq18/p/19263508) **三大压缩技术对比**: | 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 | |------|---------|---------|---------|---------| | 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 | | 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 | | 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 | **HarmonyOS推荐**:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝 --- ### 论文11: 鸿蒙AI框架集成 **标题**:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化 **作者**:bug菌 **发表**:华为云社区, 2025年11月 **链接**:[https://bbs.huaweicloud.cn/blogs/467036](https://bbs.huaweicloud.cn/blogs/467036) **核心内容**:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧 --- ### 论文12: 端侧AI框架让智能真正贴身随行 **标题**:端侧 AI 框架让智能真正贴身随行 **作者**:佩臻(华为开发者联盟) **发表**:华为开发者联盟, 2026年1月 **链接**:[https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385) **关键数据**: - 鸿蒙端侧AI已支持超200种预置模型 - 覆盖图像、语音、文本、传感器四大类 - 开放Model Zoo供开发者一键集成 - 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40% --- ## 五、物理AI与机器人 ### 论文13: 物理AI机器人革命 **标题**:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026 **作者**:Arjun Mehta **发表**:JustLast.in, 2026年7月 **链接**:[https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) **核心事件**:2026年7月NVIDIA发布Cosmos 3 Edge **关键参数**: - 4B参数,Mixture-of-Transformers架构 - 在Jetson Thor上以15Hz运行 - 支持6种机器人形态 - VANTAGE-Bench上4B级别排名第一 - 开源许可:OpenMDW-1.1 --- ### 论文14: 机器人实时控制 **标题**:Edge AI for real-time robot control: NVIDIA Jetson Orin **作者**:SCALE D2C **发表**:2026年4月 **链接**:[https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) **核心数据**: - AGX Orin:275 TOPS,15-60W - 边缘推理<1ms vs 云端往返50-200ms - 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim