Files
eaiadmin ccf72e32bd add industry research survey on RTOS+LLM+Agent competitors
包含6个文件:
- 总览:7条关键发现摘要
- 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架
- 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI
- 学术文献:14篇论文/文章完整摘要和链接
- 关键研究空白:7个研究空白及与项目框架的对齐
- 文献索引:40+条文献完整列表
2026-09-23 03:12:03 +08:00

10 KiB
Raw Permalink Blame History

03-学术文献

一、RTOS + AI/Edge推理

论文1: RTOS内核在Edge AI上的实证对比

标题:Real-time Operating Systems (RTOS) For Edge AI

作者:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul

机构:中国西部师范大学 电子与信息工程系

发表:International Journal of Trends in Emerging Research and Development, 2025年6月

链接:https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf

DOI:10.5281/zenodo.16729307

实验配置:STM32H7平台,运行量化CNN

核心结果:

指标 ThreadX Zephyr FreeRTOS VxWorks
内核大小 2KB 30KB 15KB -
推理响应延迟 11.7ms 12.3ms 13.8ms -
成熟度评分 4/4 3/4 2/4 4/4

关键结论:

  • AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
  • RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
  • 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS

论文2: 嵌入式智能体模块化架构

标题:Toward a Modular Architecture for Embedded Agent Systems at the Edge

作者:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)

发表:arXiv:2606.02862, 2026年6月

链接:https://arxiv.org/html/2606.02862

核心贡献:

  • 提出嵌入式智能体模块化参考架构
  • 两种Agent形态:
    • 自治端侧Agent:规则+高度压缩神经网络,低延迟隐私关键任务
    • 云端增强Agent:SLM进行高层推理和规划
  • 跨域治理层(Governance Layer)保障可观测性、策略执行和安全

关键需求:

  • 毫秒级响应延迟和确定性行为
  • 本地感知-动作闭环无网络延迟
  • 能量效率:嵌入式Agent需长期运行

应用场景:

  • 智慧农业(系留式Agent)
  • 预测性维护(混合模式)
  • 隐私优先智能家居(自治式)

论文3: AI辅助工程化方法

标题:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现

作者:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)

发表:电信科技, 2026年5月

链接:https://pdf.hanspub.org/etis_1380065.pdf

核心方法:

  • 面向Zephyr RTOS的"三文件"提示策略:
    • 硬件覆盖文件 (.overlay/.dts)
    • 项目配置文件 (prj.conf)
    • 主程序文件 (main.c)

参考实现:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)

应用场景:预测性维护、工业AIoT


二、Edge LLM推理

论文4: 端侧LLM推理框架对比

标题:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM

作者:Edge AI Stack

发表:2026年7月

链接:https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/

对比维度:7大运行时框架的硬件适配、吞吐量、量化支持

关键发现:

  • 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
  • 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
  • KV cache管理是生产部署成败关键

论文5: 移动端NPU推理持续负载评测

标题:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load

作者:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)

发表:arXiv:2603.23640, 2026年6月

链接:https://arxiv.org/html/2603.23640v2

实验配置:Qwen 2.5 1.5B (4-bit量化)

平台 持续吞吐 功耗 关键约束
RTX 4050 131.7 tok/s 34.1W 电池功率上限
iPhone 16 Pro 23.7 tok/s - 3次迭代后降额40%
S24 Ultra 10 tok/s - 20次迭代后降额~15%
Pi 5 + Hailo-10H 6.9 tok/s <2W 模块内存带宽

核心结论:

  • 移动端热管理是比峰值算力更主要的约束
  • iPhone 16 Pro在3次迭代后进入"热态"平台期
  • 专用NPU在能量效率上匹配GPU(19倍低功耗)

论文6: 边缘LLM推理综述

标题:Efficient Inference for Edge Large Language Models: A Survey

作者:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang

发表:Science China Information Sciences / Tsinghua Science and Technology, 2025年

链接:https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf

两大运行时优化策略:

  • 推测解码(Speculative Decoding):小模型提议候选token,大模型并行验证
  • 模型卸载(Model Offloading):战略分区LLM,高频组件放边缘,低频部分放服务器/云端

论文7: 边缘中心生成式AI综述

标题:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments

作者:Rui Huang (独立研究员)

发表:Journal of Computer and Communications, 14(4), 238-253, 2026年4月

链接:https://content.scirp.org/pdf/jcc_1733489.pdf

核心框架:

  • 定义"推理调度"为计算图到处理器的映射函数
  • 目标:在功率约束下最小化总延迟
  • 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡

设备分类:

  • 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
  • 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
  • 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP

三、LLM调度系统

论文8: 异构SoC上的Agent调度

标题:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC

作者:Xinming Wei, Jiahao Zhang, Haoran Li等

机构:北京大学 多媒体信息处理国家重点实验室 / 香港大学

发表:arXiv:2506.24045, 2026年1月

链接:https://arxiv.org/html/2506.24045v2

核心问题:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式

技术方案:

  • HEG(异构执行图):捕获NPU/iGPU亲和性
  • 流感知NPU-iGPU协同:解耦prefill和decode
  • 细粒度抢占:slack-aware piggybacking

性能提升:

  • 主动式吞吐提升1.2-4.9倍
  • 响应式延迟降低≥91%

论文9: LLM推理调度综述

标题:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs

作者:华为技术团队 (Yong Zhang, Zhenan Fan等)

发表:TechRxiv, 2025年11月

链接:https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true

覆盖方向:

  • 控制平面和数据平面的调度策略
  • 冷启动延迟、HOL阻塞、资源利用率
  • 强化学习调度、自适应批处理、推测执行
  • 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用

四、端侧AI框架(华为鸿蒙)

论文10: 鸿蒙端侧AI推理

标题:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解

作者:CSDN博主 zq18

发表:博客园, 2026年

链接:https://www.cnblogs.com/zq18/p/19263508

三大压缩技术对比:

技术 核心思想 压缩效果 精度损失 适用阶段
剪枝 移除冗余参数 30-70% 3-10% 训练后/微调
量化 降低数值精度 40-60% 1-5% 训练后/感知训练
知识蒸馏 知识迁移 50-80% 2-8% 训练阶段

HarmonyOS推荐:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝


论文11: 鸿蒙AI框架集成

标题:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化

作者:bug菌

发表:华为云社区, 2025年11月

链接:https://bbs.huaweicloud.cn/blogs/467036

核心内容:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧


论文12: 端侧AI框架让智能真正贴身随行

标题:端侧 AI 框架让智能真正贴身随行

作者:佩臻(华为开发者联盟)

发表:华为开发者联盟, 2026年1月

链接:https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385

关键数据:

  • 鸿蒙端侧AI已支持超200种预置模型
  • 覆盖图像、语音、文本、传感器四大类
  • 开放Model Zoo供开发者一键集成
  • 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%

五、物理AI与机器人

论文13: 物理AI机器人革命

标题:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026

作者:Arjun Mehta

发表:JustLast.in, 2026年7月

链接:https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/

核心事件:2026年7月NVIDIA发布Cosmos 3 Edge

关键参数:

  • 4B参数,Mixture-of-Transformers架构
  • 在Jetson Thor上以15Hz运行
  • 支持6种机器人形态
  • VANTAGE-Bench上4B级别排名第一
  • 开源许可:OpenMDW-1.1

论文14: 机器人实时控制

标题:Edge AI for real-time robot control: NVIDIA Jetson Orin

作者:SCALE D2C

发表:2026年4月

链接:https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html

核心数据:

  • AGX Orin:275 TOPS,15-60W
  • 边缘推理<1ms vs 云端往返50-200ms
  • 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim