包含6个文件: - 总览:7条关键发现摘要 - 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架 - 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI - 学术文献:14篇论文/文章完整摘要和链接 - 关键研究空白:7个研究空白及与项目框架的对齐 - 文献索引:40+条文献完整列表
14 KiB
02-国际同行
一、国际RTOS厂商
1. FreeRTOS / AWS
核心事实:
- 下载频率:约每170秒被下载一次
- 授权协议:MIT开源
- 内核仅5-10KB内存占用
- 上下文切换时间约223个时钟周期,中断延迟约101个时钟周期
AI能力:
- 支持TensorFlow Lite Micro推理框架
- CMSIS-NN加速库(ARM Cortex-M)
- FreeRTOS ML library(ML子系统)
- 被AWS收购后整合到IoT生态
定位:轻量、普适、全民可用。适合跑量为主、追求上手快、生态资料多的场景。
2. Zephyr RTOS / Linux基金会
核心事实:
- 授权协议:Apache 2.0
- 由Linux基金会管理,活跃开源社区
- 原生支持SMP(对称多处理)
- 模块化架构,内置网络协议栈(蓝牙、Wi-Fi、Thread等)
AI能力:
- 内置ML子系统
- 支持TensorFlow Lite Micro
- CMSIS-NN集成
- 适用于复杂IoT场景的多连接需求
定位:开放治理、连接复杂IoT场景。适合多连接复杂IoT设备、长期演进迭代。
3. ThreadX / Azure RTOS / Microsoft
核心事实:
- 内核仅2KB内存占用(三种RTOS中最小)
- 响应延迟约11.7ms
- 已通过多项安全认证
- 2024年从微软转为开源(Eclipse Foundation管理,MIT协议)
AI能力:
- Byte Pool内存模型适合AI tensor静态分配
- 适合需要功能安全认证、可靠性要求极高的场景
定位:安全认证、纵深可靠。适合功能安全认证、可靠性要求极高的产品。
4. RTOS选型对比实证
来源:Real-time Operating Systems (RTOS) For Edge AI (Hasan等, 2025年6月)
实验配置:STM32H7平台,运行量化CNN
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|---|---|---|---|---|
| 内核大小 | 2KB | 30KB | 15KB | 信息不足 |
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | 信息不足 |
| 成熟度 | 4/4 | 3/4 | 2/4 | 4/4 |
核心结论:
- ThreadX在资源占用和响应时间上取得最佳平衡
- FreeRTOS资源占用最低但推理延迟最高
- Zephyr提供丰富协议栈但内存开销最大
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
5. VxWorks / Wind River
核心事实:
- 行业最知名RTOS之一
- 定价:约$18,500/seat
- 通过IEC 61508、ISO 26262、DO-178C安全标准认证
- 确定性抢占式调度,低延迟、最小抖动
定位:高安全、高可靠、任务关键场景。适合航空航天、国防、汽车。
6. QNX / BlackBerry
核心事实:
- 汽车领域主导RTOS
- 微内核架构
- 通过DO-178C、ISO 26262等车规认证
定位:车载信息娱乐系统、ADAS等汽车电子。
二、国际LLM推理框架
1. llama.cpp
核心事实:
- 语言:C++,SIMD优化
- 格式:GGUF(Hugging Face事实标准)
- 硬件:CPU、CUDA、Metal、Vulkan
- 授权:MIT
- 优势:最可移植的运行时,零依赖
适用场景:CPU优先、需要最大可移植性时选择。运行于x86、ARM、Apple Silicon、Raspberry Pi。
来源:Edge LLM Runtime Stack 2026 (2026年7月)
2. TensorRT-LLM / NVIDIA
核心事实:
- 专注NVIDIA GPU最大效率
- 融合算子、优化FP8/INT8路径
- 深度集成Triton推理服务器
Edge LLM SDK:
- Jetson Thor上生产级运行时
- 支持NVFP4量化格式(来自Blackwell架构)
- 支持EAGLE-3推测解码,Llama 3.3 70B吞吐提升2.5倍
来源:Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on NVIDIA Jetson AGX Thor (2025年10月)
3. vLLM
核心事实:
- 服务器级、多租户、PagedAttention
- 支持动态批处理、chunked prefill
- 支持NVIDIA + AMD ROCm
Edge版本:vLLM Edge变体已在社区中开发,面向单设备低并发边缘服务器
来源:vLLM vs TensorRT-LLM: Inference Runtime Guide (2026年2月)
4. 运行时框架对比
来源:Edge LLM Runtime Stack 2026
| 运行时 | 核心优势 | 适用场景 |
|---|---|---|
| llama.cpp | CPU优先、最可移植 | 跨平台、portability优先 |
| Ollama | llama.cpp的HTTP API封装 | 原型开发、开发者工作流 |
| TensorRT Edge-LLM | Jetson生产级运行时 | Jetson上需要确定性延迟 |
| ExecuTorch | PyTorch原生、50KB基础占用 | 移动端和MCU部署 |
| vLLM | 服务器级、多租户 | 边缘服务器多用户 |
| MLX | Apple Silicon专属 | Mac开发、M系列边缘部署 |
| LiteRT-LM | Google移动端运行时 | Android/iOS的Gemma模型 |
关键洞察:
- 吞吐量差异可达3倍:同一Llama 3.3 70B模型在Jetson Thor上,不同运行时可产生巨大差异
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
- KV cache管理是生产部署成败关键:PagedAttention (vLLM)、KV cache量化 (TensorRT-LLM)、attention-sink驱逐 (StreamingLLM)
三、智能体(Agent)框架
1. 框架对比(2026年7月)
来源:Best AI Agent Frameworks | AI Wiki (2026年7月更新)
| 框架 | 核心优势 | 语言 | 多Agent | 授权 |
|---|---|---|---|---|
| LangGraph 1.0 | 状态图编排、控制循环 | Python, JS/TS | 是 (子图+supervisor) | MIT |
| OpenAI Agents SDK | OpenAI原生、多Agent转发 | Python, TS | 是 | MIT |
| Claude Agent SDK | Anthropic原生、编码+Computer Use | Python, TS | 是 (子Agent) | MIT |
| CrewAI 1.14 | 角色驱动Crew快速原型 | Python | 是 | MIT |
| Microsoft Agent Framework 1.0 | .NET/Azure企业级 | .NET, Python | 是 | MIT |
| LlamaIndex Workflows 1.0 | RAG密集型Agent | Python, TS | 是 | MIT |
| Google ADK 2.0 | GCP原生、Gemini集成 | Python, Java, Go, TS | 是 | Apache-2.0 |
关键选择建议:
- 编排和状态图控制:选LangGraph 1.0 (GA 2025年10月)
- 快速角色原型:选CrewAI 1.14
- 企业.NET/Azure:选Microsoft Agent Framework 1.0 (GA 2026年)
- RAG密集型:选LlamaIndex Workflows 1.0
2. LangChain vs CrewAI vs AutoGen 生产对比
来源:LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales? (2026年5月)
测试配置:Ubuntu 22.04 + Python 3.11 + GPT-4o
| 框架 | 版本 | 核心特点 |
|---|---|---|
| LangChain/LangGraph | 0.3.17 | 灵活性、工具生态、图结构状态管理 |
| CrewAI | 0.105.0 | 角色驱动、顺序/层级流程、样板代码减少40% |
| AutoGen | 0.7.7 | 多轮对话、代码执行、错误恢复率92% |
| Semantic Kernel | 1.17.0 | .NET/Azure集成、最小开销 |
| Agno | 1.1.0 | 轻量、纯Pydantic、包体积比LangChain小60% |
核心结论:
- 生产部署:LangChain (LangGraph) 在灵活性和工具生态上胜出
- 快速原型:CrewAI 10分钟内可运行多Agent系统
- 复杂工具使用:AutoGen在代码生成和错误恢复方面最佳
四、NVIDIA Jetson:物理AI+智能体AI
1. Jetson智能体就绪(2026年6月)
来源:NVIDIA Jetson 将智能体 AI 带入物理世界 (2026年6月)
核心事件:JetPack 7.2 + NemoClaw 正式发布
三层架构:
-
底层:JetPack 7.2 — 操作系统、计算能力、确定性性能
- 基于Yocto的OS支持(工业客户精简定制)
- Jetson Orin支持CUDA 13
- Jetson Thor支持多实例GPU (MIG) + 实时内核结合
-
中间层:智能体技能 — 自动化开发者任务
- Linux定制、内存优化、模型基准测试
- 从数周缩短到数天
-
顶层:NemoClaw — 直接部署到Jetson
- 一条命令部署AI智能体
- 支持视觉推理智能体(实时观察、理解、行动)
合作案例:Solomon 3D采用NemoClaw实现人形机器人上多Agent协同
2. Cosmos 3 Edge:端侧世界模型(2026年7月)
来源:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026 (2026年7月)
核心产品:Cosmos 3 Edge — 4B参数开源世界模型
关键特性:
- 完全端侧运行,无需网络连接
- 在Jetson Thor上以15Hz运行
- Mixture-of-Transformers架构(2B密集推理器+扩散模型)
- 支持6种机器人形态(Universal Embodiment Representation)
- VANTAGE-Bench上4B参数级别排名第一
- 开源许可:OpenMDW-1.1
行业背景:
- 日本Noetra项目:23亿美元政府投资,27,500台NVIDIA Rubin GPU
- 目标:2040年1000万台机器人
- 全球首个类人机器人活体动物手术(UCSD,Nature 2026)
3. Jetson Orin实时机器人控制
来源:Edge AI for real-time robot control: NVIDIA Jetson Orin (2026年4月)
关键数据:
- AGX Orin:275 TOPS AI算力,15-60W功耗
- 性能提升:较AGX Xavier提升6倍
- 延迟优势:边缘推理<1ms vs 云端往返50-200ms
完整技术栈:
| 层级 | NVIDIA技术 | 功能 |
|---|---|---|
| 硬件 | Jetson Orin AGX/NX/Nano | 边缘AI计算平台 |
| 运行时 | JetPack SDK + CUDA | 基础OS、驱动、CUDA |
| 推理引擎 | TensorRT | INT8/FP16量化推理 |
| 视觉 | DeepStream SDK | 多路视频分析管道 |
| 机器人 | Isaac ROS | ROS 2兼容的硬件加速算法 |
| 仿真 | Isaac Sim (Omniverse) | 机器人仿真训练测试 |
| 基础模型 | NVIDIA Cosmos | 机器人学习和规划的世界模型 |
4. Jetson Orin Nano 2(2026年8月发布)
来源:NVIDIA Jetson Orin Nano 2 로보틱스 컴퓨터 공개 (2026年8月)
核心参数:
- 78 TOPS AI算力
- 8GB内存
- 8核Arm CPU
- 15W模式下较前代功耗降低40%
已采用合作伙伴:
- 柯尼卡美能达(Cognex):工业视觉检测
- 斗山Bobcat:工程机械机器人
- Matic Robots:家用机器人
- Wing(Alphabet旗下):配送无人机
五、学术研究热点
1. 嵌入式智能体架构
来源:Toward a Modular Architecture for Embedded Agent Systems at the Edge (arXiv:2606.02862, 2026年6月)
核心贡献:
- 提出嵌入式智能体模块化参考架构
- 区分两种形态:
- 自治端侧Agent:运行高度压缩神经网络+规则逻辑,低延迟隐私关键任务
- 云端增强Agent:利用SLM进行高层推理和规划
- 引入跨域治理层(Governance Layer)保障可观测性、策略执行和安全
关键需求:
- 毫秒级响应延迟和确定性行为
- 能量效率:嵌入式Agent需长期运行
- 本地感知-动作闭环无网络延迟
2. 异构SoC上的Agent调度
来源:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC (arXiv:2506.24045, 2026年1月)
核心问题:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有引擎不支持流级并发
技术方案:
- HEG(异构执行图):捕获NPU/iGPU亲和性和弹性操作符绑定
- 流感知NPU-iGPU协同:解耦prefill和decode减少带宽争用
- 细粒度抢占:slack-aware piggybacking保证响应式不饿死主动式
性能提升:
- 主动式吞吐提升1.2-4.9倍
- 响应式延迟降低≥91%
3. Edge LLM推理评测
来源:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load (arXiv:2603.23640, 2026年6月)
实验配置:Qwen 2.5 1.5B (4-bit量化),258-token prompt,贪婪解码
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|---|---|---|---|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
| iPhone 16 Pro | 23.7 tok/s | 信息不足 | 3次迭代后降额40% |
| S24 Ultra | 10 tok/s | 信息不足 | 20次迭代后降额~15% |
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
核心结论:移动端热管理是比峰值算力更主要的约束;专用NPU在能量效率上匹配GPU(19倍低功耗)。
4. 边缘LLM推理综述
来源:Efficient Inference for Edge Large Language Models: A Survey (Cai等, 2025年)
两大运行时优化策略:
- 推测解码(Speculative Decoding):利用小模型提议候选token,大模型并行验证
- 模型卸载(Model Offloading):战略分区LLM,高频组件放边缘高速单元,低频部分放边缘服务器或云端
5. LLM推理调度综述
来源:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs (华为技术, 2025年11月)
覆盖方向:
- 控制平面和数据平面的调度策略
- 冷启动延迟、HOL阻塞、资源利用率、动态负载变化
- 强化学习调度、自适应批处理、推测执行、多租户调度
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用