包含6个文件: - 总览:7条关键发现摘要 - 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架 - 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI - 学术文献:14篇论文/文章完整摘要和链接 - 关键研究空白:7个研究空白及与项目框架的对齐 - 文献索引:40+条文献完整列表
373 lines
14 KiB
Markdown
373 lines
14 KiB
Markdown
# 02-国际同行
|
||
|
||
## 一、国际RTOS厂商
|
||
|
||
### 1. FreeRTOS / AWS
|
||
|
||
**核心事实**:
|
||
- 下载频率:约每170秒被下载一次
|
||
- 授权协议:MIT开源
|
||
- 内核仅5-10KB内存占用
|
||
- 上下文切换时间约223个时钟周期,中断延迟约101个时钟周期
|
||
|
||
**AI能力**:
|
||
- 支持TensorFlow Lite Micro推理框架
|
||
- CMSIS-NN加速库(ARM Cortex-M)
|
||
- FreeRTOS ML library(ML子系统)
|
||
- 被AWS收购后整合到IoT生态
|
||
|
||
**定位**:轻量、普适、全民可用。适合跑量为主、追求上手快、生态资料多的场景。
|
||
|
||
---
|
||
|
||
### 2. Zephyr RTOS / Linux基金会
|
||
|
||
**核心事实**:
|
||
- 授权协议:Apache 2.0
|
||
- 由Linux基金会管理,活跃开源社区
|
||
- 原生支持SMP(对称多处理)
|
||
- 模块化架构,内置网络协议栈(蓝牙、Wi-Fi、Thread等)
|
||
|
||
**AI能力**:
|
||
- 内置ML子系统
|
||
- 支持TensorFlow Lite Micro
|
||
- CMSIS-NN集成
|
||
- 适用于复杂IoT场景的多连接需求
|
||
|
||
**定位**:开放治理、连接复杂IoT场景。适合多连接复杂IoT设备、长期演进迭代。
|
||
|
||
---
|
||
|
||
### 3. ThreadX / Azure RTOS / Microsoft
|
||
|
||
**核心事实**:
|
||
- 内核仅2KB内存占用(三种RTOS中最小)
|
||
- 响应延迟约11.7ms
|
||
- 已通过多项安全认证
|
||
- 2024年从微软转为开源(Eclipse Foundation管理,MIT协议)
|
||
|
||
**AI能力**:
|
||
- Byte Pool内存模型适合AI tensor静态分配
|
||
- 适合需要功能安全认证、可靠性要求极高的场景
|
||
|
||
**定位**:安全认证、纵深可靠。适合功能安全认证、可靠性要求极高的产品。
|
||
|
||
---
|
||
|
||
### 4. RTOS选型对比实证
|
||
|
||
**来源**:[Real-time Operating Systems (RTOS) For Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) (Hasan等, 2025年6月)
|
||
|
||
**实验配置**:STM32H7平台,运行量化CNN
|
||
|
||
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|
||
|------|---------|--------|----------|---------|
|
||
| 内核大小 | 2KB | 30KB | 15KB | 信息不足 |
|
||
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | 信息不足 |
|
||
| 成熟度 | 4/4 | 3/4 | 2/4 | 4/4 |
|
||
|
||
**核心结论**:
|
||
- ThreadX在资源占用和响应时间上取得最佳平衡
|
||
- FreeRTOS资源占用最低但推理延迟最高
|
||
- Zephyr提供丰富协议栈但内存开销最大
|
||
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
|
||
|
||
---
|
||
|
||
### 5. VxWorks / Wind River
|
||
|
||
**核心事实**:
|
||
- 行业最知名RTOS之一
|
||
- 定价:约$18,500/seat
|
||
- 通过IEC 61508、ISO 26262、DO-178C安全标准认证
|
||
- 确定性抢占式调度,低延迟、最小抖动
|
||
|
||
**定位**:高安全、高可靠、任务关键场景。适合航空航天、国防、汽车。
|
||
|
||
---
|
||
|
||
### 6. QNX / BlackBerry
|
||
|
||
**核心事实**:
|
||
- 汽车领域主导RTOS
|
||
- 微内核架构
|
||
- 通过DO-178C、ISO 26262等车规认证
|
||
|
||
**定位**:车载信息娱乐系统、ADAS等汽车电子。
|
||
|
||
---
|
||
|
||
## 二、国际LLM推理框架
|
||
|
||
### 1. llama.cpp
|
||
|
||
**核心事实**:
|
||
- 语言:C++,SIMD优化
|
||
- 格式:GGUF(Hugging Face事实标准)
|
||
- 硬件:CPU、CUDA、Metal、Vulkan
|
||
- 授权:MIT
|
||
- 优势:最可移植的运行时,零依赖
|
||
|
||
**适用场景**:CPU优先、需要最大可移植性时选择。运行于x86、ARM、Apple Silicon、Raspberry Pi。
|
||
|
||
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) (2026年7月)
|
||
|
||
---
|
||
|
||
### 2. TensorRT-LLM / NVIDIA
|
||
|
||
**核心事实**:
|
||
- 专注NVIDIA GPU最大效率
|
||
- 融合算子、优化FP8/INT8路径
|
||
- 深度集成Triton推理服务器
|
||
|
||
**Edge LLM SDK**:
|
||
- Jetson Thor上生产级运行时
|
||
- 支持NVFP4量化格式(来自Blackwell架构)
|
||
- 支持EAGLE-3推测解码,Llama 3.3 70B吞吐提升2.5倍
|
||
|
||
**来源**:[Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on NVIDIA Jetson AGX Thor](https://developer.nvidia.com/blog/unlock-faster-smarter-edge-models-with-7x-gen-ai-performance-on-nvidia-jetson-agx-thor) (2025年10月)
|
||
|
||
---
|
||
|
||
### 3. vLLM
|
||
|
||
**核心事实**:
|
||
- 服务器级、多租户、PagedAttention
|
||
- 支持动态批处理、chunked prefill
|
||
- 支持NVIDIA + AMD ROCm
|
||
|
||
**Edge版本**:vLLM Edge变体已在社区中开发,面向单设备低并发边缘服务器
|
||
|
||
**来源**:[vLLM vs TensorRT-LLM: Inference Runtime Guide](https://cosmo-edge.com/vllm-vs-tensorrt-llm/) (2026年2月)
|
||
|
||
---
|
||
|
||
### 4. 运行时框架对比
|
||
|
||
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
|
||
|
||
| 运行时 | 核心优势 | 适用场景 |
|
||
|--------|---------|---------|
|
||
| llama.cpp | CPU优先、最可移植 | 跨平台、portability优先 |
|
||
| Ollama | llama.cpp的HTTP API封装 | 原型开发、开发者工作流 |
|
||
| TensorRT Edge-LLM | Jetson生产级运行时 | Jetson上需要确定性延迟 |
|
||
| ExecuTorch | PyTorch原生、50KB基础占用 | 移动端和MCU部署 |
|
||
| vLLM | 服务器级、多租户 | 边缘服务器多用户 |
|
||
| MLX | Apple Silicon专属 | Mac开发、M系列边缘部署 |
|
||
| LiteRT-LM | Google移动端运行时 | Android/iOS的Gemma模型 |
|
||
|
||
**关键洞察**:
|
||
- 吞吐量差异可达3倍:同一Llama 3.3 70B模型在Jetson Thor上,不同运行时可产生巨大差异
|
||
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
|
||
- KV cache管理是生产部署成败关键:PagedAttention (vLLM)、KV cache量化 (TensorRT-LLM)、attention-sink驱逐 (StreamingLLM)
|
||
|
||
---
|
||
|
||
## 三、智能体(Agent)框架
|
||
|
||
### 1. 框架对比(2026年7月)
|
||
|
||
**来源**:[Best AI Agent Frameworks | AI Wiki](https://aiwiki.ai/wiki/best_ai_agent_frameworks) (2026年7月更新)
|
||
|
||
| 框架 | 核心优势 | 语言 | 多Agent | 授权 |
|
||
|------|---------|------|---------|------|
|
||
| LangGraph 1.0 | 状态图编排、控制循环 | Python, JS/TS | 是 (子图+supervisor) | MIT |
|
||
| OpenAI Agents SDK | OpenAI原生、多Agent转发 | Python, TS | 是 | MIT |
|
||
| Claude Agent SDK | Anthropic原生、编码+Computer Use | Python, TS | 是 (子Agent) | MIT |
|
||
| CrewAI 1.14 | 角色驱动Crew快速原型 | Python | 是 | MIT |
|
||
| Microsoft Agent Framework 1.0 | .NET/Azure企业级 | .NET, Python | 是 | MIT |
|
||
| LlamaIndex Workflows 1.0 | RAG密集型Agent | Python, TS | 是 | MIT |
|
||
| Google ADK 2.0 | GCP原生、Gemini集成 | Python, Java, Go, TS | 是 | Apache-2.0 |
|
||
|
||
**关键选择建议**:
|
||
- 编排和状态图控制:选LangGraph 1.0 (GA 2025年10月)
|
||
- 快速角色原型:选CrewAI 1.14
|
||
- 企业.NET/Azure:选Microsoft Agent Framework 1.0 (GA 2026年)
|
||
- RAG密集型:选LlamaIndex Workflows 1.0
|
||
|
||
---
|
||
|
||
### 2. LangChain vs CrewAI vs AutoGen 生产对比
|
||
|
||
**来源**:[LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales?](https://markaicode.com/best/best-ai-agent-framework/) (2026年5月)
|
||
|
||
**测试配置**:Ubuntu 22.04 + Python 3.11 + GPT-4o
|
||
|
||
| 框架 | 版本 | 核心特点 |
|
||
|------|------|---------|
|
||
| LangChain/LangGraph | 0.3.17 | 灵活性、工具生态、图结构状态管理 |
|
||
| CrewAI | 0.105.0 | 角色驱动、顺序/层级流程、样板代码减少40% |
|
||
| AutoGen | 0.7.7 | 多轮对话、代码执行、错误恢复率92% |
|
||
| Semantic Kernel | 1.17.0 | .NET/Azure集成、最小开销 |
|
||
| Agno | 1.1.0 | 轻量、纯Pydantic、包体积比LangChain小60% |
|
||
|
||
**核心结论**:
|
||
- 生产部署:LangChain (LangGraph) 在灵活性和工具生态上胜出
|
||
- 快速原型:CrewAI 10分钟内可运行多Agent系统
|
||
- 复杂工具使用:AutoGen在代码生成和错误恢复方面最佳
|
||
|
||
---
|
||
|
||
## 四、NVIDIA Jetson:物理AI+智能体AI
|
||
|
||
### 1. Jetson智能体就绪(2026年6月)
|
||
|
||
**来源**:[NVIDIA Jetson 将智能体 AI 带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) (2026年6月)
|
||
|
||
**核心事件**:JetPack 7.2 + NemoClaw 正式发布
|
||
|
||
**三层架构**:
|
||
1. **底层**:JetPack 7.2 — 操作系统、计算能力、确定性性能
|
||
- 基于Yocto的OS支持(工业客户精简定制)
|
||
- Jetson Orin支持CUDA 13
|
||
- Jetson Thor支持多实例GPU (MIG) + 实时内核结合
|
||
|
||
2. **中间层**:智能体技能 — 自动化开发者任务
|
||
- Linux定制、内存优化、模型基准测试
|
||
- 从数周缩短到数天
|
||
|
||
3. **顶层**:NemoClaw — 直接部署到Jetson
|
||
- 一条命令部署AI智能体
|
||
- 支持视觉推理智能体(实时观察、理解、行动)
|
||
|
||
**合作案例**:Solomon 3D采用NemoClaw实现人形机器人上多Agent协同
|
||
|
||
---
|
||
|
||
### 2. Cosmos 3 Edge:端侧世界模型(2026年7月)
|
||
|
||
**来源**:[NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) (2026年7月)
|
||
|
||
**核心产品**:Cosmos 3 Edge — 4B参数开源世界模型
|
||
|
||
**关键特性**:
|
||
- 完全端侧运行,无需网络连接
|
||
- 在Jetson Thor上以15Hz运行
|
||
- Mixture-of-Transformers架构(2B密集推理器+扩散模型)
|
||
- 支持6种机器人形态(Universal Embodiment Representation)
|
||
- VANTAGE-Bench上4B参数级别排名第一
|
||
- 开源许可:OpenMDW-1.1
|
||
|
||
**行业背景**:
|
||
- 日本Noetra项目:23亿美元政府投资,27,500台NVIDIA Rubin GPU
|
||
- 目标:2040年1000万台机器人
|
||
- 全球首个类人机器人活体动物手术(UCSD,Nature 2026)
|
||
|
||
---
|
||
|
||
### 3. Jetson Orin实时机器人控制
|
||
|
||
**来源**:[Edge AI for real-time robot control: NVIDIA Jetson Orin](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) (2026年4月)
|
||
|
||
**关键数据**:
|
||
- AGX Orin:275 TOPS AI算力,15-60W功耗
|
||
- 性能提升:较AGX Xavier提升6倍
|
||
- 延迟优势:边缘推理<1ms vs 云端往返50-200ms
|
||
|
||
**完整技术栈**:
|
||
|
||
| 层级 | NVIDIA技术 | 功能 |
|
||
|------|-----------|------|
|
||
| 硬件 | Jetson Orin AGX/NX/Nano | 边缘AI计算平台 |
|
||
| 运行时 | JetPack SDK + CUDA | 基础OS、驱动、CUDA |
|
||
| 推理引擎 | TensorRT | INT8/FP16量化推理 |
|
||
| 视觉 | DeepStream SDK | 多路视频分析管道 |
|
||
| 机器人 | Isaac ROS | ROS 2兼容的硬件加速算法 |
|
||
| 仿真 | Isaac Sim (Omniverse) | 机器人仿真训练测试 |
|
||
| 基础模型 | NVIDIA Cosmos | 机器人学习和规划的世界模型 |
|
||
|
||
---
|
||
|
||
### 4. Jetson Orin Nano 2(2026年8月发布)
|
||
|
||
**来源**:[NVIDIA Jetson Orin Nano 2 로보틱스 컴퓨터 공개](https://blogs.nvidia.co.kr/blog/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai/) (2026年8月)
|
||
|
||
**核心参数**:
|
||
- 78 TOPS AI算力
|
||
- 8GB内存
|
||
- 8核Arm CPU
|
||
- 15W模式下较前代功耗降低40%
|
||
|
||
**已采用合作伙伴**:
|
||
- 柯尼卡美能达(Cognex):工业视觉检测
|
||
- 斗山Bobcat:工程机械机器人
|
||
- Matic Robots:家用机器人
|
||
- Wing(Alphabet旗下):配送无人机
|
||
|
||
---
|
||
|
||
## 五、学术研究热点
|
||
|
||
### 1. 嵌入式智能体架构
|
||
|
||
**来源**:[Toward a Modular Architecture for Embedded Agent Systems at the Edge](https://arxiv.org/html/2606.02862) (arXiv:2606.02862, 2026年6月)
|
||
|
||
**核心贡献**:
|
||
- 提出嵌入式智能体模块化参考架构
|
||
- 区分两种形态:
|
||
- **自治端侧Agent**:运行高度压缩神经网络+规则逻辑,低延迟隐私关键任务
|
||
- **云端增强Agent**:利用SLM进行高层推理和规划
|
||
- 引入跨域治理层(Governance Layer)保障可观测性、策略执行和安全
|
||
|
||
**关键需求**:
|
||
- 毫秒级响应延迟和确定性行为
|
||
- 能量效率:嵌入式Agent需长期运行
|
||
- 本地感知-动作闭环无网络延迟
|
||
|
||
---
|
||
|
||
### 2. 异构SoC上的Agent调度
|
||
|
||
**来源**:[Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC](https://arxiv.org/html/2506.24045v2) (arXiv:2506.24045, 2026年1月)
|
||
|
||
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有引擎不支持流级并发
|
||
|
||
**技术方案**:
|
||
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性和弹性操作符绑定
|
||
- **流感知NPU-iGPU协同**:解耦prefill和decode减少带宽争用
|
||
- **细粒度抢占**:slack-aware piggybacking保证响应式不饿死主动式
|
||
|
||
**性能提升**:
|
||
- 主动式吞吐提升1.2-4.9倍
|
||
- 响应式延迟降低≥91%
|
||
|
||
---
|
||
|
||
### 3. Edge LLM推理评测
|
||
|
||
**来源**:[LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load](https://arxiv.org/html/2603.23640v2) (arXiv:2603.23640, 2026年6月)
|
||
|
||
**实验配置**:Qwen 2.5 1.5B (4-bit量化),258-token prompt,贪婪解码
|
||
|
||
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|
||
|------|---------|------|---------|
|
||
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
|
||
| iPhone 16 Pro | 23.7 tok/s | 信息不足 | 3次迭代后降额40% |
|
||
| S24 Ultra | 10 tok/s | 信息不足 | 20次迭代后降额~15% |
|
||
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
|
||
|
||
**核心结论**:移动端热管理是比峰值算力更主要的约束;专用NPU在能量效率上匹配GPU(19倍低功耗)。
|
||
|
||
---
|
||
|
||
### 4. 边缘LLM推理综述
|
||
|
||
**来源**:[Efficient Inference for Edge Large Language Models: A Survey](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) (Cai等, 2025年)
|
||
|
||
**两大运行时优化策略**:
|
||
- **推测解码(Speculative Decoding)**:利用小模型提议候选token,大模型并行验证
|
||
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘高速单元,低频部分放边缘服务器或云端
|
||
|
||
---
|
||
|
||
### 5. LLM推理调度综述
|
||
|
||
**来源**:[LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) (华为技术, 2025年11月)
|
||
|
||
**覆盖方向**:
|
||
- 控制平面和数据平面的调度策略
|
||
- 冷启动延迟、HOL阻塞、资源利用率、动态负载变化
|
||
- 强化学习调度、自适应批处理、推测执行、多租户调度
|
||
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
|