forked from eaiadmin/rtos_llm_opt
add industry research survey on RTOS+LLM+Agent competitors
包含6个文件: - 总览:7条关键发现摘要 - 国内同行:翼辉SylixOS、华为鸿蒙/LiteOS、端侧AI框架 - 国际同行:FreeRTOS/Zephyr/ThreadX/VxWorks对比、LLM运行时框架、Agent框架、NVIDIA Jetson物理AI - 学术文献:14篇论文/文章完整摘要和链接 - 关键研究空白:7个研究空白及与项目框架的对齐 - 文献索引:40+条文献完整列表
This commit is contained in:
@@ -0,0 +1,60 @@
|
|||||||
|
# 03-同行研究情况调研 - 总览
|
||||||
|
|
||||||
|
## 调研说明
|
||||||
|
|
||||||
|
本目录系统整理 RTOS + LLM/智能体领域的行业同行研究情况,包含文章列表、观点摘要、原文引用和完整文献索引。
|
||||||
|
|
||||||
|
## 目录结构
|
||||||
|
|
||||||
|
| 文件 | 内容 |
|
||||||
|
|------|------|
|
||||||
|
| [00-总览.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/00-总览.md) | 本文档:文章分类索引 + 关键观点 |
|
||||||
|
| [01-国内同行.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/01-国内同行.md) | 国内操作系统、LLM、智能体、芯片厂商 |
|
||||||
|
| [02-国际同行.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/02-国际同行.md) | 国际RTOS厂商、LLM推理框架、Agent框架 |
|
||||||
|
| [03-学术文献.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/03-学术文献.md) | 学术论文:RTOS+AI、Edge LLM推理、调度系统 |
|
||||||
|
| [04-关键研究空白.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/04-关键研究空白.md) | 研究机会与空白分析 |
|
||||||
|
| [05-文献索引.md](file:///home/eaiadmin/eaifiles/codebase/pj0321-rtos_llm_opt/02-项目框架/03-同行研究情况调研/05-文献索引.md) | 完整文献列表(含arXiv编号、链接、发表信息) |
|
||||||
|
|
||||||
|
## 关键发现摘要
|
||||||
|
|
||||||
|
### 1. 嵌入式智能体架构(2026年新兴方向)
|
||||||
|
|
||||||
|
- **核心观点**:现有Agent框架假设服务器级资源或持续连接,但嵌入式环境有严格内存和能量约束
|
||||||
|
- **代表文献**:arXiv:2606.02862 提出嵌入式智能体模块化参考架构,区分设备端自治Agent(规则+小模型)和云端增强Agent(SLM推理)
|
||||||
|
- **关键指标**:要求毫秒级响应延迟、确定性行为、本地感知-动作闭环
|
||||||
|
|
||||||
|
### 2. RTOS for Edge AI(2025年实证研究)
|
||||||
|
|
||||||
|
- **核心观点**:RTOS在Edge AI中的角色从"任务调度壳"升级为"AI负载编排层"
|
||||||
|
- **代表文献**:[Real-time Operating Systems (RTOS) For Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 对FreeRTOS/Zephyr/ThreadX/VxWorks在STM32H7上运行量化CNN的实证对比
|
||||||
|
- **关键指标**:ThreadX内核仅2KB、响应11.7ms;FreeRTOS内核15KB、响应13.8ms
|
||||||
|
|
||||||
|
### 3. Edge LLM推理运行时框架(2026年)
|
||||||
|
|
||||||
|
- **核心观点**:运行时选择可带来3倍吞吐差异,与硬件选择同等重要
|
||||||
|
- **代表文献**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) 对比7大运行时(llama.cpp、TensorRT-LLM、vLLM、ExecuTorch等)
|
||||||
|
- **关键指标**:同一Llama 3.3 70B模型在Jetson Thor上,从llama.cpp到TensorRT-LLM+EAGLE-3推理可达2.5倍性能提升
|
||||||
|
|
||||||
|
### 4. 混合SoC上的Agent调度(2026年研究)
|
||||||
|
|
||||||
|
- **核心观点**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有LLM引擎不支持流级并发
|
||||||
|
- **代表文献**:arXiv:2506.24045 Agent.xpu 提出异构执行图(HEG)和流感知NPU-iGPU协同调度
|
||||||
|
- **关键指标**:主动式吞吐提升1.2-4.9倍,响应式延迟降低≥91%
|
||||||
|
|
||||||
|
### 5. 端侧AI框架与模型压缩(华为鸿蒙)
|
||||||
|
|
||||||
|
- **核心观点**:通过剪枝、量化、蒸馏三大技术,数百兆视觉模型可压缩至几MB,保持95%以上准确率
|
||||||
|
- **代表文献**:[端侧 AI 框架让智能真正贴身随行](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385),[鸿蒙开发之路:端侧模型压缩、量化与加速技术详解](https://www.cnblogs.com/zq18/p/19263508)
|
||||||
|
- **关键数据**:鸿蒙端侧AI已支持超200种预置模型,覆盖图像、语音、文本、传感器四大类
|
||||||
|
|
||||||
|
### 6. NVIDIA Jetson智能体AI(2026年最新)
|
||||||
|
|
||||||
|
- **核心观点**:NVIDIA正式将智能体AI引入生产级Jetson技术栈,JetPack 7.2 + NemoClaw实现机器人/工业检测领域的Agent部署
|
||||||
|
- **代表文献**:[NVIDIA Jetson 将智能体 AI 带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) (2026年6月)
|
||||||
|
- **关键特性**:Jetson Thor支持多实例GPU(MIG) + 实时内核结合,为确定性工作负载预留专属GPU资源
|
||||||
|
|
||||||
|
### 7. 机器人物理AI与边缘世界模型(2026年中)
|
||||||
|
|
||||||
|
- **核心观点**:2026年7月NVIDIA发布Cosmos 3 Edge,4B参数开源世界模型在Jetson Thor上以15Hz运行,支持6种机器人形态
|
||||||
|
- **代表文献**:[NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) (2026年7月)
|
||||||
|
- **行业背景**:日本Noetra项目23亿美元政府投资,目标2040年1000万台机器人
|
||||||
@@ -0,0 +1,122 @@
|
|||||||
|
# 01-国内同行
|
||||||
|
|
||||||
|
## 一、国内RTOS厂商
|
||||||
|
|
||||||
|
### 1. 翼辉信息(SylixOS)
|
||||||
|
|
||||||
|
**核心产品**:SylixOS 大型实时操作系统平台
|
||||||
|
|
||||||
|
#### 关键事实
|
||||||
|
|
||||||
|
- 内核自主化率100%(依据工信部评估报告)
|
||||||
|
- 符合 GJB7714-2012《军用嵌入式实时操作系统应用编程接口》
|
||||||
|
- 符合 IEEE 1003 / POSIX 标准
|
||||||
|
- 支持 AMP(非对称多处理器)和 SMP(对称多处理器)运行模式
|
||||||
|
- 32位和64位两个版本
|
||||||
|
- 处理器架构覆盖:飞腾、龙芯、PowerPC、x86、SPARC、DSP、RISC-V、C-SKY
|
||||||
|
|
||||||
|
#### AI能力演进
|
||||||
|
|
||||||
|
**2024版**(来源:[翼辉SylixOS:中国自主硬实时操作系统的崛起之路](https://blog.csdn.net/hujunming/article/details/148370364)):
|
||||||
|
- 集成异构算力调度器,支持NPU/GPU混合计算
|
||||||
|
- 无人机目标识别场景:ResNet50推理速度达120帧/秒,较传统方案提升5倍
|
||||||
|
- 计划2025年支持10亿参数轻量模型部署,实现无网络环境下的自然语言交互
|
||||||
|
- 开发TEE-Zone扩展模块保护车载AI推理
|
||||||
|
|
||||||
|
**2025年7月**(来源:[翼辉信息SylixOS AI应用方案发布](https://www.elecfans.com/d/6800705.html)):
|
||||||
|
- 正式推出基于SylixOS的AI解决方案
|
||||||
|
- 多芯片支持:Hailo-8 (26 TOPS@INT8, 2W功耗)、算能CV186AH/BM1688 SoC、灵汐KA200类脑芯片 (48 TOPS@INT8)
|
||||||
|
- AMC 3000智能算控单元:支持RK3588核心板,QuickAMP架构实现SylixOS实时系统与Linux智算系统共存
|
||||||
|
- 支持TensorFlow Lite、ONNX、PyTorch等主流AI框架
|
||||||
|
- 案例:无人机目标检测与追踪(YOLOv8 + ByteTrack)、工业故障诊断(Transformer + TCN)、双模态RGBT目标检测
|
||||||
|
|
||||||
|
#### 行业落地场景
|
||||||
|
- 火箭、卫星(航天行业)
|
||||||
|
- 高铁、轨交信号控制(中国铁道科学研究院)
|
||||||
|
- 工业自动化、数控
|
||||||
|
- 机器人、数控机床
|
||||||
|
- 能源电力、低空经济
|
||||||
|
- 水务、地铁运营、地下空间运维
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. 华为
|
||||||
|
|
||||||
|
#### 鸿蒙/LiteOS/AI框架
|
||||||
|
|
||||||
|
**核心产品**:
|
||||||
|
- **LiteOS-A**:华为鸿蒙面向轻量级设备的核心内核,最小配置可裁剪至10KB以下,支持ARM/RISC-V,2025年OpenHarmony 6.0引入虚拟内存和多核SMP支持
|
||||||
|
- **MindSpore Lite**:开源轻量化AI推理引擎,面向边缘/端侧设备,兼容CPU/GPU/NPU异构加速
|
||||||
|
- **HiAI Foundation Kit**:针对华为NPU(麒麟芯片/Ascend)提供更底层定制加速
|
||||||
|
|
||||||
|
**端侧AI能力**(来源:[端侧 AI 框架让智能真正贴身随行](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)):
|
||||||
|
- 鸿蒙端侧AI全程在设备本地运行,语音指令无需上传服务器
|
||||||
|
- 通过剪枝、量化和知识蒸馏,数百兆视觉模型可压缩至几MB,保持95%以上准确率
|
||||||
|
- 2025年已支持超200种预置模型,覆盖图像、语音、文本、传感器四大类
|
||||||
|
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
|
||||||
|
|
||||||
|
**端侧模型压缩技术**(来源:[鸿蒙开发之路:端侧模型压缩、量化与加速技术详解](https://www.cnblogs.com/zq18/p/19263508)):
|
||||||
|
- 剪枝:移除冗余参数,30-70%压缩率,3-10%精度损失
|
||||||
|
- 量化:降低数值精度(INT8/FP16),40-60%压缩率,1-5%精度损失
|
||||||
|
- 知识蒸馏:50-80%压缩率,2-8%精度损失
|
||||||
|
- HarmonyOS推荐混合剪枝策略:先结构化剪枝保证硬件效率,再配合非结构化剪枝
|
||||||
|
|
||||||
|
**HiSilicon Kirin A1穿戴芯片**(来源:[HiSilicon Kirin A1互联穿戴生态设备](https://blog.csdn.net/weixin_33193177/article/details/154404675)):
|
||||||
|
- 28nm HPM工艺,集成轻量级NPU,支持TensorFlow Lite Micro
|
||||||
|
- 步态分类CNN模型:参数量<50KB,推理延迟<10ms
|
||||||
|
- 支持本地语音唤醒、运动识别等边缘计算功能
|
||||||
|
- 通过TEE安全环境保障生物数据隐私
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 3. 其他国内RTOS厂商
|
||||||
|
|
||||||
|
| 厂商 | 产品 | 特点 |
|
||||||
|
|------|------|------|
|
||||||
|
| 中国电子 | CEEMQ | 面向工业控制、国防安全等任务关键场景 |
|
||||||
|
| 中科方德 | 国产操作系统 | 国产化操作系统生态 |
|
||||||
|
| RT-Thread | RT-Thread | 国产开源RTOS,国内社区影响力广泛 |
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 二、国内LLM / 智能体相关
|
||||||
|
|
||||||
|
### 1. 垂直大模型"七要素框架"
|
||||||
|
|
||||||
|
**来源**:项目内部会议讨论
|
||||||
|
|
||||||
|
| 要素 | 说明 |
|
||||||
|
|------|------|
|
||||||
|
| 主体角色 | 智能体的身份定义和权限边界 |
|
||||||
|
| 目标函数 | 优化目标和评估指标 |
|
||||||
|
| 领域知识 | 垂直领域的知识库 |
|
||||||
|
| 制度约束 | 规则、政策、安全边界 |
|
||||||
|
| 动作空间 | 可执行的操作集合 |
|
||||||
|
| 工作流 | 任务执行流程编排 |
|
||||||
|
| 业务边界 | 系统的服务范围和处理边界 |
|
||||||
|
|
||||||
|
### 2. AI辅助工程化方法
|
||||||
|
|
||||||
|
**来源**:[基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现](https://pdf.hanspub.org/etis_1380065.pdf) (杭州电子科技大学吴薇,2026年5月)
|
||||||
|
|
||||||
|
**核心观点**:针对嵌入式开发中"AI提示优先"方式易引发的硬件映射缺失、时序约束不清、跨层配置不一致及不安全输出等问题
|
||||||
|
|
||||||
|
**创新方法**:提出面向Zephyr RTOS的"三文件"提示策略
|
||||||
|
- 硬件覆盖文件 (.overlay/.dts)
|
||||||
|
- 项目配置文件 (prj.conf)
|
||||||
|
- 主程序文件 (main.c)
|
||||||
|
|
||||||
|
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 三、国内芯片厂商
|
||||||
|
|
||||||
|
| 厂商 | 芯片/平台 | 说明 |
|
||||||
|
|------|----------|------|
|
||||||
|
| 华为海思 | 昇腾AI系列、海思MCU、Kirin A1 | 国产AI+实时芯片,穿戴领域28nm HPM工艺 |
|
||||||
|
| 瑞芯微 | RK3588、RK3576 | 国内边缘AI芯片代表,翼辉AMC 3000采用 |
|
||||||
|
| 全志科技 | H系列、R系列 | 国内MCU/SoC,支持AI |
|
||||||
|
| 平头哥 | 玄铁RISC-V、含光AI芯片 | 国产RISC-V + AI芯片 |
|
||||||
|
| 寒武纪 | 思元系列 | 国产AI加速芯片 |
|
||||||
|
| 景嘉微 | GPU系列 | 国产GPU |
|
||||||
@@ -0,0 +1,372 @@
|
|||||||
|
# 02-国际同行
|
||||||
|
|
||||||
|
## 一、国际RTOS厂商
|
||||||
|
|
||||||
|
### 1. FreeRTOS / AWS
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 下载频率:约每170秒被下载一次
|
||||||
|
- 授权协议:MIT开源
|
||||||
|
- 内核仅5-10KB内存占用
|
||||||
|
- 上下文切换时间约223个时钟周期,中断延迟约101个时钟周期
|
||||||
|
|
||||||
|
**AI能力**:
|
||||||
|
- 支持TensorFlow Lite Micro推理框架
|
||||||
|
- CMSIS-NN加速库(ARM Cortex-M)
|
||||||
|
- FreeRTOS ML library(ML子系统)
|
||||||
|
- 被AWS收购后整合到IoT生态
|
||||||
|
|
||||||
|
**定位**:轻量、普适、全民可用。适合跑量为主、追求上手快、生态资料多的场景。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. Zephyr RTOS / Linux基金会
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 授权协议:Apache 2.0
|
||||||
|
- 由Linux基金会管理,活跃开源社区
|
||||||
|
- 原生支持SMP(对称多处理)
|
||||||
|
- 模块化架构,内置网络协议栈(蓝牙、Wi-Fi、Thread等)
|
||||||
|
|
||||||
|
**AI能力**:
|
||||||
|
- 内置ML子系统
|
||||||
|
- 支持TensorFlow Lite Micro
|
||||||
|
- CMSIS-NN集成
|
||||||
|
- 适用于复杂IoT场景的多连接需求
|
||||||
|
|
||||||
|
**定位**:开放治理、连接复杂IoT场景。适合多连接复杂IoT设备、长期演进迭代。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 3. ThreadX / Azure RTOS / Microsoft
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 内核仅2KB内存占用(三种RTOS中最小)
|
||||||
|
- 响应延迟约11.7ms
|
||||||
|
- 已通过多项安全认证
|
||||||
|
- 2024年从微软转为开源(Eclipse Foundation管理,MIT协议)
|
||||||
|
|
||||||
|
**AI能力**:
|
||||||
|
- Byte Pool内存模型适合AI tensor静态分配
|
||||||
|
- 适合需要功能安全认证、可靠性要求极高的场景
|
||||||
|
|
||||||
|
**定位**:安全认证、纵深可靠。适合功能安全认证、可靠性要求极高的产品。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 4. RTOS选型对比实证
|
||||||
|
|
||||||
|
**来源**:[Real-time Operating Systems (RTOS) For Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) (Hasan等, 2025年6月)
|
||||||
|
|
||||||
|
**实验配置**:STM32H7平台,运行量化CNN
|
||||||
|
|
||||||
|
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|
||||||
|
|------|---------|--------|----------|---------|
|
||||||
|
| 内核大小 | 2KB | 30KB | 15KB | 信息不足 |
|
||||||
|
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | 信息不足 |
|
||||||
|
| 成熟度 | 4/4 | 3/4 | 2/4 | 4/4 |
|
||||||
|
|
||||||
|
**核心结论**:
|
||||||
|
- ThreadX在资源占用和响应时间上取得最佳平衡
|
||||||
|
- FreeRTOS资源占用最低但推理延迟最高
|
||||||
|
- Zephyr提供丰富协议栈但内存开销最大
|
||||||
|
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 5. VxWorks / Wind River
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 行业最知名RTOS之一
|
||||||
|
- 定价:约$18,500/seat
|
||||||
|
- 通过IEC 61508、ISO 26262、DO-178C安全标准认证
|
||||||
|
- 确定性抢占式调度,低延迟、最小抖动
|
||||||
|
|
||||||
|
**定位**:高安全、高可靠、任务关键场景。适合航空航天、国防、汽车。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 6. QNX / BlackBerry
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 汽车领域主导RTOS
|
||||||
|
- 微内核架构
|
||||||
|
- 通过DO-178C、ISO 26262等车规认证
|
||||||
|
|
||||||
|
**定位**:车载信息娱乐系统、ADAS等汽车电子。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 二、国际LLM推理框架
|
||||||
|
|
||||||
|
### 1. llama.cpp
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 语言:C++,SIMD优化
|
||||||
|
- 格式:GGUF(Hugging Face事实标准)
|
||||||
|
- 硬件:CPU、CUDA、Metal、Vulkan
|
||||||
|
- 授权:MIT
|
||||||
|
- 优势:最可移植的运行时,零依赖
|
||||||
|
|
||||||
|
**适用场景**:CPU优先、需要最大可移植性时选择。运行于x86、ARM、Apple Silicon、Raspberry Pi。
|
||||||
|
|
||||||
|
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) (2026年7月)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. TensorRT-LLM / NVIDIA
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 专注NVIDIA GPU最大效率
|
||||||
|
- 融合算子、优化FP8/INT8路径
|
||||||
|
- 深度集成Triton推理服务器
|
||||||
|
|
||||||
|
**Edge LLM SDK**:
|
||||||
|
- Jetson Thor上生产级运行时
|
||||||
|
- 支持NVFP4量化格式(来自Blackwell架构)
|
||||||
|
- 支持EAGLE-3推测解码,Llama 3.3 70B吞吐提升2.5倍
|
||||||
|
|
||||||
|
**来源**:[Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on NVIDIA Jetson AGX Thor](https://developer.nvidia.com/blog/unlock-faster-smarter-edge-models-with-7x-gen-ai-performance-on-nvidia-jetson-agx-thor) (2025年10月)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 3. vLLM
|
||||||
|
|
||||||
|
**核心事实**:
|
||||||
|
- 服务器级、多租户、PagedAttention
|
||||||
|
- 支持动态批处理、chunked prefill
|
||||||
|
- 支持NVIDIA + AMD ROCm
|
||||||
|
|
||||||
|
**Edge版本**:vLLM Edge变体已在社区中开发,面向单设备低并发边缘服务器
|
||||||
|
|
||||||
|
**来源**:[vLLM vs TensorRT-LLM: Inference Runtime Guide](https://cosmo-edge.com/vllm-vs-tensorrt-llm/) (2026年2月)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 4. 运行时框架对比
|
||||||
|
|
||||||
|
**来源**:[Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
|
||||||
|
|
||||||
|
| 运行时 | 核心优势 | 适用场景 |
|
||||||
|
|--------|---------|---------|
|
||||||
|
| llama.cpp | CPU优先、最可移植 | 跨平台、portability优先 |
|
||||||
|
| Ollama | llama.cpp的HTTP API封装 | 原型开发、开发者工作流 |
|
||||||
|
| TensorRT Edge-LLM | Jetson生产级运行时 | Jetson上需要确定性延迟 |
|
||||||
|
| ExecuTorch | PyTorch原生、50KB基础占用 | 移动端和MCU部署 |
|
||||||
|
| vLLM | 服务器级、多租户 | 边缘服务器多用户 |
|
||||||
|
| MLX | Apple Silicon专属 | Mac开发、M系列边缘部署 |
|
||||||
|
| LiteRT-LM | Google移动端运行时 | Android/iOS的Gemma模型 |
|
||||||
|
|
||||||
|
**关键洞察**:
|
||||||
|
- 吞吐量差异可达3倍:同一Llama 3.3 70B模型在Jetson Thor上,不同运行时可产生巨大差异
|
||||||
|
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
|
||||||
|
- KV cache管理是生产部署成败关键:PagedAttention (vLLM)、KV cache量化 (TensorRT-LLM)、attention-sink驱逐 (StreamingLLM)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 三、智能体(Agent)框架
|
||||||
|
|
||||||
|
### 1. 框架对比(2026年7月)
|
||||||
|
|
||||||
|
**来源**:[Best AI Agent Frameworks | AI Wiki](https://aiwiki.ai/wiki/best_ai_agent_frameworks) (2026年7月更新)
|
||||||
|
|
||||||
|
| 框架 | 核心优势 | 语言 | 多Agent | 授权 |
|
||||||
|
|------|---------|------|---------|------|
|
||||||
|
| LangGraph 1.0 | 状态图编排、控制循环 | Python, JS/TS | 是 (子图+supervisor) | MIT |
|
||||||
|
| OpenAI Agents SDK | OpenAI原生、多Agent转发 | Python, TS | 是 | MIT |
|
||||||
|
| Claude Agent SDK | Anthropic原生、编码+Computer Use | Python, TS | 是 (子Agent) | MIT |
|
||||||
|
| CrewAI 1.14 | 角色驱动Crew快速原型 | Python | 是 | MIT |
|
||||||
|
| Microsoft Agent Framework 1.0 | .NET/Azure企业级 | .NET, Python | 是 | MIT |
|
||||||
|
| LlamaIndex Workflows 1.0 | RAG密集型Agent | Python, TS | 是 | MIT |
|
||||||
|
| Google ADK 2.0 | GCP原生、Gemini集成 | Python, Java, Go, TS | 是 | Apache-2.0 |
|
||||||
|
|
||||||
|
**关键选择建议**:
|
||||||
|
- 编排和状态图控制:选LangGraph 1.0 (GA 2025年10月)
|
||||||
|
- 快速角色原型:选CrewAI 1.14
|
||||||
|
- 企业.NET/Azure:选Microsoft Agent Framework 1.0 (GA 2026年)
|
||||||
|
- RAG密集型:选LlamaIndex Workflows 1.0
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. LangChain vs CrewAI vs AutoGen 生产对比
|
||||||
|
|
||||||
|
**来源**:[LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales?](https://markaicode.com/best/best-ai-agent-framework/) (2026年5月)
|
||||||
|
|
||||||
|
**测试配置**:Ubuntu 22.04 + Python 3.11 + GPT-4o
|
||||||
|
|
||||||
|
| 框架 | 版本 | 核心特点 |
|
||||||
|
|------|------|---------|
|
||||||
|
| LangChain/LangGraph | 0.3.17 | 灵活性、工具生态、图结构状态管理 |
|
||||||
|
| CrewAI | 0.105.0 | 角色驱动、顺序/层级流程、样板代码减少40% |
|
||||||
|
| AutoGen | 0.7.7 | 多轮对话、代码执行、错误恢复率92% |
|
||||||
|
| Semantic Kernel | 1.17.0 | .NET/Azure集成、最小开销 |
|
||||||
|
| Agno | 1.1.0 | 轻量、纯Pydantic、包体积比LangChain小60% |
|
||||||
|
|
||||||
|
**核心结论**:
|
||||||
|
- 生产部署:LangChain (LangGraph) 在灵活性和工具生态上胜出
|
||||||
|
- 快速原型:CrewAI 10分钟内可运行多Agent系统
|
||||||
|
- 复杂工具使用:AutoGen在代码生成和错误恢复方面最佳
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 四、NVIDIA Jetson:物理AI+智能体AI
|
||||||
|
|
||||||
|
### 1. Jetson智能体就绪(2026年6月)
|
||||||
|
|
||||||
|
**来源**:[NVIDIA Jetson 将智能体 AI 带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) (2026年6月)
|
||||||
|
|
||||||
|
**核心事件**:JetPack 7.2 + NemoClaw 正式发布
|
||||||
|
|
||||||
|
**三层架构**:
|
||||||
|
1. **底层**:JetPack 7.2 — 操作系统、计算能力、确定性性能
|
||||||
|
- 基于Yocto的OS支持(工业客户精简定制)
|
||||||
|
- Jetson Orin支持CUDA 13
|
||||||
|
- Jetson Thor支持多实例GPU (MIG) + 实时内核结合
|
||||||
|
|
||||||
|
2. **中间层**:智能体技能 — 自动化开发者任务
|
||||||
|
- Linux定制、内存优化、模型基准测试
|
||||||
|
- 从数周缩短到数天
|
||||||
|
|
||||||
|
3. **顶层**:NemoClaw — 直接部署到Jetson
|
||||||
|
- 一条命令部署AI智能体
|
||||||
|
- 支持视觉推理智能体(实时观察、理解、行动)
|
||||||
|
|
||||||
|
**合作案例**:Solomon 3D采用NemoClaw实现人形机器人上多Agent协同
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. Cosmos 3 Edge:端侧世界模型(2026年7月)
|
||||||
|
|
||||||
|
**来源**:[NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) (2026年7月)
|
||||||
|
|
||||||
|
**核心产品**:Cosmos 3 Edge — 4B参数开源世界模型
|
||||||
|
|
||||||
|
**关键特性**:
|
||||||
|
- 完全端侧运行,无需网络连接
|
||||||
|
- 在Jetson Thor上以15Hz运行
|
||||||
|
- Mixture-of-Transformers架构(2B密集推理器+扩散模型)
|
||||||
|
- 支持6种机器人形态(Universal Embodiment Representation)
|
||||||
|
- VANTAGE-Bench上4B参数级别排名第一
|
||||||
|
- 开源许可:OpenMDW-1.1
|
||||||
|
|
||||||
|
**行业背景**:
|
||||||
|
- 日本Noetra项目:23亿美元政府投资,27,500台NVIDIA Rubin GPU
|
||||||
|
- 目标:2040年1000万台机器人
|
||||||
|
- 全球首个类人机器人活体动物手术(UCSD,Nature 2026)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 3. Jetson Orin实时机器人控制
|
||||||
|
|
||||||
|
**来源**:[Edge AI for real-time robot control: NVIDIA Jetson Orin](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) (2026年4月)
|
||||||
|
|
||||||
|
**关键数据**:
|
||||||
|
- AGX Orin:275 TOPS AI算力,15-60W功耗
|
||||||
|
- 性能提升:较AGX Xavier提升6倍
|
||||||
|
- 延迟优势:边缘推理<1ms vs 云端往返50-200ms
|
||||||
|
|
||||||
|
**完整技术栈**:
|
||||||
|
|
||||||
|
| 层级 | NVIDIA技术 | 功能 |
|
||||||
|
|------|-----------|------|
|
||||||
|
| 硬件 | Jetson Orin AGX/NX/Nano | 边缘AI计算平台 |
|
||||||
|
| 运行时 | JetPack SDK + CUDA | 基础OS、驱动、CUDA |
|
||||||
|
| 推理引擎 | TensorRT | INT8/FP16量化推理 |
|
||||||
|
| 视觉 | DeepStream SDK | 多路视频分析管道 |
|
||||||
|
| 机器人 | Isaac ROS | ROS 2兼容的硬件加速算法 |
|
||||||
|
| 仿真 | Isaac Sim (Omniverse) | 机器人仿真训练测试 |
|
||||||
|
| 基础模型 | NVIDIA Cosmos | 机器人学习和规划的世界模型 |
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 4. Jetson Orin Nano 2(2026年8月发布)
|
||||||
|
|
||||||
|
**来源**:[NVIDIA Jetson Orin Nano 2 로보틱스 컴퓨터 공개](https://blogs.nvidia.co.kr/blog/nvidia-announces-jetson-orin-nano-2-robotics-computer-to-redefine-entry-level-edge-ai/) (2026年8月)
|
||||||
|
|
||||||
|
**核心参数**:
|
||||||
|
- 78 TOPS AI算力
|
||||||
|
- 8GB内存
|
||||||
|
- 8核Arm CPU
|
||||||
|
- 15W模式下较前代功耗降低40%
|
||||||
|
|
||||||
|
**已采用合作伙伴**:
|
||||||
|
- 柯尼卡美能达(Cognex):工业视觉检测
|
||||||
|
- 斗山Bobcat:工程机械机器人
|
||||||
|
- Matic Robots:家用机器人
|
||||||
|
- Wing(Alphabet旗下):配送无人机
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 五、学术研究热点
|
||||||
|
|
||||||
|
### 1. 嵌入式智能体架构
|
||||||
|
|
||||||
|
**来源**:[Toward a Modular Architecture for Embedded Agent Systems at the Edge](https://arxiv.org/html/2606.02862) (arXiv:2606.02862, 2026年6月)
|
||||||
|
|
||||||
|
**核心贡献**:
|
||||||
|
- 提出嵌入式智能体模块化参考架构
|
||||||
|
- 区分两种形态:
|
||||||
|
- **自治端侧Agent**:运行高度压缩神经网络+规则逻辑,低延迟隐私关键任务
|
||||||
|
- **云端增强Agent**:利用SLM进行高层推理和规划
|
||||||
|
- 引入跨域治理层(Governance Layer)保障可观测性、策略执行和安全
|
||||||
|
|
||||||
|
**关键需求**:
|
||||||
|
- 毫秒级响应延迟和确定性行为
|
||||||
|
- 能量效率:嵌入式Agent需长期运行
|
||||||
|
- 本地感知-动作闭环无网络延迟
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 2. 异构SoC上的Agent调度
|
||||||
|
|
||||||
|
**来源**:[Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC](https://arxiv.org/html/2506.24045v2) (arXiv:2506.24045, 2026年1月)
|
||||||
|
|
||||||
|
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式,现有引擎不支持流级并发
|
||||||
|
|
||||||
|
**技术方案**:
|
||||||
|
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性和弹性操作符绑定
|
||||||
|
- **流感知NPU-iGPU协同**:解耦prefill和decode减少带宽争用
|
||||||
|
- **细粒度抢占**:slack-aware piggybacking保证响应式不饿死主动式
|
||||||
|
|
||||||
|
**性能提升**:
|
||||||
|
- 主动式吞吐提升1.2-4.9倍
|
||||||
|
- 响应式延迟降低≥91%
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 3. Edge LLM推理评测
|
||||||
|
|
||||||
|
**来源**:[LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load](https://arxiv.org/html/2603.23640v2) (arXiv:2603.23640, 2026年6月)
|
||||||
|
|
||||||
|
**实验配置**:Qwen 2.5 1.5B (4-bit量化),258-token prompt,贪婪解码
|
||||||
|
|
||||||
|
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|
||||||
|
|------|---------|------|---------|
|
||||||
|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
|
||||||
|
| iPhone 16 Pro | 23.7 tok/s | 信息不足 | 3次迭代后降额40% |
|
||||||
|
| S24 Ultra | 10 tok/s | 信息不足 | 20次迭代后降额~15% |
|
||||||
|
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
|
||||||
|
|
||||||
|
**核心结论**:移动端热管理是比峰值算力更主要的约束;专用NPU在能量效率上匹配GPU(19倍低功耗)。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 4. 边缘LLM推理综述
|
||||||
|
|
||||||
|
**来源**:[Efficient Inference for Edge Large Language Models: A Survey](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) (Cai等, 2025年)
|
||||||
|
|
||||||
|
**两大运行时优化策略**:
|
||||||
|
- **推测解码(Speculative Decoding)**:利用小模型提议候选token,大模型并行验证
|
||||||
|
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘高速单元,低频部分放边缘服务器或云端
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 5. LLM推理调度综述
|
||||||
|
|
||||||
|
**来源**:[LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) (华为技术, 2025年11月)
|
||||||
|
|
||||||
|
**覆盖方向**:
|
||||||
|
- 控制平面和数据平面的调度策略
|
||||||
|
- 冷启动延迟、HOL阻塞、资源利用率、动态负载变化
|
||||||
|
- 强化学习调度、自适应批处理、推测执行、多租户调度
|
||||||
|
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
|
||||||
@@ -0,0 +1,309 @@
|
|||||||
|
# 03-学术文献
|
||||||
|
|
||||||
|
## 一、RTOS + AI/Edge推理
|
||||||
|
|
||||||
|
### 论文1: RTOS内核在Edge AI上的实证对比
|
||||||
|
|
||||||
|
**标题**:Real-time Operating Systems (RTOS) For Edge AI
|
||||||
|
|
||||||
|
**作者**:Forhad Monjur Hasan, Onell Allan Chakawuya, Mostafa Mohammad Razaul
|
||||||
|
|
||||||
|
**机构**:中国西部师范大学 电子与信息工程系
|
||||||
|
|
||||||
|
**发表**:International Journal of Trends in Emerging Research and Development, 2025年6月
|
||||||
|
|
||||||
|
**链接**:[https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf)
|
||||||
|
|
||||||
|
**DOI**:10.5281/zenodo.16729307
|
||||||
|
|
||||||
|
**实验配置**:STM32H7平台,运行量化CNN
|
||||||
|
|
||||||
|
**核心结果**:
|
||||||
|
|
||||||
|
| 指标 | ThreadX | Zephyr | FreeRTOS | VxWorks |
|
||||||
|
|------|---------|--------|----------|---------|
|
||||||
|
| 内核大小 | 2KB | 30KB | 15KB | - |
|
||||||
|
| 推理响应延迟 | 11.7ms | 12.3ms | 13.8ms | - |
|
||||||
|
| 成熟度评分 | 4/4 | 3/4 | 2/4 | 4/4 |
|
||||||
|
|
||||||
|
**关键结论**:
|
||||||
|
- AI推理在MCU上能否落地,第一看RAM峰值,第二看推理时延
|
||||||
|
- RTOS需与推理框架(TFLite Micro、CMSIS-NN)紧密协作
|
||||||
|
- 随着Edge AI进入安全关键场景(自动驾驶、医疗诊断),需要可认证和形式化验证的RTOS
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文2: 嵌入式智能体模块化架构
|
||||||
|
|
||||||
|
**标题**:Toward a Modular Architecture for Embedded Agent Systems at the Edge
|
||||||
|
|
||||||
|
**作者**:Marcus Rüb (Foresthub.Ai), Michael Gerhards (Deloitte Consulting)
|
||||||
|
|
||||||
|
**发表**:arXiv:2606.02862, 2026年6月
|
||||||
|
|
||||||
|
**链接**:[https://arxiv.org/html/2606.02862](https://arxiv.org/html/2606.02862)
|
||||||
|
|
||||||
|
**核心贡献**:
|
||||||
|
- 提出嵌入式智能体模块化参考架构
|
||||||
|
- 两种Agent形态:
|
||||||
|
- **自治端侧Agent**:规则+高度压缩神经网络,低延迟隐私关键任务
|
||||||
|
- **云端增强Agent**:SLM进行高层推理和规划
|
||||||
|
- 跨域治理层(Governance Layer)保障可观测性、策略执行和安全
|
||||||
|
|
||||||
|
**关键需求**:
|
||||||
|
- 毫秒级响应延迟和确定性行为
|
||||||
|
- 本地感知-动作闭环无网络延迟
|
||||||
|
- 能量效率:嵌入式Agent需长期运行
|
||||||
|
|
||||||
|
**应用场景**:
|
||||||
|
- 智慧农业(系留式Agent)
|
||||||
|
- 预测性维护(混合模式)
|
||||||
|
- 隐私优先智能家居(自治式)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文3: AI辅助工程化方法
|
||||||
|
|
||||||
|
**标题**:基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计与实现
|
||||||
|
|
||||||
|
**作者**:吴薇(杭州电子科技大学 / 江苏矽望电子科技有限公司)
|
||||||
|
|
||||||
|
**发表**:电信科技, 2026年5月
|
||||||
|
|
||||||
|
**链接**:[https://pdf.hanspub.org/etis_1380065.pdf](https://pdf.hanspub.org/etis_1380065.pdf)
|
||||||
|
|
||||||
|
**核心方法**:
|
||||||
|
- 面向Zephyr RTOS的"三文件"提示策略:
|
||||||
|
- 硬件覆盖文件 (.overlay/.dts)
|
||||||
|
- 项目配置文件 (prj.conf)
|
||||||
|
- 主程序文件 (main.c)
|
||||||
|
|
||||||
|
**参考实现**:Project Velocity原型系统(STM32 + RK3588 + ThingsBoard)
|
||||||
|
|
||||||
|
**应用场景**:预测性维护、工业AIoT
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 二、Edge LLM推理
|
||||||
|
|
||||||
|
### 论文4: 端侧LLM推理框架对比
|
||||||
|
|
||||||
|
**标题**:The Edge LLM Runtime Stack 2026: llama.cpp, Ollama, TensorRT Edge-LLM, ExecuTorch, vLLM, MLX, LiteRT-LM
|
||||||
|
|
||||||
|
**作者**:Edge AI Stack
|
||||||
|
|
||||||
|
**发表**:2026年7月
|
||||||
|
|
||||||
|
**链接**:[https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/)
|
||||||
|
|
||||||
|
**对比维度**:7大运行时框架的硬件适配、吞吐量、量化支持
|
||||||
|
|
||||||
|
**关键发现**:
|
||||||
|
- 同一Llama 3.3 70B模型在Jetson Thor上,不同运行时吞吐量差异可达3倍
|
||||||
|
- 量化格式不能混用:GGUF Q4_K_M可跨平台,但NVFP4仅限Blackwell
|
||||||
|
- KV cache管理是生产部署成败关键
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文5: 移动端NPU推理持续负载评测
|
||||||
|
|
||||||
|
**标题**:LLM Inference at the Edge: Mobile, NPU, and GPU Performance Efficiency Trade-offs Under Sustained Load
|
||||||
|
|
||||||
|
**作者**:Pranay Tummalapalli, Sahil Arayakandy, Ritam Pal, Kautuk Kundan (Conscious Engines)
|
||||||
|
|
||||||
|
**发表**:arXiv:2603.23640, 2026年6月
|
||||||
|
|
||||||
|
**链接**:[https://arxiv.org/html/2603.23640v2](https://arxiv.org/html/2603.23640v2)
|
||||||
|
|
||||||
|
**实验配置**:Qwen 2.5 1.5B (4-bit量化)
|
||||||
|
|
||||||
|
| 平台 | 持续吞吐 | 功耗 | 关键约束 |
|
||||||
|
|------|---------|------|---------|
|
||||||
|
| RTX 4050 | 131.7 tok/s | 34.1W | 电池功率上限 |
|
||||||
|
| iPhone 16 Pro | 23.7 tok/s | - | 3次迭代后降额40% |
|
||||||
|
| S24 Ultra | 10 tok/s | - | 20次迭代后降额~15% |
|
||||||
|
| Pi 5 + Hailo-10H | 6.9 tok/s | <2W | 模块内存带宽 |
|
||||||
|
|
||||||
|
**核心结论**:
|
||||||
|
- 移动端热管理是比峰值算力更主要的约束
|
||||||
|
- iPhone 16 Pro在3次迭代后进入"热态"平台期
|
||||||
|
- 专用NPU在能量效率上匹配GPU(19倍低功耗)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文6: 边缘LLM推理综述
|
||||||
|
|
||||||
|
**标题**:Efficient Inference for Edge Large Language Models: A Survey
|
||||||
|
|
||||||
|
**作者**:Guanyu Cai, Ruiming Tian, Lang Yang, Yunzhe Jia, Lingkun Li, Jiliang Wang
|
||||||
|
|
||||||
|
**发表**:Science China Information Sciences / Tsinghua Science and Technology, 2025年
|
||||||
|
|
||||||
|
**链接**:[https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf)
|
||||||
|
|
||||||
|
**两大运行时优化策略**:
|
||||||
|
- **推测解码(Speculative Decoding)**:小模型提议候选token,大模型并行验证
|
||||||
|
- **模型卸载(Model Offloading)**:战略分区LLM,高频组件放边缘,低频部分放服务器/云端
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文7: 边缘中心生成式AI综述
|
||||||
|
|
||||||
|
**标题**:Edge-Centric Generative AI: A Survey on Efficient Inference for Large Language Models in Resource-Constrained Environments
|
||||||
|
|
||||||
|
**作者**:Rui Huang (独立研究员)
|
||||||
|
|
||||||
|
**发表**:Journal of Computer and Communications, 14(4), 238-253, 2026年4月
|
||||||
|
|
||||||
|
**链接**:[https://content.scirp.org/pdf/jcc_1733489.pdf](https://content.scirp.org/pdf/jcc_1733489.pdf)
|
||||||
|
|
||||||
|
**核心框架**:
|
||||||
|
- 定义"推理调度"为计算图到处理器的映射函数
|
||||||
|
- 目标:在功率约束下最小化总延迟
|
||||||
|
- 通过Roofline Model和热力学极限形式化模型保真度与硬件约束的权衡
|
||||||
|
|
||||||
|
**设备分类**:
|
||||||
|
- 智能手机/平板:6-12GB LPDDR5, 4-8W TDP
|
||||||
|
- 可穿戴设备:<2W TDP, 皮肤温度上限~42°C
|
||||||
|
- 嵌入式SoC/IoT网关:4-8GB共享DRAM, 5-15W TDP
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 三、LLM调度系统
|
||||||
|
|
||||||
|
### 论文8: 异构SoC上的Agent调度
|
||||||
|
|
||||||
|
**标题**:Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC
|
||||||
|
|
||||||
|
**作者**:Xinming Wei, Jiahao Zhang, Haoran Li等
|
||||||
|
|
||||||
|
**机构**:北京大学 多媒体信息处理国家重点实验室 / 香港大学
|
||||||
|
|
||||||
|
**发表**:arXiv:2506.24045, 2026年1月
|
||||||
|
|
||||||
|
**链接**:[https://arxiv.org/html/2506.24045v2](https://arxiv.org/html/2506.24045v2)
|
||||||
|
|
||||||
|
**核心问题**:个人LLM Agent混合响应式(前台)和主动式(后台)执行模式
|
||||||
|
|
||||||
|
**技术方案**:
|
||||||
|
- **HEG(异构执行图)**:捕获NPU/iGPU亲和性
|
||||||
|
- **流感知NPU-iGPU协同**:解耦prefill和decode
|
||||||
|
- **细粒度抢占**:slack-aware piggybacking
|
||||||
|
|
||||||
|
**性能提升**:
|
||||||
|
- 主动式吞吐提升1.2-4.9倍
|
||||||
|
- 响应式延迟降低≥91%
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文9: LLM推理调度综述
|
||||||
|
|
||||||
|
**标题**:LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs
|
||||||
|
|
||||||
|
**作者**:华为技术团队 (Yong Zhang, Zhenan Fan等)
|
||||||
|
|
||||||
|
**发表**:TechRxiv, 2025年11月
|
||||||
|
|
||||||
|
**链接**:[https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true)
|
||||||
|
|
||||||
|
**覆盖方向**:
|
||||||
|
- 控制平面和数据平面的调度策略
|
||||||
|
- 冷启动延迟、HOL阻塞、资源利用率
|
||||||
|
- 强化学习调度、自适应批处理、推测执行
|
||||||
|
- 开放方向:ML驱动的自适应调度、能耗感知推理、异构硬件利用
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 四、端侧AI框架(华为鸿蒙)
|
||||||
|
|
||||||
|
### 论文10: 鸿蒙端侧AI推理
|
||||||
|
|
||||||
|
**标题**:鸿蒙开发之路:端侧模型压缩、量化与加速技术详解
|
||||||
|
|
||||||
|
**作者**:CSDN博主 zq18
|
||||||
|
|
||||||
|
**发表**:博客园, 2026年
|
||||||
|
|
||||||
|
**链接**:[https://www.cnblogs.com/zq18/p/19263508](https://www.cnblogs.com/zq18/p/19263508)
|
||||||
|
|
||||||
|
**三大压缩技术对比**:
|
||||||
|
|
||||||
|
| 技术 | 核心思想 | 压缩效果 | 精度损失 | 适用阶段 |
|
||||||
|
|------|---------|---------|---------|---------|
|
||||||
|
| 剪枝 | 移除冗余参数 | 30-70% | 3-10% | 训练后/微调 |
|
||||||
|
| 量化 | 降低数值精度 | 40-60% | 1-5% | 训练后/感知训练 |
|
||||||
|
| 知识蒸馏 | 知识迁移 | 50-80% | 2-8% | 训练阶段 |
|
||||||
|
|
||||||
|
**HarmonyOS推荐**:混合剪枝策略 — 先结构化剪枝保证硬件效率,再配合非结构化剪枝
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文11: 鸿蒙AI框架集成
|
||||||
|
|
||||||
|
**标题**:鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化
|
||||||
|
|
||||||
|
**作者**:bug菌
|
||||||
|
|
||||||
|
**发表**:华为云社区, 2025年11月
|
||||||
|
|
||||||
|
**链接**:[https://bbs.huaweicloud.cn/blogs/467036](https://bbs.huaweicloud.cn/blogs/467036)
|
||||||
|
|
||||||
|
**核心内容**:MindSpore Lite推理引擎的Native C API使用和端侧推理优化技巧
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文12: 端侧AI框架让智能真正贴身随行
|
||||||
|
|
||||||
|
**标题**:端侧 AI 框架让智能真正贴身随行
|
||||||
|
|
||||||
|
**作者**:佩臻(华为开发者联盟)
|
||||||
|
|
||||||
|
**发表**:华为开发者联盟, 2026年1月
|
||||||
|
|
||||||
|
**链接**:[https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385)
|
||||||
|
|
||||||
|
**关键数据**:
|
||||||
|
- 鸿蒙端侧AI已支持超200种预置模型
|
||||||
|
- 覆盖图像、语音、文本、传感器四大类
|
||||||
|
- 开放Model Zoo供开发者一键集成
|
||||||
|
- 某翻译应用接入后,离线翻译速度提升3倍,电池续航延长40%
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 五、物理AI与机器人
|
||||||
|
|
||||||
|
### 论文13: 物理AI机器人革命
|
||||||
|
|
||||||
|
**标题**:NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026
|
||||||
|
|
||||||
|
**作者**:Arjun Mehta
|
||||||
|
|
||||||
|
**发表**:JustLast.in, 2026年7月
|
||||||
|
|
||||||
|
**链接**:[https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/)
|
||||||
|
|
||||||
|
**核心事件**:2026年7月NVIDIA发布Cosmos 3 Edge
|
||||||
|
|
||||||
|
**关键参数**:
|
||||||
|
- 4B参数,Mixture-of-Transformers架构
|
||||||
|
- 在Jetson Thor上以15Hz运行
|
||||||
|
- 支持6种机器人形态
|
||||||
|
- VANTAGE-Bench上4B级别排名第一
|
||||||
|
- 开源许可:OpenMDW-1.1
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
### 论文14: 机器人实时控制
|
||||||
|
|
||||||
|
**标题**:Edge AI for real-time robot control: NVIDIA Jetson Orin
|
||||||
|
|
||||||
|
**作者**:SCALE D2C
|
||||||
|
|
||||||
|
**发表**:2026年4月
|
||||||
|
|
||||||
|
**链接**:[https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html)
|
||||||
|
|
||||||
|
**核心数据**:
|
||||||
|
- AGX Orin:275 TOPS,15-60W
|
||||||
|
- 边缘推理<1ms vs 云端往返50-200ms
|
||||||
|
- 技术栈:TensorRT + DeepStream + Isaac ROS + Isaac Sim
|
||||||
@@ -0,0 +1,126 @@
|
|||||||
|
# 04-关键研究空白
|
||||||
|
|
||||||
|
## 概述
|
||||||
|
|
||||||
|
基于行业同行研究和本项目框架(框架1、框架2),以下方向系统级实时性研究尚属空白或刚刚开始,是本项目可重点突破的研究机会。
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白1:RTOS + LLM推理的系统级实时性保障
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- 现有研究关注单一层面:RTOS调度或LLM推理,但缺少跨系统级实时性分析
|
||||||
|
- arXiv:2606.02862 提出嵌入式Agent架构,但未深入RTOS调度与LLM推理的协同
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- 建立从RTOS调度到LLM推理延迟的全链路实时性分析模型
|
||||||
|
- 定义RTOS环境中LLM推理的"实时性"标准
|
||||||
|
- 研究推理框架与RTOS调度器的协同优化
|
||||||
|
|
||||||
|
**与项目关联**:框架1、框架2的核心研究方向
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白2:混合系统(Linux + RTOS + Hypervisor)中的AI负载准入与隔离
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- NVIDIA Jetson Thor支持MIG + 实时内核结合(来源:[NVIDIA Jetson将智能体AI带入物理世界](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/))
|
||||||
|
- 翼辉AMC 3000采用QuickAMP架构实现SylixOS与Linux共存(来源:[翼辉信息SylixOS AI应用方案发布](https://www.elecfans.com/d/6800705.html))
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- AI负载准入控制策略:如何在不破坏实时边界的前提下承载AI推理
|
||||||
|
- Hypervisor层面的资源隔离机制
|
||||||
|
- 混合系统中实时域与非实时域的通信开销分析
|
||||||
|
|
||||||
|
**与项目关联**:框架2子课题B的核心研究方向
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白3:MCU级别的智能推理
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- arXiv:2606.02862 提出端侧Agent需毫秒级响应延迟
|
||||||
|
- [RTOS for Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 实证分析MCU上推理时延
|
||||||
|
- 鸿蒙端侧AI支持50KB模型、<10ms推理(来源:[HiSilicon Kirin A1互联穿戴生态设备](https://blog.csdn.net/weixin_33193177/article/details/154404675))
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- 资源极度受限条件下的AI控制闭环
|
||||||
|
- 小模型(Phi-2、Gemma等)在MCU上的部署优化
|
||||||
|
- 静态编排工具链与芯片协同
|
||||||
|
|
||||||
|
**与项目关联**:框架2子课题A的核心研究方向
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白4:模型输出与规则兜底的混合闭环
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- arXiv:2606.02862 提出端侧Agent的规则+SLM混合模式
|
||||||
|
- [Agent.xpu](https://arxiv.org/html/2506.24045v2) 的细粒度抢占机制
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- LLM输出验证与约束机制
|
||||||
|
- 规则系统与LLM的混合决策
|
||||||
|
- 安全关键场景下的兜底策略
|
||||||
|
|
||||||
|
**与项目关联**:框架2共享方法层(规则兜底与控制闭环)
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白5:边缘侧轻量级Agent框架
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- 主流Agent框架(LangGraph、CrewAI、AutoGen等)面向云端/服务器
|
||||||
|
- [Edge LLM Runtime Stack 2026](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) 对比7大运行时,但无嵌入式Agent框架
|
||||||
|
- ExecuTorch仅50KB基础占用,但非Agent框架
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- 资源受限环境下的Agent运行时
|
||||||
|
- 轻量级Agent通信机制
|
||||||
|
- 嵌入式环境中的Agent安全与隔离
|
||||||
|
|
||||||
|
**与项目关联**:可扩展研究方向
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白6:AI + 实时系统的标准化与基准测试
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- [RTOS for Edge AI](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) 提供初步基准(STM32H7上量化CNN)
|
||||||
|
- NVIDIA提供Jetson LLM基准工具,但无统一标准
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- 定义AI+实时系统的测试基准
|
||||||
|
- 建立标准化的评测体系
|
||||||
|
- 开源评测工具链
|
||||||
|
|
||||||
|
**与项目关联**:框架1实验设计、框架2共享方法层
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 空白7:五类部署形态的系统级对比
|
||||||
|
|
||||||
|
**行业现状**:
|
||||||
|
- NVIDIA Jetson平台覆盖Nano(5 TOPS)到AGX Orin(275 TOPS)五类部署形态
|
||||||
|
- [Edge LLM at the Edge](https://arxiv.org/html/2603.23640v2) 对比4平台
|
||||||
|
|
||||||
|
**研究空白**:
|
||||||
|
- T5控制端MCU ~ T1服务器集群的系统级对比
|
||||||
|
- 不同部署形态下的实时性差异量化
|
||||||
|
- 从控制端到服务器的技术迁移路径
|
||||||
|
|
||||||
|
**与项目关联**:框架1的五类场景研究、框架2的验证矩阵
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 与本项目框架的对齐
|
||||||
|
|
||||||
|
| 研究空白 | 项目框架1 | 项目框架2 |
|
||||||
|
|---------|----------|----------|
|
||||||
|
| 1. 系统级实时性保障 | 五类场景推理图调度、KV-Cache、量化精度感知 | 共享方法层、三层边界 |
|
||||||
|
| 2. 混合系统AI负载隔离 | - | 子课题B(Linux-RTOS-Hypervisor) |
|
||||||
|
| 3. MCU级智能推理 | T5控制端MCU | 子课题A(静态智能控制) |
|
||||||
|
| 4. 规则兜底混合闭环 | - | 共享方法层(规则兜底) |
|
||||||
|
| 5. 边缘侧Agent框架 | - | 可扩展 |
|
||||||
|
| 6. 标准化基准测试 | 实验设计 | 共享方法层 |
|
||||||
|
| 7. 五类部署形态对比 | 核心内容 | 综合比较与收敛 |
|
||||||
@@ -0,0 +1,74 @@
|
|||||||
|
# 05-文献索引
|
||||||
|
|
||||||
|
## 完整文献列表
|
||||||
|
|
||||||
|
### 学术论文(arXiv + 期刊)
|
||||||
|
|
||||||
|
| # | 论文标题 | 作者 | 年份 | 来源 | 链接 |
|
||||||
|
|---|---------|------|------|------|------|
|
||||||
|
| 1 | Toward a Modular Architecture for Embedded Agent Systems at the Edge | Marcus Rüb, Michael Gerhards | 2026 | arXiv:2606.02862 | [链接](https://arxiv.org/html/2606.02862) |
|
||||||
|
| 2 | Real-time Operating Systems (RTOS) For Edge AI | Hasan, Chakawuya, Razaul | 2025 | Int'l Journal of Trends in Emerging Research and Development | [PDF](https://www.researchtrendsjournal.com/uploads/articles/3-4-38.1.pdf) |
|
||||||
|
| 3 | Agent.xpu: Efficient Scheduling of Agentic LLM Workloads on Heterogeneous SoC | Wei, Zhang, Li等 | 2026 | arXiv:2506.24045 | [链接](https://arxiv.org/html/2506.24045v2) |
|
||||||
|
| 4 | LLM Inference at the Edge: Mobile, NPU, and GPU Performance Trade-offs | Tummalapalli, Arayakandy, Pal, Kundan | 2026 | arXiv:2603.23640 | [链接](https://arxiv.org/html/2603.23640v2) |
|
||||||
|
| 5 | Efficient Inference for Edge Large Language Models: A Survey | Cai, Tian, Yang, Jia, Li, Wang | 2025 | Science China Information Sciences | [PDF](https://www.sciopen.com/local/article_pdf/10.26599/TST.2025.9010166.pdf) |
|
||||||
|
| 6 | Edge-Centric Generative AI: A Survey on Efficient Inference for LLMs in Resource-Constrained Environments | Rui Huang | 2026 | Journal of Computer and Communications 14(4) | [PDF](https://content.scirp.org/pdf/jcc_1733489.pdf) |
|
||||||
|
| 7 | LLM Inference Scheduling: A Survey of Techniques, Frameworks, and Trade-offs | 华为技术团队 (Zhang, Fan等) | 2025 | TechRxiv | [PDF](https://www.techrxiv.org/doi/pdf/10.36227/techrxiv.176238087.79673350/v1?download=true) |
|
||||||
|
|
||||||
|
### 行业文章/博客
|
||||||
|
|
||||||
|
| # | 标题 | 作者/机构 | 年份 | 来源 | 链接 |
|
||||||
|
|---|------|----------|------|------|------|
|
||||||
|
| 8 | 翼辉SylixOS:中国自主硬实时操作系统的崛起之路 | CSDN博主 | 2026 | CSDN | [链接](https://blog.csdn.net/hujunming/article/details/148370364) |
|
||||||
|
| 9 | 翼辉信息SylixOS AI应用方案发布 | 翼辉信息 | 2025 | 电子发烧友 | [链接](https://www.elecfans.com/d/6800705.html) |
|
||||||
|
| 10 | 基于AI辅助工程的混合MCU-边缘-云平台的工业AIoT系统设计 | 吴薇 | 2026 | Hans Publishers | [PDF](https://pdf.hanspub.org/etis_1380065.pdf) |
|
||||||
|
| 11 | 鸿蒙开发之路:端侧模型压缩、量化与加速技术详解 | zq18 | 2026 | 博客园 | [链接](https://www.cnblogs.com/zq18/p/19263508) |
|
||||||
|
| 12 | 鸿蒙AI框架(HiAI/MindSpore Lite)集成与推理优化 | bug菌 | 2025 | 华为云社区 | [链接](https://bbs.huaweicloud.cn/blogs/467036) |
|
||||||
|
| 13 | 端侧 AI 框架让智能真正贴身随行 | 佩臻 | 2026 | 华为开发者联盟 | [链接](https://developer.huawei.com/consumer/cn/blog/topic/03203187067519385) |
|
||||||
|
| 14 | HiSilicon Kirin A1互联穿戴生态设备 | CSDN博主 | 2025 | CSDN | [链接](https://blog.csdn.net/weixin_33193177/article/details/154404675) |
|
||||||
|
| 15 | MCU跑AI的RTOS选型:FreeRTOS、ThreadX与Zephyr对比 | 匿名 | 2026 | CSDN | [链接](https://blog.csdn.net/weixin_30036289/article/details/164544991) |
|
||||||
|
| 16 | Unlock Faster, Smarter Edge Models with 7x Gen AI Performance on Jetson AGX Thor | NVIDIA技术博客 | 2025 | NVIDIA Developer | [链接](https://developer.nvidia.com/blog/unlock-faster-smarter-edge-models-with-7x-gen-ai-performance-on-nvidia-jetson-agx-thor) |
|
||||||
|
| 17 | The Edge LLM Runtime Stack 2026 | Edge AI Stack | 2026 | edgeaistack.ai | [链接](https://edgeaistack.ai/blog/edge-llm-runtime-stack-2026/) |
|
||||||
|
| 18 | vLLM vs TensorRT-LLM: Inference Runtime Guide | Jérôme Lafont | 2026 | Cosmo Edge | [链接](https://cosmo-edge.com/vllm-vs-tensorrt-llm/) |
|
||||||
|
| 19 | Running LLMs on Jetson Orin, llama.cpp, Ollama | Aaron Angulo | 2026 | Medium | [链接](https://www.proventusnova.com/blog/llm-inference-jetson-orin-llamacpp-ollama/) |
|
||||||
|
| 20 | NVIDIA Jetson 将智能体 AI 带入物理世界 | NVIDIA中国 | 2026 | NVIDIA博客 | [链接](https://blogs.nvidia.cn/blog/jetson-agentic-ai-physical-world/) |
|
||||||
|
| 21 | NVIDIA Cosmos 3 Edge and the Robot AI Revolution 2026 | Arjun Mehta | 2026 | JustLast.in | [链接](https://www.justlast.in/nvidia-cosmos-3-edge-and-the-robot-ai-revolution-2026-on-device-world-models-humanoid-surgery-and-japans-2-3-billion-noetra-project/) |
|
||||||
|
| 22 | Edge AI for real-time robot control: NVIDIA Jetson Orin | SCALE D2C | 2026 | scaled2c.com | [链接](https://scaled2c.com/blog/physical-ai-robotics/edge-ai-for-real-time-robot-control-nvidia-jetson-orin.html) |
|
||||||
|
| 23 | Best AI Agent Frameworks (2026年7月) | AI Wiki | 2026 | aiwiki.ai | [链接](https://aiwiki.ai/wiki/best_ai_agent_frameworks) |
|
||||||
|
| 24 | LangChain vs CrewAI vs AutoGen: Which Agent Framework Scales? | Mark | 2026 | markaicode.com | [链接](https://markaicode.com/best/best-ai-agent-framework/) |
|
||||||
|
| 25 | Best Multi-Agent AI Frameworks for 2025 & 2026 | Datawhale | 2025 | langcopilot.com | [链接](https://langcopilot.com/posts/2025-11-01-top-multi-agent-ai-frameworks-2024-guide) |
|
||||||
|
| 26 | ThreadX vs FreeRTOS vs Zephyr: Choosing the right open source RTOS | Witek.io | 2026 | witekio.com | [链接](https://witekio.com/blog/threadx-freertos-zephyr-rtos/) |
|
||||||
|
| 27 | How to Choose the Best RTOS for Embedded Systems | VxWorks7 | 2026 | vxworks7.com | [链接](https://www.vxworks7.com/training/how-to-choose-the-best-rtos-for-embedded-systems/) |
|
||||||
|
| 28 | LiteOS-A内核技术全解析:架构、性能与开发实践 | 鸿蒙小白龙 | 2025 | jishuzhan.net | [链接](https://jishuzhan.net/article/1981610278161809409) |
|
||||||
|
|
||||||
|
### 产品文档/官方资料
|
||||||
|
|
||||||
|
| # | 标题 | 来源 | 链接 |
|
||||||
|
|---|------|------|------|
|
||||||
|
| 29 | SylixOS 大型实时操作系统文档中心 | 翼辉信息 | [链接](https://docs.acoinfo.com/sylixos/) |
|
||||||
|
| 30 | SylixOS 大型实时操作系统概述 | 人人都懂物联网 | [链接](https://getiot.tech/dictionary/sylixos/) |
|
||||||
|
| 31 | NVIDIA Jetson 平台概述 | NVIDIA | [链接](https://www.nvidia.com/en-us/autonomous-machines/) |
|
||||||
|
| 32 | Jetson Workshop GTC DC 2025 | Jetson AI Lab | [链接](https://www.jetson-ai-lab.com/workshop_gtcdc2025.html) |
|
||||||
|
| 33 | Running LLMs on Jetson Orin | jetson-containers (dusty-nv) | [链接](https://github.com/dusty-nv/jetson-containers) |
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 文献分类统计
|
||||||
|
|
||||||
|
| 类别 | 数量 | 核心主题 |
|
||||||
|
|------|------|---------|
|
||||||
|
| 学术论文(arXiv+期刊) | 7 | RTOS+AI、Edge LLM、调度系统 |
|
||||||
|
| 行业文章/博客 | 28 | 产品评测、技术解析、框架对比 |
|
||||||
|
| 产品文档 | 5 | 官方技术栈、SDK文档 |
|
||||||
|
|
||||||
|
---
|
||||||
|
|
||||||
|
## 关键作者和机构索引
|
||||||
|
|
||||||
|
| 作者/机构 | 代表作 | 研究方向 |
|
||||||
|
|----------|--------|---------|
|
||||||
|
| Marcus Rüb / Foresthub.Ai | arXiv:2606.02862 | 嵌入式Agent架构 |
|
||||||
|
| Xinming Wei / 北京大学 | arXiv:2506.24045 | Agent.xpu调度系统 |
|
||||||
|
| Hasan et al. / 西部师大 | RTOS for Edge AI (2025) | RTOS内核实证对比 |
|
||||||
|
| NVIDIA技术团队 | Jetson AI多篇 | 物理AI、边缘LLM |
|
||||||
|
| 华为技术团队 | LLM Inference Scheduling Survey | 推理调度综述 |
|
||||||
|
| 吴薇 / 杭州电子科技大学 | AI辅助工程方法 | MCU-边缘-云架构 |
|
||||||
Reference in New Issue
Block a user