docs: reorganize MCU static intelligence research materials

This commit is contained in:
Mo1s
2026-09-24 14:29:50 +08:00
parent e25991c97a
commit 6badadc02c
27 changed files with 2937 additions and 15 deletions
@@ -0,0 +1,84 @@
# 子课题定义
## 1. 建议名称
正式名称:
> **面向 MCU 的静态智能控制基础系统研究**
当前工程阶段名称:
> **基于 SylixOS 与控制端 SoC 的静态智能任务编排、准入与闭环保障研究**
两个名称分别解决不同问题:正式名称保持长期研究方向,工程阶段名称准确反映当前拥有 RK3588、4×V100,而尚缺真正 MCU 实验板的设备现实。
## 2. 核心研究问题
本子课题研究:
> 在控制任务的时间、内存、功耗和安全边界必须优先满足的条件下,如何把轻量智能模型转换为具有固定资源上限、固定执行窗口、明确异常处理方式的 SylixOS 实时任务,并通过工具链在部署前完成可行性判定。
研究对象不是某一个模型,也不是单纯的模型压缩,而是由以下部分构成的静态智能控制基础系统:
1. 控制任务与安全规则;
2. 小模型与有限算子集合;
3. 离线资源分析与联合编排器;
4. 静态内存、固定优先级和固定推理窗口;
5. SylixOS BSP、内核机制和 RealEvo 工程链路;
6. 超时、拒绝、降级、恢复和部署准入机制。
## 3. 项目现实基础
| 现有条件 | 在本子课题中的作用 |
|---|---|
| RK3588 16 GB 工业盒 | 首个 SylixOS/控制端 SoC 方法原型平台 |
| RK3588 8 GB 受限配置 | 验证预算收缩和部署准入,不冒充真实 MCU |
| 4×V100 服务器 | 模型训练、量化校准、转换和参考精度平台 |
| SylixOS / RealEvo | 实时任务、BSP、内存布局、编译部署与调试基础 |
| RK3568 / RK3576 候选板 | 控制端资源收缩与跨 BSP 验证 |
| 真正 MCU 平台 | 后续补充,用于形成严格 MCU 级结论 |
## 4. 三阶段研究路线
### 阶段A:方法原型
在现有 RK3588 上打通控制任务描述、模型转换、静态 Tensor Arena、SylixOS 任务生成、固定优先级、超时与规则兜底以及部署准入报告。
### 阶段B:控制端收缩
在 RK3568、RK3576 或等价控制端平台上收紧内存、CPU时间、功耗、散热和启动预算,验证跨 BSP 可移植性。
### 阶段C:真正 MCU 实证
在确认 SylixOS lite/tiny、目标 BSP 和算子运行时可用后,验证 KB/MB 级 SRAM、片上 Flash、固定控制周期、快速启动和 `E/inference`。
## 5. 研究边界
本子课题重点覆盖:
- 小模型、小算子与关键控制任务共存;
- 离线编排、静态内存和部署前准入;
- SylixOS上的调度、中断、内存、DMA和恢复;
- 低功耗、快速启动和规则兜底;
- 工具链、代码生成和芯片协同。
本子课题不把以下内容作为主线:
- 通用大语言模型在 MCU 上运行;
- Linux 容器、复杂虚拟化和大规模服务编排;
- 只追求平均吞吐的推理优化;
- 用 RK3588 限额实验替代真正 MCU 结论;
- 在驱动或 BSP 未准入时预设 NPU 已经可用。
## 6. 与总课题的关系
本子课题对应总课题的 `T5` 控制端路线,重点研究 RTOS 直接控制域与推理运行域如何在极端约束下闭合。其任务描述、资源准入、规则兜底和数据格式也可供子课题B复用。
## 7. 成功判据
1. 部署前能够预测内存、时间和功耗预算;
2. 工具能够生成 SylixOS 工程所需代码和配置;
3. AI加入后关键控制任务仍满足截止期;
4. 超时、过载或模型异常时规则路径能够接管;
5. 预测值与实测值存在可解释误差;
6. 方法能够从 RK3588 迁移到更小控制端和真正 MCU。
@@ -0,0 +1,77 @@
# 研究问题与适用场景
## 1. 总体问题
本子课题不研究“MCU能运行多大的模型”,而研究:
> 在控制任务优先、资源预算刚性和AI结果不完全可信的条件下,基础系统如何给智能任务建立可分析的资源边界、时间边界和安全边界。
## 2. 核心研究问题
| 编号 | 研究问题 | 主要证据 |
|---|---|---|
| RQ1 | 控制任务与模型如何离线联合编排 | 可调度性、控制截止期、固定推理窗口 |
| RQ2 | 静态内存规划能否降低峰值和碎片风险 | 峰值内存、长期稳定性、部署成功率 |
| RQ3 | 部署前预测能否接近目标板实测 | 时间、内存、功耗预测误差 |
| RQ4 | 规则兜底能否限制AI故障传播 | 降级时间、控制保持率、恢复时间 |
| RQ5 | 同一工具描述能否跨设备迁移 | RK3588、RK3568/3576、真正MCU之间的迁移代价 |
## 3. 推荐主场景
### 3.1 电机或泵类设备状态识别
- 关键控制:1 ms级采样、控制计算和执行输出;
- AI功能:振动、电流或温度窗口的异常分类;
- AI周期:50~100 ms或事件触发;
- 模型:INT8 1D CNN、小型MLP或决策树;
- 兜底:AI超时或结果越界时继续规则控制并上报告警。
这个场景适合首个实验,因为控制链路、AI链路和故障处理边界都清晰,且不要求AI直接进入硬实时内环。
### 3.2 工业节点状态分类
持续运行传感器采集与现场总线通信,AI负责工况分类、故障预警或参数建议,规则层负责范围校验和安全动作。该场景可以验证 CAN、RS485、GPIO、DMA 与推理之间的干扰。
### 3.3 关键词或声学事件识别
模型和输入窗口固定,适合验证算子分段、静态Arena和低占空比推理,但不建议把语音输出直接接入关键执行链路。
### 3.4 轻量视觉检测或分类
适合 RK3588/RK3568 方法原型,可研究摄像头DMA、内存带宽和NPU中断对控制任务的影响,但不宜作为真正 MCU 阶段的唯一场景。
## 4. 不同设备上的场景分工
| 平台 | 优先场景 | 研究重点 |
|---|---|---|
| 4×V100 | 模型训练、量化校准、参考精度 | 不进行MCU实时性结论 |
| RK3588 16 GB | 电机状态、轻量视觉、控制与推理共存 | SylixOS集成、工具链闭环、干扰注入 |
| RK3588 8 GB限额 | 同一工作负载的预算收缩 | 准入机制能否正确降级或拒绝 |
| RK3568/RK3576 | 电机状态、关键词、工业节点 | 更小资源、低功耗、跨BSP迁移 |
| 真正MCU | 1D CNN、MLP、关键词、状态分类 | SRAM/Flash极限、快速启动、E/inference |
## 5. 负载结构
所有场景统一拆成三类任务:
1. **关键保障负载**:周期控制、采样、执行输出、联锁;
2. **人工智能目标负载**:分类、检测、异常识别或参数建议;
3. **伴生竞争负载**:日志、通信、存储、模型加载和后台诊断。
AI任务必须满足:不阻塞控制内环、使用有界队列、输入过期可丢弃、结果经过规则检查、超时结果不再生效、故障时控制系统能够独立运行。
## 6. 研究假设
- H1:静态联合编排比普通后台部署更能维持控制任务的尾延迟和截止期;
- H2:静态Arena与生命周期复用比动态堆具有更低、更稳定的峰值内存;
- H3:基于目标板算子数据库的预测能够给出具有工程安全系数的执行上界;
- H4:有界队列、超时和规则兜底能够把AI过载转化为可解释的拒绝或降级;
- H5:统一描述格式能够降低从RK3588迁移到更小控制端的适配成本。
## 7. 首期排除项
- AI直接闭合1 ms硬实时控制环;
- 动态Agent、多轮生成和开放式工具调用;
- 无法固定输入、模型版本或任务质量标准的应用;
- 无法获得BSP、驱动或时间戳的黑盒设备;
- 仅通过降低任务完成率来获得更好实时性或能耗结果。
@@ -0,0 +1,19 @@
# 00-总览与定位
本层回答“研究什么、为什么研究、用现有设备能证明什么”。
## 文件
1. [00-子课题定义.md](./00-子课题定义.md):名称、研究对象、三阶段路线、边界和成功判据;
2. [01-研究问题与适用场景.md](./01-研究问题与适用场景.md):研究问题、假设、首个工业场景和设备分工。
## 阅读结果
读完本层应能够明确:
- RK3588、RK3568/RK3576与真正MCU的区别;
- 4×V100在项目中的辅助角色;
- 为什么AI不直接进入1 ms硬实时内环;
- 项目最终需要证明哪些研究假设。
[返回总目录](../README.md)