Files
rtos_llm_opt/00-项目总览/01-当前研究问题:背景、问题与挑战.md
T
eaiadmin 67297c66bf reorganize project documents into structured research directories
Consolidate the research materials into numbered overview, framework, planning, partner, deliverable, and archive sections so the repository reflects the current RTOS-focused narrative and reading order.
2026-09-21 09:07:34 +08:00

4.6 KiB
Raw Blame History

01-当前研究问题:背景、问题与挑战

1. 背景

当前智能系统正在持续进入控制、装备、交通、工业现场与边缘决策等任务关键场景。随着人工智能推理能力从离线分析走向在线决策,系统对人工智能运行的要求已经扩展为功能有效性、时间约束、运行稳定性与可验证性的统一达标。

外部研究与产业表达已经形成较清晰的共识:

  • AI 用于 safety-critical systems 的安全保障仍在持续推进,系统层面的可控、可验证与可接受性仍是核心议题;
  • QNX、Wind River 等平台方已将 deterministic、predictable、secure 的软件基础与 AI 能力并列讨论;
  • Linux Foundation 对 PREEMPT_RT 的持续推进,表明低延时、低抖动和可预测执行已经成为重要基础能力。

在这样的背景下,操作系统已经成为决定 AI 推理能否进入任务关键系统的重要基础平台。尤其当 AI 推理与周期控制、执行闭环、联锁逻辑、通信管理等负载共同运行时,系统时序边界、资源争抢边界与恢复边界都会被重新放大。

2. 问题

本项目聚焦的当前研究问题可以表述为:

在五类部署形态下,当人工智能目标负载进入任务关键系统后,以大型跨平台实时操作系统为基础平台的系统,是否相较普通 Linux 与 PREEMPT_RT Linux,能够提供更强的确定性、可预测性与实时保障能力,并同时保持人工智能目标负载的功能有效性与时效性?

这个问题包含四个明确支点:

  1. 研究对象是大型跨平台实时操作系统这一类平台;
  2. SylixOS 是主实验样例,QNX、VxWorks、INTEGRITY、LynxOS-178 等构成外部参照样本;
  3. AI 推理在任务关键系统中被界定为人工智能目标负载,与关键保障负载、伴生竞争负载共同构成系统运行面;
  4. 对照对象明确拆分为普通 Linux 与 PREEMPT_RT Linux,用来建立不同系统基础能力之间的可比关系。

项目围绕以下三个判断维度展开:

  • AI 目标负载与关键保障负载能否在统一系统中稳定共存;
  • 操作系统能否通过调度、隔离、内存管理、中断管理与恢复机制维持系统边界;
  • 系统是否能够同时实现 AI 功能有效性与实时性达标。

因此,这个研究问题本质上是一个面向任务关键系统的系统研究问题,也是一个具有产业验证价值的平台比较问题。

3. 挑战

围绕上述问题,当前研究至少面临以下几类核心挑战。

3.1 五类部署形态下的统一验证挑战

T5~T1 五类部署形态与 11 个代表档位共同构成验证矩阵、证据组织框架与跨场景比较环境。这里的核心挑战,是在不同资源约束、拓扑结构和负载强度下,用统一方法解释 RTOS 的优势边界与失效边界。

3.2 对照体系的精细化挑战

本项目采用三级对照体系:

  • O0 普通 Linux;
  • O1 PREEMPT_RT Linux;
  • 大型跨平台 RTOS。

这一对照设计将普通 Linux 与 PREEMPT_RT Linux 分别建模,用于区分一般低延时收益与 RTOS 在确定性、隔离性和可分析性上的收益来源。

3.3 双目标同时达标的评价挑战

当 AI 被界定为目标负载后,评价体系同时覆盖关键保障负载保护效果,以及 AI 目标负载的有效性、时效性和长期稳定性。因此,评价指标需要同时覆盖:

  • 关键保障负载:deadline miss ratio、P99/P99.9 jitter、响应时间边界;
  • AI 目标负载:TTFT、TPOT、端到端响应时间、成功率、功能质量;
  • 系统协同层:有效吞吐、E/token、热漂移、资源争抢边界、恢复能力。

3.4 多目标负载协调的机制挑战

在任务关键系统中,AI 目标负载、关键保障负载与伴生竞争负载共同构成统一运行面。它们在 CPU、内存、总线、中断、DMA、缓存与加速器访问上会形成持续竞争。研究的关键难点在于,RTOS 是否能够把这种竞争收敛为可分析、可控制、可恢复的系统行为边界。

外部参考

  1. Linux Foundation, Real-Time Linux Project
    https://realtime-linux.dev-lfprojects5.linuxfoundation.org/
  2. QNX, Software Foundation for Physical AI https://qnx.software/en/software/technologies/physical-ai
  3. Wind River 官网与 Edge AI / mission-critical 相关公开表述
    https://www.windriver.com/
  4. Ullrich et al., AI Safety Assurance for Automated Vehicles: A Survey on Research, Standardization, Regulation
    https://arxiv.org/abs/2504.18328v1