云上AI应用故障诊断,上海开源大赛ZSvirt命题公布
创始人
2026-09-01 17:52:14

现在不少AI应用跑在云环境里,我们称之为“智算云”。简单来说,就是专门承载GPU算力、支撑大模型训练和推理的云平台。

在智算云环境中,GPU、vGPU、虚拟机、容器、模型服务和智能体(Agent)往往跨越多个资源与运行层。ZSvirt可提供主机、虚拟机、网络、存储、GPU/vGPU、告警等基础设施视角,但实际业务故障常发生在虚拟机内部:容器 OOM、GPU 显存耗尽、模型推理延迟升高、Agent工具调用失败、任务队列堆积或网络策略导致的服务不可达。

当前的运维工具通常只能覆盖“云平台资源”或“应用APM”其中一侧,缺少将ZSvirt资源事件与虚拟机内工作负载、容器运行时、AI服务和Agent任务轨迹关联起来的统一证据链。结果是告警噪声大、根因定位慢、影响范围难判断,且无法回答“某个Agent的一次失败究竟由应用、容器、虚拟机、GPU还是宿主机引起”。

ZSvirt在2026上海开源软件应用创新大赛「智算云赛道」发布《面向虚拟机内部容器与智能体工作负载的全栈可观测平台》命题,邀请开发者用开源可观测技术栈,把虚拟机内部的“黑盒”打开。

ZSvirt:开源企业级虚拟化引擎

ZSvirt是ZStack ZSphere虚拟化引擎的开源版本,以GPL3.0 协议开源,源代码在GitHub 公开。

它把经企业级验证的虚拟化引擎带入开源世界,保留以虚拟机为中心的工作流,让团队获得对基础设施的完全自主控制,无需供应商锁定,核心能力包括大规模虚拟化扩展、VMware无缝迁移、内建安全及开放集成,已在上千个生产环境中经受验证。

对参赛者来说,这意味着命题有一个真实、成熟、可部署的基础底座。ZSvirt已提供主机、虚拟机、网络、存储、GPU、告警等基础设施视角,命题要做的,是在这个底座之上补齐「虚拟机内部」的观测能力。

本赛题希望参赛者基于ZSvirt开放能力及开源可观测技术栈,设计一套可复现、低侵入、可扩展的全栈可观测方案。方案应能采集虚拟机内部的容器、应用与Agent信号,并与ZSvirt基础设施资源和事件建立关联,用于监控、诊断、告警和运维决策。

命题解读:全栈可观测平台

参赛者需要构建一套面向ZSvirt虚拟机内部AI工作负载的可观测原型,以“虚拟机为边界、工作负载为对象、事件关联为核心”,统一组织指标、日志、链路、配置与告警证据,通过可视化界面或CLI输出可解释的健康状态和诊断建议。

命题目标拆成五个要点:

  • 资源关联,建立宿主机、GPU、虚拟机、容器、AI服务、Agent的关联模型;
  • 多信号采集,至少覆盖指标、日志、事件中的两类;
  • 工作负载识别,识别容器状态、GPU使用、推理服务或Agent任务的关键运行状态;
  • 事件关联与诊断,把 ZSvirt告警与容器、应用、Agent事件关联,给出可解释的根因候选;
  • 告警降噪,支持聚合、静默、异常检测,提供处置建议。

实现上可使用 OpenTelemetry、Prometheus、Grafana、eBPF、FluentBit、Jaeger等开源组件,但不得把不可验证的闭源服务作为核心能力。命题方会提供ZSvirt测试环境或试用账号、API/SDK、开发文档和样例资源。作品需支持模拟数据或最小化降级模式,以便缺少GPU硬件时也能复现。涉及容器、Agent或业务日志时,要落实脱敏、字段过滤或访问控制。

交付要求

  • 方案说明文档,梳理总体架构、数据模型、采集方式、资源关联逻辑和诊断流程,明确与ZSvirt的集成点及安全设计;
  • 可运行原型,提供Web 控制台、CLI或开源观测平台的集成实现,至少完成资源拓扑、工作负载健康、告警详情和一次根因关联展示;
  • 虚拟机内探针,提供可部署的Agent、Sidecar、Exporter或脚本,说明性能开销和卸载方式;
  • 样例AI工作负载,在虚拟机中运行至少一种容器化AI负载;
  • 故障场景与证据,覆盖容器异常、GPU瓶颈、Agent任务异常三类,每类给出告警和处置建议;
  • 可复现材料,提供源代码、部署脚本、README和依赖清单。

另需提供3到5分钟演示视频,展示部署、观测、故障注入、跨层关联和诊断输出的完整过程。

评审维度

  • 可观测与诊断能力占25%,权重最高,看能否采集有效信号、关联跨层事件并输出可解释的根因候选;
  • 数据与关联模型质量占20%;
  • 任务定义与通用性占15%,看能否适配容器、模型服务、Agent等对象;
  • 稳定性与可复现性占15%;
  • 告警运营与可用性占10%;
  • 创新性与工程落地性占15%,看是否在低侵入采集、Agent可观测、GPU归因或跨层关联上有创新。

谁适合投这道题

做过云原生监控、可观测性或运维平台的团队,能把多信号采集和告警体系做扎实;熟悉eBPF、OpenTelemetry等底层采集技术的,能在低侵入采集上做出亮点;了解Al推理或Agent架构的,能把“Agent失败根因定位”这个命题特色做出来。

参赛报名截止10月11日,总决赛10月24日在上海举办。获奖项目可获得现金、算力与Token、大模型API等资源奖励,还有机会入选上海市开源项目培优工程,欢迎全国的开源技术爱好者报名参赛:

https://www.oschina.net/os2026/

相关内容

热门资讯

空池名单调整 | 希音-W(0... 8月28日,港交所调整认可沽空指定证券名单,希音-W(00625)进入认可沽空指定证券名单,生效日期...
机构:汽车出口产业链持续旺盛,... (来源:财闻) 随着各项稳消费政策逐步落地,叠加基数逐步改善,乘用车市场降...
北京将健全涉外知识产权公共服务... (来源:北京商报)8月31日,北京市政协召开“加强知识产权保护与运用,助力首都法治化营商环境建设”专...
上好新生入学关键一课 来源:光明日报 新学期伊始,充分把握新生入学关键点,讲好立德树人“开学第一课”至关重要。军训是新生“...
尼泊尔口岸一侧多个村镇不复存在 8月31日,总台报道员乘坐直升机飞到尼泊尔泥石流核心受灾地区、也就是中国吉隆-尼泊尔热索瓦口岸尼泊尔...