现在不少AI应用跑在云环境里,我们称之为“智算云”。简单来说,就是专门承载GPU算力、支撑大模型训练和推理的云平台。
在智算云环境中,GPU、vGPU、虚拟机、容器、模型服务和智能体(Agent)往往跨越多个资源与运行层。ZSvirt可提供主机、虚拟机、网络、存储、GPU/vGPU、告警等基础设施视角,但实际业务故障常发生在虚拟机内部:容器 OOM、GPU 显存耗尽、模型推理延迟升高、Agent工具调用失败、任务队列堆积或网络策略导致的服务不可达。
当前的运维工具通常只能覆盖“云平台资源”或“应用APM”其中一侧,缺少将ZSvirt资源事件与虚拟机内工作负载、容器运行时、AI服务和Agent任务轨迹关联起来的统一证据链。结果是告警噪声大、根因定位慢、影响范围难判断,且无法回答“某个Agent的一次失败究竟由应用、容器、虚拟机、GPU还是宿主机引起”。
ZSvirt在2026上海开源软件应用创新大赛「智算云赛道」发布《面向虚拟机内部容器与智能体工作负载的全栈可观测平台》命题,邀请开发者用开源可观测技术栈,把虚拟机内部的“黑盒”打开。
ZSvirt是ZStack ZSphere虚拟化引擎的开源版本,以GPL3.0 协议开源,源代码在GitHub 公开。
它把经企业级验证的虚拟化引擎带入开源世界,保留以虚拟机为中心的工作流,让团队获得对基础设施的完全自主控制,无需供应商锁定,核心能力包括大规模虚拟化扩展、VMware无缝迁移、内建安全及开放集成,已在上千个生产环境中经受验证。
对参赛者来说,这意味着命题有一个真实、成熟、可部署的基础底座。ZSvirt已提供主机、虚拟机、网络、存储、GPU、告警等基础设施视角,命题要做的,是在这个底座之上补齐「虚拟机内部」的观测能力。
本赛题希望参赛者基于ZSvirt开放能力及开源可观测技术栈,设计一套可复现、低侵入、可扩展的全栈可观测方案。方案应能采集虚拟机内部的容器、应用与Agent信号,并与ZSvirt基础设施资源和事件建立关联,用于监控、诊断、告警和运维决策。
参赛者需要构建一套面向ZSvirt虚拟机内部AI工作负载的可观测原型,以“虚拟机为边界、工作负载为对象、事件关联为核心”,统一组织指标、日志、链路、配置与告警证据,通过可视化界面或CLI输出可解释的健康状态和诊断建议。
命题目标拆成五个要点:
实现上可使用 OpenTelemetry、Prometheus、Grafana、eBPF、FluentBit、Jaeger等开源组件,但不得把不可验证的闭源服务作为核心能力。命题方会提供ZSvirt测试环境或试用账号、API/SDK、开发文档和样例资源。作品需支持模拟数据或最小化降级模式,以便缺少GPU硬件时也能复现。涉及容器、Agent或业务日志时,要落实脱敏、字段过滤或访问控制。
交付要求
另需提供3到5分钟演示视频,展示部署、观测、故障注入、跨层关联和诊断输出的完整过程。
评审维度
做过云原生监控、可观测性或运维平台的团队,能把多信号采集和告警体系做扎实;熟悉eBPF、OpenTelemetry等底层采集技术的,能在低侵入采集上做出亮点;了解Al推理或Agent架构的,能把“Agent失败根因定位”这个命题特色做出来。
参赛报名截止10月11日,总决赛10月24日在上海举办。获奖项目可获得现金、算力与Token、大模型API等资源奖励,还有机会入选上海市开源项目培优工程,欢迎全国的开源技术爱好者报名参赛:
https://www.oschina.net/os2026/