跳至主要内容

Amazon ECS 托管实例的 GPU 运行状况监控和自动修复简介

发布于: 2026年9月3日

Amazon Elastic Container Service(Amazon ECS)现在为 Amazon ECS 托管实例提供 NVIDIA GPU 运行状况监控和自动修复功能。这项新功能能够自动检测 NVIDIA GPU 硬件出现的严重故障,并替换受损的实例,从而帮助客户提高其基于 GPU 加速的容器化工作负载的可用性和可靠性。

运行 GPU 加速的工作负载(例如生成式人工推理)需要进行专门的硬件管理,以减少故障并最大程度地降低干扰。Amazon ECS 托管实例现在使用 NVIDIA 数据中心 GPU 管理器(DCGM)持续监测 GPU 的运行状况,并在出现严重故障时主动更换受损的容量。您可以通过 DescribeContainerInstances API 监控 GPU 运行状况,并在实例受损时通过 Amazon EventBridge 接收通知。对于您希望手动管理实例生命周期的工作负载,您可以选择在容量提供商层面取消自动修复功能,并使用自己的修复逻辑来处理 GPU 错误事件。

在所有运行于支持的 NVIDIA GPU 实例类型的 Amazon ECS 托管实例上,默认情况下已启用 GPU 运行状况自动修复功能,且无需额外费用。要了解更多信息,请访问 Amazon ECS 开发人员指南

此功能现已在由光环新网运营的亚马逊云科技中国(北京)区域和由西云数据运营的亚马逊云科技中国(宁夏)区域推出。