产品功能

GPU云服务器为用户提供安全,稳定,弹性的GPU算力平台,满足用户AI计算,图形渲染,仿真模拟等各类GPU计算需求。

GPU 云服务器

    产品功能

    多样算力的GPU云服务器

    • 多种计算架构和实例规格

      阿里云GPU云服务器支持多种GPU卡,同时提供GPU切分实例,单卡/多卡VM形态,弹性裸金属形态等计算架构,提供支持图形渲染,计算仿真,图像语音识别,大模型推理,调优等多种场景的实例,满足不同规模和类型用户的需求,用户可以根据实际使用场景选择合适的云服务器。更多信息,请参见实例规格族

    • 多地域多可用区

      阿里云GPU云服务器目前已面向全球四大洲,开服运营27+个公共云地域、90+个可用区,此外还拥有金融云、政务云专属地域,并且致力于持续的新地域规划和建设,从而更好的满足用户多样化的业务和场景需求。伴随着基础设施的加速投入和深入布局,阿里云将为广大用户享受云计算的优质体验提供坚实基础。将实例部署在同一地域的不同可用区内,会有较高的容灾能力;将实例创建在同一可用区内,实例之间的网络延时较低,可以提升用户访问速度。您可以从用户地理位置、阿里云产品发布情况、应用可用性、以及是否需要内网通信等因素选择地域和可用区,以满足您的业务需求。更多信息,请参见地域与可用区

    深度优化的解决方案工具

    • 多样工具集
      深度优化的解决方案工具集包括AI推理计算优化工具、AI通信加速库、推理引擎优化等。目前,所有工具中的组件都可以免费搭配阿里云GPU服务器和ACK容器环境使用,方便您更方便、更高效地使用阿里云的云上GPU资源。
    • AI通信加速库
      AI通信加速库是阿里云GPU云服务器产品开发的一种用于多GPU互联的通信加速能力,基于NCCL(NVIDIA Collective Communications Library)通信算子的调用,能够实现更高效的多GPU互联通信,无感地加速分布式训练或多卡推理等任务。
    • 推理引擎
      阿里云研发的基于GPU云服务器的大语言模型(Large Language Model,LLM)的推理引擎,在处理大语言模型任务中,该推理引擎通过优化和并行计算等技术手段,为您提供免费的高性能、低延迟推理服务。
    • 推理加速
      阿里云自研的AI推理加速器,专注于为Torch模型提供高性能的推理加速。通过对模型的计算图进行切割、执行层融合以及高性能OP的实现,大幅度提升PyTorch的推理性能。

    成本优化

    • 多种计费方式

      GPU云服务器提供提供按量付费、节省计划、抢占式实例等多种计费方式。按量付费支持按需开通和释放资源,无需提前购买大量资源,成本比自建IDC机房降低30%~80%;

      节省计划是一种按量付费的折扣权益计划,适用于长期稳定的资源使用,通过承诺长期稳定消费来获得最多比按量付费低70%的折扣;

      抢占式实例则针对非核心业务提供了更低廉的价格,适合耗时且可以中断的计算任务。

    • 弹性伸缩与弹性供应

      通过弹性伸缩,您可以根据业务需求和负载自动调整服务器数量,在业务需求增长时,弹自动增加指定类型的实例,来保证计算能力;

      在业务需求下降时,弹性伸缩自动减少指定类型的实例,来节约成本。基于弹性供应能力,可自动创建多种规格的抢占式实例,或混合使用按量付费和抢占式实例,实现以最低的成本交付稳定的总计算力。

    • 节省停机模式

      有较长时间关机需求,可开启节省停机模式 ,开启后不再收取计算资源(vCPU和内存)、固定公网IP费用。在保留按量付费的服务器的数据和配置信息的同时,节省部分资源使用成本。

    安全、高可用的网络

    • 使用弹性网卡ENI构建高可用、多网络环境的云服务

      ENI是一种高度灵活的虚拟网络接口,为ECS实例提供网络接口和IP地址,可随意绑定和解绑。您可以为ECS实例附加多个ENI,以实现多IP地址、多网卡、网络高可用网络、流量隔离等。

    • 使用弹性公网IP动态管理IP地址

      弹性公网IP是一种动态分配的公网IP地址,它可以独立于云服务器ECS实例存在,可以随时与ECS实例解绑,在需要时重新绑定,满足频繁变更公网通信能力IP不变的场景。

    • 使用PrivateLink与阿里云上的服务建立安全稳定的私有连接

      PrivateLink能够建立专有网络 VPC与阿里云上的服务安全稳定的私有连接,简化网络架构,实现私网访问服务,避免通过公网访问服务带来的潜在安全风险。

    • 安全组控制出入站流量、划分安全域

      安全组是一种虚拟防火墙,能够控制ECS实例的出入站流量,用于设置单台或多台云服务器的网络访问控制。安全组具备状态监测和数据包过滤能力,您可以基于安全组的特性和安全组规则的配置在云端划分安全域。

    面向GPU的自动化运维

    • 通过系统事件及时感知神龙底层基础设施异常

      系统事件是用于记录和通知云资源的信息,例如资源是否出现异常、资源状态变化等。系统事件还提供了运维能力,实现故障实例快速恢复的效果。系统事件还提供了订阅能力,支持客户构建事件驱动的自动化运维能力。

    • GPU健康度巡检和用户自诊断

      GPU健康度巡检和用户自诊断功能,通过对GPU在位状态,XID error,infoROM error,驱动异常,PCIE链路异常等,同时系统也针对以上常见异常进行定期巡检,第一时间发现故障并排除,保障业务顺畅运行。

    • 通过实例健康状态,实时感知Guest OS运行状态

      实例健康状态能反应实例的操作系统是否正常运行,及时感知实例出现OOM或蓝屏等问题。

    • 通过部署集,实现ECS实例部署的高可用和低延时

      部署集是管理实例部署策略的服务。部署集支持网络低时延策略,将ECS实例集中部署到一个网络拓扑范围内,降低实例间网络延时。支持高可用策略,将ECS实例按物理机严格打散,实现高可用。