阿里云文档 2026-07-06

使用eRDMA网络进行分布式训练

弹性RDMA(eRDMA)是阿里云自研的云上弹性RDMA网络,可显著降低节点间通信延迟。PAI通用计算资源中的部分GPU机型已支持eRDMA,使用特定镜像提交DLC任务时,系统会自动挂载eRDMA网卡,加速分布式训练。

阿里云文档 2026-07-06

在分布式训练(DLC)中挂载OSS

DLC训练任务支持通过代码配置或挂载方式接入OSS、NAS或CPFS存储,在训练过程中直接读写数据。

阿里云文档 2026-07-01

实例互联进行分布式训练

DSW支持多实例互联,您可以将多个DSW实例组网,实现多机多卡的分布式开发和训练。

阿里云文档 2026-06-10

分布式训练 DLC 快速入门

DLC 可快捷创建分布式或单机训练任务,无需手动购买机器和配置环境。本文以MNIST手写体识别为例,演示单机单卡训练和多机多卡分布式训练的完整流程。

阿里云文档 2025-02-13

使用DeepNCCL加速模型的分布式训练或推理性能

DeepNCCL是阿里云神龙异构产品开发的用于多GPU互联的AI通信加速库,能够无感地加速基于NCCL进行通信算子调用的分布式训练或多卡推理等任务。开发人员可以根据实际业务情况,在不同的GPU云服务器上安装DeepNCCL通信库,以加速分布式训练或推理性能。本文主要介绍在Ubuntu或CentOS操作系统的GPU实例上安装和使用DeepNCCL的操作方法。

文章 2023-07-23 来自:开发者社区

TensorFlow 高级技巧:自定义模型保存、加载和分布式训练

本篇文章将涵盖 TensorFlow 的高级应用,包括如何自定义模型的保存和加载过程,以及如何进行分布式训练。 一、自定义模型的保存和加载 在 TensorFlow 中,我们可以通过继承 tf.train.Checkpoint 来自定义模型的保存和加载过程。 以下是一个例子: class CustomModel(tf.keras.Model...

TensorFlow 高级技巧:自定义模型保存、加载和分布式训练
问答 2023-06-05 来自:开发者社区

机器学习PAI在easyrec里自定义了一些逻辑,pai上做分布式训练的时候如何让这个第三方包生效?

机器学习PAI在easyrec里自定义了一些逻辑,引用了第三方包,在pai上做分布式训练的时候如何让这个第三方包生效啊?

本页面内关键词为智能算法引擎基于机器学习所生成,如有任何问题,可在页面下方点击"联系我们"与我们沟通。

产品推荐

阿里云分布式应用服务

企业级分布式应用服务 EDAS(Enterprise Distributed Application Service)是应用全生命周期管理和监控的一站式PaaS平台,支持部署于 Kubernetes/ECS,无侵入支持Java/Go/Python/PHP/.NetCore 等多语言应用的发布运行和服务治理 ,Java支持Spring Cloud、Apache Dubbo近五年所有版本,多语言应用一键开启Service Mesh。

+关注