使用阿里云运行深度学习模型是一个高效、灵活的选择,尤其适合需要高性能 GPU 资源或大规模训练的场景。以下是详细的步骤指南,帮助你从零开始在阿里云上部署和运行深度学习模型。
一、准备工作
-
注册阿里云账号
- 访问 阿里云官网
- 注册并完成实名认证。
-
开通相关服务
- 弹性计算 ECS(用于运行实例)
- 对象存储 OSS(用于存储数据集和模型)
- 可选:容器服务 ACK(Kubernetes)、PAI(平台即AI服务)
二、选择合适的ECS实例类型
深度学习对GPU有较高要求,推荐使用带有GPU的实例:
- 推荐实例规格族:
ecs.gn6i:基于 NVIDIA T4 GPU,性价比高ecs.gn6v:V100 GPU,适合大规模训练ecs.gn7:A10/A100 GPU,最新一代
在创建ECS时,选择“GPU计算型”或“异构计算”分类。
三、创建并配置ECS实例
-
登录阿里云控制台
- 进入 ECS 控制台
-
创建实例
- 地域:选择离你近的区域(如华北2、华东1)
- 镜像:建议选择预装深度学习环境的镜像
- 搜索“深度学习” → 选择“Aliyun Linux + Deep Learning AMI”
- 或选择 Ubuntu/CentOS 自行安装环境
-
配置安全组
- 开放端口:
- SSH(22)用于远程连接
- Jupyter Notebook(8888)
- TensorBoard(6006)
- 其他自定义端口
- 开放端口:
-
分配公网IP或绑定弹性IP
四、连接到ECS实例
使用SSH连接(Linux/Mac)或 PuTTY(Windows):
ssh root@<你的公网IP>
输入密码或使用密钥登录。
五、配置深度学习环境(如果未预装)
方法1:使用预装镜像(推荐新手)
- 阿里云提供预装 TensorFlow、PyTorch、CUDA、cuDNN 的镜像,开箱即用。
方法2:手动安装
# 更新系统
sudo apt update && sudo apt upgrade -y
# 安装NVIDIA驱动(如果是GPU实例)
# 推荐使用阿里云提供的自动安装脚本:
wget https://ecs-image-utils.oss-cn-hangzhou.aliyuncs.com/NVIDIA-Linux-x86_64.run
chmod +x NVIDIA-Linux-x86_64.run
sudo ./NVIDIA-Linux-x86_64.run
# 安装CUDA和cuDNN(或使用conda管理)
# 或直接通过conda安装PyTorch/TensorFlow(包含CUDA)
# 使用conda创建虚拟环境
conda create -n dl python=3.9
conda activate dl
pip install torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu118
# 或安装TensorFlow
pip install tensorflow[and-cuda]
六、上传数据与代码
方式1:使用SCP上传文件
scp -r your_project root@<IP>:/root/
方式2:使用OSS对象存储(推荐大数据集)
- 创建OSS Bucket
- 上传数据集到OSS
- 在ECS中安装
ossutil下载数据:
wget http://gosspublic.alicdn.com/ossutil/latest/ossutil64
chmod +x ossutil64
./ossutil64 config
./ossutil64 cp oss://your-bucket/dataset.zip ./data/ -r
七、运行深度学习模型
-
启动训练脚本
python train.py --epochs 50 --batch-size 32 -
使用Jupyter Notebook(可选)
pip install jupyter jupyter notebook --ip=0.0.0.0 --port=8888 --allow-root --no-browser然后在浏览器访问:
http://<公网IP>:8888,输入token即可。
八、监控与优化
- 使用
nvidia-smi查看GPU使用情况 - 使用
htop查看CPU/内存 - 日志记录到OSS或本地文件
九、节省成本技巧
- 使用抢占式实例(Spot Instance):价格低至按量付费的10%,适合容错训练任务。
- 训练完成后立即释放实例,避免持续计费。
- 使用镜像保存环境:训练环境配置好后创建自定义镜像,便于复用。
十、进阶方案(可选)
| 方案 | 说明 |
|---|---|
| PAI(Platform of AI) | 阿里云一站式AI平台,支持可视化建模、AutoML、分布式训练 |
| 容器服务ACK + GPU节点 | 使用Kubernetes管理多个训练任务 |
| DSW(Data Science Workshop) | 类似于Google Colab的云端Notebook服务 |
PAI-DSW 特别适合快速实验,无需管理服务器。
总结
✅ 推荐流程(新手):
- 选择预装深度学习环境的GPU ECS实例
- SSH连接,上传代码和数据(可用OSS)
- 直接运行Python训练脚本
- 训练完成后保存模型到OSS,释放实例
📌 提示:首次使用可先用小规模数据测试,确认环境无误后再进行大规模训练。
如果你提供具体的框架(如PyTorch/TensorFlow)、任务类型(图像分类、NLP等)或数据规模,我可以给出更定制化的建议。
CLOUD技术博