在阿里云的 4核8G 服务器上部署 Ollama 是完全可行的,尤其适合运行中小型语言模型(如 Llama3-8B、Mistral、Qwen 等)。以下是详细的部署步骤和建议:
✅ 一、环境准备
1. 购买阿里云 ECS 实例
- 配置:4核 CPU,8GB 内存,系统盘建议 ≥40GB(SSD 更佳)
- 操作系统:推荐 Ubuntu 20.04/22.04 LTS 或 CentOS 7+/8+
- 安全组:开放所需端口(默认 Ollama 使用
11434)
💡 提示:选择按量付费或包年包月,根据使用需求决定。
✅ 二、安装 Ollama
以 Ubuntu 为例:
# 下载并安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 启动 Ollama 服务
systemctl start ollama
# 设置开机自启
systemctl enable ollama
安装脚本会自动添加用户到
ollama组,并配置 systemd 服务。
✅ 三、运行模型(例如 Llama3-8B)
# 拉取并运行模型
ollama run llama3:8b
首次运行会自动下载模型(约 4.7GB),后续启动更快。
✅ 四、远程访问配置(可选)
默认 Ollama 只监听本地 127.0.0.1:11434,若需远程调用 API:
1. 修改监听地址
# 编辑环境变量配置
sudo mkdir -p /etc/systemd/system/ollama.service.d
sudo tee /etc/systemd/system/ollama.service.d/environment.conf > /dev/null << EOF
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
EOF
2. 重载并重启服务
sudo systemctl daemon-reexec
sudo systemctl restart ollama
3. 防火墙 & 安全组
- 在阿里云控制台开放 11434 端口
- 若启用防火墙(如 ufw):
sudo ufw allow 11434
✅ 五、测试 API 访问
从外部机器测试:
curl http://<你的公网IP>:11434/api/generate -d '{
"model": "llama3:8b",
"prompt":"你好,你是谁?"
}'
✅ 六、性能优化建议(针对 4核8G)
| 项目 | 建议 |
|---|---|
| 模型选择 | 推荐 7B~8B 参数量的量化模型(如 qwen:7b, llama3:8b-instruct-q4_K_M) |
| 量化模型 | 使用 -q4_K_M 等量化版本降低内存占用 |
| 并发请求 | 避免高并发,8G 内存建议单并发或轻度并发 |
| Swap 空间 | 添加 4~8GB Swap 防止 OOM: |
sudo fallocate -l 4G /swapfile
sudo chmod 600 /swapfile
sudo mkswap /swapfile
sudo swapon /swapfile
|
✅ 七、常用命令
# 查看模型列表
ollama list
# 删除模型
ollama rm llama3:8b
# 拉取量化模型(节省内存)
ollama pull llama3:8b-instruct-q4_K_M
# 查看日志
journalctl -u ollama -f
✅ 八、进阶:结合 Web UI(可选)
可以搭配前端工具如:
- Open WebUI(原 Ollama WebUI)
- LMStudio(本地连接)
例如使用 Docker 部署 Open WebUI:
docker run -d -p 3000:8080
-e OLLAMA_BASE_URL=http://<你的内网IP>:11434
--name open-webui
ghcr.io/open-webui/open-webui:main
然后通过 http://公网IP:3000 访问图形界面。
❌ 注意事项
- 8G 内存限制:不要尝试运行 13B 以上非量化模型,容易内存溢出。
- 磁盘空间:每个模型约 4~6GB,预留足够空间。
- 公网暴露风险:开放 API 时建议加 Nginx + Basic Auth 或反向X_X鉴权。
- 费用监控:ECS 按使用计费,注意关机或释放资源。
✅ 总结
| 项目 | 是否支持 |
|---|---|
| 运行 Ollama | ✅ 支持 |
| 运行 7B~8B 模型 | ✅ 支持(推荐量化版) |
| 多用户/API 调用 | ⚠️ 轻量级可用,高并发不推荐 |
| 图形化交互 | ✅ 可搭配 WebUI |
如果你有具体想运行的模型(比如 Qwen、Llama3、Mistral),我可以给出更精确的拉取命令和性能评估。
需要我帮你写一个一键部署脚本吗?
CLOUD技术博