在 Ubuntu 24.04.4 LTS 上部署“千问”(Qwen)大模型,并没有一个单一的“版本”选择,因为 Qwen 是一个开源模型系列,其部署方式取决于你的硬件配置、具体需求(推理/微调)以及你对资源占用的考量。
你需要从以下三个维度来决定“选择哪个版本”:
1. 选择模型的参数量版本 (Model Size)
这是最关键的决策,直接决定你能否在本地运行。请根据显存(VRAM)大小选择:
| 模型版本 | 推荐场景 | 最低显存需求 (FP16) | 推荐量化版本 (INT4) |
|---|---|---|---|
| Qwen2.5-0.5B / 1.5B | 极低配设备、边缘计算、快速测试 | < 4 GB | 任何设备均可流畅运行 |
| Qwen2.5-3B | 笔记本独显、入门级显卡 (如 RTX 3060) | ~6 GB | 可在 8GB 显存上完美运行 |
| Qwen2.5-7B | 主流消费级显卡 (RTX 3060/4060/4090) | ~14-16 GB | 强烈推荐 (8GB 显存即可跑满) |
| Qwen2.5-14B | 高性能工作站 (RTX 3090/4090, 双卡) | ~28-32 GB | 需要 16GB+ 显存 |
| Qwen2.5-32B | 多卡服务器或高端专业卡 (A100/H100) | ~64-72 GB | 需要 24GB+ 显存 (单卡难跑) |
| Qwen2.5-72B | 企业级服务器 (多卡 A100/A800/H100) | > 140 GB | 需要多卡分布式推理 |
建议:如果你只有一张普通的家用显卡(如 RTX 3060 12G 或 4060 Ti 16G),Qwen2.5-7B-Int4 是性能与资源的最佳平衡点。
2. 选择推理框架版本 (Inference Framework)
在 Ubuntu 24.04 上,目前最流行且高效的方案是使用 Ollama 或 vLLM。
方案 A:Ollama (最简单,适合个人用户)
- 适用人群:不想折腾代码,想要像
curl一样简单调用的用户。 - 优势:自动处理量化、显存管理,一键安装。
-
命令示例:
# 1. 安装 Ollama curl -fsSL https://ollama.com/install.sh | sh # 2. 拉取并运行 Qwen2.5-7B (官方会自动下载优化版) ollama run qwen2.5:7b注:Ollama 仓库中通常包含
qwen2.5:7b,qwen2.5:14b等标签,默认即为 INT4 量化版本以节省显存。
方案 B:Llama.cpp / llama.cpp (兼容性好,CPU/GPU 混合)
- 适用人群:显存不足,想利用 CPU 内存辅助,或者需要极致控制的用户。
- 优势:支持 GGUF 格式,可以在显存不足时自动溢出到系统内存。
- 安装方式:Ubuntu 下可通过
apt或源码编译,但更推荐直接使用 HuggingFace 上的 GGUF 文件配合命令行工具。
方案 C:vLLM (高性能,适合生产环境/API服务)
- 适用人群:需要高并发 API 服务、追求极致吞吐量的开发者。
- 优势:基于 PagedAttention 技术,吞吐量极高。
- 依赖:需要较新的 NVIDIA 驱动和 CUDA 环境。
3. Ubuntu 24.04 的系统环境准备
无论选择哪个模型版本,Ubuntu 24.04 需要先准备好基础环境:
- 更新系统:
sudo apt update && sudo apt upgrade -y - 安装 NVIDIA 驱动 (如果有独显):
Ubuntu 24.04 自带较新的内核,建议通过图形界面“软件和更新” -> “附加驱动”安装专有驱动,或使用:sudo ubuntu-drivers autoinstall - 确认 CUDA 环境:
如果使用 vLLM 或 PyTorch 原生加载,需确保安装了匹配 CUDA 版本的 PyTorch。如果是用 Ollama 或 llama.cpp,它们通常自带底层库,无需手动配置 CUDA。
总结与最终建议
如果你是普通用户或开发者,想在本地体验:
- 首选方案:安装 Ollama。
- 推荐模型:
qwen2.5:7b(如果显存>12GB) 或qwen2.5:3b(如果显存<8GB)。 - 理由:Ollama 会自动处理量化(Quantization),将 7B 模型压缩到约 4-5GB 显存占用,同时保持极高的响应速度,完全适配 Ubuntu 24.04 的新特性。
如果你需要构建 API 服务:
- 首选方案:使用 vLLM 部署 Qwen2.5-7B-Instruct 的 FP16 或 INT4 版本。
你可以直接在终端执行以下命令开始体验(假设你有 NVIDIA 显卡):
# 安装 Ollama
curl -fsSL https://ollama.com/install.sh | sh
# 启动 Qwen2.5-7B
ollama run qwen2.5:7b
CLOUD技术博