Cách cài đặt Ollama trên Linux là giải pháp tối ưu giúp kỹ sư AI, lập trình viên và doanh nghiệp triển khai các mô hình ngôn ngữ lớn (LLM) cục bộ trên hạ tầng riêng biệt. Thay vì phụ thuộc vào các API đám mây đắt đỏ, việc tự host Ollama trên nền tảng máy chủ giúp bảo mật tuyệt đối dữ liệu nội bộ. Bạn có thể xây dựng nền tảng hạ tầng máy chủ vững chắc cho AI tại InterData trước khi bắt tay thiết lập hệ thống.
NỘI DUNG BÀI VIẾT
- 1. Ollama là gì và vì sao nên cài đặt trên Linux?
- 2. Yêu cầu phần cứng trước khi cài đặt Ollama trên Linux
- 3. Cách cài đặt Ollama trên Linux bằng script tự động
- 4. Cách cài đặt Ollama thủ công trên Linux chuẩn Production
- 5. Cấu hình GPU NVIDIA CUDA và AMD ROCm cho Ollama
- 6. Thiết lập biến môi trường quan trọng khi chạy Ollama trên VPS Linux
- 7. Khởi chạy model đầu tiên và các lệnh Ollama CLI cần biết
- 8. Kết nối Ollama với Open WebUI, n8n và kiến trúc AI Agent
- 9. Xử lý lỗi thường gặp khi cài đặt Ollama trên máy chủ Linux
- 10. So sánh VPS và Cloud Server khi tự host Ollama
- 11. Câu hỏi thường gặp về cách cài đặt Ollama trên Linux
Ollama là gì và vì sao nên cài đặt trên Linux?
Ollama là công cụ mã nguồn mở gọn nhẹ, đóng gói môi trường thực thi giúp bạn tải về và chạy các LLM (Large Language Model) trực tiếp trên phần cứng của mình. Trên môi trường máy chủ Linux, Ollama hoạt động dưới dạng daemon headless không tiêu tốn tài nguyên đồ họa của hệ điều hành, cho hiệu năng xử lý tác vụ tối đa.
Nếu bạn đang sở hữu một hệ thống VPS Linux, việc cài đặt Ollama cung cấp API chuẩn REST tương thích hoàn toàn với chuẩn OpenAI, phục vụ tích hợp ứng dụng mà không lo chi phí token phát sinh hàng tháng. Hơn nữa, việc quản lý tiến trình bằng systemd giúp dịch vụ AI tự khôi phục sau sự cố hoặc reboot server.

Yêu cầu phần cứng trước khi cài đặt Ollama trên Linux
Ollama không bắt buộc phải có card đồ họa chuyên dụng (GPU). Nếu không có GPU, chương trình tự động chuyển sang chế độ CPU inference, tuy tốc độ phản hồi chậm hơn nhưng vẫn hoàn toàn khả thi cho các mô hình nhỏ gọn. Dung lượng bộ nhớ RAM và không gian ổ đĩa NVMe là hai yếu tố then chốt quyết định model có tải được vào bộ nhớ hay không.
| Kích thước Model | RAM khuyến nghị (CPU) | VRAM tối thiểu (GPU) | Dung lượng ổ cứng trống |
|---|---|---|---|
| 7B / 8B (Llama 3, Qwen 2.5) | 8 GB – 16 GB | 6 GB – 8 GB | Tối thiểu 10 GB SSD |
| 13B / 14B (Qwen 14B, Mistral) | 16 GB – 32 GB | 12 GB – 16 GB | Tối thiểu 15 GB SSD |
| 32B (DeepSeek-R1 32B) | 32 GB – 64 GB | 24 GB – 32 GB | Tối thiểu 30 GB SSD |
| 70B (Llama 3.3 70B) | 64 GB – 128 GB | 40 GB – 48 GB | Tối thiểu 60 GB SSD |
*Lưu ý: Bảng cấu hình trên ước tính theo mức lượng hóa chuẩn 4-bit (Q4_K_M). Nhu cầu RAM thực tế sẽ thay đổi phụ thuộc vào mức quantization cao hơn (Q8, FP16) và độ dài ngữ cảnh (Context Length) được thiết lập.
Trước khi tiến hành, bạn cần chuẩn bị quyền quản trị root trên hệ điều hành Ubuntu 20.04/22.04/24.04, Debian 11/12 hoặc CentOS Stream/RHEL 9. Hãy làm chủ cách truy cập VPS Linux bằng SSH để kết nối vào máy chủ an toàn trước khi chạy lệnh cài đặt.
Cách cài đặt Ollama trên Linux bằng script tự động
Cách nhanh nhất để cài đặt Ollama là sử dụng script chính thức từ nhà phát triển. Lệnh cài đặt tự động này sẽ phát hiện kiến trúc phần cứng (x86_64 hoặc ARM64), tải binary thích hợp, tạo user hệ thống ollama và thiết lập một systemd service tự khởi động cùng hệ điều hành.
Đăng nhập vào terminal của server và thực thi lệnh duy nhất:
# Tải và chạy script cài đặt chính thức từ docs.ollama.com
curl -fsSL https://ollama.com/install.sh | sh
Quá trình tải và thiết lập diễn ra tự động trong khoảng 1 đến 2 phút tùy theo tốc độ mạng của VPS. Kết quả màn hình hiển thị tương tự như sau:
>>> Downloading ollama...
######################################################################## 100.0%
>>> Installing ollama to /usr/local/bin...
>>> Creating ollama user...
>>> Creating ollama systemd service...
>>> Enabling and starting ollama service...
>>> NVIDIA GPU ready.
The Ollama API is now available at 127.0.0.1:11434.
Install complete. Run "ollama" from the command line.
Kiểm tra phiên bản vừa cài đặt để chắc chắn Ollama đã chạy thành công:
ollama --version
Nếu bạn chưa quen các thao tác điều khiển terminal, hãy xem thêm danh sách các lệnh Linux cơ bản để dễ dàng quản trị file và tiến trình trên máy chủ.

Cách cài đặt Ollama thủ công trên Linux chuẩn Production
Đối với các kỹ sư hệ thống cần bảo mật chặt chẽ hoặc môi trường máy chủ enterprise không cho phép chạy script pipe trực tiếp từ internet, phương pháp cài thủ công (manual install) là tiêu chuẩn kỹ thuật bắt buộc.
Bước 1: Tải file nén binary chính thức
Tùy thuộc vào kiến trúc chip của máy chủ (Intel/AMD hoặc ARM64), bạn chọn gói tải về tương ứng từ tài liệu chính thức của Ollama:
# Dành cho CPU AMD64 (x86_64 phổ biến trên VPS):
curl -fsSL https://ollama.com/download/ollama-linux-amd64.tar.zst | sudo tar --zstd -x -C /usr
# Dành cho kiến trúc ARM64:
curl -fsSL https://ollama.com/download/ollama-linux-arm64.tar.zst | sudo tar --zstd -x -C /usr
Bước 2: Tạo User và Group phân quyền hệ thống
Tuyệt đối không chạy daemon Ollama dưới quyền root vì lý do an toàn mạng. Hãy tạo một user riêng biệt không có shell đăng nhập:
# Tạo user hệ thống và thư mục home riêng
sudo useradd -r -s /bin/false -U -m -d /usr/share/ollama ollama
# Thêm tài khoản hiện tại vào nhóm ollama
sudo usermod -a -G ollama $(whoami)
Bước 3: Cấu hình systemd service
Tạo file định nghĩa service cho systemd để tự khởi chạy tiến trình khi reboot:
sudo nano /etc/systemd/system/ollama.service
Dán nội dung cấu hình chuẩn sau vào file:
[Unit]
Description=Ollama Service
After=network-online.target
[Service]
ExecStart=/usr/bin/ollama serve
User=ollama
Group=ollama
Restart=always
RestartSec=3
Environment="PATH=$PATH"
[Install]
WantedBy=multi-user.target
Bước 4: Nạp cấu hình và kích hoạt tiến trình
# Nạp lại systemd daemon
sudo systemctl daemon-reload
# Bật tự khởi động và chạy dịch vụ ngay lập tức
sudo systemctl enable ollama
sudo systemctl start ollama
# Kiểm tra trạng thái đang active (running)
sudo systemctl status ollama
| Tiêu chí | Cài đặt tự động (Script) | Cài đặt thủ công (Manual) |
|---|---|---|
| Thời gian triển khai | 1 – 2 phút, chỉ một dòng lệnh | 5 – 10 phút, cấu hình từng phần |
| Khả năng kiểm soát | Tự gán đường dẫn và cấu hình mặc định | Kiểm soát tuyệt đối vị trí binary và service |
| Đối tượng phù hợp | Dev/Test cá nhân, thử nghiệm nhanh | Production server, môi trường enterprise |
Cấu hình GPU NVIDIA CUDA và AMD ROCm cho Ollama
Khi bạn trang bị máy chủ có GPU rời, việc cấu hình chuẩn driver sẽ giúp Ollama đưa toàn bộ trọng số (weights) của mô hình vào VRAM, mang lại tốc độ inference nhanh gấp hàng chục lần so với CPU.
Đối với GPU NVIDIA (CUDA)
Ollama tự động phát hiện GPU NVIDIA nếu hệ thống đã cài driver chuẩn và NVIDIA CUDA Toolkit. Kiểm tra trạng thái card màn hình bằng câu lệnh:
nvidia-smi
Nếu lệnh nvidia-smi hiển thị thông tin GPU cùng phiên bản Driver Version và CUDA Version hợp lệ, dịch vụ Ollama sẽ tự động kích hoạt thư viện tăng tốc mà không cần chỉnh sửa mã nguồn.
Đối với GPU AMD (ROCm)
Nếu máy chủ sử dụng card đồ họa AMD Radeon hoặc Instinct, bạn cần cài đặt bộ AMD ROCm v7 theo tài liệu chính thức của AMD, sau đó tải bản build nén tích hợp riêng cho ROCm:
# Tải gói cài đặt hỗ trợ AMD ROCm
curl -fsSL https://ollama.com/download/ollama-linux-amd64-rocm.tar.zst | sudo tar --zstd -x -C /usr
Thiết lập biến môi trường quan trọng khi chạy Ollama trên VPS Linux
Theo mặc định bảo mật, Ollama chỉ lắng nghe kết nối tại địa chỉ nội bộ 127.0.0.1:11434 và lưu dữ liệu mô hình ở phân vùng gốc /usr/share/ollama/.ollama/models. Khi triển khai trên VPS Linux để làm máy chủ API nội bộ, bạn cần điều chỉnh các biến môi trường để mở port hoặc đổi thư mục lưu trữ sang ổ cứng thứ hai.
Cách chuẩn mực nhất trên Linux là dùng systemd override:
sudo systemctl edit ollama
Trình soạn thảo mở ra, bạn điền các thông số cần thiết giữa hai dòng chú thích:
[Service]
Environment="OLLAMA_HOST=0.0.0.0:11434"
Environment="OLLAMA_ORIGINS=*"
Environment="OLLAMA_MODELS=/mnt/data/ollama/models"
Environment="OLLAMA_FLASH_ATTENTION=1"
Environment="OLLAMA_KEEP_ALIVE=24h"
| Biến môi trường | Mặc định | Giải thích và Trường hợp áp dụng |
|---|---|---|
| OLLAMA_HOST | 127.0.0.1:11434 | Đặt thành 0.0.0.0:11434 khi cần cho phép máy khác trong mạng gọi API. |
| OLLAMA_ORIGINS | Chỉ localhost | Cấu hình CORS khi tích hợp với các Web UI hoặc frontend chạy ở tên miền khác. |
| OLLAMA_MODELS | /usr/share/ollama/.. | Chỉ định thư mục lưu trữ model sang ổ cứng gắn thêm nếu phân vùng root bị đầy. |
| OLLAMA_KEEP_ALIVE | 5m (5 phút) | Thời gian giữ model trong RAM/VRAM. Đặt -1 hoặc 24h để tránh load lại model. |
| OLLAMA_FLASH_ATTENTION | 0 (Tắt) | Bật lên 1 để tiết kiệm VRAM và tăng tốc độ xử lý khi prompt đầu vào dài. |
| OLLAMA_NUM_PARALLEL | 1 | Số lượng request xử lý đồng thời. Tăng lên khi có nhiều user chat cùng lúc. |
Lưu file và khởi động lại dịch vụ để các biến môi trường có hiệu lực:
sudo systemctl daemon-reload
sudo systemctl restart ollama
Săn deal VPS & Cloud Server trước khi chốt gói
Canh Me tổng hợp khuyến mãi, mã giảm giá và điều kiện đăng ký mới nhất — xem trước để chọn cấu hình chạy Ollama với chi phí tốt nhất.
Khởi chạy model đầu tiên và các lệnh Ollama CLI cần biết
Sau khi hoàn thành các bước cài đặt Ollama trên Linux, bạn có thể tương tác trực tiếp với các mô hình ngôn ngữ lớn ngay trên giao diện dòng lệnh. Lệnh ollama run sẽ tự động kiểm tra model trong máy chủ, nếu chưa có sẽ tự pull về và mở phiên chat.
# Tải và chạy thử mô hình DeepSeek-R1 (bản 7B hoặc 8B tối ưu cho VPS)
ollama run deepseek-r1:8b
# Tải trước mô hình mà không cần mở giao diện chat
ollama pull llama3.3
# Tải mô hình Qwen 2.5 hoặc Gemma 2
ollama pull qwen2.5:7b
Các thao tác quản trị tài nguyên mô hình thường dùng gồm có:
ollama list: Hiển thị danh sách các model hiện có trên server và dung lượng đĩa tương ứng.ollama ps: Xem mô hình nào đang được nạp trực tiếp trong RAM/VRAM và phần trăm tài nguyên sử dụng.ollama rm <tên-model>: Xóa model khỏi máy chủ để giải phóng bộ nhớ lưu trữ.ollama show <tên-model> --modelfile: Xem các thông số cấu hình hệ thống, template và prompt của mô hình.
Kết nối Ollama với Open WebUI, n8n và kiến trúc AI Agent
Việc sử dụng CLI chỉ thích hợp cho việc kiểm thử. Để đưa vào sử dụng thực tế, người ta thường xây dựng giao diện trực quan tương tự ChatGPT hoặc gắn vào các luồng tự động hóa công việc. Việc triển khai các ứng dụng này trở nên dễ dàng hơn bao giờ hết khi bạn hiểu rõ Docker là gì để cô lập các môi trường chạy ứng dụng.
Để dựng giao diện chat Open WebUI kết nối trực tiếp đến Ollama đã cài trên máy chủ Linux, bạn chỉ cần thực thi Docker command:
docker run -d -p 3000:8080 \
--add-host=host.docker.internal:host-gateway \
-v open-webui:/app/backend/data \
--name open-webui \
--restart always \
ghcr.io/open-webui/open-webui:main
Bên cạnh giao diện chat, mô hình Ollama trên máy chủ Linux là thành phần hạ tầng lý tưởng khi xây dựng AI Agent thực hiện các tác vụ phân tích dữ liệu chuyên sâu. Bạn có thể nhanh chóng kết nối Ollama với công cụ tự động hóa thông qua bài hướng dẫn cài đặt n8n bằng Docker trên VPS. Khi đó, n8n sẽ gọi vào cổng 11434 của Ollama như một local LLM node bảo mật không mất phí API.
Để hệ thống vận hành liên tục cho doanh nghiệp, bạn nên tham khảo giải pháp thiết lập VPS Linux cho AI hoạt động 24/7 nhằm cấu hình firewall, log rotate và swap ram tối ưu.
Xử lý lỗi thường gặp khi cài đặt Ollama trên máy chủ Linux
1. Ollama không nhận diện được GPU NVIDIA (Chỉ chạy CPU)
Hiện tượng này xảy ra khi Ollama ghi nhận GPU discovery thất bại. Nguyên nhân thường do thiếu thư viện CUDA tương thích trong biến môi trường hoặc driver chưa nhận diện. Bạn kiểm tra log hệ thống bằng lệnh:
journalctl -u ollama --no-pager -e
Nếu bạn muốn ép buộc hệ thống chạy chế độ CPU tối ưu instruction set AVX2 (trong trường hợp driver bị xung đột), bạn có thể gán biến môi trường: OLLAMA_LLM_LIBRARY="cpu_avx2".
2. Lỗi cổng 11434 bị chiếm dụng (bind: address already in use)
Lỗi này xuất hiện khi bạn chạy lệnh ollama serve thủ công trong khi tiến trình systemd service nền vẫn đang chạy. Hãy kiểm tra các tiến trình đang chiếm cổng:
sudo ss -tulpn | grep 11434
# Nếu service ollama đang chiếm giữ, quản lý thông qua systemctl chứ không chạy serve tay:
sudo systemctl restart ollama
3. Tiến trình bị tắt đột ngột (Killed / Out of Memory)
Khi bạn cố nạp một model vượt quá lượng RAM vật lý của server, trình quản lý Linux OOM Killer sẽ tự động ngắt tiến trình Ollama. Khắc phục tạm thời bằng cách kích hoạt thêm 8GB – 16GB bộ nhớ ảo (Swap RAM) hoặc chuyển sang dùng bản model có dung lượng nhỏ hơn (ví dụ chuyển từ 14B về 8B hoặc 3B).
4. Lỗi tải model bị ngắt quãng hoặc đầy ổ cứng root
Nếu phân vùng / của hệ điều hành bị đầy, lệnh pull sẽ báo lỗi disk full. Hãy đổi biến OLLAMA_MODELS sang một phân vùng ổ cứng có dung lượng lớn hơn như đã hướng dẫn ở phần cấu hình biến môi trường.
So sánh VPS và Cloud Server khi tự host Ollama
Nhiều người phân vân không biết nên chọn máy chủ ảo VPS hay hạ tầng Cloud Server khi học cách cài đặt Ollama trên Linux. Bảng so sánh dưới đây phân loại theo nhu cầu thực tế:
| Tiêu chí hạ tầng | VPS Linux (Tiêu chuẩn) | Cloud Server (Doanh nghiệp) |
|---|---|---|
| Mục đích sử dụng | Môi trường dev/test, cá nhân, chatbot nội bộ nhỏ | Môi trường production, xử lý song song nhiều kết nối |
| Model đề xuất | Chạy tốt model 3B, 7B, 8B (lượng hóa Q4) | Đáp ứng tốt model 14B, 32B và 70B |
| Khả năng co giãn | Cấu hình cố định theo gói ban đầu | Nâng vCPU và RAM linh hoạt khi tải tăng cao |
| Chi phí vận hành | Chi phí tiết kiệm, tối ưu cho freelancer, dev | Đầu tư chuyên nghiệp theo hiệu năng yêu cầu |
Câu hỏi thường gặp về cách cài đặt Ollama trên Linux
Ollama có chạy được trên máy chủ Linux không có card màn hình rời (GPU) không?
Có. Ollama hỗ trợ hoàn toàn việc thực thi mô hình qua CPU và bộ nhớ RAM máy chủ. Mặc dù tốc độ xử lý câu từ chậm hơn GPU, các mô hình nhỏ như 7B hoặc 8B lượng hóa chuẩn vẫn phản hồi tương đối mượt cho các tác vụ tóm tắt văn bản và chatbot đơn giản.
Làm thế nào để cập nhật Ollama lên phiên bản mới nhất trên Linux?
Để nâng cấp phiên bản, bạn chỉ cần thực thi lại lệnh cài đặt tự động ban đầu: curl -fsSL https://ollama.com/install.sh | sh. Script sẽ tự tải bản cập nhật mới nhất, thay thế binary cũ mà không làm mất các file model đã tải trước đó.
Thư mục mặc định lưu trữ model của Ollama nằm ở đâu?
Khi cài đặt trên Linux qua script hoặc manual, Ollama lưu trữ toàn bộ file manifest và blobs dữ liệu của mô hình tại đường dẫn /usr/share/ollama/.ollama/models. Bạn có thể thay đổi đường dẫn này bằng biến môi trường OLLAMA_MODELS.
Làm sao để gọi API Ollama từ xa bên ngoài mạng internet?
Mặc định Ollama chỉ lắng nghe cổng cục bộ. Bạn cần đặt biến môi trường OLLAMA_HOST=0.0.0.0:11434 trong file systemd override, sau đó mở port 11434 trên firewall hệ điều hành (như UFW hoặc iptables) hoặc đặt sau một reverse proxy như NGINX có xác thực.
Làm thế nào để gỡ cài đặt hoàn toàn Ollama khỏi Linux?
Dừng và xóa service bằng lệnh: sudo systemctl stop ollama && sudo systemctl disable ollama. Sau đó xóa file binary và user hệ thống: sudo rm -rf /usr/local/bin/ollama /usr/share/ollama /etc/systemd/system/ollama.service.
Chủ động hạ tầng AI cá nhân hóa với Ollama trên nền tảng máy chủ riêng
Nắm vững cách cài đặt Ollama trên Linux mở ra giải pháp tự chủ hạ tầng trí tuệ nhân tạo toàn diện cho cá nhân và tổ chức. Việc làm chủ từ khâu thiết lập script, cấu hình GPU, tinh chỉnh biến môi trường đến kết nối ứng dụng thực tiễn sẽ giải quyết triệt để bài toán chi phí token và rò rỉ dữ liệu. Hãy khởi đầu bằng việc lựa chọn cấu hình máy chủ ảo phù hợp với nhu cầu inference tại InterData, hoặc ghé thăm trang deal Canh Me để tối ưu chi phí hạ tầng máy chủ ngay hôm nay.
Nội dung mang tính tham khảo kỹ thuật. Các lệnh cài đặt, cấu hình environment variables và driver GPU có thể thay đổi theo phiên bản Ollama, bản phân phối Linux (Ubuntu, Debian, CentOS…), phiên bản kernel và driver NVIDIA/AMD. Luôn kiểm tra tài liệu chính thức tại docs.ollama.com trước khi áp dụng cho production. Sao lưu dữ liệu và test trên staging trước khi triển khai.
