Cách cài Ollama trên Mac để chạy DeepSeek, Qwen offline
Cài Ollama trên Mac từng bước: tải app, chạy DeepSeek-R1, Qwen3, Gemma 3 bằng cửa sổ chat hoặc Terminal, thêm Open WebUI và chia sẻ cho máy khác.

Muốn có một “ChatGPT riêng” chạy ngay trên Mac, không gửi dữ liệu ra ngoài, cách nhanh nhất hiện nay là Ollama. Bài này hướng dẫn từ lúc tải app đến khi chat được với DeepSeek-R1, Qwen3 hay Gemma 3, kèm cách gắn giao diện web cho cả nhà dùng chung. Chưa biết máy mình chạy nổi model cỡ nào? Xem bảng RAM trong bài Mac mini chạy AI cần RAM bao nhiêu trước.

B1: Kiểm tra máy trước khi cài — đừng bỏ qua bước này
Theo tài liệu chính thức của Ollama cho macOS:
- macOS Sonoma (14) trở lên.
- Chip Apple M để dùng cả CPU lẫn GPU. Mac Intel vẫn cài được nhưng chỉ chạy CPU, rất chậm.
- Ổ cứng trống: mỗi model nặng từ 1GB đến vài chục GB. Máy 256GB nên chừa ít nhất 30–40GB.
RAM là giới hạn thật: máy 8GB chỉ nên chạy model 3–4B, máy 16GB chạy model 8B, 32GB mới chạy thoải mái model 14B trở lên.
B2: Tải và cài app Ollama
- Vào ollama.com/download, bấm tải bản macOS (file Ollama.dmg). Có thể tải thẳng từ trang Ollama trong Kho App.
- Mở file .dmg, kéo Ollama vào thư mục Applications — đây là cách cài Ollama khuyến nghị.
- Mở Ollama lần đầu. App sẽ kiểm tra lệnh
ollamađã có trong Terminal chưa; nếu chưa, nó xin quyền tạo liên kết trong/usr/local/bin— nhập mật khẩu máy để đồng ý.
Người quen Terminal có thể cài bằng một dòng lệnh theo README chính thức:
curl -fsSL https://ollama.com/install.sh | sh
Cài xong, biểu tượng chú lạc đà xuất hiện trên thanh menu. Ollama chạy ngầm như một máy chủ nhỏ tại địa chỉ 127.0.0.1:11434.
B3: Chat ngay trong app Ollama — cách dễ nhất cho người mới
Các bản Ollama gần đây có sẵn cửa sổ chat, không bắt buộc dùng Terminal:
- Mở cửa sổ Ollama, chọn model ở ô chọn model cạnh khung nhập.
- Gõ câu hỏi. Nếu model chưa có trên máy, app sẽ tự tải về ở lần đầu (mất vài phút tuỳ mạng).
- Vào phần cài đặt nếu muốn chỉnh Context length — để mặc định là hợp lý với máy 16GB.
Mình thấy với người Việt, Qwen3 và Gemma 3 trả lời tiếng Việt tự nhiên hơn Llama cùng cỡ. Đây là nhận xét qua sử dụng, bạn nên thử 2–3 model với đúng loại câu hỏi của mình.
B4: Chạy DeepSeek, Qwen, Gemma bằng Terminal
Mở Terminal và gõ một trong các lệnh sau. Lần đầu lệnh sẽ tải model, lần sau mở ngay:
ollama run qwen3:8b # 5,2GB – hợp máy 16GB
ollama run deepseek-r1:8b # 5,2GB – có "suy nghĩ" trước khi trả lời
ollama run gemma3:4b # 3,3GB – nhẹ, hợp máy 8–16GB
ollama run deepseek-r1:14b # 9,0GB – nên có 24–32GB RAM
(Dung lượng theo thư viện ollama.com, tháng 9/2026.)
Các lệnh quản lý cần nhớ:
| Lệnh | Tác dụng |
|---|---|
ollama list | Xem các model đã tải |
ollama ps | Xem model nào đang nạp trong RAM |
ollama rm qwen3:8b | Xoá model để giải phóng ổ cứng |
/bye | Thoát khỏi phiên chat trong Terminal |
Lưu ý với DeepSeek: các bản deepseek-r1 từ 1.5b đến 70b trên Ollama là bản chưng cất dựa trên Qwen/Llama, không phải model DeepSeek đầy đủ chạy trên web, nên đừng kỳ vọng chất lượng ngang bản online.
B5: Thêm giao diện chat đẹp hơn — Reins, Jan hoặc Open WebUI
Ollama là “động cơ”; bạn có thể gắn giao diện khác lên trên:
- Reins (Mac App Store, miễn phí): app chat gọn gàng kết nối Ollama hoặc LM Studio, hỗ trợ đính kèm ảnh, PDF. Xem Reins.
- Jan: app chat offline có thể dùng model riêng hoặc kết nối máy chủ khác. Xem Jan.
- Open WebUI: giao diện web giống ChatGPT, hợp khi muốn cả nhà cùng dùng qua trình duyệt. Theo README chính thức, cài bằng Python 3.11:
pip install open-webui
open-webui serve
Sau đó mở http://localhost:8080. Chi tiết ở trang Open WebUI.

B6 (tuỳ chọn): Cho máy khác trong nhà dùng chung Ollama
Mặc định Ollama chỉ nhận kết nối từ chính máy đó. Muốn laptop khác trong mạng LAN gọi tới Mac mini, tài liệu Ollama hướng dẫn đặt biến môi trường rồi khởi động lại app:
launchctl setenv OLLAMA_HOST "0.0.0.0:11434"
Chỉ làm điều này trong mạng nhà/văn phòng tin cậy, không mở cổng 11434 ra Internet. Muốn biến Mac mini thành máy chủ AI cả nhà dùng, xem bài Mac mini làm server tại nhà.
Kết quả và giới hạn cần biết
Làm xong các bước trên, bạn có trợ lý AI chạy hoàn toàn trên máy: hỏi đáp, tóm tắt tài liệu, viết code cơ bản, cả khi không có mạng. Nhưng nói thẳng: model vừa RAM Mac vẫn kém ChatGPT bản cloud ở câu hỏi khó và kiến thức mới. Hãy dùng Ollama cho việc cần riêng tư và lặp lại hằng ngày, còn việc khó thì vẫn nên nhờ AI trên mây.
Đang cân nhắc giữa Ollama và app có giao diện đầy đủ hơn? Đọc tiếp LM Studio, Ollama hay Jan. Cần Mac mini cài sẵn Ollama và model phù hợp, Huy Store hỗ trợ cài đặt, chạy thử khi nhận máy — hotline 0862 838 663.
Câu hỏi thường gặp
Ollama có miễn phí không?
Có. Ollama là phần mềm mã nguồn mở theo giấy phép MIT, tải và chạy model trên máy không mất phí. Ollama có thêm dịch vụ model đám mây tuỳ chọn, nhưng chạy offline thì không cần tài khoản.
Model Ollama tải về lưu ở đâu, xoá thế nào?
Theo tài liệu Ollama, model và cấu hình nằm trong thư mục ~/.ollama. Xoá một model bằng lệnh ollama rm tên-model, xem danh sách bằng ollama list.
Mac Intel có cài Ollama được không?
Cài được, nhưng tài liệu Ollama ghi rõ máy x86 chỉ chạy bằng CPU nên rất chậm. Mac chip M (Apple Silicon) mới dùng được GPU.
DeepSeek chạy bằng Ollama có giống DeepSeek trên web không?
Không hoàn toàn. Các bản deepseek-r1 1.5b đến 70b trên Ollama là bản chưng cất dựa trên Qwen hoặc Llama, nhỏ hơn nhiều so với model DeepSeek chạy trên máy chủ, nên trả lời kém hơn ở câu hỏi khó.
Cần tư vấn mua Mac?
Huy Store tư vấn cấu hình & báo giá MacBook · iMac · Mac mini chính hãng.