Mac mini chạy AI local cần RAM bao nhiêu? Chọn cấu hình nào
Chạy AI offline trên Mac mini: bảng cỡ model ↔ RAM theo dữ liệu Ollama, vì sao băng thông bộ nhớ quyết định tốc độ, và cấu hình M4, M6, M5 Pro nên chọn.

Tuần nào Huy Store cũng có khách hỏi cùng một câu: “Anh muốn mua Mac mini để chạy AI offline, lấy bản nào?”. Người thì muốn tự chạy DeepSeek cho yên tâm dữ liệu công ty, người muốn có “ChatGPT riêng” cho cả nhà, người dùng cho lập trình. Trả lời ngắn: với AI chạy tại máy, RAM quyết định bạn chạy được model cỡ nào, còn băng thông bộ nhớ quyết định nó trả lời nhanh hay chậm. Chip mạnh hay yếu đứng hàng thứ ba.
Bài này đi thẳng vào con số: model cỡ nào cần bao nhiêu RAM (theo dữ liệu Ollama công bố), Mac mini đời nào có bao nhiêu RAM và băng thông (theo MacRumors), rồi gợi ý cấu hình theo ngân sách. Nếu bạn chưa rõ nên mua đời Mac mini nào nói chung, đọc bài trụ cột Mac mini đời nào đáng mua nhất 2026 trước.
Vì sao RAM là thứ quyết định, không phải chip
Một mô hình ngôn ngữ (LLM) về bản chất là một file trọng số rất lớn. Khi chạy, toàn bộ file đó phải nằm trong bộ nhớ để GPU đọc liên tục. Trên PC, bộ nhớ đó là VRAM của card đồ hoạ — thường chỉ 8–16GB. Trên Mac Apple Silicon, CPU và GPU dùng chung Unified Memory, nên một chiếc Mac mini 32GB có thể dành phần lớn số RAM đó cho model. Đây là lý do Mac mini trở thành “máy AI giá mềm” được nhắc nhiều trên các diễn đàn. Mình đã giải thích kỹ cơ chế này trong bài Unified Memory là gì.
Nhưng có hai giới hạn cần nói thẳng:
- macOS không giao 100% RAM cho GPU. Hệ điều hành và app đang mở vẫn cần chỗ, và macOS mặc định chỉ cho GPU dùng một phần bộ nhớ. Vì vậy model 16GB không chạy thoải mái trên máy 16GB.
- Ngoài file model còn “ngữ cảnh” (context). Đoạn hội thoại càng dài, tài liệu dán vào càng nhiều thì bộ nhớ đệm càng phình. Trong Ollama, thanh trượt Context length đi từ 4k tới 128k — kéo lên cao là tốn thêm RAM đáng kể.
Quy tắc mình áp dụng khi tư vấn: file model nên chiếm không quá khoảng 60–70% RAM máy để còn chỗ cho ngữ cảnh và các app khác. Đây là kinh nghiệm thực tế, không phải con số Apple công bố.
Bảng cỡ model ↔ RAM: dữ liệu thật từ thư viện Ollama
Tài liệu gốc của Ollama từng ghi rõ khuyến nghị: cần ít nhất 8GB RAM để chạy model 7B, 16GB cho model 13B và 32GB cho model 33B (nguồn: README Ollama trên GitHub). Bảng dưới là dung lượng file tải về (bản nén mặc định) mình tra trực tiếp trên thư viện ollama.com, kèm mức RAM Mac mini mình khuyên dùng:
| Model (Ollama) | Dung lượng file | RAM Mac mini nên có |
|---|---|---|
| Llama 3.2 3B | 2,0GB | 8GB (tối thiểu), 16GB thoải mái |
| Gemma 3 4B | 3,3GB | 16GB |
| Qwen3 8B / DeepSeek-R1 8B | 5,2GB | 16GB |
| Gemma 3 12B | 8,1GB | 24GB |
| Qwen3 14B / DeepSeek-R1 14B | 9,0–9,3GB | 24GB |
| gpt-oss 20B | 14GB | 32GB |
| Gemma 3 27B | 17GB | 32GB |
| DeepSeek-R1 32B | 20GB | 32GB (chật), 48–64GB thoải mái |
| DeepSeek-R1 70B | 43GB | 64GB |
| gpt-oss 120B | 65GB | Vượt Mac mini — cần Mac Studio |
Dung lượng file: tra trên ollama.com/library tháng 9/2026. Cột RAM khuyên dùng là ước lượng của huytao.com dựa trên quy tắc 60–70% ở trên.
Một lưu ý hay bị hiểu sai: “DeepSeek chạy trên Mac” gần như luôn là bản chưng cất (distill) cỡ 7B–70B dựa trên nền Qwen hoặc Llama, không phải DeepSeek-R1 bản đầy đủ mà bạn dùng trên web. Bản đầy đủ cần hàng trăm GB bộ nhớ — không một chiếc Mac mini nào kham nổi.

Băng thông bộ nhớ: lý do M5 Pro “nói” nhanh hơn M6 dù cùng chạy một model
Khi AI sinh từng chữ, máy phải đọc gần như toàn bộ trọng số model từ bộ nhớ cho mỗi token. Vì thế tốc độ trả lời gần như tỉ lệ thuận với băng thông bộ nhớ chia cho kích thước model. Theo MacRumors:
| Mac mini 2026 | RAM | Băng thông bộ nhớ | Giá khởi điểm (Mỹ) |
|---|---|---|---|
| M6 bản gốc | 16GB (tuỳ chọn tới 32GB) | 153GB/s (tối đa 170GB/s) | 899 USD |
| M5 Pro | 24GB (tuỳ chọn tới 64GB) | 307GB/s | 1.699 USD |
Nghĩa là cùng một model 14B, M5 Pro sẽ sinh chữ nhanh hơn M6 đáng kể nhờ băng thông gần gấp đôi. Mình không đưa con số token/giây ở đây vì chưa có phép đo độc lập đáng tin cho hai máy mới — con số trên mạng thường khác nhau tuỳ model, bản nén và độ dài ngữ cảnh. Nếu bạn cần con số cho đúng model mình định dùng, cứ mang câu hỏi qua Huy Store, bọn mình chạy thử trực tiếp cho xem.
Apple còn nói chip M6 có Neural Accelerator trong từng lõi GPU, cho hiệu năng AI nhanh tới 4 lần so với Mac mini M4 (nguồn: Apple qua MacRumors). Con số này đo trên tác vụ Apple chọn; thực tế với app chạy LLM phổ biến, mức cải thiện còn phụ thuộc app đã tận dụng phần cứng mới hay chưa.
Mac mini đời cũ còn chạy AI được không?
Rất nhiều khách Việt mua Mac mini cũ để tiết kiệm, nên mình tách riêng:
- Mac mini M1 (8GB/16GB): bản 8GB chỉ nên thử model 3B–4B cho vui. Bản 16GB chạy được model 8B nhưng chậm hơn máy mới rõ. Xem thêm Mac mini M1 năm 2026 còn đáng mua không.
- Mac mini M2 (8GB–24GB): bản 16–24GB là lựa chọn máy cũ hợp lý cho model 8B–14B.
- Mac mini M4 (16GB–32GB) và M4 Pro (tới 64GB): vẫn rất đáng giá, nhất là bản 32GB hoặc M4 Pro 48/64GB mua lại. So sánh chi tiết ở bài Mac mini M2 hay M4.
LM Studio ghi rõ yêu cầu: Mac chip M1 trở lên, macOS 14 trở lên, khuyến nghị 16GB RAM; máy 8GB vẫn chạy được nhưng nên dùng model nhỏ và ngữ cảnh ngắn (nguồn: tài liệu LM Studio). Mac mini Intel thì bỏ qua — LM Studio không hỗ trợ, còn Ollama chỉ chạy bằng CPU trên máy Intel nên rất chậm.
Gợi ý cấu hình theo ngân sách và nhu cầu
| Nhu cầu | Cấu hình nên chọn | Lý do |
|---|---|---|
| Thử cho biết, hỏi đáp đơn giản, tóm tắt văn bản | Mac mini M4/M6 16GB | Chạy tốt model 4B–8B, rẻ nhất |
| Dùng hằng ngày cho công việc, viết code, đọc tài liệu nội bộ | Mac mini 32GB (M6 hoặc M4) | Model 14B mượt, chạy được model 27–32B |
| Chạy AI cho cả văn phòng nhỏ, model lớn, cần tốc độ | Mac mini M5 Pro 48–64GB | Băng thông 307GB/s, chạy được model 70B bản nén |
| Model trên 60GB, nhiều người dùng song song | Mac Studio | Vượt khả năng Mac mini |
Nếu phân vân giữa M5 Pro 64GB và lên hẳn Mac Studio, bài Mac Studio hay Mac mini M5 Pro có phân tích riêng. Còn với ổ cứng, mỗi model nặng vài GB đến vài chục GB, tải 4–5 model là mất cả trăm GB — 512GB là mức mình khuyên cho người chạy AI nghiêm túc (xem chọn dung lượng SSD).
Nói thẳng về giới hạn: AI local không thay được ChatGPT
Mình dùng song song cả hai nên nói thật: model 8B–14B chạy trên Mac mini trả lời kém hơn ChatGPT, Gemini hay Claude bản cloud ở câu hỏi khó, kiến thức mới và tiếng Việt chuyên sâu. Model nhỏ đôi khi trả lời tiếng Việt lơ lớ hoặc bịa thông tin tự tin. Thứ bạn đổi lại được là:
- Riêng tư: dữ liệu khách hàng, hợp đồng, tài liệu nội bộ không rời khỏi máy.
- Không phí tháng, không giới hạn lượt, chạy cả khi mất mạng.
- Tự động hoá: Ollama và LM Studio có API để nối vào công cụ, bot nội bộ.
Với người Việt, lợi thế riêng tư này đáng giá với các văn phòng kế toán, luật, y tế nhỏ — nơi không muốn dán dữ liệu lên dịch vụ nước ngoài.
Kết luận: 32GB là điểm ngọt, đừng mua 16GB nếu AI là lý do chính
Nếu AI chỉ là phụ, Mac mini 16GB vẫn đủ để thử và học. Nhưng nếu bạn mua máy vì AI, hãy lấy tối thiểu 32GB — vì RAM không nâng cấp được, và chênh lệch trải nghiệm giữa model 8B và 14B–27B là rất rõ. Cần tốc độ và model lớn thì M5 Pro 64GB, đừng cố ghép nhiều máy nhỏ khi chưa thật sự cần.
Bước tiếp theo: cài app chạy AI theo bài hướng dẫn cài Ollama trên Mac, hoặc xem LM Studio, Ollama hay Jan — chọn app nào.
Cần tư vấn cấu hình Mac mini chạy AI đúng model bạn định dùng, Huy Store có thể cài sẵn và chạy thử trước khi giao máy — liên hệ Fanpage, Zalo hoặc hotline 0862 838 663.
Câu hỏi thường gặp
Mac mini 16GB có chạy được AI offline không?
Được, nhưng nên dừng ở các model khoảng 4–8 tỷ tham số (file tải về chừng 2,5–5GB trên Ollama) như Qwen3 8B, Gemma 3 4B, DeepSeek-R1 8B. Model 14B vẫn mở được nhưng khá chật khi còn mở trình duyệt và app khác.
Nên mua Mac mini 32GB hay M5 Pro 64GB để chạy AI?
32GB (M6 hoặc M4 nâng cấp) là điểm ngọt cho model 14B và một phần model 27–32B. Chỉ nên lên M5 Pro 64GB nếu bạn thật sự cần model cỡ 70B hoặc chạy AI cho nhiều người cùng lúc; M5 Pro còn có băng thông bộ nhớ 307GB/s nên sinh chữ nhanh hơn rõ.
Mua Mac mini RAM thấp rồi nâng cấp sau được không?
Không. RAM trên mọi Mac mini Apple Silicon nằm chung đế chip, không nâng cấp được sau khi mua. Muốn chạy AI thì phải chọn đủ RAM ngay từ đầu.
AI chạy trên Mac mini có thông minh bằng ChatGPT không?
Chưa bằng. Model chạy vừa RAM Mac mini nhỏ hơn nhiều so với model trên máy chủ của OpenAI hay Google, nên kém hơn ở câu hỏi khó, kiến thức mới và tiếng Việt chuyên sâu. Đổi lại bạn có sự riêng tư, chạy offline và không tốn phí theo tháng.
Cần tư vấn mua Mac?
Huy Store tư vấn cấu hình & báo giá MacBook · iMac · Mac mini chính hãng.


