GEARVN
VRAM, RAM và bộ nhớ khi chạy LLM Local: Cách tính đúng

VRAM, RAM và bộ nhớ khi chạy LLM Local: Cách tính đúng

Ngày cập nhật: 14/07/2026Marketing & SEO

VRAM quyết định phần lớn khả năng giữ model trên GPU, còn RAM hệ thống quyết định không gian cho runtime, dữ liệu và phần model phải offload. Tuy vậy, không có công thức “X tỷ tham số = Y GB” đúng cho mọi trường hợp vì precision, quantization, context và số phiên đồng thời đều làm thay đổi footprint.

Tóm tắt nhanh

  • Phải tính weights, KV cache, activation/workspace và phần dự phòng.
  • Quantization 8-bit hoặc 4-bit giảm footprint nhưng phải kiểm tra chất lượng.
  • Context và concurrency có thể ăn nhiều bộ nhớ dù weights không đổi.
  • RAM bằng 1,5–2 lần VRAM là heuristic tham khảo, không phải cam kết hiệu năng.

1. VRAM đang chứa những gì?

Khi inference, GPU không chỉ giữ weights. Runtime còn cần KV cache cho context đã xử lý, vùng làm việc cho kernel và các buffer khác. Với serving nhiều người dùng, mỗi sequence đồng thời có thể cần thêm KV cache. Tài liệu multi-GPU của llama.cpp nêu rõ KV cache tăng gần theo context và số slot song song; giảm context hoặc parallelism có thể giải phóng bộ nhớ.

VRAM đang chứa những gì? (Nguồn: NVIDIA)

2. Vì sao không thể tính theo số tham số một cách máy móc?

Cùng một model có thể được lưu ở FP16, 8-bit, 4-bit hoặc định dạng GGUF khác nhau. Hugging Face mô tả LLM.int8() và 4-bit quantization như cách giảm memory footprint, nhưng các module, cache và runtime vẫn dùng thêm bộ nhớ. Model dense và MoE cũng có hành vi khác nhau. Vì vậy con số trên tên model chỉ là dữ liệu đầu vào, chưa phải cấu hình.

Biến
Tác động chính
Cách kiểm tra
Precision/quantization
Kích thước weights và chất lượng
Đọc model card, chạy eval
Context
KV cache và thời gian prefill
Test đúng độ dài tài liệu
Concurrency
Cache cho nhiều sequence
Load test theo tải cao điểm
Runtime
Cách phân bổ và kernel
Ghi version, backend, flags
Offload
Giảm VRAM nhưng tăng phụ thuộc RAM
Đo tốc độ full-GPU và hybrid
 

3. RAM hệ thống dùng để làm gì?

RAM chứa hệ điều hành, inference server, model file được memory-map, input/output, index RAG và phần weights chạy trên CPU. Khi model không nằm trọn VRAM, llama.cpp hỗ trợ CPU+GPU hybrid inference; đây là cách để chạy model lớn hơn VRAM nhưng thường chậm hơn giữ toàn bộ phần tính toán quan trọng trên GPU.

Puget Systems khuyến nghị tối thiểu RAM không thấp hơn VRAM và ưu tiên khoảng 1,5–2 lần VRAM cho workstation local LLM. Đây là biên thiết kế hữu ích để tránh thiếu RAM khi load và offload, không phải quy tắc chứng minh mọi cấu hình đều nhanh hơn.

4. Ví dụ quy trình sizing an toàn

  1. Chọn model và revision cụ thể.
  2. Chọn định dạng weights/quantization sẽ triển khai.
  3. Đặt context và số request đồng thời thật.
  4. Chạy runtime với công cụ báo memory footprint.
  5. Giữ biên cho hệ điều hành, cache và spike.
  6. Load test, ghi OOM, thời gian và chất lượng output.

5. Những lỗi tư vấn thường gặp

  • Cộng VRAM nhiều GPU rồi mặc định mọi phần mềm nhìn thấy một pool thống nhất.
  • Quên KV cache khi tăng context hoặc số user.
  • Dùng quantization chỉ để fit mà không đánh giá chất lượng tiếng Việt.
  • Để RAM vừa đủ bằng kích thước file model, không chừa cho runtime và dữ liệu.
  • Gọi “chạy được” khi thực tế mỗi phản hồi mất nhiều phút.

Để hiểu sự khác nhau giữa bộ nhớ hệ thống và bộ nhớ đồ họa, xem thêm bài phân biệt DDR và GDDR. Khi đã xác định nhu cầu, bạn có thể đối chiếu các cấu hình AI PC GVN.

6. Câu hỏi thường gặp

6.1. RAM 32 GB có phải mức tối thiểu cho mọi AI PC?

Không phải mọi tác vụ. Model nhỏ, OCR hoặc classification có thể chạy với ít hơn. Nhưng workstation đa dụng cần tính cả model, dữ liệu và ứng dụng chạy song song; 32 GB thường là mốc khởi đầu thực tế hơn cho cấu hình mới.

6.2. Model không fit VRAM có chạy được không?

Có thể chạy bằng offload hoặc chia nhiều GPU nếu runtime hỗ trợ, nhưng phải đo đánh đổi về tốc độ và độ ổn định.

Nguồn kỹ thuật tham khảo: Hugging Face bitsandbytes documentation, llama.cpp README/multi-GPU documentation và Puget Systems Local LLM Hardware Primer.