Chạy AI local sau cập nhật tháng 8/2026: GPU mới, runtime mới và mặc định đã đổi
Nếu bạn đang chạy AI local trên máy cá nhân hoặc workstation tự quản, bản cập nhật tháng 8/2026 là thời điểm nên rà lại toàn bộ stack: runtime đang dùng, GPU được hỗ trợ, model đang nạp, tham số mặc định và cách đo hiệu năng. Lý do rất đơn giản: chỉ trong vài ngày đầu tháng 8/2026, cả Ollama lẫn llama.cpp đều có nhiều thay đổi ảnh hưởng trực tiếp đến người tự vận hành máy.
Gợi ý nhanh từ GearVN: Đừng nâng cấp rồi đánh giá bằng cảm giác. Hãy ghi lại phiên bản cũ, cập nhật có kiểm soát, chạy benchmark tách riêng tốc độ xử lý prompt và tốc độ sinh token, sau đó kiểm tra lại API hoặc công cụ coding agent đang kết nối với máy local.
Mục lục bài viết1. Có gì mới đáng chú ý với người chạy AI local?2. GPU và nền tảng: Đừng chỉ nhìn tên model3. Cách nâng cấp an toàn khi chạy AI local4. Lượng tử hóa: Chọn file đúng trước khi trách phần cứng5. API local: Nền tảng để dựng RAG, agent và công cụ nội bộ6. Checklist GearVN trước khi bấm nâng cấp
1. Có gì mới đáng chú ý với người chạy AI local?
Ở nhóm Ollama, bản v0.32.9 ngày 11/08/2026 bổ sung NVIDIA Nemotron 3.5 Lightning, một model mixture-of-experts 30B với 3B tham số active, đồng thời hỗ trợ kiến trúc Nemotron 3. Đây là thay đổi đáng chú ý nếu bạn theo dõi các model MoE phục vụ suy luận cục bộ.
Muse Glimmer cũng là một điểm mới cần theo dõi. Model đa phương thức 30B của Meta, được định vị cho agent workload, được Ollama hỗ trợ ban đầu qua MLX engine trên Apple Silicon ở v0.32.7 ngày 10/08/2026, rồi mở rộng ra mọi nền tảng gồm NVIDIA và AMD ở v0.32.8 cùng ngày. Với người dùng muốn thử coding agent hoặc trợ lý cá nhân chạy dài trên máy riêng, đây là nhóm cập nhật nên được đưa vào danh sách kiểm thử.
Trên Apple GPU, Ollama v0.32.6 ngày 04/08/2026 cải thiện hiệu năng Qwen3.5 bằng speculative decoding qua MTP head tự động. Bản này cũng chuẩn hóa định dạng streaming của endpoint chat completions theo OpenAI, trong khi tính năng sinh ảnh thử nghiệm bị gỡ tạm thời. Vì vậy, nếu workflow của bạn phụ thuộc vào streaming hoặc sinh ảnh, hãy kiểm tra kỹ trước khi cập nhật.
Đến Ollama v0.32.10 ngày 12/08/2026, một thay đổi nhỏ nhưng dễ ảnh hưởng chất lượng đầu ra là mặc định repeat_penalty chuyển từ 1.1 xuống 1.0 cho các model không tự khai báo tham số này. Bản pre-release này cũng cải thiện prefill NVFP4 trên MLX khoảng 7–8% ở một số model.
2. GPU và nền tảng: Đừng chỉ nhìn tên model
Với người tự vận hành, câu hỏi không chỉ là “Model nào mới?” mà còn là “Máy của mình có được runtime hỗ trợ tốt hơn không?”. Ollama v0.32.3 ngày 23/07/2026 đã mở rộng hỗ trợ GPU sang CUDA trên Windows ARM64 và B200 qua CUDA 12. Bản này cũng bổ sung chat, thinking và tool calling cho Laguna 2.1.

Ollama v0.32.3 đã cập nhật thêm nhiều tính năng mới
Ở nhánh llama.cpp, bản b10356 ngày 11/08/2026 nâng hỗ trợ ROCm từ 7.2.1 lên 7.14 và là bản production đầu tiên dùng hệ thống build TheRock. Nếu bạn đang chạy GPU AMD với ROCm, đây là thông tin nên được ghi vào checklist nâng cấp.
llama.cpp bản b10369 ngày 12/08/2026 còn tích hợp Pocket-TTS cho sinh audio, với thời gian sinh mỗi frame giảm khoảng 80% trên CUDA và khoảng 50% trên CPU. Điều này đặc biệt liên quan nếu bạn đang dựng trợ lý giọng nói hoặc pipeline tạo audio chạy nội bộ.
3. Cách nâng cấp an toàn khi chạy AI local
3.1. Ghi lại phiên bản và tham số đang dùng
Trước khi nâng cấp, hãy lưu lại runtime hiện tại, model đang dùng, cấu hình lượng tử hóa và các tham số sinh văn bản quan trọng. Thay đổi mặc định repeat_penalty trong Ollama v0.32.10 là ví dụ rõ ràng: nếu bạn không cố định tham số, cùng một prompt có thể cho cảm giác đầu ra khác sau khi cập nhật.
3.2. Kiểm tra model đang có và model đang nạp
Ollama cung cấp các endpoint quản trị model như liệt kê model đã có, xem model đang nạp trong bộ nhớ, xem thông tin model, kéo model mới, tạo model và xóa model. Với máy chạy lâu dài, thao tác này giúp bạn tránh nhầm giữa model đã tải, model đang nằm trong RAM hoặc VRAM, và model thực sự được ứng dụng gọi đến.
3.3. Đo lại hiệu năng bằng benchmark tách bạch
Khi đo tốc độ, nên tách hai phần: prompt processing và text generation. Công cụ llama-bench báo kết quả theo tokens/giây kèm trung bình và độ lệch chuẩn qua nhiều lần lặp, mặc định 5 lần. Quan trọng hơn, phép đo này không tính thời gian tokenization và sampling, nên bạn cần hiểu đúng phạm vi con số trước khi so sánh.
llama-bench có chế độ prompt processing, mặc định 512 token; text generation, mặc định 128 token; và chế độ kết hợp. Cách tách này hữu ích vì một cấu hình có thể xử lý prompt rất nhanh nhưng sinh token chưa chắc nhanh tương ứng, hoặc ngược lại.
Nếu muốn tham chiếu phương pháp rộng hơn, MLPerf Client v1.6 phát hành ngày 06/04/2026 đo workload LLM chạy cục bộ trên PC qua các backend như Windows ML, llama.cpp trên Windows và macOS, MLX với Metal, và llama.cpp với Metal. Bộ đo này báo cả tính đáp ứng lẫn thông lượng; trong đó time to first token là thời gian chờ trước token đầu tiên và càng thấp càng tốt.
4. Lượng tử hóa: Chọn file đúng trước khi trách phần cứng
Với AI local, file model có thể quyết định trải nghiệm không kém GPU. GGUF được thiết kế để triển khai bằng một file duy nhất, hỗ trợ nạp bằng mmap và tự chứa thông tin cần thiết để load model, bao gồm cả tokenizer. Điều này giúp việc quản lý model local gọn hơn, nhất là khi bạn thường xuyên đổi bản lượng tử hóa.
GGUF định nghĩa nhiều họ lượng tử hóa như nhóm legacy, nhóm K-series, nhóm IQ, cùng các định dạng BF16, MXFP4, TQ1_0 và TQ2_0. Ý nghĩa thực tế là bạn có nhiều mức đánh đổi giữa dung lượng và độ chính xác, nhưng không nên suy luận chất lượng chỉ từ tên file. Hãy đo trên đúng workload của bạn.
AWQ là một hướng lượng tử hóa trọng số có nhận biết activation, hỗ trợ INT3 và INT4 với activation 16-bit. Repo của phương pháp này công bố mức nhanh hơn FP16 khoảng 2.7 lần trên RTX 4090 và 2.9 lần trên Jetson Orin với LLaMA-3-8B; công trình đạt Best Paper Award tại MLSys 2024. Tuy vậy, đây là số liệu theo điều kiện công bố của chính tác giả phương pháp, không phải kết quả so sánh trực tiếp với mọi file GGUF trên mọi cấu hình.
5. API local: Nền tảng để dựng RAG, agent và công cụ nội bộ
Ollama phục vụ REST API cục bộ mặc định tại localhost:11434, với các nhóm gọi sinh nội dung, chat và embedding. Nếu bạn đang dựng ứng dụng nội bộ, đây là bề mặt tích hợp quan trọng để tách phần giao diện khỏi phần model đang chạy trên máy.
Endpoint chat của Ollama hỗ trợ tool calling qua tham số chứa định nghĩa hàm. Model có thể sinh tool call có cấu trúc, sau đó kết quả được đưa lại vào lịch sử hội thoại. Đây là nền tảng cho các trợ lý nội bộ biết gọi công cụ, đọc dữ liệu đã cấp quyền hoặc thực hiện một bước xử lý trong quy trình có kiểm soát.
Endpoint embedding cho phép sinh embedding từ một hoặc nhiều đoạn văn bản, đảm nhiệm phần truy hồi của một stack RAG chạy cục bộ. Nếu mục tiêu của bạn là hỏi đáp trên tài liệu riêng, đây thường là mảnh ghép cần kiểm tra song song với model chat.
Về framework, LangChain là lựa chọn phổ biến để xây dựng agent và ứng dụng LLM, cấp phép MIT, cung cấp giao diện chuẩn cho model, embedding, vector store và retriever, kèm LangGraph cho luồng agent có kiểm soát. Với coding agent, Continue được phát hành dưới dạng CLI, extension VS Code và plugin JetBrains, nhưng repository continuedev/continue hiện ở trạng thái read-only và không còn được bảo trì tích cực, nên bạn cần cân nhắc trước khi chọn làm nền lâu dài.

Framework của LangChain
6. Checklist GearVN trước khi bấm nâng cấp
- Chốt mục tiêu: Bạn cần chat, coding agent, RAG, tool calling hay sinh audio?
- Ghi lại baseline: Lưu runtime, model, bản lượng tử hóa, tham số sinh và workflow đang ổn định.
- Đọc kỹ release: Chú ý các thay đổi như GPU mới được hỗ trợ, backend ROCm, CUDA, MLX, hoặc mặc định repeat_penalty.
- Benchmark đúng phần: Đo riêng prompt processing, text generation và time to first token nếu có công cụ phù hợp.
- Kiểm tra API: Xác nhận ứng dụng đang gọi đúng model, đúng endpoint chat, generate hoặc embed.
Không suy đoán VRAM: Số tham số model không đủ để kết luận máy bạn chạy tốt; hãy kiểm thử bằng file và cấu hình thực tế.
Kết luận: chạy AI local tháng 8/2026 cần quản trị như một stack phần mềm
Các cập nhật tháng 8/2026 cho thấy AI local không còn là chuyện tải một model rồi chạy thử. Runtime thay đổi nhanh, GPU được mở rộng hỗ trợ, model mới xuất hiện, mặc định sinh văn bản có thể đổi, còn API local ngày càng phù hợp để dựng RAG và agent.
Nếu bạn đang tự vận hành máy, cách làm bền vững là quản trị AI local như một stack phần mềm: có phiên bản, có baseline, có benchmark và có quy trình rollback. Làm được vậy, mỗi bản cập nhật sẽ là cơ hội tăng hiệu năng hoặc mở thêm use case, thay vì trở thành một lần “hên xui” với model và GPU.
