Bản tin Local LLM 13/08/2026: Nemotron 3.5 Lightning, Muse Glimmer và Qwen3.5
Tháng 8/2026 là một nhịp khá dày với người theo dõi local llm: Ollama cập nhật liên tục cho Nemotron 3.5 Lightning, Muse Glimmer và Qwen3.5; llama.cpp mở rộng runtime; còn câu chuyện benchmark ngày càng cần được đọc kỹ hơn thay vì chỉ nhìn một con số tokens/giây. Nếu bạn đang dựng trợ lý AI chạy cục bộ, coding agent hoặc RAG nội bộ, đây là những điểm đáng chú ý nhất.
Mục lục bài viết
1. Điểm nóng: Ollama bổ sung Nemotron 3.5 Lightning, Muse Glimmer và tối ưu Qwen3.52. llama.cpp: Pocket-TTS, ROCm và tín hiệu runtime ngày càng rộng3. Benchmark Local LLM: đừng chỉ hỏi “bao nhiêu token/giây?”4. GGUF và AWQ: lượng tử hoá là cuộc đánh đổi, không phải phép màu5. Tích hợp local: Ollama API, embedding, tool calling và coding agent6. GearVN gợi ý cách đọc bản tin Local LLM tháng này
1. Điểm nóng: Ollama bổ sung Nemotron 3.5 Lightning, Muse Glimmer và tối ưu Qwen3.5
Ở bản Ollama v0.32.9 ngày 11/08/2026, Ollama bổ sung NVIDIA Nemotron 3.5 Lightning, một model mixture-of-experts 30B với 3B tham số active, đồng thời hỗ trợ kiến trúc Nemotron 3. Đây là loại cập nhật đáng để người dùng Local AI theo dõi vì MoE thường gợi ý hướng cân bằng giữa năng lực model và chi phí suy luận thực tế.

NVIDIA Nemotron 3.5 Lightning, một model mixture-of-experts 30B (Nguồn: NVIDIA)
Muse Glimmer, model đa phương thức 30B của Meta được định vị cho agent workload, cũng xuất hiện trong chuỗi cập nhật tháng này. Ollama hỗ trợ ban đầu qua MLX engine trên Apple Silicon ở v0.32.7 ngày 10/08/2026, rồi mở rộng sang mọi nền tảng gồm NVIDIA và AMD ở v0.32.8 cùng ngày. Với người làm coding agent hoặc trợ lý cá nhân chạy dài, đây là một tín hiệu đáng chú ý vì bản thân Ollama định vị Muse Glimmer cho các workload agent như vậy.

Muse Glimmer, model đa phương thức 30B của Meta (Nguồn: Meta)
Qwen3.5 cũng nhận nâng cấp cụ thể trên Apple GPU. Ở Ollama v0.32.6 ngày 04/08/2026, Ollama cải thiện hiệu năng GPU Apple cho Qwen3.5 bằng speculative decoding qua MTP head tự động, đồng thời chuẩn hoá định dạng streaming của /v1/chat/completions cho khớp OpenAI. Cũng trong bản này, tính năng sinh ảnh thử nghiệm bị gỡ tạm thời.

Qwen3.5 nhận nâng cấp cụ thể trên Apple GPU
Một thay đổi nhỏ nhưng có thể ảnh hưởng hành vi sinh văn bản là Ollama v0.32.10 ngày 12/08/2026, hiện là pre-release, đổi mặc định repeat_penalty từ 1.1 xuống 1.0 cho các model không tự khai báo tham số này. Bản này cũng cải thiện prefill NVFP4 trên MLX khoảng 7–8% ở một số model.
Trước đó, Ollama v0.32.4 ngày 25/07/2026 đã tối ưu decoding cho Qwen3 MoE với expert ở mức lượng tử hoá hỗn hợp, cải thiện khoảng 4–9%. Còn Ollama v0.32.3 ngày 23/07/2026 mở rộng hỗ trợ GPU sang CUDA trên Windows ARM64 và B200 qua CUDA 12, đồng thời bổ sung chat, thinking và tool calling cho Laguna 2.1.
2. llama.cpp: Pocket-TTS, ROCm và tín hiệu runtime ngày càng rộng
Ở phía llama.cpp, bản b10369 ngày 12/08/2026 tích hợp Pocket-TTS để sinh audio. Theo ghi chú phát hành, thời gian sinh mỗi frame giảm khoảng 80% trên CUDA và khoảng 50% trên CPU. Đây không chỉ là tin về text generation nữa, mà cho thấy runtime local đang mở rộng sang các workload đa phương thức và audio.
Bản llama.cpp b10356 ngày 11/08/2026 nâng hỗ trợ ROCm từ 7.2.1 lên 7.14, đồng thời là bản production đầu tiên dùng hệ thống build TheRock. Với người dùng AMD, các mốc như thế này đáng theo dõi vì khả năng chạy local không chỉ phụ thuộc model, mà còn phụ thuộc độ trưởng thành của backend phần cứng.
3. Benchmark Local LLM: đừng chỉ hỏi “bao nhiêu token/giây?”
Khi so sánh Local LLM, tokens/giây là cần thiết nhưng chưa đủ. Công cụ llama-bench báo kết quả theo tokens/giây kèm trung bình và độ lệch chuẩn qua nhiều lần lặp, mặc định 5 lần. Quan trọng hơn, phép đo này không tính thời gian tokenization và sampling, nên không nên đọc nó như toàn bộ trải nghiệm người dùng cuối.
llama-bench cũng tách các chế độ đo khác bản chất: prompt processing, viết tắt là pp, mặc định 512 token; text generation, viết tắt là tg, mặc định 128 token; và chế độ kết hợp pg. Vì vậy, một cấu hình xử lý prompt nhanh chưa chắc sinh token nhanh, và ngược lại.
Ở cấp benchmark chuẩn hoá hơn, MLPerf Client v1.6 phát hành ngày 06/04/2026 đo workload LLM chạy cục bộ trên PC qua các backend Windows ML, llama.cpp trên Windows và macOS, MLX với Metal, và llama.cpp với Metal. MLPerf Client báo cả tính đáp ứng lẫn thông lượng; trong đó time to first token là thời gian chờ trước token đầu tiên, và giá trị thấp hơn là tốt hơn.
Gợi ý thực dụng: khi tự test máy local, nên tách ít nhất ba câu hỏi. Một là tốc độ xử lý prompt dài. Hai là tốc độ sinh token khi chat. Ba là cảm giác chờ token đầu tiên. Ba con số này trả lời ba vấn đề khác nhau.
4. GGUF và AWQ: lượng tử hoá là cuộc đánh đổi, không phải phép màu
GGUF là định dạng quen thuộc trong hệ sinh thái local model vì được thiết kế để triển khai bằng một file duy nhất, hỗ trợ nạp bằng mmap, và tự chứa đầy đủ thông tin cần thiết để load model, bao gồm cả tokenizer. Với người dùng phổ thông, điều này giúp việc tải, quản lý và chạy model gọn hơn.
GGUF cũng định nghĩa nhiều họ lượng tử hoá: nhóm legacy như F32, F16, Q4_0, Q4_1, Q5_0, Q5_1, Q8_0, Q8_1; nhóm K-series như Q2_K, Q3_K, Q4_K, Q5_K, Q6_K, Q8_K; nhóm IQ như IQ2_XXS, IQ3_XXS, IQ4_NL; cùng các định dạng BF16, MXFP4, TQ1_0 và TQ2_0. Ý nghĩa thực tế là người dùng có nhiều nấc đánh đổi giữa dung lượng và độ chính xác.
AWQ là một hướng khác: lượng tử hoá trọng số có nhận biết activation, hỗ trợ INT3/INT4 với activation 16-bit, hay W4A16. Repo của MIT Han Lab công bố AWQ nhanh hơn FP16 khoảng 2.7 lần trên RTX 4090 và 2.9 lần trên Jetson Orin với LLaMA-3-8B; công trình này đạt Best Paper Award tại MLSys 2024.
Tuy vậy, không nên trộn các con số này thành kết luận kiểu “định dạng nào luôn nhanh hơn”. Với Local LLM, kết quả phụ thuộc model, backend, GPU/CPU, batch, context, kiểu lượng tử hoá và cả cách đo. Đây là chỗ nên đo lại trên chính cấu hình bạn dùng.
5. Tích hợp local: Ollama API, embedding, tool calling và coding agent
Về mặt dựng ứng dụng, Ollama phục vụ REST API cục bộ mặc định tại http://localhost:11434, với các endpoint chính như POST /api/generate, POST /api/chat và POST /api/embed. Với một stack AI nội bộ, đây là bề mặt đủ trực tiếp để bắt đầu từ chatbot, tóm tắt tài liệu cho đến RAG.
- POST /api/chat hỗ trợ tool calling qua tham số tools chứa định nghĩa hàm. Model có thể sinh tool call có cấu trúc, sau đó kết quả được đưa lại vào lịch sử hội thoại. Đây là nền móng cho các agent local biết gọi công cụ thay vì chỉ trả lời văn bản.
- POST /api/embed sinh embedding từ một hoặc nhiều đoạn văn bản, đảm nhiệm phần truy hồi của một stack RAG chạy cục bộ. Ngoài ra, Ollama còn có nhóm endpoint quản trị model như GET /api/tags để liệt kê model đã có, GET /api/ps để xem model đang nạp trong bộ nhớ, cùng POST /api/show, POST /api/pull, POST /api/create và DELETE /api/delete.
Ở lớp công cụ lập trình, Continue là coding agent phát hành dưới ba dạng: CLI @continuedev/cli trên npm, extension VS Code trên Marketplace và OpenVSX, cùng plugin JetBrains. Tuy nhiên, repository continuedev/continue hiện ở trạng thái read-only và không còn được bảo trì tích cực; dự án cấp phép Apache 2.0.
LangChain vẫn là một framework phổ biến để xây dựng agent và ứng dụng LLM. Dự án cấp phép MIT, cung cấp giao diện chuẩn cho model, embedding, vector store và retriever, kèm LangGraph cho luồng agent có kiểm soát. Với người muốn kết hợp local model, RAG và workflow agent, đây là lớp framework đáng cân nhắc.
6. GearVN gợi ý cách đọc bản tin Local LLM tháng này
Nếu bạn chỉ cần chạy thử model mới, các cập nhật Ollama là phần nên xem đầu tiên: Nemotron 3.5 Lightning, Muse Glimmer và Qwen3.5 đều có mốc phát hành cụ thể trong đầu tháng 8/2026. Nếu bạn đang tối ưu máy local, hãy ưu tiên đọc benchmark theo từng phần: prompt processing, text generation và time to first token.
Nếu bạn đang dựng để ứng dụng thật, phần quan trọng không chỉ là model nào mới. Bạn cần kiểm tra runtime có hỗ trợ phần cứng của mình tốt không, định dạng lượng tử hoá có phù hợp dung lượng bộ nhớ không, API có đủ cho chat, embedding và tool calling không, và công cụ agent bạn chọn có còn được bảo trì tích cực không.
Kết luận
Tháng 8/2026 không chỉ là cuộc đua model mới. Đây là giai đoạn hệ sinh thái Local LLM đang trưởng thành ở cả ba lớp: model, runtime và cách đo. Người dùng khôn ngoan nên đo trên cấu hình thật, đọc kỹ release note theo phiên bản, và chọn stack theo workload cụ thể thay vì chạy theo tên model đang hot.
Xem thêm tại GearVN
