AI offline mở rộng sang audio: llama.cpp thêm Pocket-TTS, ROCm được nâng nền
AI offline đang bước thêm một nhánh mới: không chỉ hỏi đáp văn bản hay tạo embedding cục bộ, runtime phổ biến như llama.cpp đã bắt đầu mở rộng rõ hơn sang audio. Điểm đáng chú ý trong tuần là bản llama.cpp b10369 ngày 12/08/2026 tích hợp Pocket-TTS cho sinh audio, với thời gian sinh mỗi frame giảm khoảng 80% trên CUDA và khoảng 50% trên CPU.
Với người dùng máy không nối mạng, cập nhật này đáng quan tâm vì nó cho thấy hệ sinh thái AI chạy local đang đi từ “chat được trên máy cá nhân” sang nhiều tác vụ hơn: đọc, tạo phản hồi, truy hồi dữ liệu nội bộ và nay là sinh giọng nói cục bộ. Khi mọi thứ diễn ra trên máy, lợi ích dễ thấy nhất là giảm phụ thuộc vào kết nối Internet và hạn chế đưa dữ liệu ra dịch vụ bên ngoài.
Mục lục bài viết1. llama.cpp thêm Pocket-TTS: Tín hiệu mới cho audio chạy local2. ROCm được nâng lên 7.14: Tin tốt cho người dùng GPU AMD3. Người dùng AI offline nên đo hiệu năng như thế nào?4. GGUF và lượng tử hoá vẫn là nền móng của AI offline5. AI offline không chỉ là model, mà là cả stack cục bộ6. Nên hiểu tin Pocket-TTS theo hướng nào?
1. llama.cpp thêm Pocket-TTS: Tín hiệu mới cho audio chạy local
Theo release llama.cpp b10369 ngày 12/08/2026, Pocket-TTS đã được tích hợp để phục vụ tác vụ sinh audio. Cập nhật này đi kèm cải thiện tốc độ sinh từng frame: khoảng 80% trên CUDA và khoảng 50% trên CPU.

Pocket-TTS được tích hợp để phục vụ tác vụ sinh audio
Con số này không nên được hiểu là hiệu năng thực tế cho mọi cấu hình máy, vì nguồn chỉ nêu mức cải thiện trong release của dự án, không cung cấp bảng benchmark theo từng CPU, GPU hay model cụ thể. Tuy vậy, nó vẫn là một mốc quan trọng: audio đang trở thành một phần nghiêm túc hơn trong dòng chảy AI offline, thay vì chỉ xoay quanh chatbot văn bản.
Trong bối cảnh sử dụng không nối mạng, TTS cục bộ có nhiều tình huống phù hợp: đọc tài liệu nội bộ, tạo trợ lý giọng nói trong mạng kín, hỗ trợ accessibility, hoặc dựng pipeline xử lý văn bản thành giọng nói mà không phải gửi nội dung ra cloud.
2. ROCm được nâng lên 7.14: Tin tốt cho người dùng GPU AMD
Song song với nhánh audio, llama.cpp b10356 ngày 11/08/2026 nâng hỗ trợ ROCm từ 7.2.1 lên 7.14. Đây cũng là bản production đầu tiên dùng hệ thống build TheRock.

Phần mềm AMD ROCm (Nguồn: AMD)
Với người dùng GPU AMD, thay đổi này đáng chú ý vì ROCm là nền tảng quan trọng để khai thác tăng tốc GPU trong các workload AI cục bộ. Dossier không cung cấp số liệu hiệu năng cụ thể cho từng dòng card AMD, nên chưa thể kết luận cấu hình nào chạy nhanh hơn bao nhiêu. Điểm chắc chắn có thể nói là nền hỗ trợ ROCm của llama.cpp đã được nâng phiên bản trong bản phát hành này.
3. Người dùng AI offline nên đo hiệu năng như thế nào?
Khi chuyển từ đọc tin cập nhật sang quyết định dùng thực tế, người dùng không nên chỉ nhìn tên model hoặc tên runtime. Với llama.cpp, công cụ llama-bench báo kết quả theo tokens/giây, kèm trung bình và độ lệch chuẩn qua nhiều lần lặp; mặc định là 5 lần. Công cụ này không tính thời gian tokenization và sampling vào phép đo.
Điểm quan trọng là llama-bench tách các chế độ đo khác bản chất: prompt processing hay pp, mặc định 512 token; text generation hay tg, mặc định 128 token; và chế độ kết hợp pg. Vì vậy, một cấu hình xử lý prompt nhanh chưa chắc sẽ sinh token nhanh tương ứng, và ngược lại.
Ngoài llama-bench, MLPerf Client v1.6 phát hành ngày 06/04/2026 cũng đo workload LLM chạy cục bộ trên PC qua nhiều backend, gồm Windows ML, llama.cpp trên Windows và macOS, MLX với Metal, và llama.cpp với Metal. MLPerf Client báo cả tính đáp ứng lẫn thông lượng; trong đó time to first token, hay TTFT, là thời gian chờ trước token đầu tiên và giá trị thấp hơn là tốt hơn.
4. GGUF và lượng tử hoá vẫn là nền móng của AI offline
Để chạy AI offline hiệu quả, định dạng model và lượng tử hoá vẫn là phần rất quan trọng. GGUF định nghĩa nhiều họ lượng tử hoá, từ nhóm legacy như F32, F16, Q4_0, Q4_1, Q5_0, Q5_1, Q8_0, Q8_1; nhóm K-series như Q2_K, Q3_K, Q4_K, Q5_K, Q6_K, Q8_K; nhóm IQ như IQ2_XXS, IQ3_XXS, IQ4_NL; cho đến các định dạng BF16, MXFP4, TQ1_0 và TQ2_0.
Ý nghĩa thực tế là người dùng có nhiều mức đánh đổi giữa dung lượng và độ chính xác, thay vì chỉ có một bản model duy nhất. GGUF cũng được thiết kế để triển khai một file duy nhất, hỗ trợ nạp bằng mmap, và tự chứa đầy đủ thông tin cần thiết để load model, bao gồm cả tokenizer.
Với máy không nối mạng, đặc điểm “một file tự chứa” rất hữu ích: dễ lưu trữ, dễ chuyển giữa máy, dễ kiểm soát phiên bản model đang dùng và ít phụ thuộc vào việc tải thêm thành phần bên ngoài trong lúc chạy.
5. AI offline không chỉ là model, mà là cả stack cục bộ
Một điểm người dùng nên nhìn rộng hơn: AI offline không chỉ là file model nằm trên ổ cứng. Nó còn cần runtime, API, công cụ đo, model embedding và lớp ứng dụng phía trên.
Ollama là ví dụ rõ cho bề mặt tích hợp cục bộ. Theo tài liệu API, Ollama phục vụ REST API mặc định tại http://localhost:11434, với các endpoint như POST /api/generate, POST /api/chat và POST /api/embed. Trong đó, POST /api/embed có thể sinh embedding từ một hoặc nhiều đoạn văn bản, đảm nhiệm phần truy hồi của một stack RAG chạy cục bộ.
Ollama cũng có nhóm endpoint quản trị model gồm GET /api/tags để liệt kê model đã có, GET /api/ps để xem model đang nạp trong bộ nhớ, cùng POST /api/show, POST /api/pull, POST /api/create và DELETE /api/delete. Với môi trường không nối mạng, các endpoint quản trị như vậy giúp người dùng kiểm soát tốt hơn model nào đang có sẵn và model nào đang được nạp.
6. Nên hiểu tin Pocket-TTS theo hướng nào?
Với GearVN, cách đọc hợp lý là: Pocket-TTS trong llama.cpp chưa phải lời hứa rằng mọi máy cá nhân đều sẽ có trợ lý giọng nói offline mượt như dịch vụ cloud. Nhưng đây là dấu mốc cho thấy runtime local AI đang mở rộng phạm vi tác vụ, trong khi nền GPU, CPU, định dạng model và công cụ đo hiệu năng tiếp tục được hoàn thiện.
Nếu bạn đang dùng máy không nối mạng hoặc cần giữ dữ liệu trong môi trường nội bộ, hãy nhìn AI offline như một hệ thống gồm nhiều mảnh ghép: runtime như llama.cpp hoặc Ollama, model ở định dạng phù hợp như GGUF, công cụ đo như llama-bench hoặc MLPerf Client, và lớp ứng dụng phục vụ nhu cầu cụ thể như chat, RAG hay TTS.
Tóm lại, cập nhật llama.cpp b10369 ngày 12/08/2026 với Pocket-TTS và b10356 ngày 11/08/2026 với ROCm 7.14 là hai tín hiệu đáng chú ý: AI offline đang vừa mở rộng sang audio, vừa củng cố nền phần cứng cho người dùng muốn chạy tác vụ AI ngay trên máy của mình.
