GEARVN
Chatbot Local AI và tool calling: Model làm gì, hệ thống làm gì?

Chatbot Local AI và tool calling: Model làm gì, hệ thống làm gì?

Ngày cập nhật: 14/07/2026Marketing & SEO

Một chatbot Local AI đáng tin cậy không chỉ cần model biết tiếng Việt; nó cần dữ liệu nguồn, tool có schema, lớp quyền, kiểm tra kết quả và bộ eval. Model tạo function call nhưng ứng dụng mới là nơi thực thi hành động.

Tóm tắt nhanh

  • Chatbot hỏi đáp và agent thực thi tool là hai mức rủi ro khác nhau.
  • Model không tự gọi database hay API nếu ứng dụng không cung cấp tool.
  • Mọi argument phải validate; thao tác rủi ro cần approval.
  • Số tool không phải thước đo duy nhất; schema và eval quan trọng hơn.

1. Function calling thực sự hoạt động thế nào?

  1. Ứng dụng gửi cho model danh sách function và schema.
  2. Model trả về tên function và argument có cấu trúc.
  3. Ứng dụng kiểm tra quyền, schema và điều kiện nghiệp vụ.
  4. Ứng dụng thực thi API/tool.
  5. Kết quả được đưa lại cho model để soạn câu trả lời.

Google nhấn mạnh model không tự thực thi code; developer phải chạy và đặt safeguard. Vì vậy model tốt hơn không thay thế lớp API an toàn.

Model không tự thực thi code

2. Ba cấp độ chatbot

Cấp độVí dụKiểm soát
Phân loạiXác định ngành hàngEnum và confidence
Hỏi đáp có nguồnChính sách giao hàngRAG, citation, freshness
Thực thiTạo ticket hoặc cập nhật tagPermission, approval, audit
 

3. Vì sao chatbot nhỏ dễ trả lời “gần đúng”?

Nếu không có nguồn hiện hành, model dựa vào pattern ngôn ngữ để tạo câu trả lời. Với câu hỏi “giao hàng mấy tiếng”, một câu nghe hợp lý vẫn có thể sai theo khu vực, tồn kho và chính sách. Cách thiết kế đúng là gọi API/chính sách thật, rồi trả lời từ dữ liệu read-back.

4. Thiết kế tool cho agent

  • Tên tool mô tả một hành động duy nhất.
  • Input dùng schema chặt, enum và trường bắt buộc.
  • Tool đọc và tool ghi tách riêng.
  • Ghi có idempotency key và optimistic locking khi cần.
  • Không expose delete/publish nếu chưa có approval và rollback.
  • GET read-back để chứng minh trạng thái sau ghi.

5. Đánh giá model tool-calling

Không nên kết luận dựa trên vài prompt demo. Bộ eval cần đo chọn đúng tool, argument đúng schema, không gọi tool khi không cần, xử lý lỗi tool, dừng đúng lúc và không lặp vô hạn. Với workflow nhiều bước, cần thêm success rate toàn luồng và tác động khi một bước timeout.

6. Sizing phần cứng theo tải chatbot

Một request đơn có thể chạy tốt nhưng nhiều request đồng thời sẽ tiêu thụ KV cache và tạo hàng đợi. Nghiên cứu vLLM cho thấy quản lý cache/batching ảnh hưởng lớn đến throughput. Vì vậy cần load test đúng input length, output length và concurrency thay vì lấy tốc độ một phiên làm năng lực server.

Quản lý cache/batching ảnh hưởng lớn đến throughput

Đọc thêm về Claude AI, DeepSeek AI và tham khảo AI PC GVN nếu cần dựng môi trường local thử nghiệm. Các bài giới thiệu model không thay thế benchmark trên hệ thống thật.

7. Câu hỏi thường gặp

7.1. Model càng lớn có luôn gọi tool tốt hơn?

Không có bảo đảm chung. Model lớn thường có nhiều năng lực hơn nhưng schema, prompt, runtime và eval vẫn quyết định kết quả.

7.2. Local chatbot có cần internet?

Model có thể chạy local, nhưng tool gọi dịch vụ ngoài vẫn cần mạng. Hệ thống air-gapped phải dùng nguồn dữ liệu và API nội bộ.

Nguồn kỹ thuật tham khảo: Google function-calling documentation, vLLM PagedAttention paper và project safety patterns.