Cách tiết kiệm token / chi phí khi dùng AI
Khi gọi AI qua API, bạn trả tiền theo token (đầu vào + đầu ra). Đây là các cách giảm chi phí mà vẫn giữ chất lượng — đúc kết từ chính hệ thống AI của CV Work.
7 cách giảm token hiệu quả
- Chọn đúng mô hình: việc dễ dùng mô hình nhỏ/rẻ, chỉ dùng mô hình mạnh cho việc khó.
- Prompt gọn: bỏ chữ thừa, nêu rõ định dạng đầu ra mong muốn để khỏi sinh dài.
- Giới hạn đầu ra: đặt
max_tokenshợp lý; yêu cầu trả ngắn gọn. - Cache & tái dùng: lưu kết quả cho câu hỏi lặp lại; dùng prompt caching nếu có.
- Chỉ đưa dữ liệu cần (RAG): trích đoạn liên quan thay vì nhồi cả tài liệu.
- Structured output / tool-use: buộc trả JSON đúng khuôn, tránh 'suy nghĩ' lan man đốt token.
- Gộp yêu cầu (batch) khi có thể, tránh gọi lặp nhiều lần.
CV Work tiết kiệm token thế nào?
Hệ thống chấm CV của CV Work dùng tool-use để ép định dạng đầu ra (tránh phần 'suy nghĩ' ăn hết hạn mức), và có chế độ chấm Luật/AI/Hybrid — việc đơn giản xử lý bằng luật, chỉ gọi AI khi thật cần — nhờ đó tiết kiệm chi phí đáng kể.
Câu hỏi thường gặp
Token trong AI là gì?
Token là mẩu chữ (khoảng 3–4 ký tự tiếng Việt). API tính tiền theo tổng token đầu vào + đầu ra; càng dài càng tốn.
Cách nào giảm chi phí AI nhanh nhất?
Chọn mô hình rẻ cho việc dễ, viết prompt gọn, giới hạn độ dài đầu ra, và cache kết quả lặp lại.
Mô hình rẻ có kém không?
Với việc đơn giản (phân loại, tóm tắt ngắn, trích xuất), mô hình nhỏ thường đủ tốt và rẻ hơn nhiều lần so với mô hình lớn.