Bảng giá model API minh bạch theo usage.
Trang này giải thích rõ cách tính chi phí API theo usage thực tế. Bạn có thể xem giá theo từng model, giá bán sau hệ số, quy đổi sang quota và cách tự kiểm tra chi phí của mỗi request.
| Model | Short ≤300K / 1M tokens | Long >300K / 1M tokens | Hệ số bán | ||||
|---|---|---|---|---|---|---|---|
| Input giá gốc | Output giá gốc | Cache giá gốc | Input giá gốc | Output giá gốc | Cache giá gốc | Giá bán | |
Cách tính chi phí
Gateway tính theo số token thực tế của từng request. Mỗi model có giá riêng cho input, output và cache. Giá trong bảng là giá gốc trên mỗi 1 triệu token; giá bán được nhân với hệ số hiện tại.
Short: tổng input usage ≤ 300.000 token. Long: tổng input usage > 300.000 token.
Cache token không tính như input thường; cache được áp dụng mức giá riêng thấp hơn nếu model có cấu hình.
Quy đổi tiền và quota
Ví dụ token bên trên áp dụng cho model đang tải..., đã bao gồm hệ số bán. Mỗi model có giá khác nhau.
Lưu ý
Gateway tạm giữ quota trước khi gọi API, sau đó quyết toán theo usage thật từ upstream.
Request lỗi sẽ được hoàn quota. Nếu upstream không gửi usage, gateway dùng cơ chế ước tính dự phòng đã cấu hình.