Bộ công cụ AI của bạn nhiều khả năng đang bị tính tiền theo bốn cách khác nhau cùng lúc, và phần lớn đội nhóm chỉ có mô hình tư duy cho đúng một cách.
Đây không phải bài so giá. Đây là giải thích về bốn cơ chế, vì một khi gọi được tên cơ chế mà một công cụ đang dùng, bạn đoán trước được nó sẽ làm bạn bất ngờ theo kiểu nào.
1. Theo chỗ ngồi — cách duy nhất thực sự dự đoán được
Một mức giá cố định cho mỗi người mỗi tháng. Bộ phận tài chính rất thích vì chỉ cần nhân lên, và đây là mô hình duy nhất trong danh sách mà mức sử dụng không làm con số nhúc nhích.
Kiểu hỏng của nó ngược hẳn với hóa đơn bất ngờ: đó là lãng phí âm thầm. Chỗ ngồi vẫn được cấp cho người đã nghỉ, hoặc cho một đợt dùng thử ba mươi người tham gia mà giờ còn bốn người dùng. Không có cảnh báo nào, vì có gì hỏng đâu — một khoản chi phí cố định trông y như vậy, dù có ai dùng hay không.
Công cụ kiểm soát ở đây là rà soát quyền truy cập, không phải cảnh báo ngân sách.
2. Premium request — đếm được, cho tới khi agent xuất hiện
Một hạn mức các lượt tương tác chi phí cao, đôi khi kèm hệ số nhân theo model. Đây là câu trả lời của ngành cho bài toán "làm sao để tính theo mức dùng mà vẫn có cảm giác như thuê bao", và với chat thì nó hiệu quả: một lượt là một lượt, người dùng nhẩm được trong đầu.
Nó vỡ khi agent xuất hiện. Một người ngồi hỏi sẽ tạo ra số lượt đếm được. Một agent hoàn thành một đầu việc sẽ tạo ra bao nhiêu lượt tùy nó cần, và bạn biết sau khi mọi chuyện đã xong. Số thứ bạn yêu cầu và số lượt bị tính tiền thôi đi cùng nhau.
Hãy nhìn hệ số nhân, đừng nhìn hạn mức. Một hạn mức hào phóng đi kèm hệ số nhân cao chỉ là một hạn mức nhỏ khoác áo.
3. Theo token — tăng theo khối lượng việc, không theo số lần hỏi
Tính theo token đầu vào và đầu ra, thường có token đầu vào đã cache được giảm giá mạnh. Bảng giá Kimi K3 mà GitHub công bố ngày 6/8 là ví dụ cụ thể: 3 USD/1 triệu token đầu vào, 15 USD/1 triệu token đầu ra, 0,30 USD/1 triệu token đầu vào có cache.
Đây là mô hình bị ước lượng sai nhiều nhất, vì số token gần như không liên quan gì tới cảm giác về công sức của bạn. Hai câu lệnh dài bằng nhau có thể chênh nhau hai bậc về chi phí, tùy vào lượng ngữ cảnh công cụ kéo vào và thời gian nó chạy.
Cái cần gạt duy nhất thực sự có tác dụng là cache. Token đầu vào đã cache rẻ bằng một phần mười nghĩa là làm đi làm lại trên cùng một codebase thì rẻ, còn làm rải rác trên nhiều codebase thì không. Thứ hiện lên hóa đơn là nhịp làm việc của bạn, không phải số câu lệnh.
4. Credit — một lớp trừu tượng phủ lên ba cách trên
Credit là bất cứ thứ gì nhà cung cấp nói nó là. Đó vừa là toàn bộ vấn đề vừa là toàn bộ sức hấp dẫn: nó cho phép công cụ thu tiền cho một chi phí gốc dao động cực mạnh trong khi vẫn hiển thị cho bạn một con số trông ổn định.
Các hệ thống credit chia làm hai phe theo đúng một câu hỏi — nhà cung cấp có công bố giá của từng thao tác không? Lovable có, liệt kê một chỉnh sửa đơn giản 0,50 credit và một tính năng xác thực 1,20 credit. Emergent không công bố bảng tương đương, và mức tiêu khó đoán chính là than phiền phổ biến nhất về nó trên thực tế.
Trục thứ hai là credit đến vào lúc nào. Emergent phát một túi theo tháng — 10 ở gói Free, 100 ở Standard, 750 ở Pro. Lovable nhỏ giọt 5 build credit mỗi ngày, trần 30 credit/tháng ở gói miễn phí, cộng Cloud credit theo tháng. Cùng một từ, ràng buộc ngược nhau: một bên giới hạn cả tháng của bạn, bên kia giới hạn buổi chiều của bạn.
Lập ngân sách cho một bộ công cụ trộn cả bốn
Đừng cố quy mọi thứ về một đơn vị. Hãy quy mọi thứ về một câu hỏi: cái gì làm con số này tăng lên?
- Theo chỗ ngồi — số người. Rà lại danh sách mỗi quý và thu hồi chỗ ngồi thừa
- Premium request — số lần người và agent hỏi. Để mắt tới hệ số nhân của model mới, và lường trước rằng việc dùng agent sẽ phá vỡ mức trung bình lịch sử của bạn
- Theo token — lượng việc bạn giao đi và lượng ngữ cảnh nó kéo theo. Ưu tiên làm lặp trên cùng một repository; cache mới là khoản giảm giá thực sự áp dụng được
- Credit — tùy nhà cung cấp quyết định. Hãy chạy thử hai tuần và đo tốc độ tiêu của chính mình, vì không con số công bố nào cho bạn biết điều này
- Với mọi thứ tính theo mức dùng, hãy đặt cảnh báo chi tiêu trước khi cần tới nó; cả nhóm mô hình này được thiết kế sao cho hóa đơn là tín hiệu đầu tiên