Ngày 11/8 GitHub thêm phần bóc tách token theo từng model vào báo cáo sử dụng Copilot: đầu vào, đầu ra, đọc cache và ghi cache, mỗi loại quy về số AI credit tương ứng.
Bốn con số cho mỗi model là đủ để chẩn đoán gần như mọi vấn đề chi phí tránh được của một đội. Nó cũng đủ để rút ra những kết luận sai một cách tự tin, và đó là điều xảy ra khi người ta đọc con số tổng rồi dừng lại.
Mỗi cột thực sự đo cái gì
Trước khi bất kỳ tỉ lệ nào có ý nghĩa, cần chính xác về việc cái gì đang được đếm.
- Đầu vào — mọi thứ gửi tới model: câu lệnh của bạn, cộng với phần ngữ cảnh công cụ tự đính kèm. Bạn kiểm soát phần đầu và phần lớn không kiểm soát phần sau
- Đầu ra — phần model sinh ra. Thường đắt nhất tính trên mỗi token, và là phần thực sự tương quan với lượng việc đã làm
- Đọc cache — ngữ cảnh lấy từ cache thay vì gửi lại, thường được giảm giá rất mạnh
- Ghi cache — chi phí đưa ngữ cảnh vào cache. Bạn trả một lần để về sau đọc cache tiết kiệm cho bạn
Những tỉ lệ đáng quan tâm
Con số tuyệt đối cho biết quy mô sử dụng của bạn. Tỉ lệ cho biết nó có lành mạnh hay không.
Đọc cache so với đầu vào là tỉ lệ quan trọng nhất. Tỉ trọng token đầu vào đến từ cache cao nghĩa là bạn đang làm lặp trong cùng một ngữ cảnh và hưởng khoản giảm giá. Tỉ trọng thấp nghĩa là bạn đang trả giá đầy đủ cho phần ngữ cảnh mình từng gửi rồi.
Ghi cache so với đọc cache là tỉ lệ tiếp theo. Ghi mà không có đọc tương ứng nghĩa là bạn đang nạp những cái cache không bao giờ dùng lại — trả chi phí thiết lập của một phép tối ưu mà không bao giờ thu về.
Đầu ra so với đầu vào là tỉ lệ thứ ba. Nếu đầu vào lớn hơn đầu ra nhiều lần, bạn đang tiêu phần lớn tiền cho ngữ cảnh chứ không phải cho phần sinh ra, và thường điều đó nghĩa là công cụ đang đính kèm nhiều hơn mức đầu việc cần.
Bốn hình thái và cách xử lý
Bốn hình thái này bao phủ phần lớn những gì lần đọc báo cáo đầu tiên sẽ phơi ra.
- Ghi cache cao, đọc cache thấp — phiên làm việc quá ngắn hoặc quá rải rác. Hãy làm nhiều việc liên tiếp trong một repository thay vì nhảy qua nhiều repo, và chính cái cache đó bắt đầu tự hoàn vốn
- Đầu vào cao, đầu ra thấp, model đắt — một model đắt đang trả lời những câu hỏi rẻ tiền kèm rất nhiều ngữ cảnh. Đây là trường hợp rõ nhất để đẩy việc thường ngày sang một model nhỏ như MAI-Code-1.1-Flash
- Một model chiếm phần lớn chi phí mà không tương xứng với lượng việc — hãy kiểm tra xem đó là lựa chọn có chủ ý của ai đó hay là một mặc định toàn đội mà không ai xem lại. Mặc định là cách các model đắt trở thành thói quen đắt
- Đầu ra tăng nhanh hơn nhiều so với số người — thường là do agent, không phải do người. Điều đó không hẳn sai, nhưng nó có nghĩa cách hình dung chi phí theo đầu người của bạn đã hết đúng và cần thay
Điều báo cáo không cho bạn biết
Nó đo mức tiêu thụ, không đo giá trị. Không cột nào trong bốn cột này biết được số token đó sinh ra một pull request được merge hay một pull request bị từ chối, và một tháng rẻ mà chẳng ship được gì thì không phải chiến thắng.
Hãy ghép nó với một tín hiệu kết quả lấy từ nguồn khác trước khi kết luận điều gì — tỉ lệ merge, tỉ lệ revert, hoặc mức nỗ lực nay đã được ghi lại trên các lần Copilot code review. Riêng dữ liệu chi phí thì luôn đẩy đội nhóm theo hướng rẻ hơn thay vì tốt hơn.
Đừng dựng bảng xếp hạng theo từng lập trình viên
Đó là thứ đầu tiên người ta nghĩ tới và cũng là công cụ sai. Mức tiêu token bám theo hình dạng công việc: một cuộc refactor hệ thống cũ đồ sộ đốt nhiều hơn viết code mới, và người làm việc đó không hề lãng phí.
Xếp hạng con người theo mức tiêu token dạy mọi người né công cụ đắt tiền thay vì dùng nó cho giỏi, và cái giá của việc đó lớn hơn mọi khoản vượt chi mà nó ngăn được. Hãy dùng báo cáo để tìm lãng phí mang tính cấu trúc — một mặc định tồi, một tác vụ tự động bị lặp, một cái cache không ai đọc — và để con người ra ngoài chuyện này.
Quy trình rà soát mười lăm phút mỗi tháng
Đủ để bắt gần hết mọi thứ, và đủ ngắn để thực sự được làm.
- Tải báo cáo về và sắp xếp theo số credit của từng model — kiểm tra model đứng đầu có phải model bạn chọn có chủ ý không
- Xem tỉ trọng đọc cache trên đầu vào, và so với tháng trước thay vì so với một mốc tuyệt đối nào đó
- Tìm phần ghi cache không có đọc tương ứng, đây là thứ rẻ nhất để sửa trong danh sách này
- Tìm model đắt nhất của bạn và tự hỏi phần việc nó làm có thật sự cần tới nó không
- Ghi lại một con số để theo dõi trong tháng sau, rồi dừng ở đó