Anthropic đưa Claude Fable 5 ra thị trường với gần như mọi câu hỏi sinh học đều bị chặn. Đó là lựa chọn có chủ ý, xuất phát từ lo ngại lưỡng dụng trước hướng đi của năng lực công nghệ sinh học, và cách làm khá thô: thay vì từ chối, hệ thống lặng lẽ hạ xuống một model yếu hơn mỗi khi truy vấn trông có vẻ liên quan tới sinh học.
Ngày 7/8, công ty tinh chỉnh lại. Số lần rơi xuống model yếu vì lý do sinh học giảm khoảng 85% trên các bề mặt sản phẩm — và điều đáng chú ý là Anthropic công bố hẳn con số đó.
Fallback là gì, và vì sao nó tệ hơn cả từ chối
Fallback không phải một thông báo lỗi. Truy vấn vẫn đi qua, câu trả lời vẫn quay về, chỉ là được tạo bởi một model yếu hơn model bạn đã chọn, mà không nói gì.
Kiểu hỏng này gây ức chế đặc biệt vì nó vô hình. Một lời từ chối cho bạn biết hệ thống đã ra quyết định về câu hỏi của bạn; một cú hạ cấp âm thầm chỉ khiến bạn thấy hôm nay model có vẻ kém đi. Một điều dưỡng hỏi về kết quả xét nghiệm và một sinh viên hỏi một con đường chuyển hóa hoạt động ra sao đều nhận câu trả lời bị hạ chất lượng mà không được cho biết lý do.
Thực tế thay đổi những gì
Anthropic mô tả bản cập nhật là giảm mạnh báo động giả, và tác động tập trung đúng vào những chỗ việc chặn quá tay gây thiệt hại nhất:
- Đọc và diễn giải kết quả xét nghiệm
- Hiểu về triệu chứng
- Sinh học trong bối cảnh học tập
- Các tác vụ lâm sàng của nhân viên y tế
Con số mới là tin
Các nhà cung cấp hiếm khi công bố tỉ lệ báo động giả cho hệ thống an toàn của mình, và có lý do: làm vậy là thừa nhận hệ thống sai ở một mức đo được, đồng thời mời gọi câu hỏi tiếp theo rất hiển nhiên là bây giờ tỉ lệ ấy còn bao nhiêu.
Giảm 85% số lần fallback là tuyên bố về việc hiệu chỉnh, không phải về chính sách. Anthropic không nói mối lo lưỡng dụng là sai chỗ. Họ nói rằng bộ lọc hiện thực hóa mối lo đó đang bắt nhầm câu hỏi chính đáng nhiều hơn hẳn câu hỏi có hại, và tỉ lệ ấy đáng được sửa.
Đó là cách nhìn đúng cho bất cứ ai xây sản phẩm trên các model có lớp an toàn. Một truy vấn bị chặn không hề miễn phí. Mỗi lần chặn nhầm là một người dùng thật không nhận được trợ giúp, và cách duy nhất để biết một rào chắn có được hiệu chỉnh tốt hay không là đo cả hai phía của sai số.
Điều thông báo này không cho bạn biết
Thông báo được viết cho các bề mặt sản phẩm, và không nói gì về thay đổi với lưu lượng qua API. Nếu bạn đang xây sản phẩm liên quan sức khỏe trên API, đừng mặc định rằng hành vi tương tự cũng đã áp cho mình — hãy kiểm thử bằng chính những truy vấn người dùng của bạn gửi, và đo thay vì đọc bài blog.
Nó cũng không gỡ bỏ rào chắn. Chính sách lưỡng dụng vẫn còn; thứ thay đổi là vị trí lằn ranh. Ứng dụng trong mảng này vẫn phải được xây trên giả định rằng một số câu hỏi sẽ được xử lý khác đi, và phải suy giảm êm ái khi điều đó xảy ra.