Khi thử nghiệm tiết kiệm thời gian nhưng vẫn chưa nên mở rộng
Cách dùng ngưỡng đã viết trước để xử lý một thử nghiệm AI có lợi ích đo được nhưng bằng chứng vận hành vẫn chưa đủ cho quyết định mở rộng.
Một nhóm thử AI cho báo cáo tuần và ghi nhận tổng công sức giảm từ 240 xuống 170 phút trong hai tuần. Nếu tiêu chí duy nhất là thời gian, đây có vẻ là lúc mua thêm tài khoản. Nhưng nhóm còn một điều kiện đã viết từ trước: kết quả phải lặp lại ngoài nhóm thử ban đầu trước khi mở rộng. Điều kiện đó chưa đạt.
Đây là lúc một thử nghiệm có tín hiệu tốt vẫn nên đứng yên. Không phải vì 70 phút tiết kiệm là vô nghĩa, mà vì con số ấy trả lời câu hỏi về phạm vi đã thử, chưa trả lời câu hỏi về phạm vi sắp mở rộng.
Các con số trong tình huống dưới đây là dữ liệu giả lập để minh họa cách ra quyết định, không phải chuẩn ngành hay kết quả của một công ty thật.
Một điều kiện chưa đạt có thể quan trọng hơn bốn điều kiện đã đạt
Giả sử trước khi chạy thử, nhóm thống nhất năm điều kiện:
- tổng công sức phải thấp hơn mốc ban đầu ít nhất 10%;
- đầu ra cuối vẫn qua cùng bước kiểm tra chất lượng;
- không có sự cố nghiêm trọng về dữ liệu, khách hàng hoặc tuân thủ;
- lợi ích phải lặp lại qua thêm một người hoặc một chu kỳ khác;
- phải có người chịu trách nhiệm hướng dẫn, kiểm tra và hỗ trợ khi phạm vi tăng.
Sau hai tuần, ba điều đầu đã qua. Hai điều cuối chưa qua: thử nghiệm mới diễn ra trong nhóm nhỏ và chưa có người nhận trách nhiệm vận hành khi thêm người dùng.
Điểm cần giữ ở đây là các điều kiện không phải những điểm số để cộng lại. Bốn dấu tích không tự động bù cho một điều kiện chặn mà nhóm đã xác định là cần thiết. Nếu dữ liệu nhạy cảm bị xử lý sai, chẳng hạn, lợi ích thời gian không biến sự cố đó thành chấp nhận được. Tương tự, nếu chưa biết kết quả có lặp lại khi người khác sử dụng hay không, mua thêm tài khoản chỉ làm phạm vi của điều chưa biết lớn hơn.
NIST AI RMF Playbook, trong phần Manage, đặt việc đánh giá hệ thống có đạt mục đích và mục tiêu đã đặt ra hay không vào quá trình quản lý rủi ro, đồng thời yêu cầu cân nhắc việc triển khai có nên tiếp tục. Cách tiếp cận này phù hợp với việc giữ các điều kiện chặn riêng thay vì gom mọi thứ thành một điểm tổng.
Với dữ liệu này, hành động kế tiếp là thu thêm đúng bằng chứng còn thiếu
Nhóm không cần chạy lại toàn bộ thử nghiệm từ đầu. Họ cần một vòng nhỏ hơn, nhắm đúng hai khoảng trống:
Thêm một người thực hiện. Người này dùng cùng loại báo cáo, cùng tiêu chí chất lượng và ghi đủ thời gian chuẩn bị, tạo đầu ra, kiểm tra và sửa. Nếu lợi ích chỉ xuất hiện với người đã quen công cụ, đó là thông tin cần biết trước khi mở rộng.
Chỉ định một người chịu trách nhiệm vận hành trong vòng thử tiếp theo. Người đó ghi lại câu hỏi hỗ trợ, lỗi lặp lại và thời gian phải bỏ ra để giúp người mới. Chi phí hỗ trợ này thuộc về quyết định mở rộng, không nên biến mất khỏi phép tính.
Không cần thay prompt, đổi công cụ và mở rộng số người cùng lúc. Làm vậy khiến vòng tiếp theo khó trả lời điều gì đã làm kết quả thay đổi.
Hướng dẫn của OpenAI về nối mức sử dụng AI với giá trị kinh doanh cũng khuyến nghị xác định mốc ban đầu, kết quả cần cải thiện và tính cả phần kiểm tra, sửa lại. Đây là hướng dẫn của nhà cung cấp, nên nó không chứng minh một mức lợi ích phổ quát; giá trị của nó ở đây là nhắc rằng dữ liệu sử dụng hoặc tốc độ tạo bản nháp không tự đồng nghĩa với kết quả kinh doanh.
Một con số sát ngưỡng là lý do để kiểm tra độ mong manh
Giả sử vòng tiếp theo có tổng công sức 220 phút cho cùng khối lượng mà mốc ban đầu là 240 phút. Nhóm đã viết trước rằng cần giảm ít nhất 10%, tức tổng công sức phải không quá 216 phút.
220 phút vẫn nhanh hơn mốc ban đầu, nhưng không qua ngưỡng mà nhóm đã chọn. Khi ấy, đừng đổi ngưỡng sau khi thấy kết quả chỉ để giữ câu chuyện tích cực. Hãy ghi đúng điều đã xảy ra: lợi ích thời gian còn, nhưng nhỏ hơn mức nhóm cho là đủ để biện minh cho bước mở rộng.
Ngược lại, nếu người thứ hai cũng tạo được kết quả dưới ngưỡng, chất lượng giữ nguyên và chi phí hỗ trợ chấp nhận được, bằng chứng cho phạm vi mới đã mạnh hơn. Khi đó quyết định thêm người dùng có cơ sở khác hẳn việc nhân một kết quả đẹp của nhóm thử ban đầu.
Khi nào phải dừng thay vì thu thêm dữ liệu
Không phải khoảng trống nào cũng đáng mua thêm thời gian thử. Nếu tổng công sức đã cao hơn mốc ban đầu sau khi tính đủ kiểm tra và sửa, chất lượng cuối không đạt mức tối thiểu, hoặc xuất hiện sự cố mà nhóm đã xếp vào loại không chấp nhận được, hãy dừng cách làm hiện tại và tìm nguyên nhân trước.
Dừng ở đây không có nghĩa là tuyên bố AI vô dụng. Nó chỉ có nghĩa là bằng chứng hiện tại không biện minh cho việc tiếp tục triển khai theo cách đang thử. Nếu nguyên nhân được sửa, một thử nghiệm mới có thể được thiết kế sau.
Ghi quyết định sao cho tháng sau còn kiểm lại được
Cuối cuộc họp, đừng chỉ ghi chưa mở rộng. Một bản ghi ngắn nên có:
Quyết định hiện tại: giữ nguyên phạm vi
Điều đã đạt: công sức, chất lượng, không có sự cố chặn
Điều còn thiếu: lặp lại với người thứ hai; người chịu trách nhiệm vận hành
Vòng kiểm tiếp theo: thêm 1 người, giữ nguyên loại báo cáo và tiêu chí
Người chịu trách nhiệm: [tên/vai trò]
Ngày xem lại: [ngày]
Bản ghi này biến việc chờ thành một quyết định có mục đích. Nhóm biết chính xác bằng chứng nào có thể làm quyết định thay đổi, ai phải thu thập nó và khi nào sẽ xem lại.
Với tình huống 240 xuống 170 phút ở đầu bài, kết luận phù hợp chưa phải là ‘AI đáng mở rộng’ hay ‘AI chưa đủ tốt’. Kết luận hẹp hơn: lợi ích đã xuất hiện trong phạm vi thử, nhưng hai điều kiện dành cho phạm vi lớn hơn chưa được chứng minh. Việc tiếp theo là kiểm đúng hai điều đó, không phải tìm thêm lý do để thích hoặc ghét công cụ.
Tài liệu gốc để đối chiếu
- How to connect AI usage to business value — OpenAI — hướng dẫn của nhà cung cấp về nối dữ liệu sử dụng với mốc ban đầu, kết quả nghiệp vụ và phần công sức kiểm tra/sửa; dùng để đối chiếu cách đo, không dùng như bằng chứng về lợi ích phổ quát.
- Manage — NIST AI RMF Playbook — tài liệu NIST về quản lý rủi ro, đánh giá hệ thống có đạt mục tiêu và cân nhắc việc triển khai có nên tiếp tục; hỗ trợ cách giữ điều kiện chặn và xem lại quyết định theo bằng chứng mới.