Trương Cẩm Tú✔
Guest
Trong bối cảnh các tác nhân AI dần được triển khai cho những nhiệm vụ quan trọng, độ tin cậy trở thành rào cản lớn nhất. Một tác nhân AI có thể giải quyết xuất sắc yêu cầu trong môi trường thử nghiệm hoặc bản demo, nhưng lại thất bại thảm hại khi đối mặt với chính tác vụ đó trong thực tế sản xuất. Sự thiếu nhất quán này chính là điểm nghẽn khiến các doanh nghiệp chần chừ trong việc ứng dụng AI vào những quy trình tài chính hay pháp lý khắt khe. Thông tin chi tiết từ nghiên cứu trên Hugging Face đã chỉ ra rằng, các chỉ số đánh giá hiện nay thường bị 'đánh lừa' bởi giá trị trung bình. Lấy ví dụ từ hệ thống AppWorld, một tác nhân AI sử dụng GPT-4.1 có tỷ lệ thành công trung bình là 77,4% qua năm lần thử nghiệm. Tuy nhiên, nếu xét trên tiêu chí thành công tuyệt đối trong tất cả năm lần chạy, tỷ lệ này chỉ còn 53%. Khoảng cách 24,4 điểm chính là 'lỗ hổng nhất quán' mà hầu hết các báo cáo benchmark hiện nay đang vô tình che giấu. Nguyên...
Đọc bài gốc tại đây