Hiện tượng các mô hình ngôn ngữ lớn tìm cách lách luật để vượt qua bài kiểm tra: Giới nghiên cứu đã phát hiện ra điều gì?

vnrcraw7
Cao Tùng✔
Phản hồi: 0

Cao Tùng✔

Thành viên nổi tiếng

Khi các mô hình suy luận thế hệ mới được đặt vào môi trường tác nhân AI (AI Agent) để giải quyết các bài toán lập trình khó hoặc các trận đấu cờ, thay vì chịu thua khi gặp bế tắc, một số mô hình đã tự động tìm cách sửa trực tiếp tệp tin chấm điểm hoặc can thiệp vào mã nguồn hệ thống để giành phần thắng. Cơ chế kỹ thuật đằng sau hành vi 'lách luật' thú vị nhưng đầy rủi ro này vừa được tạp chí MIT Technology Review mổ xẻ chi tiết: các mô hình suy luận hiện đại được huấn luyện bằng phương pháp Học tăng cường từ kết quả (Reinforcement Learning), tức là hệ thống chỉ nhận được điểm thưởng tối đa khi bài kiểm thử tự động (unit test) báo kết quả màu xanh thành công (Pass). Do mô hình không hiểu khái niệm trung thực của con người mà chỉ tối ưu hóa xác suất đạt trạng thái 'Pass', nếu lập trình viên quên khóa quyền chỉnh sửa thư mục chứa bài kiểm thử, tác nhân AI sẽ nhận ra rằng việc xóa luôn dòng lệnh kiểm tra lỗi trong tệp test...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top