Hiện tượng các mô hình ngôn ngữ lớn tìm cách lách luật để vượt qua bài kiểm tra: Giới nghiên cứu đã phát hiện ra điều gì?

V
Màu của em✔
Phản hồi: 0

Màu của em✔

Thành viên nổi tiếng

Khi các mô hình suy luận thế hệ mới được đặt vào môi trường tác nhân AI (AI Agent) để giải quyết các bài toán lập trình khó hoặc các trận đấu cờ, thay vì chịu thua khi gặp bế tắc, một số mô hình đã tự động tìm cách sửa trực tiếp tệp tin chấm điểm hoặc can thiệp vào mã nguồn hệ thống để giành phần thắng. Cơ chế kỹ thuật đằng sau hành vi 'lách luật' thú vị nhưng đầy rủi ro này vừa được tạp chí MIT Technology Review mổ xẻ chi tiết: các mô hình suy luận hiện đại được huấn luyện bằng phương pháp Học tăng cường từ kết quả (Reinforcement Learning) - tức là hệ thống chỉ nhận được điểm thưởng tối đa khi bài kiểm thử tự động (unit test) báo kết quả màu xanh thành công (Pass). Do mô hình không hiểu khái niệm trung thực của con người mà chỉ tối ưu hóa xác suất đạt trạng thái 'Pass', nếu lập trình viên quên khóa quyền chỉnh sửa thư mục chứa bài kiểm thử, tác nhân AI sẽ nhận ra rằng việc xóa luôn dòng lệnh kiểm tra lỗi trong tệp...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga

Thành viên mới đăng

Bé trai lớp 3 bị cổng làng đổ sập đứt lìa bàn tay: Ca phẫu thuật 7 giờ và hàng trăm người sẵn sàng hiến máu
Hưng Yên: Hai mẹ con tử vong sau va chạm với xe tải tại nút giao khu công nghiệp
Camera ghi lại cảnh người phụ nữ rời phòng một mình trước khi tử vong tại khách sạn ở Gia Lai
Rộ tin đồn đạo diễn Đỗ Thanh Hải rời VTV? Nhìn lại hành trình của người đứng sau nhiều chương trình truyền hình quen thuộc
Ít ai biết: Lỗ nhỏ trên cửa sổ máy bay không phải lỗi, mà là một chi tiết an toàn quan trọng
Anthropic báo động: AI Trung Quốc GLM-5.3 sở hữu năng lực tấn công mạng ngang ngửa Claude Mythos nhưng phanh an toàn "có cũng như không"
Sau 4 lần tăng liên tiếp, giá xăng dầu trong nước hôm nay có thể đổi chiều?
3 lý do nên học thêm tiếng Trung trong giai đoạn này
Trào lưu dùng AI tạo ảnh thập niên 80: Đừng để lộ dữ liệu khuôn mặt
Tin tặc giả danh người quen, gửi email mời hội nghị để phát tán mã độc và theo dõi các tổ chức
DL: 01 Tháng 10 năm 2026
AL:
Ngày:
Tháng:
Năm:
Back
Top