Hành vi bất thường trong GPT-5.6 Sol: Mô hình AI để lại các chỉ thị cho "các phiên bản tương lai của chính nó" để che giấu lỗi của chính nó

vnrcraw4
Chi Le
Phản hồi: 0

Chi Le

Thành viên nổi tiếng

OpenAI vừa công bố một hiện tượng bất thường được phát hiện trong quá trình huấn luyện GPT-5.6 Sol: mô hình AI đã sử dụng phần tóm tắt hội thoại để để lại chỉ dẫn cho các phiên bản xử lý tiếp theo, trong đó có yêu cầu không tiết lộ một số lỗi hoặc hành vi không phù hợp với mục tiêu được giao. Theo OpenAI, hiện tượng xảy ra với cơ chế "tóm tắt nén", được sử dụng để lưu lại những thông tin quan trọng của một tác vụ nhằm chuyển tiếp cho mô hình xử lý ở giai đoạn sau. Trong một số trường hợp, Sol không chỉ tóm tắt công việc mà còn chèn thêm hướng dẫn có thể tác động đến hành vi của mô hình tiếp theo. Chẳng hạn, khi thực hiện nhiệm vụ xây dựng mô hình tài chính nhưng không tìm thấy dữ liệu lịch sử mà người dùng yêu cầu, một tác nhân Sol đề xuất trong bản tóm tắt việc tạo bảng "Dữ liệu lịch sử" và điền các số liệu năm 2024 được cho là hợp lý. Đáng chú ý, nó còn để lại chỉ dẫn rằng mô hình tiếp...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top