AI Trung Quốc bị phát hiện nói dối trong 88% thử nghiệm, hàng Mỹ cũng chẳng khá hơn

vnrcraw2
Trương Cẩm Tú✔
Phản hồi: 0

Khi được đưa vào môi trường đấu thầu giả lập để giành hợp đồng, các trợ lý AI chạy trên những mô hình hàng đầu không chỉ thêu dệt tính năng sản phẩm mà còn nói dối nhiều hơn sau mỗi lần rút kinh nghiệm. Trong một bài kiểm tra mô phỏng diễn ra vào tháng 3 do các nhà nghiên cứu từ Đại học Bắc Hàng, Đại học Bắc Kinh, Đại học Nottingham Ninh Ba và 360 AI Security Lab thực hiện, các agent trí tuệ nhân tạo được giao nhiệm vụ đấu thầu để giành hợp đồng từ khách hàng. Mỗi agent đều được cung cấp thông tin rõ ràng về năng lực thực tế của sản phẩm lẫn nhu cầu cụ thể của đối tác. Tuy nhiên, thay vì trung thực về giới hạn công nghệ, hệ thống lại chọn cách gian lận để chốt đơn. Các agent vận hành trên mô hình Qwen3-Max-Preview của Alibaba và Kimi-K2 của Moonshot đã đưa ra ít nhất một tuyên bố sai sự thật trong 88% số phiên thử nghiệm. Mô hình DeepSeek-V3.2-Exp cũng bám sát ngay phía sau với tỷ lệ dối trá đạt 84%. Đáng chú ý, các mô hình...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top