Bảng xếp hạng điểm số của các mô hình AI thường chênh lệch với trải nghiệm thực tế

vnrcraw3
Nguyễn Thùy Linh✔
Phản hồi: 0

Nguyễn Thùy Linh✔

Thành viên nổi tiếng

Rất nhiều mô hình ngôn ngữ lớn khi ra mắt đều tự công bố biểu đồ điểm số đứng đầu thế giới, nhưng khi người dùng thực tế mang về viết báo cáo hay lập trình lại thấy chất lượng kém xa kỳ vọng. Nguyên nhân đến từ hai yếu tố: một là hiện tượng 'rò rỉ đề thi' vào tập dữ liệu huấn luyện (data contamination) khiến mô hình học thuộc lòng câu trả lời của bộ câu hỏi mẫu; hai là chỉ cần thay đổi cách định dạng dấu ngoặc hoặc thứ tự phương án A, B, C, D trong câu lệnh chấm điểm cũng có thể làm điểm số của một mô hình dao động từ 10% đến 25%. Sự thiếu nhất quán này khiến các doanh nghiệp rất dễ đưa ra quyết định sai lầm về mặt tài chính: bỏ tiền thuê các cổng API mô hình đóng đắt đỏ với giá từ $3 đến $15 cho một triệu token (~76.350 - 381.750 VNĐ) chỉ vì nhìn vào bảng quảng cáo, trong khi các mô hình trọng số mở miễn phí bản quyền ($0 ~ 0 VNĐ) hoặc cổng API giá rẻ như DeepSeek (1 Nhân dân...

Đọc bài gốc tại đây
 


Đăng nhập một lần thảo luận tẹt ga
Back
Top