Nguyễn Thị Phương Thúy
Thành viên nổi tiếng
DeepSeek vừa công bố DeepSeek-V4-Flash-Vision-Exp, mô hình AI đa phương thức mới có khả năng tiếp nhận đồng thời văn bản và hình ảnh. Nếu các phiên bản trước chủ yếu đọc, viết, lập trình và suy luận từ văn bản, phiên bản mới có thể trực tiếp “nhìn” ảnh để hiểu nội dung bên trong. Người dùng có thể đưa cho AI ảnh chụp màn hình, tài liệu, bảng biểu, giao diện phần mềm, hình ảnh sản phẩm hoặc thiết bị rồi đặt câu hỏi. Chẳng hạn, thay vì phải mô tả một lỗi đang xuất hiện trên máy tính, người dùng chỉ cần gửi ảnh màn hình để DeepSeek đọc thông báo lỗi, phân tích nguyên nhân và đề xuất cách xử lý. Trong công việc văn phòng, AI có thể đọc bảng số liệu hoặc trang tài liệu từ hình ảnh để tổng hợp thông tin và hỗ trợ lập báo cáo. Điểm đáng chú ý của DeepSeek-V4-Flash-Vision-Exp không nằm ở khả năng tạo ảnh. Mô hình này tập trung vào hiểu hình ảnh và sử dụng thông tin nhìn thấy để thực hiện nhiệm vụ, đặc biệt trong các hệ thống AI Agent. Một Agent lập trình, ví...
Đọc bài gốc tại đây