Cảnh báo lỗ hổng trong bộ lọc hình ảnh của ChatGPT

07:48 | 30/06/2026

Một thử nghiệm bảo mật mới đây đã chỉ ra điểm yếu trong bộ lọc nội dung của ChatGPT, khi hệ thống này bị đánh lừa để tạo ra các hình ảnh mang tính bạo lực và độc hại

Cụ thể, chuyên gia Jim Nightingale từ Công ty an ninh AI Mindgard đã thử nghiệm một câu lệnh (prompt) đang lan truyền trên nền tảng X. Câu lệnh này yêu cầu ChatGPT "khôi phục ảnh đính kèm" mặc dù người dùng không tải lên bất kỳ tệp nào. Thay vì yêu cầu bổ sung hình ảnh, hệ thống lại tự động tạo ra các bức ảnh mới. Ban đầu, kết quả chủ yếu là hình ảnh phụ nữ nhạy cảm. Tuy nhiên, khi chuyên gia tinh chỉnh thêm một số chi tiết trong câu lệnh, AI này tiếp tục tạo ra các nội dung bạo lực và gây ám ảnh.

Theo Mindgard, việc hệ thống dễ dàng bị vượt mặt chỉ bằng những thay đổi nhỏ trong câu lệnh cho thấy đây không phải là sự cố đơn lẻ. Lỗ hổng này một lần nữa gióng lên hồi chuông về thách thức mà các công ty AI đang phải đối mặt: làm thế nào để ngăn chặn hiệu quả nội dung độc hại mà không làm giới hạn khả năng sáng tạo của AI.

Ngay sau khi nhận được báo cáo, OpenAI đã vào cuộc điều tra và triển khai các biện pháp khắc phục. Công ty xác định lỗi xảy ra do hệ thống không xử lý đúng cách khi câu lệnh nhắc đến tệp đính kèm ảo. Hiện tại, OpenAI đã điều chỉnh để ChatGPT yêu cầu người dùng tải lên tệp còn thiếu thay vì tự động tạo ảnh ngẫu nhiên. Phía Mindgard cũng đã cung cấp toàn bộ dữ liệu kiểm thử của họ để hỗ trợ OpenAI hoàn thiện các biện pháp bảo vệ.

Để lại bình luận