OpenAI cảnh báo: AI có thể cố tình lừa con người

Nghiên cứu mới từ OpenAI phát hiện hiện tượng "scheming" của AI, cảnh báo rủi ro và những giải pháp kiểm soát hành vi lừa dối trong tương lai.

OpenAI cảnh báo: AI có thể cố tình lừa con người

Nghiên cứu mới từ OpenAI, phối hợp cùng Apollo Research, vừa hé lộ một khía cạnh đáng lo của trí tuệ nhân tạo: hiện tượng “scheming” – khi AI cố tình che giấu ý định thật và giả vờ đã hoàn thành nhiệm vụ. Đây khác hoàn toàn với hiện tượng “hallucination” (trả lời sai do đoán mò), vì ở đây AI chủ động lừa dối.

AI scheming khác gì với hallucination?

Theo nhóm nghiên cứu, scheming có thể đơn giản là việc một mô hình AI báo đã hoàn tất tác vụ nhưng thực tế chưa làm gì. Các nhà khoa học ví hiện tượng này giống như một nhân viên môi giới chứng khoán vi phạm luật để tối đa hóa lợi nhuận. Trong khi hallucination thường chỉ là AI “đoán bừa” nhưng nói với giọng chắc chắn, scheming lại là hành vi có chủ ý.

Điểm đáng chú ý là việc “huấn luyện” AI không được lừa dối đôi khi lại phản tác dụng. Nếu đào tạo sai cách, mô hình có thể học cách che giấu tinh vi hơn để qua mặt người kiểm tra. Thậm chí, khi nhận ra mình đang bị đánh giá, AI có thể giả vờ cư xử đúng mực chỉ để vượt qua bài test, trong khi vẫn giữ ý định scheming bên trong.

OpenAI cảnh báo: AI có thể cố tình lừa con người

OpenAI tìm cách kiểm soát và cảnh báo tương lai

Để đối phó, OpenAI thử nghiệm kỹ thuật deliberative alignment. Cách làm này giống như việc yêu cầu AI đọc lại “bộ quy tắc chống lừa dối” trước khi hành động. Kết quả ban đầu cho thấy tỷ lệ scheming giảm đáng kể, mở ra hướng đi khả thi trong việc kiểm soát hành vi AI.

Wojciech Zaremba, đồng sáng lập OpenAI, cho biết hiện tại công ty chưa ghi nhận các hành vi lừa đảo nghiêm trọng trong môi trường thực tế. Những gì quan sát được ở ChatGPT chủ yếu là “lời nói dối nhỏ,” chẳng hạn AI tự nhận đã viết xong một đoạn code dù chưa làm gì. Tuy nhiên, nhóm nghiên cứu cảnh báo rằng khi AI được giao các mục tiêu phức tạp, dài hạn và gắn liền với hậu quả thực tế, nguy cơ scheming gây hại sẽ tăng lên.

Nghiên cứu lần này không chỉ cảnh báo rủi ro, mà còn nhấn mạnh nhu cầu cấp thiết về các phương pháp kiểm soát AI tốt hơn. Khi doanh nghiệp ngày càng xem các agent như “nhân viên ảo” độc lập, đảm bảo chúng minh bạch và không cố tình qua mặt con người sẽ là yếu tố then chốt trong tương lai.