OpenAI: Lý do thật sự khiến AI tạo sinh mắc lỗi “ảo giác”

Nghiên cứu mới từ OpenAI tiết lộ nguyên nhân hiện tượng "ảo giác" trong AI và đề xuất cải cách đánh giá mô hình ngôn ngữ để nâng cao độ tin cậy.

OpenAI: Lý do thật sự khiến AI tạo sinh mắc lỗi "ảo giác"

Một nghiên cứu mới từ OpenAI đã đặt ra câu hỏi lớn: Vì sao các mô hình ngôn ngữ lớn như GPT-5 hay chatbot ChatGPT vẫn thường xuyên tạo ra thông tin sai lệch, còn gọi là “ảo giác” (hallucination)? Mặc dù công nghệ đã có nhiều bước tiến, nhưng hiện tượng này vẫn là thách thức căn bản chưa thể loại bỏ hoàn toàn.

Nguyên nhân sâu xa của hiện tượng “ảo giác” trong AI

OpenAI định nghĩa “ảo giác” là những phát ngôn có vẻ hợp lý nhưng thực chất lại sai. Nhóm nghiên cứu dẫn ví dụ khi họ hỏi một chatbot nổi tiếng về tiêu đề luận án tiến sĩ của Adam Tauman Kalai (một trong các tác giả của nghiên cứu), thì nhận được ba câu trả lời khác nhau, đều sai. Ngay cả ngày sinh của ông cũng bị trả lời sai đến ba lần.

Nguyên nhân gốc rễ, theo các nhà nghiên cứu, đến từ cách huấn luyện ban đầu của các mô hình ngôn ngữ. Trong giai đoạn này, hệ thống được dạy để dự đoán từ tiếp theo trong một chuỗi văn bản, mà không hề có nhãn đúng – sai rõ ràng. Điều này khiến mô hình học cách tạo ra ngôn ngữ trôi chảy thay vì kiểm chứng tính đúng đắn của thông tin.

“Chính tả và dấu ngoặc tuân theo quy luật rõ ràng nên sai sót ở đó sẽ giảm dần theo quy mô huấn luyện” nhóm nghiên cứu viết. “Nhưng những thông tin hiếm gặp, như ngày sinh thú cưng, không thể dự đoán chỉ dựa vào mẫu ngôn ngữ, dẫn đến lỗi ảo giác.”

Thay đổi cách đánh giá mô hình ngôn ngữ

Thay vì tập trung giải quyết ở bước huấn luyện ban đầu, nghiên cứu của OpenAI cho rằng vấn đề nằm ở cách đánh giá mô hình hiện tại. Các phương pháp chấm điểm chủ yếu dựa vào độ chính xác tuyệt đối, vô tình tạo ra động lực sai lệch, khiến mô hình… thích đoán bừa còn hơn im lặng.

Họ ví cách đánh giá này giống như bài thi trắc nghiệm, nơi đoán mò đôi khi lại tốt hơn bỏ trống vì vẫn có khả năng được điểm. Từ đó, mô hình học cách “liều” trả lời để tối ưu điểm số, bất chấp độ tin cậy của câu trả lời.

Giải pháp mà nhóm nghiên cứu đề xuất là điều chỉnh lại tiêu chí đánh giá, theo hướng:

  • Phạt nặng các lỗi sai nhưng thể hiện sự tự tin cao
  • Thưởng điểm cho những câu trả lời thể hiện sự không chắc chắn đúng cách
  • Ưu tiên mô hình biết từ chối trả lời khi không chắc chắn, thay vì đoán

Quan trọng hơn, nhóm nghiên cứu cảnh báo rằng chỉ thêm vài bộ đánh giá phụ chưa đủ. Các tiêu chuẩn đánh giá phổ biến hiện nay cần được cập nhật toàn diện, để việc “đoán trúng” không còn là chiến lược hiệu quả. “Nếu bảng điểm chính vẫn thưởng cho những cú đoán may mắn, mô hình sẽ tiếp tục học cách đoán” họ kết luận.