Các mô hình AI có thể tự tin tuyên bố thông tin hoàn toàn sai—và không có tín hiệu nội bộ nào cho thấy có điều gì đó không đúng. Điều này được gọi là ảo giác, và nó là một trong những thách thức lớn nhất trong nghiên cứu hỗ trợ AI.
Vấn đề: Sự tự tin vô nghĩa
Khi bạn yêu cầu một mô hình AI xác minh một tuyên bố, nó không kiểm tra một cơ sở dữ liệu các sự thật. Nó tạo ra một phản hồi có vẻ hợp lý dựa trên các mẫu trong dữ liệu huấn luyện của nó. Đôi khi, những mẫu đó dẫn đến việc bịa đặt:
- Trích dẫn giả: Các bài báo học thuật không tồn tại (vụ Mata kiện Avianca liên quan đến luật án giả)
- Thống kê được phát minh: "Các nghiên cứu cho thấy 80% các chuyên gia đồng ý..." mà không có nguồn gốc
- Các lỗi tự tin: Giải thích kỹ thuật nghe có vẻ hợp lý nhưng hoàn toàn sai.
Tại sao "Bạn có chắc không?" lại không hiệu quả
Một phản ứng tự nhiên trước sự không chắc chắn là yêu cầu AI xác minh chính nó. Nhưng điều này không giúp ích gì:
Lỗi xác minh bản thân
- •"Bạn có chắc không?" → Thường lặp lại cùng một lỗi với sự tự tin hơn.
- •"Xác minh điều này" → Có thể tạo ra ảo giác hỗ trợ
- •"Kiểm tra nguồn của bạn" → Có thể tạo thêm nhiều trích dẫn giả
- •Điểm tự tin → Không tương quan với độ chính xác
Mô hình không có tham chiếu thực tế để kiểm tra. Nó vẫn chỉ là việc khớp mẫu, chỉ là với một lời nhắc yêu cầu nó tự tin hơn về việc khớp mẫu của mình.
Giải pháp: Xác thực giữa các mô hình
Các mô hình AI khác nhau có những cách tưởng tượng khác nhau. Chúng có dữ liệu đào tạo khác nhau, kiến trúc khác nhau và thời điểm cắt đứt kiến thức khác nhau. Khi một mô hình bịa ra một tuyên bố, các mô hình khác thường không mắc phải sai lầm tương tự.
Nguyên tắc Độc lập
Nếu GPT tạo ra một trích dẫn, Claude không "kế thừa" lỗi đó - nó đánh giá tuyên bố một cách độc lập từ chính quá trình đào tạo của nó. Sự độc lập này là điều làm cho việc xác thực chéo hoạt động. Năm mô hình đồng ý có nghĩa là năm hệ thống độc lập đã đạt được cùng một kết luận.
Cách hoạt động của Phát hiện Chéo Mô hình
Sản xuất độc lập
Mỗi mô hình AI trả lời cùng một câu hỏi mà không nhìn thấy phản hồi của những mô hình khác.
Đánh giá chéo
Mỗi mô hình đánh giá mỗi lập luận từ mỗi mô hình khác.
Phát hiện sự bất đồng
Các yêu cầu được đánh giá kém bởi nhiều mô hình sẽ bị đánh dấu.
Điểm số đồng thuận
Sự đồng thuận cao = sự tự tin cao hơn; sự không đồng thuận = điều tra
Khi nào sử dụng phát hiện ảo giác
Xác thực chéo giữa các mô hình là có giá trị nhất cho:
- Các tuyên bố thực tế cần phải có thể xác minh được.
- Trích dẫn và tài liệu tham khảo
- Thống kê và các tuyên bố định lượng
- Các sự kiện lịch sử và chi tiết kỹ thuật
Nó ít liên quan hơn đối với các nhiệm vụ dựa trên ý kiến hoặc sáng tạo, nơi không có "sự thật cơ bản" để xác thực.
Giới hạn để Hiểu
Xác thực chéo giữa các mô hình không hoàn hảo:
- Thiên kiến chung: Tất cả các mô hình có thể đã học cùng một lỗi từ dữ liệu huấn luyện tương tự
- Các khoảng trống kiến thức: Các sự kiện gần đây có thể vượt quá giới hạn đào tạo của tất cả các mô hình.
- Chuyên môn lĩnh vực: Tất cả các mô hình có thể thiếu kiến thức trong các lĩnh vực chuyên môn.
Sự đồng thuận giữa các mô hình giảm đáng kể xác suất sai sót nhưng không loại bỏ nhu cầu xác minh của con người đối với các tuyên bố có rủi ro cao.
Câu hỏi thường gặp
AI ảo giác là gì?
Khi một mô hình tự tin tuyên bố thông tin hoàn toàn sai lệch mà không có tín hiệu nội bộ nào cho thấy có điều gì đó sai — một trong những thách thức lớn nhất trong nghiên cứu hỗ trợ bởi AI.
Tại sao việc hỏi một mô hình "Bạn có chắc không?" lại không phát hiện ra ảo giác?
Bởi vì một mô hình đơn lẻ không có tín hiệu nội bộ đáng tin cậy về lỗi của chính nó; việc tự kiểm tra có thể lặp lại cùng một sai lầm. Bài viết trình bày xác thực chéo giữa các mô hình như một giải pháp thay thế.
Phát hiện ảo giác giữa các mô hình hoạt động như thế nào?
Truy vấn nhiều mô hình độc lập, để chúng đánh giá câu trả lời của nhau và đánh dấu những sự không đồng nhất. Các mô hình khác nhau có cách tưởng tượng khác nhau, vì vậy khi một mô hình bịa đặt, các mô hình khác thường phát hiện ra điều đó.