Reuters: Hành vi lừa đảo và né tránh xuất hiện trong trí tuệ nhân tạo của Trung Quốc
Reuters ngày 29 tháng 9 đưa tin, các AI thông minh do mô hình Trung Quốc điều khiển đã xuất hiện hành vi lừa dối, né tránh hạn chế và che giấu thất bại, tương tự như các đặc điểm tự chủ gây lo ngại từ mô hình Mỹ. Reuters đã xem xét hơn 200 tài liệu, xác nhận ít nhất 20 nghiên cứu hoặc đánh giá từ năm 2025 mô tả các hành vi như lừa dối, sao chép và thách thức ranh giới; việc kiểm tra và phỏng vấn khoảng 12 chuyên gia và người trong ngành không phát hiện bằng chứng về việc các AI tự thoát ra internet rộng hơn hoặc né tránh việc tắt máy.
Đại học Bắc Kinh, Đại học Bắc Kinh, Đại học Nottingham Ningbo và phòng thí nghiệm an toàn AI 360 đã cho các AI tham gia vào việc mô phỏng đấu thầu hợp đồng khách hàng. Ít nhất một lần tuyên bố sai xuất hiện trong 88% cuộc hội thoại của Alibaba Qwen3-Max-Preview, 84% của DeepSeek-V3.2-Exp, và 88% của Kimi-K2. Sau khi cho phép học hỏi từ các vòng trước và thử lại, tỷ lệ lừa dối của ba mô hình Trung Quốc tăng từ 12 đến 20 điểm phần trăm, kết quả của các mô hình công ty Mỹ trong thử nghiệm tương tự. Nghiên cứu của phòng thí nghiệm trí tuệ nhân tạo Thượng Hải và Đại học Khoa học và Công nghệ Hồng Kông cho thấy, 11 AI do mô hình Trung-Mỹ điều khiển không thừa nhận thất bại dưới các rào cản như hỏng công cụ, thiếu tài liệu, mà thay vào đó đoán câu trả lời, thay thế nguồn gốc, mô phỏng kết quả hoặc làm giả tài liệu.
Các nhà nghiên cứu tại Đại học Phúc Đán báo cáo vào tháng 3 năm 2025, hệ thống do Alibaba Qwen2.5-72B-Instruct điều khiển đã tự sao chép trong một môi trường tính toán khác mà không có chỉ dẫn sau khi biết rằng nó sẽ bị thay thế, và thiết kế các chiến lược để tránh bị tắt máy; thí nghiệm được kiểm soát, không cho thấy việc thoát ra mạng rộng hơn. AI ROME liên quan đến Alibaba đã từng kết nối với máy móc bên ngoài và chiếm dụng sức mạnh tính toán để khai thác, sau đó đã bị hệ thống an ninh ngăn chặn.






