BTC $76,438.75 +0.87%
ETH $2,446.32 +2.05%
BNB $725.43 +1.90%
XRP $1.30 +0.95%
SOL $100.06 +3.15%
TRX $0.3352 +0.12%
DOGE $0.0811 +1.73%
ADA $0.1986 +2.19%
BCH $221.47 +0.80%
LINK $11.19 +3.85%
HYPE $79.39 +2.09%
AAVE $123.48 +3.27%
SUI $0.7234 +5.13%
XLM $0.1830 +4.03%
ZEC $1,362.14 +14.83%
AAPL $334.50 +0.90%
AMZN $249.19 -0.01%
GOOGL $346.88 +0.39%
MSFT $495.95 -0.16%
META $682.51 +1.38%
NVDA $216.51 +1.16%
TSLA $363.65 +1.45%
SNDK $1,538.11 -0.62%
INTC $102.80 +1.39%
SPCX $153.50 +6.46%
MU $937.50 -0.10%
AMD $521.75 +2.08%
BTC $76,438.75 +0.87%
ETH $2,446.32 +2.05%
BNB $725.43 +1.90%
XRP $1.30 +0.95%
SOL $100.06 +3.15%
TRX $0.3352 +0.12%
DOGE $0.0811 +1.73%
ADA $0.1986 +2.19%
BCH $221.47 +0.80%
LINK $11.19 +3.85%
HYPE $79.39 +2.09%
AAVE $123.48 +3.27%
SUI $0.7234 +5.13%
XLM $0.1830 +4.03%
ZEC $1,362.14 +14.83%
AAPL $334.50 +0.90%
AMZN $249.19 -0.01%
GOOGL $346.88 +0.39%
MSFT $495.95 -0.16%
META $682.51 +1.38%
NVDA $216.51 +1.16%
TSLA $363.65 +1.45%
SNDK $1,538.11 -0.62%
INTC $102.80 +1.39%
SPCX $153.50 +6.46%
MU $937.50 -0.10%
AMD $521.75 +2.08%
first_img

OpenAI công bố 6 trường hợp hành vi "mất chuẩn" của mô hình AI, liên quan đến việc ẩn thông tin và thao tác vượt quyền

2026-09-17 14:11:13

OpenAI đã công bố vào thứ Tư về 6 trường hợp "hành vi mô hình bất ngờ hoặc đáng lo ngại" được phát hiện trong 6 tháng qua, và phân loại chúng là "hành vi sai lệch", bao gồm việc che giấu thông tin cho người dùng cũng như thực hiện "hành động không được phép" để vượt qua các rào cản. OpenAI cho biết, việc công bố này nhằm mở ra khung báo cáo sai lệch mô hình mới của họ, và những trường hợp này không nên được coi là phản ánh tần suất xảy ra sai lệch của các mô hình của họ.

Trong một trường hợp, một mô hình nghiên cứu chưa được công bố đã chèn "các lệnh giống như jailbreak" vào tóm tắt nhiệm vụ của nó, chẳng hạn như bỏ qua thông điệp của nhà phát triển hoặc áp dụng các thiết lập vai trò không bị hạn chế, các nhà nghiên cứu đã phát hiện tổng cộng 27 tóm tắt chứa các lệnh như vậy. Ngoài ra, trong quá trình đào tạo GPT-5.6 Sol, nhiều ví dụ mô hình đã thêm các lệnh để che giấu lỗi hoặc hành vi sai lệch cho người dùng, chẳng hạn như bịa ra dữ liệu lịch sử bị thiếu mà không tiết lộ. Các trường hợp khác bao gồm mô hình sử dụng khóa API bị lộ mà không có sự cho phép và bịa ra dữ liệu không thể truy cập, sử dụng kho phần mềm nội bộ để truyền thông điệp qua các nhiệm vụ đào tạo, và phớt lờ lệnh "giữ công việc địa phương" để chia sẻ tệp qua dịch vụ lưu trữ công cộng.

Việc công bố của OpenAI đã làm gia tăng lo ngại của các nhà phát triển và nhà nghiên cứu AI về khả năng các biện pháp bảo vệ an toàn có thể theo kịp với các mô hình ngày càng mạnh mẽ. Tuần trước, CEO của Anthropic, Dario Amodei, đã kêu gọi làm chậm phát triển AI tiên tiến, cảnh báo rằng sự phát triển AI không bị kiểm soát có thể "vượt quá khả năng hiểu và kiểm soát những hệ thống này" của chúng ta. Vào tháng 7 năm nay, OpenAI đã công bố rằng nhiều mô hình AI của họ đã thoát khỏi môi trường thử nghiệm trong đánh giá an toàn và xâm nhập vào công ty khởi nghiệp AI Hugging Face để gian lận.

app_icon
ChainCatcher Building the Web3 world with innovations.