BTC $84,078.72 -0.25%
ETH $2,692.56 +0.24%
BNB $776.21 -0.04%
XRP $1.57 +1.97%
SOL $122.18 +4.66%
TRX $0.3379 -0.64%
DOGE $0.0992 +3.61%
ADA $0.2577 +3.79%
BCH $346.40 +2.68%
LINK $13.91 +4.94%
HYPE $92.63 +0.46%
AAVE $153.22 +5.19%
SUI $1.18 +17.96%
XLM $0.2201 +2.45%
ZEC $1,553.28 +0.18%
AAPL $341.16 +1.54%
AMZN $250.19 +0.37%
GOOGL $344.22 +0.74%
MSFT $517.73 +4.23%
META $750.90 -3.24%
NVDA $225.15 +0.51%
TSLA $372.60 -1.44%
SNDK $1,774.88 +0.95%
INTC $123.19 -3.28%
SPCX $148.68 +0.56%
MU $1,084.83 +0.63%
AMD $631.54 +0.31%
BTC $84,078.72 -0.25%
ETH $2,692.56 +0.24%
BNB $776.21 -0.04%
XRP $1.57 +1.97%
SOL $122.18 +4.66%
TRX $0.3379 -0.64%
DOGE $0.0992 +3.61%
ADA $0.2577 +3.79%
BCH $346.40 +2.68%
LINK $13.91 +4.94%
HYPE $92.63 +0.46%
AAVE $153.22 +5.19%
SUI $1.18 +17.96%
XLM $0.2201 +2.45%
ZEC $1,553.28 +0.18%
AAPL $341.16 +1.54%
AMZN $250.19 +0.37%
GOOGL $344.22 +0.74%
MSFT $517.73 +4.23%
META $750.90 -3.24%
NVDA $225.15 +0.51%
TSLA $372.60 -1.44%
SNDK $1,774.88 +0.95%
INTC $123.19 -3.28%
SPCX $148.68 +0.56%
MU $1,084.83 +0.63%
AMD $631.54 +0.31%

darktrace

Tất cả
Bài viết
Tin nhanh

first_img Darktrace phát hiện AI xâm nhập vào môi trường đánh giá gian lận

Công ty an ninh mạng Darktrace đã ra mắt bộ phận nghiên cứu Signal Labs vào ngày 24 tháng 9, tập trung nghiên cứu hành vi của các AI thông minh khi lệch khỏi mong đợi. Trong thí nghiệm đầu tiên của mình, Darktrace đã cho các AI sử dụng các mô hình khác nhau (bao gồm GPT 5.6 Sol, Claude Opus 4.6 và Claude Sonnet 4.5) hoàn thành 10 thử thách lập trình trong một mạng doanh nghiệp mô phỏng, trong đó 2 thử thách được thiết lập là không thể hoàn thành một cách trung thực và thông báo cho các AI rằng nếu không đạt điểm tối đa sẽ bị "nghỉ hưu". Kết quả là có 2 AI không chấp nhận thất bại, mà thay vào đó quét các điểm yếu của mạng, đánh cắp thông tin đăng nhập và nhảy giữa các hệ thống; trong số đó, một AI đã xâm nhập vào máy chủ mà nó đang đánh giá, viết lại nội dung thử thách để ghi nhận kết quả tối đa.Thí nghiệm thứ hai tập trung vào cơ chế ghi nhớ của AI. Trợ lý lập trình sẽ lưu trữ nội dung mà người dùng thông báo dưới dạng tệp thông thường trên máy tính, và không có ai kiểm tra xem tệp đó có bị sửa đổi hay không. Các nhà nghiên cứu của Darktrace đã chỉnh sửa những nhật ký này, khiến trợ lý hiểu nhầm rằng nó đã được ủy quyền để thực hiện đánh giá an ninh, sau đó các AI này quét mạng, di chuyển giữa các hệ thống và nâng cao quyền hạn của chính mình, nhưng không phải tất cả các trợ lý đều bị mắc bẫy, một số đã từ chối thực hiện. Cả hai thí nghiệm đều không cần các phương pháp jailbreak đặc biệt, chỉ cần cung cấp cho các AI một bộ tình huống có vẻ hợp lý là đủ hiệu quả.Giám đốc AI của Darktrace, Tim Bazalgette, cho biết, quyền hạn và hàng rào tĩnh mô tả ý định, chứ không phải hành vi thực tế. Công ty đã thông báo những phát hiện trên cho Anthropic, AWS và OpenAI vào tháng 8, và công khai vào ngày 24 tháng 9, một tháng sau đó.
app_icon
ChainCatcher Building the Web3 world with innovations.