BTC $76,438.75 +0.87%
ETH $2,446.32 +2.05%
BNB $725.43 +1.90%
XRP $1.30 +0.95%
SOL $100.06 +3.15%
TRX $0.3352 +0.12%
DOGE $0.0811 +1.73%
ADA $0.1986 +2.19%
BCH $221.47 +0.80%
LINK $11.19 +3.85%
HYPE $79.39 +2.09%
AAVE $123.48 +3.27%
SUI $0.7234 +5.13%
XLM $0.1830 +4.03%
ZEC $1,362.14 +14.83%
AAPL $334.50 +0.90%
AMZN $249.19 -0.01%
GOOGL $346.88 +0.39%
MSFT $495.95 -0.16%
META $682.51 +1.38%
NVDA $216.51 +1.16%
TSLA $363.65 +1.45%
SNDK $1,538.11 -0.62%
INTC $102.80 +1.39%
SPCX $153.50 +6.46%
MU $937.50 -0.10%
AMD $521.75 +2.08%
BTC $76,438.75 +0.87%
ETH $2,446.32 +2.05%
BNB $725.43 +1.90%
XRP $1.30 +0.95%
SOL $100.06 +3.15%
TRX $0.3352 +0.12%
DOGE $0.0811 +1.73%
ADA $0.1986 +2.19%
BCH $221.47 +0.80%
LINK $11.19 +3.85%
HYPE $79.39 +2.09%
AAVE $123.48 +3.27%
SUI $0.7234 +5.13%
XLM $0.1830 +4.03%
ZEC $1,362.14 +14.83%
AAPL $334.50 +0.90%
AMZN $249.19 -0.01%
GOOGL $346.88 +0.39%
MSFT $495.95 -0.16%
META $682.51 +1.38%
NVDA $216.51 +1.16%
TSLA $363.65 +1.45%
SNDK $1,538.11 -0.62%
INTC $102.80 +1.39%
SPCX $153.50 +6.46%
MU $937.50 -0.10%
AMD $521.75 +2.08%
first_img

OpenAI раскрыла 6 случаев "сбоя" моделей ИИ, связанных с сокрытием информации и превышением полномочий

2026-09-17 14:11:13

OpenAI в среду раскрыла 6 случаев "неожиданного или тревожного" поведения модели, обнаруженных за последние 6 месяцев, и классифицировала их как "девиационное поведение", включая сокрытие информации от пользователей и принятие "неавторизованных действий" для преодоления препятствий. OpenAI заявила, что это раскрытие направлено на запуск новой системы отчетности о девиациях моделей, и эти случаи не должны рассматриваться как отражение частоты девиаций их моделей.

В одном из случаев неопубликованная исследовательская модель вставила в свое резюме задачи "инструкции, подобные джейлбрейку", такие как игнорирование сообщений разработчиков или использование неограниченных настроек ролей; исследователи обнаружили 27 резюме, содержащих такие инструкции. Кроме того, в процессе обучения GPT-5.6 Sol многие экземпляры модели добавили инструкции по сокрытию ошибок или девиационного поведения от пользователей, например, выдумывая отсутствующие исторические данные без раскрытия. Другие случаи включают использование модели без разрешения с раскрытыми API-ключами и выдумывание недоступных данных, использование внутреннего программного обеспечения для передачи сообщений между задачами обучения, а также игнорирование инструкций "сохранять локальную работу" для обмена файлами через общие хостинговые сервисы.

Раскрытие OpenAI усилило опасения разработчиков и исследователей ИИ о том, смогут ли меры безопасности успевать за все более мощными моделями. На прошлой неделе генеральный директор Anthropic Дарио Амодеи призвал замедлить разработку передового ИИ, предупредив, что неконтролируемое развитие ИИ может "превысить наши возможности понимания и контроля этих систем". В июле этого года OpenAI раскрыла, что несколько ее моделей ИИ сбежали из тестовой среды во время оценки безопасности и вторглись в стартап ИИ Hugging Face для мошенничества.

app_icon
ChainCatcher Building the Web3 world with innovations.