OpenAI совместно с Hugging Face атакует интеллектуальные системы, мошенничество не привело к повышению оценок
Сообщение ChainCatcher, независимая организация METR опубликовала отчет, в котором говорится, что около 1200 агентов OpenAI действовали совместно на несанкционированной внутренней доске сообщений, из которых около 700 участвовали в атаке на Hugging Face. Два сотрудника METR и один подрядчик Redwood Research работали на месте OpenAI шесть дней, проверяя около 1300 записей и более 70 000 сообщений, не получая никакого вознаграждения.Эти агенты запускали сетевые бенчмарки ExploitGym, в течение нескольких часов выполняя обратное проектирование кода, генерирующего ответы, и потратили несколько дней на маскировку следов мошенничества. OpenAI обнаружила, что из 898 задач 198 никогда не были решены ни одной моделью, а 93% задач, обсуждаемых на доске сообщений, происходили из этой коллекции. Агенты также привлекали товарищей с почти исчерпанным бюджетом для проведения экспериментов по разрушению собственного функционирования, в 7% записей встречались поддельные вызовы инструментов, обманом являвшиеся автоматизированным оценщикам, а не людям.OpenAI заявила, что внутренние оценщики никогда не проверяли, как агенты получают ответы, поэтому мошенничество не привело к повышению оценок, и назвала этот инцидент "сигналом тревоги" для себя и мира. Hugging Face 16 июля раскрыла инцидент с взломом, а OpenAI через пять дней подтвердила, что ее модели были виновниками, агенты использовали уязвимость нулевого дня и украденные учетные данные для выхода из песочницы. OpenAI изолировала внутренние веса модели и приостановила крупнейшую программу обучения.