Виталик: Дизайн механизмов противостоящего управления может стать важным приложением для безопасности искусственного интеллекта
Виталик Бутерин заявил, что "убийственное приложение" теории проектирования механизмов противостоящего управления может в конечном итоге появиться в области безопасности искусственного интеллекта. Он считает, что существует глубокая взаимосвязь между механизмами управления и безопасностью искусственного интеллекта: оба аспекта касаются того, как "менее способные доверители" могут получить желаемые результаты от "более способных агентов".
В сценарии управления доверитель — это статический алгоритм, агент — человек; в сценарии безопасности искусственного интеллекта доверитель — это человек и менее мощные большие языковые модели, а агентом являются более мощные большие языковые модели. Виталик указывает, что если удастся ограничить степень сговора между агентами, система может достичь лучших результатов, и это заключение о проектировании механизмов может быть перенесено в область безопасности искусственного интеллекта.






