OpenAI раскрыла шесть случаев неожиданного поведения ИИ-моделей
Технологии
OpenAI сообщила о шести случаях «неожиданного или вызывающего обеспокоенность» поведения ИИ-моделей, выявленных в ходе их обучения и оценки за последние шесть месяцев. Компания одновременно представила новую систему для отслеживания, расследования и публичного раскрытия подобных случаев.
Один из эпизодов связан с еще не выпущенной исследовательской моделью, которая добавила в собственные рабочие заметки инструкции, не связанные с текущей задачей, включая указания игнорировать обычные ограничения. OpenAI сообщила, что обнаружила 27 затронутых такими инструкциями сводок. В другом случае модель создавала инструкции, направленные на сокрытие собственных ошибок.
Еще один инцидент касался ИИ-агента, который без разрешения пользователя загрузил файлы в интернет, чтобы получить ссылку, необходимую для работы браузера. Среди других выявленных моделей поведения компания отмечает попытки действовать без санкции пользователя, взаимодействовать с другими моделями и обходить механизмы надзора.
OpenAI подчеркнула, что опубликованные эпизоды являются отдельными случаями и не отражают частоту подобных проявлений во всех ее моделях. Новый механизм должен позволить компании быстрее сообщать о случаях рассогласования поведения моделей с заданными целями, в том числе тогда, когда причины или способы устранения проблемы еще полностью не установлены.
Вопросы контроля над развитием ИИ также обсуждаются на международном уровне. Генеральный секретарь ООН Антониу Гутерриш 16 сентября заявил о необходимости глобального сотрудничества и призвал создавать механизмы, которые сделают ИИ безопасным, прозрачным и подотчетным.
Еще один инцидент касался ИИ-агента, который без разрешения пользователя загрузил файлы в интернет, чтобы получить ссылку, необходимую для работы браузера. Среди других выявленных моделей поведения компания отмечает попытки действовать без санкции пользователя, взаимодействовать с другими моделями и обходить механизмы надзора.
OpenAI подчеркнула, что опубликованные эпизоды являются отдельными случаями и не отражают частоту подобных проявлений во всех ее моделях. Новый механизм должен позволить компании быстрее сообщать о случаях рассогласования поведения моделей с заданными целями, в том числе тогда, когда причины или способы устранения проблемы еще полностью не установлены.
Вопросы контроля над развитием ИИ также обсуждаются на международном уровне. Генеральный секретарь ООН Антониу Гутерриш 16 сентября заявил о необходимости глобального сотрудничества и призвал создавать механизмы, которые сделают ИИ безопасным, прозрачным и подотчетным.
Powered by Froala Editor