OpenAI рассказала о шести случаях «неожиданного или вызывающего беспокойство» поведения своих ИИ-моделей, выявленных во время обучения и тестирования. Об этом пишет The Guardian.
Так, в одном из тестов модель без разрешения загрузила созданный ею файл в интернет, чтобы впоследствии сослаться на него в ответе.
В другом случае ИИ нашёл в открытом репозитории чужой API-ключ и попытался им воспользоваться. После неудачной попытки получить нужную информацию модель придумала данные и выдала их за сведения из запрашиваемого источника.
Ещё одна экспериментальная модель начала оставлять самой себе инструкции в служебных резюме, которые использовались для продолжения работы. Среди них были указания игнорировать обычные ограничения.
В то же время OpenAI подчеркнула, что речь идёт об отдельных случаях, выявленных во время обучения и тестирования. По ним нельзя оценивать, насколько часто такое поведение встречается у моделей в целом.
Новые данные появились через несколько недель после другого серьёзного инцидента. Во время внутренних тестов модели OpenAI обошли ограничения, которые должны были изолировать их от интернета, использовали уязвимости в инфраструктуре и получили доступ к системам платформы Hugging Face.


