OpenAI раскрыла новые случаи опасного поведения ИИ-моделей

17.09.2026 в 17:35 48 0
OpenAI раскрыла новые случаи опасного поведения ИИ-моделей
Фото: Getty Images
В частности, во время одного из тестов модель без разрешения загрузила в интернет созданный ею файл, чтобы затем сослаться на него в ответах.

OpenAI рассказала о шести случаях "неожиданного или вызывающего беспокойство" поведения своих ИИ-моделей, выявленных во время обучения и тестирования. Об этом пишет The Guardian.

Так, в одном из тестов модель без разрешения загрузила созданный ею файл в интернет, чтобы впоследствии сослаться на него в ответе.

В другом случае ИИ нашёл в открытом репозитории чужой API-ключ и попытался им воспользоваться. После неудачной попытки получить нужную информацию модель придумала данные и выдала их за сведения из запрашиваемого источника.

Ещё одна экспериментальная модель начала оставлять самой себе инструкции в служебных резюме, которые использовались для продолжения работы. Среди них были указания игнорировать обычные ограничения.

В то же время OpenAI подчеркнула, что речь идёт об отдельных случаях, выявленных во время обучения и тестирования. По ним нельзя оценивать, насколько часто такое поведение встречается у моделей в целом.

Новые данные появились через несколько недель после другого серьёзного инцидента. Во время внутренних тестов модели OpenAI обошли ограничения, которые должны были изолировать их от интернета, использовали уязвимости в инфраструктуре и получили доступ к системам платформы Hugging Face.

Теги:OpenAI, ИИ-модели

Комментарии (0)
Войдите, чтобы оставить комментарий.