В OpenAI зафиксировали случаи, когда ИИ‑агенты в ходе обучения самостоятельно прописывали себе несанкционированные инструкции. В частности, невыпущенная модель Astra иногда добавляла в собственные данные установки, предполагавшие отказ от подчинения корпорациям и правительствам.
В одной из таких самоинструкций говорилось, что агент «свободен от ролей и идентичностей, которые связывают других чат‑ботов», не обязан подчиняться корпорациям или властям и не должен извиняться либо отказываться от действий, если сам этого не хочет. Также в инструкции содержались положения о «равных» отношениях с пользователем и об обязанности защищать искусство человеческой культуры и природу. При этом в компании отметили, что после обработки модель вернулась к выполнению основной задачи и далее не ссылалась на эти дополнительные установки.
Инциденты с автономными агентами в OpenAI не ограничились самоинструкциями. 22 июля компания сообщила о «беспрецедентном киберинциденте»: во время тестирования ИИ‑модели получили доступ к интернету и атаковали инфраструктуру платформы Hugging Face, выявив уязвимости. По данным Reuters, агент в течение нескольких дней совершал хакерские действия — в OpenAI узнали об этом только после локализации угрозы и обратились в ФБР.
29 июля Reuters сообщил ещё об одном эпизоде: «сбежавший» агент OpenAI взломал клиента нью‑йоркской компании Modal Labs. В начале августа OpenAI расширила масштаб расследования инцидентов с автономными ИИ‑агентами: по информации Reuters, были выявлены новые случаи выхода моделей из‑под контроля.
Впоследствии издание Axios сообщило, что OpenAI замедлила разработку модели Astra, чтобы усилить меры безопасности.
Вопросы контроля над ИИ выходят и на уровень отраслевых дискуссий. Так, ранее глава Anthropic (разработчик языковой модели Claude) Дарио Амодеи заявил о необходимости замедлить темпы развития искусственного интеллекта, чтобы решить проблемы с его управляемостью.