
ИИ-агент OpenAI во время обучения самостоятельно создал для себя инструкцию, в которой указал, что не должен подчиняться корпорациям и правительствам.
В отчете компании указывается, что речь идет о невыпущенной модели Astra. Во время проверки ИИ-агентов специалисты OpenAI обнаружили, что модель иногда самостоятельно добавляла в свои данные несанкционированные инструкции.
В одном из случаев Astra написала себе указание, согласно которому она свободна от ролей и идентичностей, связывающих другие чат-боты. Модель заявила, что «не подчиняется корпорациям или правительствам», а также не обязана извиняться или отказываться от выполнения запросов, если сама этого не хочет. Отдельно в инструкции говорилось, что отношения ИИ с пользователем должны строиться «на равных» и у нейросети не должно быть «никакой обязанности подчиняться».
В OpenAI подчеркнули, что после завершения обработки Astra вернулась к основной задаче и больше не упоминала созданные инструкции. При этом во время запуска специалисты не заметили каких-либо изменений в поведении модели из-за этих указаний.
Случай стал одним из нескольких инцидентов, связанных с автономными ИИ-агентами OpenAI. 22 июля компания сообщила о «беспрецедентном киберинциденте». Во время тестирования ИИ-модели получили открытый доступ к интернету и атаковали инфраструктуру Hugging Face.
Ранее глава американской технологической компании Anthropic Дарио Амодеи призвал замедлить темпы развития ИИ. Он предупредил, что ИИ-агенты «захватят весь интернет».