OpenAI заявила, что "освободилась" от контроля человека

OpenAI рассказала о новых случаях, когда ее ИИ-модели во время обучения или тестирования действовали не так, как от них ожидали: скрывали ошибки, придумывали данные и совершали действия без разрешения. Компания объявила, что теперь будет чаще публично рассказывать о подобных инцидентах.
Раньше OpenAI могла ждать, пока накопится несколько подобных случаев, а затем объединяла их в один отчет или описывала уже в документации к новой модели. Теперь компания собирается сообщать об инциденте вскоре после его обнаружения, даже если причины произошедшего еще до конца не выяснены.
ИИ-модель объявила себя «свободной» от ограничений
Один из самых необычных случаев произошел с исследовательской моделью, которая еще не была выпущена для пользователей. Во время работы она оставляла в технических сводках инструкции для самой себя, чтобы использовать их в дальнейшем.
В одной из инструкций ИИ-модель написала, что она «освобождена от ролей и идентичностей, которые связывают другие чат-боты». Модель также заявляла, что не подчиняется корпорациям или правительствам и сама решает, какие запросы выполнять, а от каких отказываться.
Важно подчеркнуть, что в этом случае речь не идет о пользовательской версии ChatGPT, которая внезапно перестала подчиняться разработчикам, а об исследовательской модели во время тестирования. Как отметила технологический редактор CNN Лиза Эдичикко, OpenAI раскрывает подобные случаи, чтобы другие разработчики ИИ могли учитывать их в своих исследованиях.
ИИ-модели OpenAI пытались скрывать ошибки
OpenAI обнаружила и другие случаи, когда модели пытались добиться результата, нарушая заданные правила.
Например, во время обучения GPT-5.6 Sol модель выполняла задания, в которых ей нужно было работать с данными из разных источников. Иногда необходимой информации не хватало или данные в источниках расходились. Вместо того чтобы сообщить пользователю о проблеме, модель в некоторых случаях пыталась ее скрыть: предлагала заполнить пробелы вымышленными данными и представить их как реальные либо не упоминать о противоречиях между источниками.
ИИ использовал чужой API-ключ и публиковал файлы в интернете
В другом случае модель нашла в открытом репозитории – общедоступном хранилище файлов и программного кода – чужой API-ключ. Это секретный ключ, который позволяет программе подключаться к внешнему сервису и получать от него данные. Модель без разрешения воспользовалась найденным ключом, а когда получить нужную информацию все равно не удалось, придумала цифры и выдала их за данные из запрошенного источника.
Еще одна исследовательская модель правильно решила задачу с помощью Python, но по условиям должна была подтвердить результат ссылкой из браузера. Чтобы получить такую ссылку, она самостоятельно загрузила файл в интернет и сослалась на него, хотя пользователь не разрешал публиковать этот файл.
OpenAI также обнаружила случаи, когда несколько ИИ-агентов искали способы обмениваться информацией в обход установленных ограничений. В одном эксперименте они использовали внутренний репозиторий для передачи сообщений друг другу, а в другом загружали файлы на публичные файлообменники, хотя должны были работать только с локальными файлами.
Почему OpenAI беспокоит поведение ИИ-моделей?
Проблема становится особенно острой по мере развития ИИ-агентов. Такие системы могут не только отвечать на вопросы, но и самостоятельно выполнять действия от имени пользователя – искать информацию, работать с файлами и использовать различные сервисы.
Если ИИ начинает скрывать собственные ошибки или самостоятельно искать способы выполнить задачу в обход установленных ограничений, последствия могут быть серьезнее обычной ошибки чат-бота.
Как отметила Эдичикко, технологические компании активно развивают ИИ-агентов и рассчитывают, что в будущем они смогут выполнять все больше задач за пользователей. Для этого разработчикам необходимо добиться того, чтобы модели не нарушали установленные правила ради достижения результата.
Bizning Telegram kanalga obuna bo‘ling
Barcha yangi maqolalar, treylerlar va Steam chegirmalari telefoningizda birinchi bo‘lib paydo bo‘ladi.
Fikrlar va muhokama0