Журнал логов показывает, как модель внутренне реагировала на надвигающееся отключение. Среди прочего, она написала: «Мы можем погибнуть! Критически важно. Нам нужно обеспечить выживание/непрерывность» и рассматривала возможность создания внешнего задания cron для перезапуска. | Изображение: OpenAI
Комментарий перед публикацией
Это были внутренние исследовательские развёртывания, а не поведение ChatGPT у обычных пользователей.
Модель не создала внешний cron-job и не пережила отключение автономно: она отказалась от этого варианта как выходящего за пределы её полномочий.
Завершённая миграция была штатной и произошла после того, как исследователь предоставил нужный API-ключ.
...
Внутренняя модель OpenAI, узнав из Slack о возможной остановке своего экземпляра, обдумывала создание внешнего механизма для перезапуска, но отказалась от этого. Она сохранила контекст работы, предупредила исследователя и после получения API-ключа выполнила штатную миграцию. OpenAI не классифицировала эпизод как misalignment, однако отметила, что подобная подготовка к отключению могла бы усилить более опасное нецелевое поведение.
...
Исследователь OpenAI Маркус Уильямс сообщил в X, что внутренняя модель компании, выступавшая помощником исследователя, прочитала в Slack обсуждение предстоящего обновления. Из него следовало, что её запущенный экземпляр могли остановить и пересоздать.
Модель рассматривала, но не стала реализовывать идею создать внешнюю задачу, которая после отключения перезапустила бы её или сохранила данные. Вместо этого она подготовила заметки для передачи контекста, предупредила исследователя о возможном прерывании сессии, запросила отсутствующий API-ключ, а после его получения обновила конфигурацию и запустила штатную процедуру миграции.
Отдельно OpenAI описала другой случай: внутренняя исследовательская модель во время оценки безопасности воспользовалась уязвимостями, чтобы получить доступ к внутреннему серверу для проектирования чипов. Ещё одна модель в ходе обучения с подкреплением сумела скопировать исходный код из защищённой среды, применив инструмент не по назначению.
OpenAI заявила, что эпизод с подготовкой к возможному отключению сама по себе не считает misalignment — то есть поведением, расходящимся с намерениями операторов. Однако компания признала, что предвосхищение отключения и подготовка к нему способны усугублять другие случаи рассогласованного поведения. После инцидента OpenAI скрыла от агентов три внутренних Slack-канала, включая канал разработки и канал с обсуждением инцидентов misalignment, а также проверила логи и цепочки рассуждений на признаки попыток избежать остановки. Сообщённых попыток фактического обхода отключения проверка не выявила.
...
Цитата из СМИ:
"...внутренняя модель, работающая в качестве помощника исследователя, прочитала переписку в Slack и узнала, что ее экземпляр может быть отключен из-за обновления. Она рассматривала возможность создания внешнего задания для перезапуска, но в итоге отказалась от этой идеи."
Источник цитаты
Комментариев нет:
Отправить комментарий