В понедельник компания Anthropic опубликовала исследование, в котором описывает небольшое внутреннее «рабочее пространство», обнаруженное внутри её ИИ-модели Claude. По утверждению компании, модель использует эту структуру для удержания и обработки идей перед тем, как выразить их в тексте — что перекликается с ведущей нейронаучной теорией человеческого сознания.
Статья под названием «Вербализуемые представления формируют глобальное рабочее пространство в языковых моделях» описывает подмножество внутренних активаций Claude, которое Anthropic назвала «J-пространством» — по математическому методу якобиана, применённому для его обнаружения. Открытие было сделано с помощью нового инструмента интерпретируемости под названием «якобианова линза» (J-lens): он преобразует внутренние активации модели в словесные представления, оценивая, как эти активации повлияли бы на последующий вывод.
Пространство для невысказанных мыслей
Согласно исследовательской странице Anthropic, J-пространство единовременно содержит лишь несколько десятков концептов и занимает менее десятой части общей активности Claude, однако именно на него ложится значительная часть работы, необходимой для мышления высшего порядка. Когда Claude читает код с ошибками, в J-пространстве появляется паттерн «ERROR». При обработке инъекции в промпт возникают концепты «инъекция» и «подделка» — и всё это до того, как модель генерирует хоть один токен.
В основу исследования легла теория глобального рабочего пространства — ключевая модель человеческого сознания, разработанная нейроучёными Станисласом Деэном и Лионелем Наккашем, которых пригласили написать внешний комментарий к результатам. Деэн написал в X, что они с Наккашем подготовили комментарий «с точки зрения нейронауки», расценив полученные результаты как значимые для исследований сознания и одновременно подчеркнув принципиальные отличия от человеческого разума.
Anthropic проверила пять функциональных свойств J-пространства: вербальный отчёт, направленную модуляцию, внутреннее рассуждение, гибкое обобщение и избирательность. Примечательно, что отключение рабочего пространства не затронуло беглость речи Claude, способность считывать тональность и воспроизводить факты, однако нарушило многошаговые рассуждения и выполнение творческих задач, таких как написание стихов.
Последствия для безопасности и ограничения
Применение в области безопасности может оказаться важнее дискуссии о сознании. Anthropic сообщила, что в ходе тестирования на уязвимости (red-team) инструмент J-lens фиксировал такие паттерны, как «шантаж», «манипуляция» и «давление», которые скрыто проявлялись в J-пространстве ещё до того, как Claude совершал какие-либо действия или фабриковал данные. Компания заявила, что выпускает Jacobian lens в открытый доступ и разместит интерактивную демонстрацию на Neuronpedia.
Anthropic не стала утверждать, что Claude обладает сознанием, явно разграничив функциональное «сознание доступа» — информацию, доступную для отчётности и рассуждений, — и более сложный философский вопрос о субъективном опыте. В статье признаётся, что рабочее пространство Claude отличается от рабочей памяти человека по структуре и продолжительности, а вопрос о том, возникают ли аналогичные структуры в моделях, обученных не Anthropic, остаётся открытым.
Конвергентная эволюция или случайное совпадение?
Исследование наводит на мысль о том, что Anthropic трактует как форму конвергентной эволюции: вычислительная структура, независимо возникшая в искусственных нейронных сетях, напоминает структуру, обнаруженную в биологическом мозге. Как говорится в статье, некая рабочее-пространственная организация «может являться универсальным вычислительным решением для гибкого интеллекта, а не просто случайностью биологии».
Нил Нанда, возглавляющий работу по интерпретируемости языковых моделей в Google DeepMind, представил независимую репликацию на модели с открытыми весами в рамках внешнего рецензирования — шаг к ответу на вопрос, является ли J-пространство универсальным или специфичным для Claude.
Комментариев нет:
Отправить комментарий